スキャンしたPDFを、検索できる書類にする
紙を読み取っただけのPDFで、文字が検索もコピーもできない理由と直し方
更新日:
なぜ検索できないのか
複合機やスマートフォンで紙を読み取ると、ページ全体が1枚の写真としてPDFに入ります。人の目には文字に見えますが、PDFの中身は絵でしかありません。だから検索にも引っかからず、コピーもできません。
見分け方は、PDFを開いて文字をなぞってみることです。選択できなければ、文字の層がありません。
見た目を変えずに、文字を重ねる
スキャンPDFを文字検索できるようにする(OCR)は、ページの文字を読み取って、見えない文字としてページに重ねます。ページの絵は1画素も変えないので、印影や手書きのサインもそのまま残り、容量もほとんど増えません。
すでに文字を選べるページは読み取らずにそのまま残すので、紙と電子が混ざった書類でも通せます。
読み取りの精度を上げるこつ
いちばん効くのは、元の読み取りの品質です。複合機の設定を300dpi程度にし、白黒2値ではなくグレースケールにすると、かすれが減ります。スマートフォンで撮る場合は、真上から、影が入らないように撮ってください。
地色が暗い、影が出ている、という写真はスキャンPDFの背景を白くするで紙の地を白くしてから読み取ると精度が上がります。傾きは大きく影響するので、まっすぐに直してから通してください。
読み取りは間違える
印刷された横書きの文字はよく読めますが、手書き・かすれ・縦書きは苦手です。数字の0とО、1とlのような取り違えも起こります。契約書の金額や、請求書の番号は、必ず目で確かめてください。
読み取った文字は見えない層として重なるだけなので、間違いがあってもページの見た目は変わりません。つまり「検索で見つからない」という形でしか気づけません。大事な書類では、鍵になる語(社名・金額・日付)で一度検索して、引っかかるかどうかを確かめておくと安心です。
文字をテキストとして取り出したい場合は、読み取ったあとのPDFをPDFをMarkdownにするに通します。取り出せる精度は、読み取りの精度までです。
読み取る前に、ページを整えておく
複合機でまとめて読み取ると、裏面が上下逆になる、白紙が混ざる、順番が入れ替わる、といったことが起きます。PDFのページを整理でページを見ながら回し、消し、並べ替えてから読み取りにかけてください。順番を直したあとで読み取れば、二度手間になりません。
見開きで読み取ってしまった資料は、先に1ページずつへ割っておくと、行の並びが素直になり、読み取りの精度も上がります。
社外に出せない書類でも扱える
当サイトの読み取りは、ブラウザの中だけで行います。書類がサーバーへ送られることはありません。社内規程で外部のサービスへ上げられない資料でも、そのまま扱えます。
そのぶん、処理はお使いの端末の速さに左右されます。ページ数の多い書類は、電源につないだパソコンで行うのが確実です。
よくある質問
この記事で使う道具
記事で紹介しているツールは、すべて登録不要・ブラウザ内で動きます。