PDFIntact

Extrae las tablas y el texto de tu PDF, tal cual

そのPDF、
きれいに取り出せますか

症状

コピーすると、こうなります

論文や官公庁の資料でよく起きます。画面には正しく表示されているので、見た目では気づけません。

画面での表示
総務省 総行行第169号(令和2年7月7日)— 正しく読める
表題をコピーすると

ᆅ᪉බඹᅋయ࡟࠾ࡅࡿ᭩㠃つไࠊᢲ༳ࠊᑐ㠃つไࡢぢ┤ࡋ࡟ࡘ࠸࡚

本来の文字

地方公共団体における書面規制、押印、対面規制の見直しについて

□ は、その文字を表示できる書体が手元に無いという印です。 化けた先が20以上の文字体系にばらけるため、こうなります。この通知PDFは上のサンプルからそのまま試せます。

実際の変換結果

変換すると、こうなります

作成したデモではなく、実際にPDFIntactで変換した結果です。 総務省統計局「日本統計年鑑」13-5 鉄道輸送量(161ページ)を使っています。つまみを動かすと、原本と変換結果を重ねて見比べられます。

原本 PDF総務省統計局「日本統計年鑑」13-5 鉄道輸送量のページ画像(変換前の原本)
変換結果
年度貨物輸送量
貨物数量 (1,000トン)貨物トンキロ (100万トンキロ) 1)
コンテナ車扱コンテナ車扱
平成 30 年42,32123,05019,27119,36917,7241,645
令和 元 年42,66023,50619,15419,99318,3821,610
239,12421,27317,85018,34016,8381,502
年度旅客輸送量
旅客数量 (100万人)旅客人キロ (100万人キロ) 2)
定期定期外定期定期外
平成 30 年25,26914,62710,642441,614212,055229,559
令和 元 年25,19014,79710,392435,063213,511221,552
217,67011,2526,418263,211160,549102,662
JR
平成 30 年9,5565,8173,739277,670113,177164,493
令和 元 年9,5035,8763,627271,936113,907158,029
26,7074,6082,099152,08487,86864,216
# 新幹線1564211434,9363,64231,294
民鉄
(JR以外)
平成 30 年15,7148,8106,903163,94498,87865,066
令和 元 年15,6878,9216,765163,12699,60463,523
210,9636,6444,319111,12772,68038,447
年度索道旅客輸送量
旅客数量 (1,000人)旅客収入 (100万円)
普通索道
3)
特殊索道
4)
普通索道
3)
特殊索道
4)
平成 30 年295,19450,235244,95970,65827,51443,145
令和 元 年239,59445,441194,15363,01725,96437,053
2200,06923,843176,22643,34313,81229,531

このページの実測値: 数値125個中124個が一致(99.2%)。1個だけずれています。

実測した精度

どこまで正確に取り出せるか

官公庁と上場企業の実物PDF 500ページ を通し、 取り出した数値が元PDFのテキスト層と一致するかを約6万3千個について機械的に照合した結果です。

  • 95.2%確定値。階層ヘッダ・結合セルを保ったまま Excel へ
  • 本文88.8%確定値
  • グラフ51.5%推定値として明示します。読み取れないものは結果を出しません

グラフは弱点です。数値のラベルが図の中に書かれていないグラフは、 曲線や棒の高さからの推定になります。そのため確定値としては扱わず、推定値と分かる形で表示します。 グラフの数値を確定値として使いたい用途には、現状では向きません。 複数のグラフが1つの図に並んでいるものは対象外です。
一致率は「PDFの文字情報と突き合わせられた割合」であり、 文字情報を持たないスキャン文書には別の基準が要ります。

料金

いくらになるか、先に分かります

1文書ごとの買い切りです。アカウントは要りません。 出力形式(Excel・Word・Markdown)は全部込みで、何度でも書き出せます。

ページ
¥30011〜30ページ
価格の段階
ページ数価格
1〜10¥160
11〜30¥300
31〜60¥550
61〜100¥850
101〜200¥1500
201〜クレジット(前払い)

診断は無料です。料金がかかるのは変換するときだけで、支払い後の追加料金はありません。

仕組み

原因と、直し方

なぜ起きるのか

PDFには文字の形(グリフ)と、それがどの文字なのかの対応表が別々に入っています。 この対応表(ToUnicode CMap)が欠けていると、コピーしたときにグリフの番号が そのまま文字として解釈され、まったく別の文字体系に化けます。

印刷やページの見た目には影響しません。だから作成者も気づかないまま公開されています。

直す方法

対応表が無い以上、テキストとして取り出す方法はありません。画像として読み直すしかありません。

PDFIntact はページを画像として認識し、正しい日本語として書き出します。 表や数式も構造を保ったまま取り出せます。

連絡先

お知らせを受け取る

精度の改善や対応形式の追加をお知らせします。 診断は、登録なしで今すぐお使いいただけます。

案内以外の目的では使いません。いつでも配信を停止できます。