PDFテーブルパーサー

PDFから必要な表の列を抽出

列を定義し、PDFの表から行を抽出して、結果をスプレッドシートや自動化ワークフローに送信します。

無料トライアル:月20クレジット、クレジットカード不要。

サンプルで試す

2ページのサンプル表で試す

2ページにまたがる1つの表を含むPDFをダウンロードし、ご自身のinboxにアップロードして、列がどのように抽出されるかを確認してください。

  • 合成ドキュメント:会社名、品目、数値はすべて架空のものです。
  • 2ページ・16行:抜粋ではなく、2ページ目に続く1つの表です。
  • 見出し行は2ページ目でも繰り返され、16件中12件の品名は2行にまたがっています。
  • 列:品目コード、品名、数量、単価、行の合計。

行(16行中16行)

item_codedescriptionquantityunit_priceline_total
WH-1001Steel bolt M8 x 40 mm, zinc plated (box of 100)1214.50174.00
WH-1002Hex nut M8, zinc plated (box of 100)129.80117.60
WH-1015Flat washer M8, stainless (box of 200)811.2590.00
WH-1120Cable tie 300 mm, black (pack of 100)254.60115.00
WH-1121Cable tie 200 mm, natural (pack of 100)203.7575.00
WH-1210Work gloves, nitrile coated, size L (pair)402.90116.00
WH-1211Safety glasses, clear lens, anti-fog coating303.40102.00
WH-1305Duct tape 48 mm x 50 m, silver185.2093.60
WH-1306Masking tape 24 mm x 50 m242.3556.40
WH-1410LED work light, rechargeable, 10 W, with magnetic base627.90167.40
WH-1411Extension cord 5 m, 3 x 1.5 mm2, indoor use1012.60126.00
WH-1502Pallet wrap film 500 mm x 300 m, clear158.40126.00
WH-1503Packing tape 48 mm x 66 m, brown361.9570.20
WH-1620Storage bin 600 x 400 x 220 mm, stackable, with lid149.15128.10
WH-1621Label roll 100 x 150 mm, direct thermal (roll of 500)1013.70137.00
WH-1700Hand truck, folding, 70 kg capacity264.00128.00

結果:このサンプルPDFに対してAirparserが返した内容を、編集せずにそのまま表示しています。ダウンロードできるファイルは、同じ実行のExcelエクスポートです。フィールド名や形式はこの実行で使用したスキーマに基づくもので、実際にはご自身が定義するスキーマに従います。これは1回の実行例であり、精度のベンチマークではありません。

同様の列でinboxを設定してサンプルPDFをアップロードするか、そのままご自身のドキュメントを処理してください。

最初の表を処理する

できること

お客様が定義した列であり、レイアウトのコピーではありません

Airparserは、指定した列の値を抽出して行として返します。表の見た目を再現するものではありません。

Airparserが抽出するもの

  • お客様が定義する列。品目コード、品名、数量などの名前付きフィールドとして抽出します。
  • 表の1行につき1レコード:ExcelやCSVの行、またはJSONの配列として出力します。
  • お客様が選んだタイプの値:テキスト、数値、日付。

行わないこと

  • 表の見た目の書式(フォント、色、罫線、列幅)を保持すること。
  • ページ全体をコピーすること:抽出されるのは定義した列だけです。
  • 定義していないものを保持すること:見出し、ロゴ、フッターは、フィールドを追加しない限り対象外です。

デジタルPDFをすぐに1回だけ変換したい場合は、無料のPDFからExcelへのツールが登録不要で使えます。 無料のPDFからExcelへの変換ツール

アプリ内で

アプリでの実際の抽出

このスクリーンショットは、Airparserで手書きの応募書類を処理している様子です。過去の職歴の表が、元のドキュメントの隣に、名前付きの列を持つ行として抽出されています。

Airparserで、手書きの応募書類が、抽出されたフィールドと過去の職歴の表の隣に表示されている様子

PDFからCSVまで

AirparserでPDFの表を処理する方法

  1. 1. inboxを作成

    名前を付けてCreateをクリックします。inboxはPDFが届く場所であり、列の定義が保存される場所です。

  2. 2. アップロードして解析

    PDFをinboxにドロップするか、inboxのアドレスにメールで転送します。Airparserがフィールドを設定して自動的に解析することも、より細かく制御したい場合は独自のフィールドを定義することもできます。

  3. 3. エクスポートまたはどこへでも送信

    エクスポート前に、抽出した行と金額を原本と照合してください。自動送信する場合は、先に連携を設定してください。 XLSX、CSV、JSONでエクスポートするか、Google Sheets、Webhook、API、Zapier、Make、n8nなどを通じて、データをどこへでも送信できます。

品質

ご自身の表で結果を確認してください

表はレイアウトやスキャン品質によって異なるため、単一の精度の数値は公表していません。まず確認しておきたいのは次の点です:

スキャン品質

可能であれば、元のデジタルPDFを使用してください。

繰り返される見出し

表が次のページに続く場合、見出し行が繰り返されることがよくあります。繰り返された見出しがデータ行として扱われていないか確認してください。

折り返されたセル

2行目に続く長いセルは1行分のデータに属します。折り返された行が別の行として扱われていないか確認してください。

数値と区切り文字

小数点や桁区切り、通貨、符号が正しく読み取られているか確認してください。

合計の整合

表に合計がある場合、各行を足すとその値になるはずです。一致しない場合は、行が欠けているか、誤って読み取られています。

レイアウトで問題が起きた場合は、[email protected]までご連絡ください。

クレジットとデータの取り扱い

クレジットの仕組み

Airparserはクレジット制です。PDF1ページにつき1クレジットで、2ページのPDFには2クレジットかかります。無料トライアルには月20クレジットが含まれ、クレジットカードは不要です。

料金を見る

ドキュメントとデータについて

送信されたドキュメントがAIモデルの学習に使われることはありません。ドキュメントはいつでも削除でき、保持期間は1日から180日の範囲で設定できます(無料トライアルではドキュメントを30日間保持します)。

PDFテーブル解析のユースケース

財務報告書

貸借対照表、損益計算書、財務報告書から財務データを自動的に抽出。

請求書処理

会計や経費管理のために請求書から明細項目や商品テーブルを抽出。

データ移行

データベースやデータウェアハウスへの移行のためにPDFレポートから表データを抽出。

研究・分析

分析や比較のために研究論文やレポートからデータテーブルを抽出。

システム連携

表データを抽出し、Excel、Googleスプレッドシート、データベースシステムと自動連携。

データ分析

分析、レポート作成、ビジネスインテリジェンスのために構造化された表データを抽出。

お客様の声

Airparserユーザーの声

The Right Product for quick integration of smart extraction of data from PDF.

Marty N. - CEO, Information TechnologyMarty N.
CEO, Information Technology
on Capterra

The simplicity of creating the data capture fields. I also like the webhook feature.

Allen M. - Owner Realtor, Real EstateAllen M.
Owner Realtor, Real Estate
on Capterra

The AI schema creator made it quite literally a 60 second job.

NK
Nick K.
Family Owner, Retail
on Capterra

よくある質問

必要な列だけを取得するにはどうすればよいですか?

列をinboxのフィールドとして定義するか、ドキュメントをアップロードしてAirparserに提案させます。抽出されるのは定義したフィールドだけで、表の各行が結果の1行になります。

表の書式は保持されますか?

いいえ。Airparserは列の値を構造化データとして返すもので、表の見た目のレイアウトをコピーするものではありません。デジタルPDFをすぐに1回だけ変換したい場合は、無料のPDFからExcelへのツールが代替になります。

次のページに続く表にも対応できますか?

このページのサンプルは、2ページ目に続く1つの表で、繰り返される見出し行と折り返された品名を含みます。結果はレイアウトによって異なるため、ご自身のドキュメントで行を確認し、表に合計がある場合は合計も照合してください。

どのファイル形式をアップロードできますか?

PDF(スキャンしたPDFを含む)と画像(JPG、PNG、BMP)に対応しています。スキャンや写真の結果は画像の品質に左右されるため、デジタルPDFのほうが最もきれいな入力になるのが一般的です。

どのエクスポート形式が利用できますか?

アプリからXLSX、CSV、JSONでエクスポートできます。継続的なエクスポートには、Google Sheets連携、Webhook、API、またはZapier、Make、n8nなどの自動化プラットフォームをご利用ください。

クレジットはどのように消費されますか?

PDF1ページにつき1クレジットが消費されるため、2ページのPDFには2クレジットかかります。無料トライアルには月20クレジットが含まれ、クレジットカードは不要です。

料金を見る

データは安全ですか?

お客様のドキュメントがAIモデルの学習に使われることはありません。ドキュメントはいつでも削除でき、保持期間は1日から180日の範囲で設定できます(無料トライアルではドキュメントを30日間保持します)。データは転送時も保存時も暗号化されます。

Trust Centerで詳しく見る

ビジネスを成長させる準備はできましたか? ここから始めましょう。