本文へ移動

AI導入・開発

AI OCRとは?従来のOCRとの違いと生成AIでの読み取り、導入の流れ

AI OCRとは?従来のOCRとの違いと生成AIでの読み取り、導入の流れ

AI OCRは、紙やPDFの書類から文字を読み取り、請求書番号や金額のような項目をデータとして取り出す仕組みです。従来のOCRが文字をテキストに変えることを主な役割にしていたのに対し、AI OCRは手書きの文字や表を読み、書類のどこに何が書かれているかまで扱います。生成AIを使う方式では、取り出したい項目を言葉で説明するだけで、様式の違う書類から値を抽出できるようになりました。

一方で、読み取った結果には誤りが残ります。業務に組み込むときは、読み取りの後に照合と人の確認を置き、確認が済んだデータだけを基幹システムに登録する流れを作ります。この記事では、AI OCRと従来のOCRの違い、生成AIで変わったこと、向く書類、処理の流れと確認の仕組み、3つの方式の選び方、データの扱いを、各サービスの公式資料をもとに整理します。

AI OCRとは:従来のOCRとの違い

OCR(光学文字認識)は、画像に写った文字をテキストデータに変える技術です。スキャンした書類やスマートフォンで撮った写真から文字を取り出し、検索や入力に使えるようにします。

AI OCRは、法律や規格で定められた用語ではありません。この記事では、機械学習のモデルで文字を読み取り、さらに書類の構造や項目を判別してデータとして取り出すものをAI OCRと呼びます。

従来のOCR:読み取る位置を帳票ごとに決める

従来のOCRで帳票から特定の項目を取り出す場合は、「請求金額はこの位置」のように、帳票の様式ごとに読み取る範囲を決めておく方法がよく使われてきました。様式が決まった社内の申請書には向いていますが、取引先ごとに様式が違う請求書や注文書では、様式の数だけ設定が必要になります。現在のクラウドサービスにも、様式が固定された書類向けのテンプレート型の抽出が用意されています。

AI OCR:手書き、表、項目と値の組を読む

GoogleのDocument AIの概要ページは、OCRでテキストとレイアウトを取り出すことに加えて、項目名とその値の組(キーと値)や表を見つけること、書類の種類を判別して後の処理を振り分けることを主な機能として挙げています。MicrosoftのAzure Document Intelligenceも、印刷された文字と手書き文字の読み取り、表や文書構造の抽出に加え、請求書や領収書など書類の種類ごとに学習済みのモデル(事前構築モデル)を提供しています。

ただし、どの言語の手書き文字を読めるかはサービスごとに異なります。2026年10月6日時点で、Azure Document Intelligenceの読み取りモデルは、手書き文字の対応言語に日本語を含みます。一方、Amazon TextractのFAQは、手書き文字、請求書と領収書、身分証明書、質問形式での抽出(Queries)の処理は英語のみと記載しています。日本語の書類を扱う場合は、使う機能ごとに対応言語を先に確かめます。

生成AIで変わった書類の読み取り

取り出したい項目を言葉で説明して抽出する

生成AIを組み込んだ文書処理では、取り出したい項目を説明するだけで抽出を始められるようになりました。GoogleのDocument AIで生成AIを使うカスタム抽出(Custom extractor)は、学習用の書類がなくても項目の定義(スキーマ)だけで抽出するゼロショットに対応し、少数の例で精度を上げる方法では学習用の書類を5件用意するよう勧めています。同じページには、項目名のつけ方が精度に大きく影響するため、内容がわかる名前にするよう注意書きがあります。

Microsoftは、Azure Content Understandingについて、項目を平易な言葉で説明すればラベル付けなしで抽出を始められ、取引先ごとに様式が違う請求書や注文書にも対応しやすいと説明しています。書類に直接書かれていない値を推論する例として、契約の開始日と期間から終了日を導くことも挙げています。

生成AIのモデルに書類を直接渡す

OpenAIやAnthropicのAPIでは、PDFや画像をモデルに直接渡して内容を読ませることができます。OpenAIのドキュメントによると、画像を扱えるモデルにPDFを渡すと、APIはPDFから取り出したテキストと各ページの画像の両方をモデルに渡します。AnthropicのClaudeのドキュメントも、PDFの情報を構造化した形式に変換する使い方を例に挙げています。出力の形をそろえる場合は、OpenAIの構造化出力(Structured Outputs)のように、指定したJSONスキーマに沿って結果を返させる機能を使います。

生成AIでも読み取りの誤りは残る

各社の公式ドキュメントは、画像の読み取りに限界があることを明記しています。OpenAIは、日本語や韓国語のようなラテン文字以外の文字を含む画像では性能が最適にならない場合があることや、小さな文字、回転した文字を読み違える場合があることを挙げています。Anthropicは、画質が低い画像、回転した画像、非常に小さい画像では誤った出力が起きうるとし、完全な正確さが必要な作業には人の監督なしで使わないよう求めています。構造化出力についても、OpenAIは、形式がスキーマに沿っていても中身に誤りが含まれる場合があると説明しています。

生成AIによって、ラベル付けなどの準備をせずに様式の違う書類を扱える範囲は広がりました。ただし、読み取った値が正しいかを確かめる工程は、従来のOCRと同じように必要です。

AI OCRで読み取る書類と業務

請求書・注文書:取引先ごとに様式が違う

請求書や注文書は、取引先ごとに様式が異なり、明細の行数も書類によって変わります。Azure Document Intelligenceの請求書モデルは、請求書や注文書から顧客名、請求先住所、支払期日、請求金額などの項目と明細行を取り出し、スマートフォンで撮影した画像、スキャンした書類、PDFを扱えるとしています。

読み取った値は、そのまま使わずに発注データや取引先マスタと照合します。インボイス制度の登録番号は、国税庁の適格請求書発行事業者公表サイトで確認できます。システムから問い合わせるためのWeb-API機能も提供されており、利用にはアプリケーションIDの発行申請が必要です。

FAX・スキャンした書類:画質が読み取りに影響する

FAXで届いた注文書や複合機でスキャンした書類は、かすれ、傾き、小さな文字が読み取りの誤りにつながります。GoogleのEnterprise Document OCRには、ぼやけ、小さすぎる文字、光の反射など8つの観点でページごとの画質を評価する機能があり、画質の評価を使って書類の処理先を振り分ける使い方が示されています。

申込書・手書きの書類:対応言語とチェック欄

申込書や点検記録のような手書きの書類では、前の節で触れたとおり、手書き文字の対応言語を確認します。申込書ではチェック欄も多いため、チェックの有無を読み取る機能(GoogleのEnterprise Document OCRのチェックボックス抽出、Azure Document Intelligenceの選択マーク)があるかも確かめます。

AI OCRを業務に組み込む処理の流れ

AI OCRを導入するときは、読み取りの精度だけでなく、読み取った後に何をするかを決めておく必要があります。請求書の受付を例にすると、処理は読み取り、項目の抽出、照合、人の確認、基幹システムへの登録の順に進みます。

AI OCRで請求書を処理する流れ
図の要点をテキストで読む

請求書の受付にAI OCRを組み込む場合の処理の流れ。AIが書類から文字と配置を読み取り、請求書番号や金額などの項目を抽出する。システムが発注データや取引先マスタ、登録番号と照合し、明細の合計と請求金額が一致するかも確かめる。信頼度が低い項目と照合で一致しない書類は、担当者が原本と見比べて確認・修正する。確認が済んだデータだけを会計システムなどに登録し、修正の記録を残す。読み取れない書類や想定外の書類は保留し、担当者と期限を決めて判断する。

  1. 読み取り:書類の画像やPDFから、文字とその配置を取り出します。画質が低い書類は、この段階で別の扱いに分けます。
  2. 項目の抽出:請求書番号、取引先、金額、支払期日などを、決めた項目名と形式で取り出します。
  3. 照合:抽出した値を、発注データ、取引先マスタ、登録番号などの既存の情報と突き合わせます。明細の合計と請求金額が一致するかのように、書類の中での整合も確かめます。
  4. 人の確認:信頼度が低い項目や照合で一致しなかった書類を、担当者が原本と見比べて確認し、修正します。
  5. 基幹システムへの登録:確認が済んだデータだけを会計システムや販売管理システムに登録し、誰が何を修正したかを記録に残します。

この流れでは、AIが1と2を、システムが3と5を、人が4と例外の判断を担います。照合を自動で行える項目が増えるほど、人が確認する書類を絞り込めます。AIに任せる範囲と人が確認する場面の決め方は、AIエージェントに任せる仕事、人が確認する仕事の分け方でも解説しています。

読み取ったデータと書類の保存は別に考える

請求書のような国税関係書類は、読み取ったデータとは別に、書類そのものを保存する必要があります。国税庁の「電子帳簿保存法の概要」によると、紙で受け取った国税関係書類は、一定の要件の下で、スキャナで読み取った電磁的記録の保存をもって書類の保存に代えることができます(スキャナ保存)。また、所得税と法人税の保存義務者は、電子メールに添付されたPDFのように電子取引で受け取った取引情報を、一定の要件の下で電磁的記録のまま保存することとされています。AI OCRで読み取るかどうかにかかわらず、保存の要件は国税庁の資料や顧問の税理士に確認します。

AI OCRの精度と確認の仕組み

信頼度で確認する項目を絞る

Amazon Textract、Azure Document Intelligence、GoogleのDocument AIのカスタム抽出(対応するバージョン)は、読み取った値に信頼度(confidence score)を付けて返します。Amazon TextractのFAQは、信頼度を予測が正しい確率を示す0から100の数値として返し、信頼度が一定の値より低い項目に印を付けるルールを設定する使い方を例に挙げています。値が書類のどこにあったかを示す座標も一緒に返るため、確認画面で原本の該当箇所を示せます。

Microsoftの資料は、人の確認なしで処理できる書類の割合をストレートスループロセッシング(STP)と呼び、信頼度と精度が高いほどこの割合を増やせると説明しています。一方で、生成AIのモデルを使って抽出の仕組みを自前で作る場合は信頼度が得られないため、想定される誤りの割合に応じてすべての結果を受け入れるかすべてを確認するか、独自に信頼度を推定する仕組みを作る必要があるとしています。

二重チェックを置く項目

すべての項目を二人で確認し直すと、AI OCRを入れる意味が薄れます。二重チェックは、金額、振込先口座、支払期日のように、誤ると支払いや取引先に影響する項目に絞ります。二人が同じ画面を見るだけでなく、明細の合計と請求金額、発注データと請求金額のように、別の情報と突き合わせる確認も組み合わせます。

例外の扱いを先に決める

読み取れない書類、想定していない種類の書類、照合で一致しない書類は、運用を始めると一定の割合で出てきます。こうした書類を保留する置き場所、確認する担当者、判断の期限を決めておき、保留した理由を記録します。記録がたまると、項目の定義や照合のルールのどこを直すべきかがわかります。

実際の書類で項目ごとに測る

精度は、きれいなサンプルではなく、実際に届く書類で項目ごとに測ります。GoogleのDocument AIのカスタム抽出では、テスト用の書類で書類全体と項目ごとの適合率、再現率、F1値を確認し、本番の目標を満たすかを判断してから使うバージョンを切り替える手順が示されています。試験運用から本番運用へ移すときの確認項目は、AIのPoCを本番運用に移すには?で整理しています。

AI OCRの3つの方式と選び方

AI OCRを使う方法は、業務向けのAI OCRサービス、クラウドの文書AIのAPI、生成AIのモデルで抽出する方法の3つに大きく分けられます。

AI OCRの3つの方式
図の要点をテキストで読む

AI OCRを使う3つの方式の比較表。業務向けのAI OCRサービスは、読み取りから確認画面と出力までを一つのサービスで使え、確認の仕組みはサービスの確認画面を使う。開発の手間は用意された画面を使う分だけ少ないが、対応する書類と出力形式はサービスの範囲に限られる。クラウドの文書AIのAPIは、信頼度と座標が返るため確認画面や照合を業務に合わせて作れるが、画面と連携の開発が必要になる。生成AIのモデルで抽出する方法は、指示とスキーマを変えて書類や項目を変えられるが、信頼度が返らないため確認の絞り方を自分で設計し、指示の保守を続ける必要がある。

業務向けのAI OCRサービス

読み取りから確認・修正の画面、データの出力までを、一つのサービスで使える形にしたものです。システム開発の手間を抑えて始めたい場合や、担当者が画面で確認作業を行う場合に向きます。対応する書類の種類、確認画面の使い勝手、出力できる形式と連携先、料金の単位を、自社の書類で試して確かめます。

クラウドの文書AIのAPI

Google Cloud Document AI、Azure Document Intelligence、Amazon Textractのように、読み取りと抽出の機能をAPIで提供するものです。信頼度や座標が返るため、確認画面や照合の処理を自社の業務に合わせて作れます。その分、画面や既存システムとの連携を開発する必要があります。

生成AIのモデルで抽出する

OpenAIやAnthropicのAPIに書類を渡し、指示とスキーマで項目を取り出す方法です。指示とスキーマを書き換えれば、扱う書類や項目を変えられます。一方で、前の節のとおり信頼度が返らないため、確認する対象の絞り方を自分で設計し、指示の調整と保守も続ける必要があります。

Microsoftの資料は、選ぶ目安として、事前構築モデルがある書類はそこから始めること、様式のばらつきが大きい書類には項目を言葉で定義する方法を使うこと、モデルや指示を完全に管理したい場合に自前での構築を検討することを挙げています。GoogleもEnterprise Document OCRの使い道として、OCRで取り出したテキストと配置を生成AIのモデルと組み合わせる方法を挙げており、方式を組み合わせる構成もとれます。

AI OCRで扱うデータとセキュリティ

請求書や申込書には、取引条件や個人情報が含まれます。クラウドのサービスに書類を送る前に、送ったデータがどう扱われるかを公式の資料で確認します。扱いはサービスや設定によって異なり、2026年10月6日時点の公式資料には次のように記載されています。

  • Google Cloud:Document AIのモデルの学習に顧客のデータを使わないとしています。一方、生成AIを使うカスタム抽出の一部のプレビュー版は、地域を問わないエンドポイントを使うため、データを処理する地域を限定する基準に準拠しないと注記されています。
  • Microsoft:Azure Document Intelligenceは、リソースを作成した地域でデータを処理し、送信した書類と解析結果を解析の完了から24時間保存した後に自動で削除するとしています。
  • AWS:Amazon Textractは、サービスの改善のために入力された書類を保存・利用する場合があり、AWS Organizationsのオプトアウトポリシーで停止できるとしています。オプトアウトしない場合、内容の一部が別のリージョンに保存されることがあります。
  • OpenAI:APIに送信したデータは、利用者が明示的に同意しない限りモデルの学習に使わないとしています。不正利用を監視するためのログは、原則として最大30日保持されます。

確認する点は、学習への利用の有無、保存期間と削除の方法、データを処理・保存する地域、アクセスできる人の範囲です。社内の情報セキュリティの規程や、取引先との秘密保持の取り決めに照らして、送ってよい書類の範囲を決めます。読み取りから入力までの業務を外部に委託する場合の確認項目は、AI×BPOとは?従来のBPOとの違いと向く業務、委託前の確認項目で整理しています。

AI OCRの導入を進める手順

AI OCRの導入は、対象の書類を絞って始め、確認の仕組みを整えてから範囲を広げると進めやすくなります。

  1. 書類を棚卸しする:書類の種類、受け取り方(紙、PDF、FAX)、月ごとの量、入力先のシステムを洗い出します。
  2. 項目と照合のルールを決める:取り出す項目、その形式、照合に使うデータ、二重チェックを置く項目を決めます。
  3. 実際の書類で評価する:過去の書類を使い、項目ごとの正しさと、人が確認する書類の割合を測ります。
  4. 一部の書類で試行する:対象の取引先や部署を絞って運用し、修正の内容と理由を記録します。
  5. 範囲を広げる:記録をもとに項目の定義やルールを見直し、対象の書類を広げます。

想定例:請求書の受付にAI OCRを組み込む場合

以下は説明のための架空の例です。取引先から紙、メールに添付されたPDF、FAXで請求書が届く経理部門を想定します。

最初は取引の多い取引先の請求書に絞り、請求書番号、取引先、登録番号、請求金額、支払期日、振込先口座の6項目を抽出の対象にします。抽出した取引先と金額は発注データと照合し、登録番号は公表サイトのWeb-API機能で確認します。信頼度が低い項目と照合で一致しない請求書は確認画面に回し、担当者が原本と見比べて修正してから会計システムに登録します。振込先口座が前回と変わっている請求書は、信頼度にかかわらず別の担当者が確認します。1か月の試行で修正した項目と理由を記録し、項目の定義と照合のルールを見直してから対象の取引先を広げます。

社内に開発や運用の担当者がいる場合は、この記事の流れと確認項目を導入の計画に使えます。担当者が足りない場合は、書類の整理から確認画面や連携の開発、運用の設計までを外部の支援と分担する方法もあります。

inovieでは、扱う書類と業務の整理から、読み取り、照合、確認画面を含むシステムの試作と検証、既存システムとの連携、運用の設計までを支援しています。支援の範囲と開発例はAI導入・システム開発の支援をご覧ください。書類の読み取りから登録までの業務自動化について、お手元の書類でどこまでできるかのご相談は、お問い合わせから受け付けています。

出典確認日:2026-10-06

この記事をシェアする

← ブログ一覧に戻る記事の先頭へ ↑