最近のベンチマークでは、複数のOCRエンジンを複雑なネストフォーム文書で評価し、重要なギャップが明らかになりました。主要なツールはテキスト認識に優れていますが、元のビジネス構造を正しく再構築できるものはほとんどありません。テストでは、保険、銀行、法律文書で一般的な階層フィールド、条件付きセクション、マルチレベルテーブルに焦点を当てました。結果は、TesseractやGoogle、AzureのクラウドAPIなどの従来のOCRエンジンはフラットなテキスト抽出には優れているが、ネストされた関係を保持できないことを示しました。Amazon TextractやMicrosoft Form Recognizerなどの専門的な文書AIプラットフォームは構造保持に優れていますが、深くネストされたレイアウトでは依然として課題があります。文書処理パイプラインを構築する開発者にとって、OCRの精度だけでは不十分であり、構造認識型の後処理や専用のフォームパーサーが不可欠です。この発見は、スキャン文書からの構造化データ抽出に依存するRAGシステムに直接的な影響を与えます。企業が完全自動化を目指す中、フォームからビジネスロジックを保持する能力は、依然として未解決の重要な課題です。
複数のOCRエンジンを複雑なネストフォーム文書で評価した結果、テキスト認識はできても元のビジネス構造を保持できないツールが多いことが判明。文書理解システムを構築するチームにとって重要な知見です。