データレディネス・インデックス2026: AI を活用して成功するための基盤について学びましょう。

結果を見る
  • Cloudera Cloudera
  • | パートナー

    エンタープライズ AI の新たなボトルネックはドキュメントの中に潜んでいる

    Sid Manchkanti Headshot
    タブレットを見ている男性と女性

    この記事は、2026/06/09に公開された「The New Bottleneck for Enterprise AI Sits Inside the Document」の翻訳です。

    ここ 2 年ほど、エンタープライズ AI に関する議論は、AI モデルから始まっていました。組織は、どの基盤モデルを使用するか、どのようにファインチューニングするか、そしてどのオーケストレーションフレームワークが最良の結果をもたらすかについて議論してきました。

    その議論は変化しつつあります。基盤モデルの能力が向上し、利用しやすくなり、プロバイダー間での互換性が高まるにつれ、多くの組織は、モデルのパフォーマンスがもはや AI の成果を左右する最大の制約要因ではないことに気づき始めています。その代わり、ボトルネックはパイプラインのさらに上流、つまり AI システムにデータを提供するドキュメント層に存在するようになっています。

    金融サービス、医療、通信分野の CIO や CDO との対話では、同じような見解が繰り返し聞かれます。課題はもはや、モデルの推論方法ではありません。重要なのは、モデルが何を基に推論しているかです。

    モデルは、エンタープライズ AI 推論におけるボトルネックではもはやありません。ドキュメントの理解の層です。その見方は、エンタープライズ AI スタックにおいて、価値とリスクの所在が構造的に変化していることを示しています。

    真の課題:非構造化データとドキュメントインテリジェンス

    規制の厳しい企業環境では、最も重要なデータの多くは、整理された構造化データとしてデータウェアハウスのテーブルに保存されているわけではありません。PDF、スキャン文書、申請書類、保険金請求明細、契約書、財務諸表、検査報告書、料率表といった非構造化データとして存在しています。こうしたデータこそが AI システムの基盤となっています。

    ドキュメントインテリジェンスとは、この非構造化データを、AI モデルで使用可能な構造化された入力へと変換するプロセスを指します。この段階で失敗すると、その影響は AI パイプライン全体に波及します。

    その失敗の原因は、一見したところ意外なほど単純です。表の読み取りミスやセルの結合によって、誤った形式でデータが抽出されることがあります。その抽出によって、埋め込みの生成に誤りが生じ、検索時に適切でないコンテキストが返されることになります。その結果、モデルは誤った入力を基に、自信たっぷりの誤った回答を生成します。

    その時点では、どれほど高度なモデルであっても、根本的なエラーを補うことはできません。モデルのパフォーマンスを改善しても、モデルが実行される前に発生した構造的な問題は修正されません。実際には、ドキュメントパイプラインの品質が、AIシステムの精度の上限を決定することがよくあります。

    解析エラーがビジネスリスクとなる場合

    ドキュメント解析の精度が低いことによる影響は、ビジネスの成果に直接現れます。その影響は具体的で測定可能であるにもかかわらず、経営層には十分に認識されていません。これこそが、ドキュメントインテリジェンスが単なる技術的な課題以上のものとなっている理由です。多くの企業では、すでにこのことが運用面と財務面の課題となっています。

    解析エラーは、発生したときに目に見えることはあまりありません。その代わりに、ワークフロー、意思決定、ビジネスプロセスを通じて、その後さらに積み重なっていきます。問題が表面化する頃には、対処にかかるコストは予防のコストをはるかに上回ることも少なくありません。

    金融サービス

    金融サービス業界では、ファンド管理会社の資本勘定計算書に記載された数値を一つ誤って読み取るだけで、その後の引受審査や責任準備金のモデルにエラーが連鎖的に波及することがあります。こうした誤りは、規制上の問題につながる可能性があるだけでなく、数百万ドル規模に及ぶ高額な是正対応を招くこともあります。

    ヘルスケア

    医療機関は、請求書、送金通知書、臨床記録の作成において、依然として手作業によるドキュメント抽出に大きく依存しています。これは、データ構造の複雑さと、保護対象医療情報に関する厳格な要件が部分的に影響しています。

    手作業によるドキュメントの抽象化は、ヘルスデータ運用予算において常に最大の項目の一つとなっています。

    通信

    通信業界では、ベンダー間の相互接続請求やサービスレベル契約(SLA)に複雑な料金表が含まれていることが多く、大規模な環境でこれを正確に読み取れるシステムはほとんどありません。わずかな不正確さであっても、キャリア規模では数億ドルもの損失につながる可能性があります。

    これらの業界全体におけるパターンは同じです。不正確なドキュメントの理解は、単なる技術的な不便さではありません。それは、静かに悪化していく損益(P&L)の問題です。

    トレードオフ:精度対データ主権

    精度に関する問題に加え、規制対象の企業に特有の 2 つ目の制約があります。それは、AI 処理がどこで行われるかという点です。

    ここ数年、エンタープライズ AI の推論スタックの大部分は、顧客が管理する環境である仮想プライベートクラウド(VPC)、オンプレミスインフラストラクチャ、またはソブリンクラウドリージョンへと着実に移行しています。モデル、ベクトルストア、オーケストレーション層、およびオブザーバビリティは、現在、基盤となるデータと同じガバナンス制御下で動作しています。しかし、ドキュメント解析だけは、やむを得ず例外となっています。

    歴史的に、最も精度の高いドキュメント処理オプションは SaaS API 経由でのみ提供されており、規制対象の顧客は、以下に示す精度と主権のどちらかを選択せざるを得ませんでした。

    • より高い精度を得るために、企業内の最も機密性の高いドキュメントをサードパーティの API へルーティングする。 

    • データをエンタープライズの境界内に保持し、最も重要なワークフローにおいて意味のある精度のギャップを受け入れる。 

    コンプライアンス、法務、リスクの各チームは、長らく両方の選択肢を妥協案と見なしてきました。その結果、多くの組織が、ビジネスに不可欠なワークフローに必要な精度を達成することと、機密データがどこで処理されるかを管理し続けることという、等しく重要な 2 つの優先事項のバランスを取ることに苦労しています。

    最近まで、その両方を実現するための明確な道筋はありませんでした。

    エンタープライズ・ドキュメントインテリジェンスの成熟しつつあるカテゴリー

    幸いなことに、このトレードオフは解消されつつあります。業界全体で、組織はドキュメントインテリジェンスシステムの評価方法に対してより厳格なアプローチをとるようになっています。特に、従来の解析手法では対応が困難であった複雑な表や高度に構造化されたビジネスドキュメントにおいて、その傾向が顕著です。

    同時に、新世代のドキュメントインテリジェンスプロバイダーによって、顧客が管理する環境内で高いレベルの解析精度を実現することが可能になっています。Pulse チームは最近、PulseBench-Tab をオープンソースとして公開しました。これは、規制の厳しい業界の企業が実際に扱う文書を対象に開発された、表解析の最先端ベンチマークです。

    これには、実際の財務関連の提出書類、政府のレポート、企業開示資料、規制当局への提出書類から抽出された、1,820 件の人手でアノテーションされた表が含まれており、9 つの言語と 4 つの文字体系にまたがっています。その多くには、結合セルや複数セルにまたがるセル、従来の解析システムでは処理できないことが多い複雑な構造が含まれています。

    重要な点として、このベンチマークでは、テキストと構造の正確性の両方を捉える統合スコアリング手法である T-LAG を導入しています。これにより、テーブルの形状を密かに破壊しながら近似テキストを抽出するようなシステムが評価されることを防ぎます。

    このベンチマークの結果は、サードパーティの SaaS エンドポイントを使用せずにドキュメント解析で最先端レベルの精度を達成可能であることを示しており、エンタープライズ AI パイプラインに新たなレベルの信頼性をもたらします。

    9 社のプロバイダーが独立かつ公開された形で評価され、その評価手法には、S&P Global の Enterprise Data Organization のメンバーによる学術的な貢献が反映されています。そのベンチマークにおいて、Pulse は全 1,820 サンプルを完全に網羅し、0.9347 という T-LAG スコアを達成しました。これは、次に近いプロバイダーの 0.8155 を大きく上回る結果です。

    エンタープライズ AI スタックへのドキュメントインテリジェンスの導入

    この進歩により、エンタープライズ AI の新しいアーキテクチャが実現します。それは、ドキュメントインテリジェンスが他のデータパイプラインと同じ環境内で動作するアーキテクチャです。ドキュメントインテリジェンスがガバナンスの行き届いたエンタープライズ環境内に導入可能になることで、組織はドキュメント処理を他の AI スタックと同じ運用およびガバナンスの境界内に収めることができるようになります。

    AI を活用したレイクハウス・アーキテクチャと組み合わせることで、構造化データと非構造化データを管理するためのより統一されたアプローチが実現し、取り込みから推論に至るまで、一貫したセキュリティ、データリネージ、オブザーバビリティ、ガバナンス制御が可能になります。

    Pulse のようなソリューションは、このアーキテクチャが実際にどのようなものになり得るかを示しており、機密データをエンタープライズ環境の外に出すことなく、組織が複雑な文書を解析して構造化できるようにします。

    その結果、以下が可能な完全に統合されたパイプラインが実現します。

    • 非構造化ドキュメントを解析
    • それらを構造化データに変換
    • 関連するコンテキストの埋め込みと取得
    • AI モデルを使用して出力を生成

    これらすべて、同一の制御された環境下で行われます。

    CIO にとってそれは、セキュリティ保護、監査、管理が必要な断片化された環境の寄せ集めではなく、AI ワークフロー全体にわたる単一のガバナンス境界を意味します。

    CFO にとっては、ドキュメント処理を継続的に発生する外部サービスへの支出から、既存の AI データ基盤を活用した社内の中核的な業務基盤へと転換できる可能性があります。

    さらに重要なのは、組織がどこに投資を集中すべきかが変わることです。モデルがますます利用しやすくなるにつれて、競争優位性は、それらを支えるデータパイプラインの品質、ガバナンス、および信頼性へとシフトしています。

    規制の厳しい業界に何をもたらすか

    規制の厳しい業界で AI 戦略を策定するエグゼクティブにとって、ドキュメントインテリジェンスの向上は、運用指標に目に見える影響をもたらします。

    金融サービス

    金融機関は、10-K 報告書や各種提出書類、ファンド管理記録、ボルドロー(保険契約明細)の処理、保険金請求明細、数理計算レポートをすべてガバナンスが確立された環境内で処理できます。さらに、後続の AI エージェントが出力結果を信頼できるだけの高い構造解析精度を実現することで、人によるレビューサイクルにかかる負担と時間を削減できます。

    これまで手作業による照合に充てられていた人員を、より価値の高い分析業務に再配置できます。

    ヘルスケア

    医療機関は、臨床試験データの抽出、検査パネルの取り込み、給付説明(EOB)処理といった文書量の多いワークフローを、構造化された PHI と同じ環境で自動化できます。これにより、医療データ運用における最大のコスト項目の一つが大幅に削減されると同時に、収益サイクル時間と臨床研究ワークフローが加速します。

    通信業界

    通信事業者は、接続契約や料金体系を、収益漏れの回収に必要な詳細レベルで正確に解釈できるようになります。これにより、これまで複雑な料金表の中に埋もれていた収益漏れを回収できるようになります。

    いずれの場合も、ドキュメントインテリジェンスの向上は、測定可能なビジネス価値に直結します。

    未来を見据えて:ソブリン AI スタック

    エンタープライズ AI の重心は移りつつあります。モデルの能力が収束し続ける中、持続的な競争優位性は一段下のレイヤー、つまりデータから推論に至るパイプラインへと移行しています。具体的には、組織がいかに効率的に非構造化データを処理し、ガバナンスを効かせられるかが鍵となります。

    いまや、ドキュメントインテリジェンスが精度と ROI の上限を決めます。同時に、規制の厳しい業界ではデータ主権は譲れません。AI はデータがある場所で運用する必要があります。Cloudera の「AI とデータをあらゆる場所で活用する」というビジョンが活きるのは、まさにこの領域です。ハイブリッド環境とマルチクラウド環境全体に AI を展開し、データはその場に保持したまま、一貫したガバナンスを徹底できます。

    Pulse と組み合わせることで、規制対象の企業は、その上に構築されるあらゆるワークフローの精度、制御、および基礎となる ROI を保護する「AI ネイティブ」への道筋を得ることができます。それこそが、カスタマーが求めていたソブリン AI スタックであり、今やそれが実現可能なものとなっています。

    Your form submission has failed.

    This may have been caused by one of the following:

    • Your request timed out
    • A plugin/browser extension blocked the submission. If you have an ad blocking plugin please disable it and close this message to reload the page.