AIエージェントのためのドキュメント・コンテキスト・レイヤー構築 — Jerry Liu, LlamaIndex
AAI Engineer
Computing/SoftwareInternet Technology
Transcript
00:00:00SharePoint内で継続的に更新されるような、RAGのナレッジベース
00:00:04検索用途ですね。こうした場合、極端に不正確なのは避けたいですが、
00:00:08多少の乱れなら問題ありません。最終的に
00:00:12十分優秀なエージェントがあれば、ドキュメントの深くを探索し、適切な
00:00:16引用や根拠とともに正しい情報を提示できるからです。そのため、こうした用途では
00:00:20コスト制約に優れた、拡張性のあるオフライン・インデックス作成パイプラインを構築することが
00:00:25最適となります。しかし、VLMベースの手法に関して1つ言えるのは、
00:00:31通常それほど高速ではないということです。リアルタイムでの
00:00:36ファイルアップロード、例えばCloud Coworkを使用して1,000件のドキュメントをアップロードし、
00:00:411分以内に処理する必要がある場合、多数のVLMで大規模に処理するのは非常に困難です。
00:00:47公平に言えば、世の中のほぼ全てのOCRサービスにとって難しく、当社のサービスも例外ではありません。
00:00:52全般的に、極めて低遅延なソリューションのニーズも存在しており、
00:00:57高度な視覚的検査や分析のためにVLMを活用した深い処理を行う場合でも、
00:01:03リアルタイムで処理できるようにする必要があります。これが、私が言う「エージェントループ内での活用」です。
00:01:08ドキュメント処理や抽出を行う商用サービスであるLlamaParseのほかに、
00:01:12当社はLightParseというツールも作成しました。
00:01:17これが驚くほど優れています。Twitterの
00:01:21スレッドをご覧になった方もいるかもしれませんが、Rust製で、オープンソースパーサーとしては最速です。
00:01:27完全無料であり、制約もほぼありません。MITまたはApacheライセンスだと思います。
00:01:33VLMや高度なモデルを使用しないパーサーの中では、
00:01:37最高精度のMarkdownパーサーと言えます。そのため、支援型エージェントのループ内で
00:01:43デフォルトとして利用できる点において、非常に優れています。例えば、
00:01:48Cloud CodeやCloud Codework、Codexに多数のドキュメントをアップロードし、1,000件のPDFを
00:01:53超高速で処理させたい場合でも、常にそれを行うことができます。その上で、LlamaParseなどのVLMベースのパーサーや
00:01:59他の最先端モデルをツールとして組み込みます。そうすればエージェントは、まず全ドキュメントを
00:02:04迅速に一次スキャンします。極めて効率的にすべてのコンテキストを
00:02:09見渡すのです。そして、表やグラフが含まれるページを
00:02:13より深く掘り下げて数値を理解する必要が生じた場合のみ、処理速度は遅いもののVLMベースのツールを使用して
00:02:19情報を正確に読み取るようにします。この機能は
00:02:22ワンクリックでインストール可能なスキルとして提供されており、他のあらゆる高精度なVLMベースOCRツールを補完します。
00:02:27可能な限り高速に動作し、お気に入りのAIエージェントへ
00:02:32簡単に組み込めるよう設計されています。
00:02:35少し早口で説明してしまいましたが、要するに当社は
00:02:42構文解析層(パーシングレイヤー)に多くの時間を費やしてきました。また、ドキュメントの抽出や検索、
00:02:47もちろんドキュメントワークフローに関する、意味解析層やストレージ層といった他のコンポーネントもあります。
00:02:51時間の都合上、エージェントネイティブなドキュメント形式や「サービスとしてのヒルクライミング(Hill-climbing as a Service)」など、
00:02:57未開拓の領域についての説明はスキップさせていただきます。ただし、
00:03:01スライドの全データはオンラインで共有いたします。意味解析層およびストレージ層に関してですが、
00:03:06ドキュメントの構文解析だけでなく、多くのユースケースではドキュメントから大規模に構造化データを
00:03:12抽出して取得することが求められます。100万件の請求書や経費精算書、
00:03:16領収書、申請書を処理する場合でも、
00:03:21後続のデータベースやシステムに投入できる構造化データを出力として確実に得る必要があります。
00:03:26そのため、こうしたユースケースの多くは、大量の書類の確認やデータ入力を
00:03:31人間が手作業で行っていた業務を、いかに自動化するかという点に集約されます。
00:03:36請求書、申請書、契約書、領収書など、対象が何であれ同様です。
00:03:41当社はそうした機能をLlamaParse内にも構築しました。当社の機能の多くは、
00:03:47低コストでありながら極めて高い精度を実現するよう調整されています。また、抽出されたすべてのデータに対して、
00:03:52元ドキュメントのソースまで遡れる詳細な引用情報が取得できます。
00:03:56もちろん、確信度スコアを伴ったパイプライン処理を大規模に実行可能です。また、
00:04:02ソフトウェアシステムへデータを投入する前に、特定の値の正確性に確信が持てるかどうかを
00:04:06フラグ付けすることもできます。さらに、ドキュメント検索機能もあり、これは先述の通り
00:04:12情報抽出、BM25、Grep、ベクトル検索、読解、スクロールなどをカバーする拡張ツールセットです。
00:04:19これらの機能は、当社の商用プラットフォームおよびオープンソース製品の両方でご利用いただけます。
00:04:23ですが、本日は現在存在する全般的な概念の全体像をお伝えしたかった次第です。今後の展望に関するこのセクションはスキップし、最後へ進みます。時間を超過してしまい申し訳ありませんが、本日はご清聴いただき心より感謝申し上げます。それでは最後に、
00:04:36急いでこのパートへ移動しますね。あ、そうです。この部分はスキップしてオンラインに掲載します。興味のある方はぜひブース「LG 47」にお立ち寄りください。本日は大規模なピックルボール大会も主催しています。ご清聴ありがとうございました。
00:05:06ありがとうございました。
Community Posts
No posts yet. Be the first to write about this video!
Write about this video