Transcript
00:00:00比如在 SharePoint 中持续更新,仅用于 RAG 知识库
00:00:04搜索。在这种情况下,你显然希望它不要太不准确,
00:00:08但哪怕有点搞砸了,也没关系,因为归根结底,如果你有
00:00:12一个足够优秀的 Agent,它总能深入文档并调出正确的
00:00:16信息,并附带正确的引用和依据。所以对于这些情况,
00:00:20能够创建一个具备最佳成本约束的可扩展离线索引流水线,
00:00:25是非常理想的。不过,基于 VLM 的方法有一点就是,
00:00:31它们通常不是很快。很多时候,如果你有实时
00:00:36文件上传需求,假设你正在使用 Cloud Cowork,你上传了 1000 份文档,
00:00:41需要在几分钟内处理完,让一堆 VLM 进行大规模处理真的很吃力,
00:00:47对市面上基本上每一个 OCR 服务都是如此,说实话也包括我们的。我认为
00:00:52总体而言,也需要一种极其低延迟的解决方案,
00:00:57这样你才能真正实时处理内容,即使你拥有更深层的基于 VLM 的
00:01:03处理,用于更深入的视觉检查和分析。这就是我所说的
00:01:08“处于 Agent 循环之中”。除了 LlamaParse——这是我们围绕文档处理和提取的商业服务之外,
00:01:12我们还创建了这个叫做 LightParse 的工具。
00:01:17它出奇地非常好用。不知道大家有没有关注 Twitter 上的
00:01:21讨论,它是基于 Rust 的。它是目前最快的开源解析器。它是完全
00:01:27免费的,没有任何附加条件。好像使用的是 MIT 或 Apache 开源协议。
00:01:33它基本上是目前最准确的 Markdown 解析器,且无需使用 VLM 或
00:01:37任何其他更深层次的模型。这挺不错的,因为你可以
00:01:43把它作为辅助 Agent 循环中的默认选项。假设你上传了一堆文档
00:01:48到 Cloud Code、Cloud Codework 或 Codex,你希望它极速处理
00:01:53上千份 PDF。你随时可以做到。然后,把基于 VLM 的解析器(如 LlamaParse
00:01:59或其他前沿模型)配备为一种工具。这些 Agent 会做的是,先对所有文档
00:02:04进行快速预扫。相当于极高效地把所有上下文过一遍。
00:02:09如果它确实需要深入了解某个包含表格、图表
00:02:13的页面,并需要更深层次地理解其中的数值,它就会使用基于 VLM 的工具,通过稍慢的
00:02:19处理过程,来确保准确读取信息。该功能
00:02:22现已作为一键安装的技能提供。它可以补充你想使用的任何其他更深层的基于 VLM 的 OCR 工具。
00:02:27我们的设计初衷就是让它尽可能快,同时方便
00:02:32插接到你最喜欢的 AI Agent 中。
00:02:35我快速过了一下这些内容,但基本上,我们在解析层
00:02:42投入了大量时间。此外在文档提取和搜索的语义层与存储层,
00:02:47当然还有文档工作流方面,也有其他通用组件。由于时间关系,
00:02:51我可能会跳过一些未探索的领域,比如 Agent 原生文档格式、爬山法即服务(Hill-climbing as a service)等。
00:02:57但我会在网上分享全套 PPT。至于语义层和存储层,
00:03:01除了文档解析外,很多用例还需要大规模地从文档中
00:03:06提取结构化信息。无论你是在处理上百万张发票、报销单、
00:03:12收据还是索赔单,你都需要确保能获取
00:03:16可以放入下游数据库或系统的结构化输出。因此,很多这类用例
00:03:21基本上都是围绕着“如何将人类通常在扫描大量文件和录入数据时
00:03:26所做的大量工作自动化”这一形式。无论是发票、索赔单、
00:03:31合同、收据还是其他文件。我们在 LlamaParse 中也集成了
00:03:36这些功能。我们的许多功能实际上都是针对低成本和极高准确度
00:03:41进行调优的。对于每个提取出的输出,你都可以获得追溯至源文档的
00:03:47细粒度引用。当然,你可以在流水线中大规模运行它,并附带置信度评分。
00:03:52每个提取出的输出结果,都能精准追溯到原始文档。当然,你也可以在
00:03:56流水线中大规模运行此功能,并附带置信度评分。此外,还能自动标记
00:04:02还有文档搜索,如前所述,它基本上是一个扩展的工具集,
00:04:06涵盖检索、BM25、grep、向量搜索、阅读和滚动等。所有这些功能
00:04:12都可以通过我们的一些商业平台以及开源产品来获取。但我只是想
00:04:19描绘一下当今这一领域的总体概念图景。所以关于下一步计划的这一部分我就跳过了,直接拉到最后吧。我知道我已经有点超时了,所以非常感谢大家今天抽空参加。接下来让我
00:04:23快速看看怎么跳到这部分。对,这段我就跳过了,我会把内容发到网上。如果大家有兴趣,我们的展位在 LG 47。我们今天还会举办一场大型匹克球比赛。感谢大家的时间。
00:04:36谢谢。
00:05:06谢谢。
Community Posts
No posts yet. Be the first to write about this video!
Write about this video