面向 AI Agent 的前沿 AI 推理云 — FriendliAI 创始人 Chun Byung-Gon (Gon)

AAI Engineer
Computing/SoftwareSmall Business/StartupsInternet Technology

Transcript

00:00:00我们开始吧。大家好,非常感谢大家的到来。今天是下午的最后一场,也是大会的最后一天,所以我真的很感激。
00:00:25我是 Friendly AI 的创始人兼 CEO 贡。今天我想谈谈智能体推理。首先,我将探讨发生了什么、为什么它很重要,以及我们如何为智能体重建推理云。
00:00:40在深入探讨之前,请允许我简要介绍一下 Friendly AI。Friendly AI 是专为智能体打造的前沿 AI 推理云。
00:00:50实现规模化、更快、更便宜和更高的可靠性。我们诞生于首尔大学的一个研究团队,这些研究根基至今仍在定义着我们。
00:01:02我们是发明连续批处理的团队,这项推理优化技术现在已成为行业标准,我们的 ORCA 工作启发了广受欢迎的开源框架 vLLM。
00:01:15今天我们在全球开展业务,总部位于旧金山,并在首尔设有团队,以扩大前沿推理的规模。
00:01:24如你所知,2026 年是智能体大规模进入生产环境的一年,这是由两个趋势的交汇推动的。
00:01:33首先,智能体正在呈指数级增长。AI 智能体正在推动软件、运营和知识工作领域的爆发式采用。
00:01:45其次,开源模型已经达到了前沿水平,并使智能体变得经济可行。它们现在在能力上可以媲美闭源前沿模型,这意味着你可以用低得多的 Token 成本在开源模型上运行前沿质量的智能体。
00:02:00让我来证明,开源模型现在已经足够强大,可以支持这些类型的真实智能体工作流。
00:02:13这里我们将完全相同的任务——用编码智能体构建一个塔防游戏——交给了两个模型。
00:02:19左边是运行在 Friendly AI 上的开源模型 GLM 5.2。右边是 Anthropic 的 Opus 4.8。
00:02:29重点不在于输出完全相同。重点在于,两者都以清晰可用的水平完成了任务。
00:02:38对于许多智能体工作流而言,开源模型已经跨过了质量门槛,但经济效益却大不相同。
00:02:49对于同一任务,Opus 4.8 耗资约 1.50 美元。而 Friendly AI 上的 GLM 5.2 仅需 0.27 美元,便宜了 5.6 倍。
00:03:03这就是我之前提到的承诺。开源模型以极小的一部分成本为你提供前沿质量的智能体。
00:03:12但模型成本只是其中一部分。要让智能体真正快速且可靠,推理技术栈本身必须发生改变。
00:03:22因此,让我们来看看智能体工作流内部到底发生了什么。
00:03:28首先,来看看工作流的变化。过去,主要的用法是聊天。
00:03:34基本单位是一个请求。一个人提问,模型回答,然后这个人阅读回答。
00:03:41延迟意味着我多快能得到一个响应?但智能体则不同。基本单位是一个任务。
00:03:49一个任务可能涉及许多模型调用、许多工具调用,并且可能会自主运行一段时间。
00:03:58因此,用户并不真正在意单个请求的延迟。
00:04:04用户关心的是整个任务何时完成。
00:04:08这意味着我们必须针对任务进行优化,而不仅仅是单个请求。
00:04:16让我们更仔细地看看智能体工作流。智能体实际上运行的是由任务组成的会话。
00:04:23每个任务通常在循环中运行。首先,它进行规划,这通常意味着调用大语言模型。
00:04:29然后它采取行动,也许是通过调用工具。接着它观察结果并将结果加回上下文中。
00:04:38它重复这一过程,直到任务完成。
00:04:41因此,我们在大语言模型推理和一个或多个非大语言模型工具执行之间不断交替。
00:04:50所以在两次大语言模型调用之间存在间隙。智能体还可以创建子智能体并并行运行它们。
00:05:01智能体的输入看起来也与聊天截然不同。这里的图表显示了我们日常使用的、带有 GLM 5.2 的内部编码智能体运行的提示词和补全长度分布。
00:05:15它们的长度要长得多。随着任务的进展,它们会不断增长,因为每个观察结果都会被附加回上下文中。
00:05:25这里有一个重要的模式。连续的智能体步骤通常共享一个巨大的前缀。
00:05:32如果我们每次都重新计算相同的前缀,我们就是在已经完成的工作上浪费大量的计算资源。
00:05:40因此,这是智能体推理中最大的机遇之一。
00:05:46那么,智能体对 Token 的需求有多大呢?
00:05:49现在让我们看一个长视野任务的例子,比如深度研究。
00:05:53我们在 Friendly AI 上使用带 GLM 5.2 的 Kilo code 解释了 vLLM 中的投机解码框架。
00:06:02这里有多个阶段,每个阶段都由子智能体组成,这些子智能体运行多个推理和工具调用。
00:06:12因此,它可能会运行数十甚至数百个推理步骤,有时会持续几分钟或几小时。
00:06:19而且共享上下文在这整个过程中不断增长。
00:06:23对用户而言,重要的不是单个 Token 或一次调用的延迟。
00:06:28重要的是我的任务何时完成。
00:06:35所以智能体推理不仅仅是带有更多请求的聊天。
00:06:39这是一个不同的问题。上下文随时间增长。
00:06:43工具工作穿插在模型调用之间。
00:06:46模型调用的次数取决于输入。
00:06:49所以你无法真正围绕固定的请求速率计划来进行规划。
00:06:55真正的指标端到端任务延迟,而不是单个请求的延迟。
00:07:02那么我们该怎么做呢?让我向您展示背后的关键工程技术。
00:07:23这是我们思考这一问题的工程路线图。
00:07:27我们围绕智能体工作流,一层一层地构建技术栈。
00:07:33我今天要讲四大支柱。
00:07:37前缀缓存、键值(简称为 KV)缓存管理、缓存感知路由以及智能体感知优化。
00:07:48当然,在底层,我们需要模型层优化,例如针对长上下文的稀疏注意力、
00:07:56减少错误的技術、快速解码、弹性服务等。
00:08:02在这项工作中,我将重点介绍这四大支柱。
00:08:05让我们从前缀缓存开始。
00:08:09由于智能体步骤共享一个大的前缀,我们计算一次前缀的键值并将其缓存起来。
00:08:17然后在随后的步骤中,我们复用缓存的键值,并且只处理新的后缀。
00:08:23从缓存中读取比重新计算预填充要便宜得多,
00:08:27因此这改善了首字延迟,并减少了每一步的计算量。
00:08:33而且在智能体中任务运行的时间越长,这一点就越有价值。
00:08:41但缓存只有在 KV 缓存真正装得下且能高效移动时才起作用。
00:08:48因此我们需要强大的 KV 缓存管理。
00:08:52我们使用内存管理将更多活跃上下文打包到每个 GPU 内存中。
00:08:59我们使用 KV 量化来减少内存占用。
00:09:04我们在 GPU 内存、主机内存和磁盘之间使用分层缓存,这样我们就可以超越 GPU 的限制。
00:09:13我们还使用分布式缓存,以便一个前缀可以在多个副本之间提供服务,而不局限于单个实例内部。
00:09:26在全球集群规模下,路由变得非常重要。
00:09:29简单的负载均衡器可能会将请求均匀地分发到各个 GPU 集群,但这会破坏缓存局部性。
00:09:38全局规模的缓存感知路由器则会采取更聪明的做法。
00:09:42它将请求发送到已经缓存了正确前缀的 Pod,从而将沉重的预填充转变为一次缓存命中。
00:09:51与此同时,它仍然必须平衡负载,这样就不会让某个 Pod 变成热点。
00:09:58在此示例中,任务 A 的两个请求为了缓存局部性而被发送到同一个 Pod。
00:10:08下一个部分是智能体感知优化。
00:10:11这是智能体推理的下一个前沿。
00:10:16今天,大多数系统将每个大语言模型调用调度得好像它们是独立的一样。
00:10:21它们并不真正理解这次调用是较长智能体程序的一部分。
00:10:27但是,如果优化器了解智能体级别的上下文,它就能做出更好的决策。
00:10:33例如,抢占正确的工作、为可能的下一步投机性地预填充上下文,或者根据智能体级别的上下文做出更好的缓存驱逐决策。
00:10:48因此,目标是减少端到端任务延迟,而不仅仅是让单次调用看起来很快。
00:10:58当我们将所有这些结合在一起时,这就是回报。
00:11:01我们正在使用相同的模型 GLM 5.2,配合 Kilo code 来创建一个简单的手机游戏。
00:11:07我们在 Friendly AI 的模型 API 和另一个知名推理提供商上运行了相同的任务。
00:11:14正如您所看到的,得益于我们以智能体为中心的云设计,Friendly AI 更快地端到端完成了相同的任务。
00:11:24那么这在实践中释放了什么呢?
00:11:29一个更强大的生产智能体技术栈。
00:11:32挑选一个你已经喜欢的智能体。
00:11:35现在,接入在 Friendly AI 上运行的开源前沿模型,如 GLM 5.2、Minimax 和 Kimi。
00:11:43模型为你提供前沿质量的能力和更好的经济效益。
00:11:49Friendly AI 为你提供生产环境所需的的速度、可靠性和端到端任务性能。
00:11:56这种质量、速度、可靠性和成本的结合,正是让智能体在生产环境中真正有用且经济可行的原因。
00:12:06Friendly AI 目前正在为从 AI 原生初创公司到全球企业的生产团队提供支持。
00:12:15我想在这里重点介绍几个。
00:12:20Kilo 是一个广受欢迎的智能体 AI 编码工具,服务于数百万用户。
00:12:27LG 是一家全球性企业,其业务从电子产品到医疗保健再到能源。
00:12:35这些公司截然不同,但它们都需要相同的东西。
00:12:39快速、可靠、具有成本效益的智能体推理。
00:12:45我们客户 Kilo 的这段评价说明了一切。
00:12:50在过去的一年里,Kilo code 测试了几家托管开源和闭源模型的推理提供商。
00:12:56在将 GLM 5 的使用情况与其他第三方提供商以及来自 Model Lab G.AI 的直接使用进行分流测试时,
00:13:05Friendly AI 的速度始终快七倍,且错误率显著降低。
00:13:12今天,Friendly AI 是 Kilo 技术栈的核心组件。
00:13:17你可以按照最适合你技术栈的方式使用它。
00:13:23模型 API 是开始使用的最快方式。
00:13:26通过我们的无服务器 API 提供核心前沿开源模型。
00:13:29专用端点为你提供自己的隔离部署,并为生产工作负载提供有保证的 SLA。
00:13:36BYOG(自带 GPU)允许你在自己的基础设施上运行 Friendly 推理。
00:13:44相同技术栈,三种部署方式。
00:13:49总而言之,有三件事需要记住。
00:13:53首先,前沿开源模型使生产智能体在经济上可扩展。
00:13:59其次,智能体不只是拥有更多核心的聊天。
00:14:03智能体推理需要通过我提到的挑战来优化端到端任务延迟。
00:14:10第三,Friendly AI 是作为面向智能世界的推理云构建的。
00:14:16快速、可靠、具有成本效益的智能体推理。
00:14:23感谢您参加我的演讲。
00:14:25如果您正在构建智能体,今天就在 Friendly AI 上尝试一下前沿开源模型,
00:14:30您可以在几分钟内在 Friendly AI 上开始使用。
00:14:34谢谢大家。
00:14:35演讲结束后我会在附近。
00:14:37谢谢。
00:14:38谢谢。

Key Takeaway

面向智能体的推理云通过前缀缓存、KV 缓存管理和缓存感知路由等四大工程支柱,使开源模型在降低 5.6 倍成本的同时实现了前沿质量和高速的端到端任务性能。

Highlights

  • Friendly AI 源自首尔大学研究团队,曾发明连续批处理并启发了 vLLM 开源框架。

  • 开源模型 GLM 5.2 在塔防游戏构建任务中仅需 0.27 美元,比 Anthropic Opus 4.8 便宜 5.6 倍。

  • 智能体推理的核心挑战在于端到端任务延迟,而不是单个请求的响应时间。

  • Friendly AI 的推理技术栈包含前缀缓存、KV 缓存管理、缓存感知路由以及智能体感知优化四大支柱。

  • 在 Kilo code 的分流测试中,Friendly AI 的运行速度始终快七倍且错误率显著降低。

  • Friendly AI 提供模型 API、专用端点和 BYOG 自带 GPU 三种部署方式。

Timeline

Friendly AI 的背景与开源模型的经济优势

  • Friendly AI 是专为智能体打造的前沿 AI 推理云,起源于首尔大学的连续批处理研究。
  • 开源模型在能力上已可媲美闭源前沿模型,并具备显著的 Token 成本优势。
  • 在编码智能体构建塔防游戏的任务中,Friendly AI 上的 GLM 5.2 耗资 0.27 美元,比 Opus 4.8 便宜 5.6 倍。

Friendly AI 继承了发明连续批处理和 ORCA 工作的研究根基。随着 2026 年智能体大规模进入生产环境,开源模型已经跨过了质量门槛,支持真实的智能体工作流。通过具体的塔防游戏构建测试证明了开源模型能以极小成本提供前沿质量。

智能体工作流的独特性与优化需求

  • 智能体的基本单位是任务而非单个请求,包含多次模型调用、工具调用和自主运行循环。
  • 智能体输入提示词长度显著增加,且连续步骤共享巨大的前缀。
  • 智能体推理的核心指标是端到端任务延迟,而非单次请求延迟。

聊天与智能体的工作流存在本质区别。智能体在 LLM 推理和非 LLM 工具执行之间交替,上下文随时间不断增长。由于连续步骤共享相同的前缀,每次重新计算前缀会造成巨大的计算资源浪费,因此必须针对端到端任务延迟进行优化。

智能体推理云的四大工程支柱

  • 前缀缓存复用已计算的键值,仅处理新后缀以改善首字延迟。
  • KV 缓存管理通过内存管理、量化、分层缓存和分布式缓存突破 GPU 限制。
  • 全局缓存感知路由器将请求发送至已缓存正确前缀的 Pod,同时平衡负载避免热点。
  • 智能体感知优化器根据智能体级别的上下文做出抢占和预填充决策。

为了解决智能体推理的挑战,工程路线图构建了四大技术支柱。前缀缓存减少了重复计算。KV 缓存管理利用多种缓存策略提升效率。全局路由器确保缓存局部性。智能体感知优化则从全局上下文出发减少端到端延迟。

生产环境性能与多样的部署方式

  • 在创建手机游戏的测试中,Friendly AI 依托以智能体为中心的云设计更快完成了端到端任务。
  • Kilo code 的实测表明 Friendly AI 的速度始终快七倍且错误率显著降低。
  • 用户可以通过模型 API、专用端点或 BYOG 自带 GPU 三种方式使用该技术栈。

Friendly AI 目前已为 Kilo 和 LG 等企业提供支持。Kilo 的实测数据验证了其速度和可靠性优势。平台提供了无服务器 API、隔离部署和自带基础设施等多种接入选项,满足不同生产团队的需求。

Community Posts

No posts yet. Be the first to write about this video!

Write about this video