推理工程最新动态 — Philip Kiely,Baseten

AAI Engineer
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00今天我要和大家聊聊推理工程领域的最新进展,大家好,我是 Philip,今天能来到这里是因为
00:00:19我写了一本书,这是我第三次参加 AI 工程师世界博览会,这是我最喜欢的
00:00:24全球会议,也是我每年日程安排中最期待的亮点,我真正
00:00:29作为演讲者和工程师崭露头角就是在 2024 年的这里,2025 年我再次回归并做了很多事情
00:00:36现在我又来了,我非常喜欢这里,也非常感谢主办方一直邀请我,我写了
00:00:44《推理工程》这本书,大概三四个月前出版的,这段时间
00:00:49大家的反响让我受宠若惊,我是 2 月 23 日出版的,截至目前
00:00:57纸质书销量已突破 1.1 万册,电子书也即将达到 3 万册,全世界有 2400 万
00:01:04人或 2400 万个 Twitter 账号,具体有多少实际人数我们拭目以待
00:01:09看到过关于推理工程的内容,在收到这么多积极反馈的同时
00:01:17大家也一直在问我同一个问题:你究竟为什么要写这个?为什么
00:01:23要为更新迭代如此迅速的技术写一本书?嗯,我认为推理工程的很多
00:01:29核心原则如今已经非常巩固了,有许多经验可以
00:01:34在代代更迭的模型中不断学习和复用,但今天我站在这里,主要是想聊聊
00:01:42推理工程有哪些新动态,这是自本书出版以来,首个公开补充全新信息的演讲
00:01:48我们将稍微回顾一下推理工程的基本原则,然后讨论
00:01:54自 2026 年 2 月 23 日以来推理界发生的一切,我们会谈谈
00:02:00TurboQuant 的现状,稍微聊聊 KV 压缩,并花大量
00:02:05时间讨论 D-Flash 以及投机解码中其他一些令人兴奋的新技术,接着我会做一些
00:02:12接着我会做一些预测,对推理领域接下来的发展走势
00:02:17做一点展望,以及我希望下次再站在这里时能和大家分享的兴奋内容
00:02:23能站在这里和大家分享的令人兴奋的内容。太棒了,那我们开始吧。在与
00:02:30我总结出了几条核心共识,其中非常重要的一条是……前几天我和 Sarah 录播客时也聊到了推理
00:02:38我们发现目前实际上演化出了两类推理工程:一类是本地推理
00:02:44其核心策略就是无论手头有什么硬件,先设法让模型跑起来
00:02:48不管是通过量化、蒸馏还是剪枝,想尽一切办法压缩模型
00:02:56把它拆分到家里现有的各种 GPU 上,首先让它跑起来,然后再想办法降低它的“蠢度”
00:03:02消除因模型过度压缩而导致的致命问题,力求
00:03:09在 Batch Size 为 1 的情况下将其恢复到基线智能水平;而另一类
00:03:15则是我的领域,即大 Batch Size 和数据中心的世界,这里的逻辑是“先跑通”
00:03:20从第一天起把 vLLM 的构建做起来、让它正常运转,然后再想办法提高速度
00:03:27比如采用感知 KV 的路由、投机采样和解耦架构等技术,在这两个世界中,我认为我们有很多可以互相借鉴的地方
00:03:33在这场演讲中,我将重点关注面向数据中心的推理工程进展
00:03:40因为那是我熟悉的领域,但本地推理领域同样有着许多非常酷的前沿突破
00:03:46在《推理工程》这本书中,我通常假设权重是成品
00:03:52我认为从训练到推理的交接是一个非常关键的环节,也是界定该领域范围的好方法
00:03:58然而最近我越来越发现,许多推理优化手段本质上源自专门的训练过程
00:04:03因此训练与推理之间的界限正变得越来越模糊,这是个值得关注的有趣现象
00:04:10我们正在看到这样一个循环:更快的推理带来更多数据,进而训练出更好的模型
00:04:17训练和推理之间的界限正变得越来越模糊,这一点非常值得关注
00:04:22我们正在看到这样一个循环:更快的推理带来更多数据,进而训练出更好的模型
00:04:28在涵盖我称之为“三大支柱”的各个方面,我们有一系列新技术要探讨
00:04:33我们将探讨量化方面的新动态、缓存(特别是 KV Cache 机制)的新动态
00:04:39以及投机解码的新动态,因为尽管推理世界还有许多其他内容
00:04:45包括我最后会谈到的东西,但在如何让模型 X 变得更快这个日常实操问题上
00:04:52这三种技术通常是大家首选的武器
00:04:57首先,我二月份刚出版了新书,当时感觉自我良好,心里想:“哇”
00:05:02“关于推理你需要知道的一切都在这里了”,结果接着……量化界就爆出了新新闻
00:05:09先简单复习一下,量化就是使用更小、精度较低的数值格式
00:05:16以节省带宽、节省计算量,并提升首字延迟(TTFT)和每秒 Token 数(TPS)
00:05:23它通常高度依赖特定硬件,能节省成本,但可能会稍微牺牲一点模型质量
00:05:32顺便说一句,如果你想听我对量化的长篇大论,我上个月在 AI 工程师迈阿密大会上做过一场演讲
00:05:39阐述了量化并不一定像听起来那么糟糕,以及在此过程中你可以通过很多手段来保持模型质量
00:05:45我原本对自己在书中对量化的阐述挺自豪的,结果两千万人看到了 TurboQuant
00:05:51甚至一度导致内存概念股在大盘上下跌,因为大家都在想“哇,现在内存效率要提高这么多”
00:05:57“我们不再需要那么多闪存了”,虽然这种想法是错的,但无论如何,这种全新的量化方法
00:06:04在今年三月风靡一时,它采用极坐标进行量化
00:06:12能将 KV Cache 压缩到 4 位,当时热度极高,我心里直呼“天哪”
00:06:16“我漏掉了整整一套东西,这到底会发展成什么样?”
00:06:23于是我们团队对此展开了大量研究,大家可能知道 Twitter 上的 Waterloo 实习生
00:06:29我们模型性能团队的 Ali,我不确定他现在还是不是实习生
00:06:36但他来自滑铁卢大学,他写了一篇出色的文章剖析了 TurboQuant 背后的数学原理
00:06:43简单来说,TurboQuant 带给你的好处是可以用 4 位代替 8 位来表示 KV Cache
00:06:50节省了一半的空间和一半的带宽,在系统内存中移动 KV Cache 时有效带宽翻倍
00:06:57但它的缺点也非常明显:事实证明,为了在解码过程中实现这一点
00:07:04你必须在前向传播中增加额外的计算量,这会导致 TPS 直接腰斩以上
00:07:09对于许多生产环境的使用场景而言,这种权衡是完全无法接受的
00:07:14因此我们深入研究了 TurboQuant,但最终并未将其用于任何实际的生产工作负载
00:07:21我们依然沿用传统的 NVFP4 量化,话虽如此
00:07:25它对本地推理人群来说确实是一项伟大的技术,如果你要在本地电脑或地下室的 GPU 上
00:07:32运行模型,特别是长上下文语言模型,内存容量是最大的头号瓶颈
00:07:38因此任何能释放 KV Cache 内存、让你能够塞入更长序列的技术都极具价值
00:07:44而前向传播额外的计算代价也就显得没那么致命了
00:07:51所以 TurboQuant 依然是一篇极好的研究论文,也是一项非常优秀的技术,只是在数据中心推理场景下
00:07:58它的适用性并没有乍看之下那么强。相反,我们正专注于 NVFP4
00:08:04把重点放在量化模型权重而非 KV Cache 上,竭尽全力找出量化权重中的瑕疵
00:08:09确保不会展平概率分布;至于 KV Cache 本身,则转而关注 KV 感知路由、KV 卸载和 KV 共享
00:08:16利用 NCCL、NVIDIA Dynamo 等工具在系统内部迁移 KV Cache
00:08:22并将其卸载至 CPU 常规内存等位置,而不是试图使用 TurboQuant 来对其进行压缩
00:08:28此外,我们也关注跨模态的量化,思考如何将 NVFP4 的优势
00:08:36不仅应用于语言模型,还能拓展到图像和视频模型中,Ali 在 Twitter 上写过很多精彩内容,大家可以去看看
00:08:41话虽如此,KV Cache 依然至关重要,接下来我们来聊聊 KV 压缩
00:08:49快速复习一下:如果在输入时使用带有相同前缀的 Prompt,就能复用上次预填充(Pre-fill)计算出的 Token
00:08:55这会让整个系统运行得更快、更高效,广义上讲,KV Cache 属于无损内存
00:09:04当我们思考推理系统时,无损内存的来源只有少数几种:Prompt 的内容、上下文以及 KV Cache
00:09:11它们的体积会随输入数据量线性增长,现在如果考虑到百万级的序列长度
00:09:17开销实际上相当可观,因此很多人都在思考如何压缩内存、如何压缩上下文
00:09:23智能体框架会压缩上下文,RAG 检索等我们讨论多年的技术
00:09:29本质上都是将庞大的上下文压缩成可以喂给模型或写入文件的内容
00:09:35这些方法的增长速度都远低于数据量的线性增长,但如果有折中方案呢?
00:09:42如果有一种方法可以在大幅压缩记忆数据的同时,做到近乎无损的信息保留呢?
00:09:48关于 Cache 中该保留什么,我们有许多不同的思考角度
00:09:55最近的压缩方法表明,我们可以用更短的 Cache 来替换原有的 Cache
00:09:59像 Attention Matching 和 Cartridges 等论文在保持高压缩比的同时
00:10:05展现出了非常令人前景看好的成果,但它们都是在推理阶段运行的
00:10:11正如我之前提到的,我想探讨的核心主题之一是“为推理而训练”
00:10:17在此情况下,我想介绍由 Base 10 研究团队提出的 STILL 技术
00:10:22它在 Cache 之上进行合成,保留信息的学习化表征
00:10:28而非直接存储原始信息或确定性的子集,并通过训练来分摊成本
00:10:34来自我们后训练团队的 Charlie 和 Mudith 最近在 Coda Compile 做了一场出色的 Chalk Talk
00:10:41视频已上传至 YouTube,如果大家对 KV 压缩感兴趣,强烈建议看看
00:10:47更短的缓存。像 Attention Matching 和 Cartridges 这类论文
00:10:53在此展现了极具前景的高压缩率效果,但它们都是在推理阶段运行的。再次强调,
00:11:00我想讨论的技术或主题之一,就是“为推理而训练”。
00:11:05在这个背景下,我想介绍 Base10 研究团队提出的 STILL,它在缓存之上进行合成,
00:11:12缓存的精简合成,使我们能保留信息的已学习表征,而非原始信息
00:11:17或某种确定性的子集,这是通过训练摊销成本来实现的。来自我们
00:11:25后训练团队的 Charlie 和 Mudith 最近在 CoSA Compile 上做了一场出色的黑板演讲,
00:11:31视频已经上传到 YouTube 了。如果你对 KV 压缩感兴趣,我非常建议大家去看看。
00:11:37很遗憾,我没有足够的时间或天赋在这里把一切都解释清楚,
00:11:46但其基本机制是:STILL 是一种 Perceiver 瓶颈,
00:11:53它接收一组固定的可学习 Query 向量,与完整的 KV 缓存进行交叉注意力计算,并在单次前向传播中生成一组紧凑的键值对。
00:11:59这创建了一个快速、可微的压缩记忆,大语言模型可以像对待真实上下文一样对其进行注意力计算。
00:12:05所以如果你对 KV 压缩感兴趣,一定要关注 Charlie 和 Mudith 的工作,
00:12:09了解这些成果真的很棒。这就是我们讨论过的两种技术:
00:12:16量化和缓存。最后一种是投机采样(Speculation),这里发生了很大的变化。
00:12:21简单回顾一下:在投机解码中,我们会生成草稿 Token,在
00:12:29前向传播中验证它们,并借此在单次前向传播中生成多个 Token。
00:12:34这对提升每秒 Token 数很有帮助,而且是一种完全无损的优化,这太棒了,
00:12:40因为我们完全不用担心质量问题。在投机发展的历史中,我们刚开始
00:12:46做投机解码时——这些在书里都有写——你使用的是 SpecDec,即用同系列的小模型
00:12:52来生成草稿 Token。事实证明,小模型并不是出色的草稿 Token 生成器,
00:12:58它们只是不错的小模型而已。于是作为整个行业,我们发明了一系列新方法,比如 Medusa,
00:13:04直接在模型上添加解码头;最终到了 Eagle 3,也就是:如果
00:13:09我们不使用同系列的小模型,而是基于目标模型的
00:13:15隐藏状态专门训练一个十亿参数的模型来生成草稿 Token 呢?这效果确实非常好。
00:13:21大概截至去年 2 月或者今年 2 月,Eagle 3 还是投机采样领域
00:13:27最好的方法。而现在我们有了 dFlash,dFlash 甚至更好。它是基于扩散模型的投机采样,
00:13:36dFlash 能直接生成一串草稿 Token 序列,而不是单个 Token。这个模型是一个扩散语言模型,
00:13:43这意味着它生成整个 Token 序列的方式,就像视频或图像生成
00:13:49生成一串帧或像素序列并在其上迭代一样,而不是进行自回归式的 Token
00:13:55生成。dFlash 模型的运行速度可能慢两到四倍,但它们能在这个窗口内
00:14:01一次性预测 8 或 16 个 Token,而 Eagle 一次只能预测一个。因此,单次 dFlash
00:14:08前向传播比整个 Eagle 起草阶段还要快,并且能预测更多 Token。这些 Token 能够
00:14:14相互进行交叉注意力计算,从而普遍带来更高的接受率,因为在投机采样中,接受率
00:14:21就是一切。在实际应用中,我们看到 dFlash 带来了超过 3 倍的提升,这是在
00:14:30单卡 B200 运行 Qwen 38B 上测得的。与 Eagle 相比,它在 Token 接受率
00:14:40和每秒 Token 数量上都有实质性的提升。这些 dFlash 模型采用了专门用于
00:14:47双向起草的注意力掩码进行训练。目标模型将提供上下文,
00:14:54在每个块内部,我们将对一部分干净的 Token 进行采样,注意力掩码将强制
00:14:59保持因果一致性,但依然允许双向注意力。而在
00:15:06传统的自回归模型中,你只能观察单一方向的 Token,所以这就是为什么我们能够
00:15:13利用这种基于扩散的架构。然后,我本以为自己
00:15:19讲完了,结果几天前 dSpark 发布了。dFlash 我们已经在生产环境中运行了,
00:15:25而 dSpark 是极新的研究。对于它,我基本上只能说:“嘿,它存在,很酷,我们
00:15:31正在密切关注。”相比 dFlash,它依然保留了扩散模型,但同时也将其与
00:15:38序列模型相结合。其核心思路是通过让这两个模型协同工作,来进一步提高接受率,
00:15:45而不是仅仅依靠单一的迭代投机器、单一的扩散
00:15:51投机器或单一的自回归投机器。所以 dSpark 非常令人兴奋,但我们目前还没有
00:15:57生产环境的数据可以分享。希望下次能有机会展现给你们。
00:16:03不过,我们在“持续投机器再训练”方面确实拥有生产实践成果。这里我们
00:16:09讲回 dFlash。这个理念在于,投机解码非常依赖于
00:16:15系统处理的实际 Prompt 和 Response 内容。因此,如果你
00:16:21在生产线上持续基于这些 Prompt 和 Response 重新训练,你的 Token 接受率可以提升 20% 甚至高达 2 倍。
00:16:29这在实践中其实非常困难:它需要海量的存储,并且你必须确保
00:16:36拥有授权,可以按照这种方式使用处理的数据;
00:16:40它需要极大的算力,你还得在各处传输所有这些信息;而且如果你
00:16:46更换了底层的基座模型,也必须同步更换投机模型。但当我展望
00:16:51未来时,我确实认为对于超大规模系统而言,持续投机采样将是一个非常值得投入的优化方向。
00:16:58那么,推理领域的下一个风口是什么?以下完全是我个人的观点、推测
00:17:06以及公开信息的结合。如果我真的掌握了任何未公开的内幕,我在这里也是不能透露的。
00:17:11所以,这仅仅代表我个人对未来的展望。我已经亲历了
00:17:17三次硬件迭代周期:经历了 Ampere、Hopper 以及 Blackwell 的发布。
00:17:23从这些芯片出货,到它们部署安装进数据中心,再到
00:17:30整个软件栈真正能够充分释放它们的硬件潜能,总是需要时间的。但我目前
00:17:36感到非常兴奋的是:在 Rubin 架构上,NVFP4 的性能表现似乎会非常惊艳。
00:17:44因此,我们越能坦诚地借鉴端侧本地推理的技术,并在这种 NVFP4 数据格式下运行模型时建立起足够的信心,
00:17:49我们就越能够充分利用即将推出的 Rubin 系统那强悍无匹的
00:17:54性能。我认为解耦(Disaggregation)以及全系统维度的
00:18:00通信将会变得越来越重要。我们已经看到 PD
00:18:05解耦带来的极其出色的早期收益,而在整个系统范围内流动传输像 KV 缓存数据这类信息的能力,
00:18:12也将会变得愈发关键。正如我之前所说,“为推理而训练”的主题
00:18:17在未来将继续对整个行业产生深远的影响。非常感谢大家
00:18:25前来倾听这次演讲!大家可以在 Twitter 和 LinkedIn 上找到我,另外我正在现场免费赠书,
00:18:32你可以扫描二维码下载 PDF,或者和我一起去 Base10 展位领取免费的
00:18:37《推理工程》实体书。我们在那里准备了很多,也许足够每个人都拿一本,如果不够的话,我们也会叫同事
00:18:43从办公室再带一些过来。所以是的,我一会儿就在楼下的 Base10 展位,再次非常感谢大家,
00:18:48祝大家度过愉快的一天!

핵심 요약

数据中心推理工程的核心在于利用为推理专门训练的突破性技术——如 dFlash 扩散投机解码和 STILL 缓存压缩——在无损或极低损耗的前提下大幅提升吞吐量与性能。

하이라이트

  • 《推理工程》纸质书销量突破 1.1 万册,电子书接近 3 万册,Twitter 曝光量达 2400 万次。

  • TurboQuant 使用极坐标将 KV Cache 压缩至 4 位,但前向传播增加的计算量导致 TPS 降低超过一半。

  • STILL 架构通过 Perceiver 瓶颈和固定可学习 Query 向量进行交叉注意力计算,实现可微的紧凑 KV Cache 压缩。

  • dFlash 基于扩散模型进行双向起草,单次前向传播预测 8 到 16 个 Token,在单卡 B200 运行 Qwen 38B 上带来超过 3 倍的性能提升。

  • 基于生产环境真实 Prompt 和 Response 对投机器进行持续再训练,可将 Token 接受率提升 20% 至 2 倍。

타임라인

推理工程的发展与范式分化

  • 推理工程演化出本地推理与数据中心推理两大不同阵营。
  • 训练与推理之间的界限因“为推理而训练”的趋势而日益模糊。

本地推理以 Batch Size 为 1 为主,核心策略是不惜代价压缩模型以适应现有硬件并恢复基线性能。数据中心推理则聚焦于大 Batch Size 场景,优先跑通 vLLM 等系统,再通过 KV 路由、投机采样与解耦架构提升速度。更快的推理产生更多数据,从而反哺训练出更优质的模型,形成闭环。

TurboQuant 评估与数据中心量化策略

  • TurboQuant 将 KV Cache 压缩至 4 位,但因前向传播计算开销导致吞吐量腰斩。
  • 数据中心推理更适合采用 NVFP4 进行权重量化,配合系统级 KV 缓存管理。

TurboQuant 利用极坐标将 KV Cache 压缩一半并节省带宽,极度适合显存容量受限的本地长上下文推理。但在数据中心场景下,其带来的前向计算开销会导致 TPS 降低 50% 以上,难以用于生产环境。数据中心转而采用 NVFP4 量化权重,结合 NCCL 和 NVIDIA Dynamo 进行 KV 卸载与跨节点迁移。

基于 STILL 的可学习 KV 缓存压缩

  • STILL 技术通过训练分摊成本,实现对 KV Cache 的精简合成与已学习表征保留。
  • Perceiver 瓶颈结构允许模型对压缩后的记忆直接计算注意力。

上下文与 KV Cache 的无损占用随输入数据量线性增长,引发极大的开销。不同于推理阶段的 Attention Matching,STILL 机制在训练阶段引入 Perceiver 瓶颈,利用固定可学习 Query 向量与完整 KV Cache 交互,在单次前向传播中生成紧凑键值对,提供快速且可微的压缩记忆。

从 Eagle 到 dFlash 与 dSpark 的投机解码进阶

  • dFlash 采用扩散语言模型进行块状起草,单次前向传播生成 8 至 16 个 Token。
  • 在单卡 B200 运行 Qwen 38B 的测试中,dFlash 相比 Eagle 实现了超过 3 倍的性能提升。
  • dSpark 将扩散模型与序列模型结合以进一步提高 Token 接受率。

投机解码已从早期 SpecDec 小模型起草发展到 Eagle 3 隐藏状态起草,再演进至 dFlash 扩散起草。dFlash 通过双向注意力掩码训练,像图像生成一样非自回归地一次性预测 Token 序列。块内 Token 相互进行交叉注意力计算,大幅提高了接受率,且单次起草速度超越 Eagle。

持续投机器再训练与 Rubin 架构展望

  • 基于生产数据对投机器进行持续再训练,可将 Token 接受率提升最高 2 倍。
  • 下一代 Rubin 架构上的 NVFP4 性能表现与全系统 PD 解耦是未来的重要趋势。

持续投机采样再训练依赖海量算力、存储与数据授权,但在超大规模生产线中能带来显著的接受率增益。随着硬件迭代,Rubin 架构对 NVFP4 的支持将进一步释放端到端性能,全系统维度的 PD(Prefill/Decode)解耦与数据流动能力将成为大模型推理的关键支撑。

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기