Kimi K3 已经达到了 Fable 的水平……(他们该担心了)
BBetter Stack
Computing/SoftwareSmall Business/StartupsInternet Technology
Transcript
00:00:00Kimi K3 来了,老实说它真的很震撼。它不仅追上了 Opus 和
00:00:04GPT 5.5,还追上了 Fable 和 GPT 5.6。开源模型并没有我们起初
00:00:10想的那么落后。让我们来看看。先从公告说起。Kimi K3 是一个拥有 2.8 万亿
00:00:19参数的模型,基于 Kimi Delta Retention 和 Attention Residuals 构建,具有原生视觉
00:00:24能力和 100 万 token 的上下文窗口。它是世界上第一个 3 万亿级别的开源模型,
00:00:29专为长跨度编码、知识工作和推理等前沿智能领域而设计。
00:00:34在他们博客展示的所有基准测试中,Kimi K3 要么紧追 Fable
00:00:38和 GPT 5.6 Soul,要么在某些领域甚至超越了它们。这种飞跃太疯狂了,
00:00:43我想很多人都没预料到。当然,这只是他们自己的基准测试,所以让我们来看看
00:00:47人工智能和第三方基准测试,很高兴地说,结果基本
00:00:52吻合。在这个基准测试中,我们可以看到观看视频的人中有 80% 左右还没有订阅,
00:00:56所以如果你想跟上软件开发和 AI 的最新动态,请点击那个订阅按钮。
00:01:00再来看看真正的基准测试,从编码指数开始,它得分为 76.2,
00:01:06这比 Fable 5 落后 0.3 分,略高于 GPT 5.5,超过 Opus 4.8,
00:01:12也超过了 GPT 5.6 Luna,仅略逊于 GPT 5.6 Soul 和 Terra。看看他们从上一代模型取得的跨越式进步。
00:01:19再看看智能体指数,情况也是一样。
00:01:23它排在第三,仅次于 Fable 和 Soul,但这依然非常令人印象深刻,你已经习惯了
00:01:29这一点,但在智能指数上也完全一样。所以即便是第三方
00:01:32基准测试也证实了这个模型非常出色。遗憾的是,录制时我们还没有 Deep SWE 的结果,
00:01:38但如果看看我们自己的基准测试,你会发现它又排在第三。
00:01:42这个模型看起来简直好得令人难以置信。我目前发现它唯一的缺点就是
00:01:46价格有点贵。除非你家里有超级计算机,否则我不认为你
00:01:50在本地运行它,所以通过 API 使用的话,价格实际上是 100 万输入 token 3 美元,
00:01:54100 万输出 token 15 美元。这比 Kimi K 2.6 有了很大提升,
00:02:00折扣结束后,价格与 Sonic 5 大致相同,但比 Fable 5、
00:02:06Opus 和 GPT 5.6 更便宜。API 定价并不是全部,如果我们结合成本来看它的实际表现,
00:02:12每个任务的费用实际上与 GPT 5.6 Soul 相似,大约是 Opus 4.8 的一半,
00:02:17当然也比 Fable 和 Sonic 5 更便宜。所以它与那些前沿闭源模型相比很有竞争力,但
00:02:22对于那些喜欢开源模型是因为它们稍微便宜一点的人来说,这个模型可能
00:02:26并不适合你。GLM 5.2 是这里的第二好选择,价格只有一半。它也不是
00:02:31有史以来最快的模型,但在我看来,在同等智能水平下它相当有竞争力。
00:02:36总的来说,老实说很难对这个模型有什么负面评价,所以让我们直接
00:02:40进入我的本地测试看看吧。我让这些模型做的第一个测试是创建一个
00:02:44完整的 3.js 一级方程式赛车游戏,所有代码都在一个 index.html 文件中,这是通过 Open Router 运行的 Kimi K3。
00:02:50我还测试了 Kimi Code CLI,看看框架是否有变化。
00:02:56你可以看到在下方,它在开始前思考了 14 分钟,总共花了
00:03:0035 分钟制作了这个 3.js Web 应用,花费了 1.24 美元的 API token。得到的结果
00:03:06相当令人印象深刻。显然它无法访问任何外部资源,所以它在尽力创建
00:03:11这些模型。但赛道确实有效。我们有 AI 赛车手,看起来它们能绕着
00:03:16赛道跑。你可以看到障碍物确实起作用,所以我不会穿墙而过。我们的位置也在更新。
00:03:21地图在更新,当前时间在更新,圈数也在更新。我已经跑了
00:03:25完整的一圈并确认一切正常。对于 Kimi K3 给我们的结果来说,这非常不错。
00:03:30如我所说,我也测试了不同的框架。这是在 Kimi Code 中运行的 Kimi K3。这个版本
00:03:35我认为看起来更好一点。它在资源处理上做得更好,尽管那只是一个
00:03:39风格指南。这些模型运行起来有点延迟,但操控感稍好一些。
00:03:43控制依然是反转的,这似乎是很多此类 3.js 应用中的一种模式,
00:03:48不知为何。但再说一次,所有这些处理得都很好,而且它有诸如冲出
00:03:52赛道会减速之类的功能。是的,它也做得相当令人印象深刻。现在让我们
00:03:57把它与前沿模型进行比较。我们有在 Claude Code 中运行且设定为 max 的 Fable 5,它花了
00:04:0144 分钟制作了我的 3.js 应用。还有同样设定为 max 的 GPT 5.6 Soul,
00:04:07它花了 18 分钟。这是 Fable 给我的结果。我们称之为 Fable GP。我会说
00:04:12它看起来稍微好一点点,也许吧。但所有这些都只是风格选择。而且控制
00:04:17在这个版本中并不是反转的。还有一点摄像机晃动,我认为这是一个不错的
00:04:22风格。同样,就像其他模型一样,这里的一切似乎都在正常工作。我测试了
00:04:26跑完整圈,尽管很困难。我们也确实有一些碰撞检测,如你所见。总之,
00:04:31一切似乎都运作良好,与 Kimi K3 的表现相当。GPT 5.6 Soul 的情况也是如此。
00:04:35如你所见,我们这里有一个可用的游戏。虽然我要指出,这里的道路是
00:04:40草地。它并没有渲染出来。一切似乎都在正常工作。控制
00:04:44在这个模型中也是反转的。而且我们还有一些反向的素材。我不知道为什么这些模型
00:04:48似乎喜欢这样做。唯一没这样做的就是 Fable。这里的赛道也变得有点
00:04:53混乱。所以这是唯一一个没有为我制作出可用赛道的模型。最后再加入一个
00:04:57比较。我还检查了 GLM 5.2 的表现,因为它是下一个最佳开源模型。这个模型
00:05:02思考了 5 分 58 秒。虽然它并没有在一个提示词内完成。实际上存在
00:05:07几个 Bug。所以我不得不重新发送一个提示词。即便如此,当我最终让游戏运行起来时,
00:05:11你可以看到这里有很多 Bug。首先,我们在赛道上的起始位置不对。
00:05:15而且实际上根本没有赛道。看起来也比其他的模型差得多。
00:05:20所以 Kimi K3 确实有很大的提升。进入测试 2。我要求创建一个
00:05:25个人财务管理仪表板。这将构建一个带有前端和后端的全栈应用。
00:05:29我唯一的要求是不需要身份验证。我还要求它预填充一些数据。
00:05:33我再次在 Open Router 中使用 K3 进行了测试。然后又在 Kimi Code 中测试。所以这个是在 Open
00:05:38Router 中运行的。你可以看到它总共花了 56 分钟为我制作了这个应用。成本
00:05:43是 1.30 美元。这是它给我的结果。老实说,我没什么可抱怨的。
00:05:48这正是我所要求的。这是一个个人财务管理仪表板。我认为它看起来
00:05:53也非常棒。我们拥有所有功能,比如这里的额外页面。我也
00:05:57检查了添加资金和发送资金的功能。一切正常。所以它做得非常好。我也
00:06:01总是很好奇它是用什么工具来完成任务的。因为我实际上没有在提示词中
00:06:05给它任何关于使用什么栈的说明。你可以看到前端这里,它选择了
00:06:09React 和 React DOM。它实际上没有使用任何路由器或类似的东西。它甚至构建了自己的
00:06:12视图系统。所以我可能更希望它使用类似 React Router、
00:06:16TanStack 或 Next.js。在后端,它也构建了自己的服务器。我相信
00:06:21这个是在使用 Express.js,如下所示。但它还只是用一个 JSON 文件来构建数据库。
00:06:26没有使用 SQLite 或类似的东西,也没有用 Drizzle,如果未来要扩展这个应用,我可能更希望看到这些。
00:06:31但我知道我本可以在提示词中指出这一点。但我总是喜欢看看它们默认会选择什么。这是
00:06:35我通过 Kimi Code 使用 K3 得到的结果。你可以看到这个实际上更简单。
00:06:38它只有一页,没有侧边栏。同样,所有功能都正常,外观也与我们在 Open Router 中得到的非常相似。
00:06:43查看代码时,我其实更喜欢 Kimi Code 给我们的 K3 版本。
00:06:47看起来和我们在 OpenRouter 上得到的结果非常相似。不过看看代码的话,我
00:06:51确实更喜欢 Kimi Code 用 K3 给我们的方案。它的前端非常相似,
00:06:55它是用 Express 构建的。我们也确实有一个财务数据库,并且在使用 Node
00:06:59SQLite。现在,如果再把它与前沿模型进行比较,这是 Claude Code 中的 Fable 5。
00:07:04你可以看到它在最大努力模式下工作了 56 分钟。然后我还有 GPT 5.6 Soul Max,
00:07:08它思考了 31 分钟来制作这个应用。这是 Fable 5 给我们的,
00:07:13老实说设计非常相似。毕竟个人财务仪表板能做的也就这些了。
00:07:17这里面所有功能都能用。它换了一种
00:07:21字体风格,这在最近的 Fable 和 Opus 中我很常见。他们似乎
00:07:25在重新训练它,以摆脱过去的一些 AI 设计感,并建立一种新的
00:07:29AI 设计风格。这似乎就是他们选择的方向。我想说这些图表实际上比 Kimi K3 给出的
00:07:34更没用一点。但总体看起来非常相似,工作方式也
00:07:38基本一致。甚至代码也非常相似。你可以看到它选择了 React 做前端,
00:07:43也没有使用路由器,而是自己写了一个。在数据库方面,
00:07:47它确实成功地正确使用了数据库。所以我们在这个版本里也在使用 Node SQL。至于
00:07:51实际服务器,它只是在运行 Express 2。再来看 GPT 5.6 Soul,这个有点
00:07:57奇怪。这绝对是我最喜欢的设计。而且所有功能
00:08:02都能用。告诉我你是否同意这是最好的设计。但奇怪的地方在于代码。
00:08:06这绝对是我们在这些示例中看到的最完整的应用代码。它
00:08:11实际上构建了一个完整的 Next.js 应用,并且正如我所期望的那样使用了 Drizzle。它还使用了 Next.js
00:08:15作为前端和服务器。但我发现有点奇怪的部分是,它
00:08:20选择了托管在 Cloudflare 上,这本身并不奇怪,但它还使用了 For Next。这不
00:08:24一定是我不推荐的。我只是觉得这有点未经测试。而且它非常
00:08:29新,这表明他们实际上在推动 GPT 5.6 Soul 使用这个。我只能推测
00:08:33原因,但似乎可能是因为 ChatGPT 网站本身就是这样运作的。你可以
00:08:38看到它这里实际上决定通过 ChatGPT 网站功能为我托管应用,尽管我并没有请求。
00:08:42个人而言,当我在编写应用时,我不太喜欢这样。我不希望
00:08:47它替我托管。我更愿意自己处理所有这些。但我本可以在
00:08:50提示词中要求它不这么做。我更希望是我要求它托管,而不是反过来。
00:08:54我这里的最终结果是 GLM 5.2,它的表现与 Kimi K3
00:08:58在 Kimi Code 中的表现非常相似,它只是构建了这个单页应用。但同样,所有功能都能工作,我确实
00:09:04认为这个设计相当不错。GLM 5.2 实际上花了 15 分钟才完成,你可以看到它花费了
00:09:08我 1.11 美元。至于实际代码,GLM 5.2 也选择了 Next.js 路线,
00:09:13我确实很喜欢这个。但它构建了自己的 store 而不是使用数据库。所以所有这些
00:09:19都只是在 JavaScript 的内存中。所以从我的快速测试来看,我认为 Kimi K3 确实能与 Fable
00:09:24和 GPT 5.6 Soul 相媲美,并无愧于基准测试所带来的炒作。老实说,在视频演示中
00:09:29向你展示这些模型有多强大变得相当困难。你通常
00:09:33必须在生产代码库中花费一周的时间来使用它们,才能真正看到代码的质量。
00:09:38如果你有任何我可以在视频中展示的测试想法,那些真正能让这些模型接受高难度考验的测试,
00:09:42请在下面的评论中告诉我就行。我也想展示一些它们在技术博客中的示例。
00:09:46你可以看到 Kimi
00:09:50K3 构建了这个游戏,但有另一个工具来生成这些素材,所以牛仔和
00:09:53马匹并不是 K3 生成的。它们是在别处制作的。你可以看到它在 3GS 中
00:09:58做得非常好。另一件疯狂的事情是这个芯片设计项目。你可以看到作为一个早期
00:10:03概念验证,Kimi K3 设计了一个芯片来服务一个基于其自身架构构建的纳米模型。在单次
00:10:0848 小时的自主运行中,K3 使用开源工具构建、优化并验证了该芯片。所以希望
00:10:13你已经看到这个模型非常出色,这对那些前沿闭源实验室来说肯定是一个打击。
00:10:19或者至少在它们真正发布权重时会如此。它们还没有发布,但计划这样做。
00:10:23所以我希望很快能见到。你对此怎么看?你预料到中国实验室会这么快赶上吗?
00:10:27这个模型吸引你吗?
00:10:32在下方的评论中告诉我吧。别忘了订阅。和往常一样,下一期再见。
00:10:36...