Transcript
00:00:00Claude Opus 5 刚刚发布,Anthropic 声称我们现在拥有了一个
00:00:04成本减半,但表现逼近 Fable 5 的模型。让我们来看看他们带来的成果。
00:00:09我们先来看看基准测试,数据相当令人惊艳。我们可以看到,
00:00:14它击败了 Fable 5,并在多项测试中遥遥领先 Opus 4.8,特别是在
00:00:20Agent 终端编程、知识工作和 Agent 搜索方面。同时,它在这些领域
00:00:27也击败了 GPT 5.6 等模型。Opus 5 唯一落后于 Fable 5 的领域是
00:00:33多学科推理(虽然差距并不大,实际上在使用工具时它能胜出),以及
00:00:39法律和健康领域。但在其他所有方面,它都击败了顶尖模型。如果这些数据
00:00:46属实,那真的很疯狂。这里显示,在 Cursor Bench 3.2 的最大计算投入模式下,该模型的表现
00:00:51距 Fable 5 的最高得分仅相差 0.5%,但单次任务成本却只有一半。太不可思议了。你可以看到
00:00:57红色代表 Opus 5,橙色代表 Fable 5,最下方的蓝色则是 Opus 4.8。
00:01:03确实,在极高投入下,Fable 5 领先一点,但大多数人并不会
00:01:08在极限投入下运行。大家通常使用高或超高设定。对比 Fable 的
00:01:13高和超高设定,Opus 5 能提供几乎相同的输出,但再次提醒,成本只有
00:01:17大约一半。在其他一些基准测试中,比如 Artificial Analysis 的 Coding Agent 指数,
00:01:23Opus 5 则是纯粹直接击败了 Fable 5。Frontier Bench 测试也是如此。
00:01:27它几乎是碾压了 Fable,而且价格更便宜。现在让我们来看看一些知识
00:01:32工作和问题解决任务。同样,我觉得真正疯狂的不仅仅是
00:01:37Fable 5 和 Opus 5 的竞争关系,而是从 Opus 4.8 到 Opus 5 的巨大跨越。所有这些
00:01:43各项指标,都是一次非常巨大的飞跃。再强调一次,如果像 Sonnet 5 那样
00:01:49性能虽优于前代,但价格高得令人望而却步(因为细分到
00:01:53每个任务时,Sonnet 5 某种程度上是目前最昂贵的模型),
00:01:57按任务细分来看。但这里情况并非如此。与这两款其他模型相比,Opus 的 Token 利用效率似乎极高。
00:02:03它能击败 Fable 5 这一点,真的非常令人震撼。
00:02:07另一个有趣的改进是视觉输出。这里展示了 Opus 5 处理
00:02:13风洞模拟工作的效果。而在右边,它正在构建一个 3D 交互式动物细胞
00:02:19Artifact 构件。Claude 的短板之一是无法直接生成图像等资源,
00:02:24因此它在 3D SVG、类似 HTML 图形绘制能力上的提升意义重大。
00:02:31另一个重大改进是,Anthropic 表示它在自我验证和仔细迭代
00:02:35直到成功方面的能力大增。这意味着什么?这意味着当我们将 Opus 5 用于
00:02:40长流程 Agent 任务时——那些不是单次回答,而是涉及循环逻辑的任务。
00:02:45比如大家现在常说的图工程(Graph Engineering)。任何需要
00:02:49Claude 根据我们给出的目标来检查自身工作,并不断循环反复的任务,
00:02:53Opus 5 在这方面的表现都远超 Opus 4.8。这里有一个有趣的
00:02:58例子:给 Opus 5 一张零件草图,要求编写代码将其重建为
00:03:033D FreeCAD 模型。但模型并未被直接提供查看该图纸的接口。
00:03:09它接到了目标,但没有被告知具体的实现路径。于是它自行
00:03:14编写了一套计算机视觉管线,从原始像素中提取几何结构,并成功重建了
00:03:19整个机械零件。对于任何设定了明确导向目标的长期复杂任务,
00:03:25Opus 5 达成任务的能力都远胜 4.8。在对齐异常行为控制方面,
00:03:29它也比此前所有模型更胜一筹。数值越低越好。我们在开源代码漏洞与利用检测上
00:03:35看到了从 Opus 4.8 到 5 的巨大能力提升。另一个亮点是安全防护。
00:03:40它不会像 Fable 那样,只要提及网络安全或生物学知识
00:03:45就直接拒绝回答。Opus 5 的安全栅栏比 Fable 5 要宽松得多。
00:03:50虽然内部依然保留了一些分类器,但官方称触发误拒的概率比 Fable 降低了 85%。
00:03:56最后,最重要的亮点是成本。正如我所说,它的价格只有 Fable 的一半。
00:04:01输入每百万 Token 为 5 美元,输出每百万 Token 为 25 美元。正如我们在基准测试
00:04:07图表中所见,这是一款 Token 效率相对极高的模型。所以我迫不及待想上手测试,
00:04:12因为如果数据属实,我们相当于用一半的价格获得了更好的 Fable。