Transcript
00:00:00Anthropic 刚刚发布了 Sonnet 5,让我们来深入了解一下你需要知道的一切。
00:00:04首先从基准测试开始。请记住,Sonnet 5 是一款性能较弱、
00:00:08价格比 Opus 和 Fable 更低的模型。自 4.6 版本以来,我们一直没有进行过升级。
00:00:13现在,对比 5 和 4.6 版本,我们发现它在智能体编码方面取得了巨大的飞跃,
00:00:21在多学科推理、计算机使用和知识工作方面也是如此。可以说是全面提升。
00:00:26现在,当我们把它与 Opus 4.8 相比时,问题不在于它是否接近,而是性能下降了多少?
00:00:32说实话,下降幅度并不大。事实上,在知识工作方面,它的数据表现甚至更好,这真的很疯狂。
00:00:39在计算机使用方面仅落后 2%,
00:00:44在智能体编码方面也仅落后 2%,在多学科推理方面也只落后几个百分点。
00:00:49最大的差距出现在 Sweebench Pro 上,数值是 63% 对比 69%。
00:00:56但是,Terminal Bench 2.1 的成绩是 80% 对比 82%。所以差距并不大。而且这场关于
00:01:03性能的讨论必须结合价格来看。记住,Fable 5,Mythos 5,
00:01:08输入 token 的价格是每百万 10 美元,这是 Opus 的两倍。Opus 是每百万输入 token 5 美元。
00:01:16输出价格是 25 美元。所以是 5 美元和 25 美元。对于 Sonnet 5,输入 token 价格是 2 美元,仅为 Opus 成本的 40%。
00:01:26输出价格是 10 美元。所以价格显著更低,不到 Opus 成本的一半。
00:01:34然而当我们看数据时,它非常接近。所以如果你不是在进行极其前沿的 AI 任务,
00:01:40而是在处理更常规的任务,并且仍然需要强大的性能,那么 Sonnet 5 现在填补了这个空白。
00:01:46现在让我们看看这些超越基准测试的图表。这里我们看的是按努力程度划分的智能体搜索性能,
00:01:51比较了 Opus 4.8、Sonnet 5 和 Sonnet 4.6。
00:01:55所以,我想你会立刻注意到,Sonnet 5 在不同努力程度之间的通过率有很大的差距。
00:02:04在低努力程度下,它的成功率是 55%。但如果我们看 Sonnet 4.6 的低努力程度表现,
00:02:13Sonnet 4.6 在低努力程度下实际上表现更好。而且就成本而言,它便宜得多。
00:02:19我们转到中等程度,基本上得到了和 Sonnet 4.6 一样的性能,
00:02:25但价格有显著折扣。直到进入高努力程度,我们才开始超过 Sonnet 4.6。
00:02:34但在那个点上,我们获得了比 Sonnet 4.6 更好的性能,但成本却
00:02:41相当于 Sonnet 4.6 在低努力程度时的水平。所以这种努力程度的划分,
00:02:49我认为非常重要,因为它不仅仅是说 Sonnet 5 在各方面都更好,
00:02:53比如 5 的低努力程度并不一定优于 4.6 的低努力程度。Sonnet 5 的低努力程度实际上只意味着这会非常便宜。
00:02:59但就获得更高水平的性能而言,正如我们在过去所看到的,
00:03:03可能需要做一些在高范围内的任务。话虽如此,当我们处于 Sonnet 5 的
00:03:08高努力程度范围时,我们支付的费用与 Opus 差不多。Opus 在中等和高程度下的成本
00:03:14与 Sonnet 在高程度下相同,但我们获得了更好的通过率。所以这给讨论带来了很多细微差别。
00:03:21在智能体搜索等方面,我们是否需要使用 Sonnet 5 对比 Opus 4.8?我认为这真的取决于情况。
00:03:27如果是更复杂的问题,最终,Opus 4.8 可能更便宜,因为它在 token 使用上非常高效,
00:03:33而 Sonnet 并不是这项工作的最佳选择。
00:03:38然而,当我们处理的任务对这些 AI 模型来说不是那么具有挑战性时,
00:03:44也许根本不需要使用 Opus 4.8。这时我们就会引入 Sonnet 5。所以我认为这是一个
00:03:49有趣的现状,现在我们需要根据具体情况来判断应该使用哪种模型。
00:03:54现在,这里有另一个有趣的例子,智能体计算机使用。现在,在整个领域,
00:03:58大部分情况下,Sonnet 5 击败了 Sonnet 4.6,而且成本很低。所以,
00:04:05智能体搜索可能情况并非如此,但智能体计算机使用,突然之间,
00:04:09我们总是会选择使用 Sonnet 5 而非 4.6。再次强调,这回到了我们需要根据情况
00:04:14来判断使用哪种模型的观点。有趣的是,看看 Opus。Opus High 的表现
00:04:20优于 Sonnet 5 的最大值,而且更便宜。所以,你看这些,你会觉得,
00:04:26哇,Opus 在它所做的事情上真的很高效。更不用说它能达到 Sonnet 无法企及的更高水平。
00:04:30所以,虽然 Opus 的每百万 token 成本更低,但仍然有很多情况是 Opus 是最好的。
00:04:36现在,如果不谈论失调行为,就不算是一次 Anthropic 模型发布。我们可以看到 Sonnet 5 有了改进,
00:04:41但仍然低于我们对 Opus 4.8 和 Mythos Preview 的预期。
00:04:45在漏洞和网络安全问题方面,这是 Mythos 几乎被锁定的原因,
00:04:50但这在 Sonnet 类模型中不是一个问题,或者说你不需要担心这些。
00:04:55所以总的来说,老实说,我不会太关注这些基准测试。
00:04:59这些基准测试、这些图表让我更犹豫,因为我不认为问题是 Sonnet 5 和 4.6 的对比。
00:05:05我们几乎总是会选择 Sonnet 5。问题是 Sonnet 5 和 Opus 4.8 的对比。
00:05:11问题是 Opus 实际上是否更便宜?我希望能看到 Anthropic 做更多测试,
00:05:18能划出一条分界线,比如:Ok,Sonnet 5 在这个任务上做得很好,而且比 Opus 便宜,
00:05:24对比:嘿,这是一个更复杂的任务,Opus 在完成任务时实际上会比 Sonnet 更高效。
00:05:29所以,这些是需要考虑的事情,绝对是一个不错的选择。
00:05:34我认为总体而言,低级别的任务使用 Sonnet 会是一个福音,
00:05:40因为对于我们这些将 API token 用于应用程序的人,或者是那些不在 Claude Max Plan 生态系统中的人,
00:05:46使用 Anthropic 真的很困难。它太昂贵了。
00:05:51我一直告诉人们,去看看 OpenAI,看看他们的一些迷你模型,
00:05:55因为这对于很多人的工作来说通常已经足够了。
00:05:59现在我们有了 Anthropic 的中端选择,这很好。
00:06:05所以今天我就讲到这里。我认为这已经在各地可用了。
00:06:09我觉得大家需要经过一番摸索,才能找到最适合的使用方式。所以请告诉我
00:06:13你们的想法。如果你想学习我的Claude代码大师课,记得查看Chase AI Plus。
00:06:17Code Masterclass,请务必查看 Chase AI Plus,我们下次见。