Sonnet 3.5 正式发布,性能直逼 Opus

CChase AI
컴퓨터/소프트웨어창업/스타트업경영/리더십

스크립트

00:00:00Anthropic 刚刚发布了 Sonnet 5,让我们来深入了解一下你需要知道的一切。
00:00:04首先从基准测试开始。请记住,Sonnet 5 是一款性能较弱、
00:00:08价格比 Opus 和 Fable 更低的模型。自 4.6 版本以来,我们一直没有进行过升级。
00:00:13现在,对比 5 和 4.6 版本,我们发现它在智能体编码方面取得了巨大的飞跃,
00:00:21在多学科推理、计算机使用和知识工作方面也是如此。可以说是全面提升。
00:00:26现在,当我们把它与 Opus 4.8 相比时,问题不在于它是否接近,而是性能下降了多少?
00:00:32说实话,下降幅度并不大。事实上,在知识工作方面,它的数据表现甚至更好,这真的很疯狂。
00:00:39在计算机使用方面仅落后 2%,
00:00:44在智能体编码方面也仅落后 2%,在多学科推理方面也只落后几个百分点。
00:00:49最大的差距出现在 Sweebench Pro 上,数值是 63% 对比 69%。
00:00:56但是,Terminal Bench 2.1 的成绩是 80% 对比 82%。所以差距并不大。而且这场关于
00:01:03性能的讨论必须结合价格来看。记住,Fable 5,Mythos 5,
00:01:08输入 token 的价格是每百万 10 美元,这是 Opus 的两倍。Opus 是每百万输入 token 5 美元。
00:01:16输出价格是 25 美元。所以是 5 美元和 25 美元。对于 Sonnet 5,输入 token 价格是 2 美元,仅为 Opus 成本的 40%。
00:01:26输出价格是 10 美元。所以价格显著更低,不到 Opus 成本的一半。
00:01:34然而当我们看数据时,它非常接近。所以如果你不是在进行极其前沿的 AI 任务,
00:01:40而是在处理更常规的任务,并且仍然需要强大的性能,那么 Sonnet 5 现在填补了这个空白。
00:01:46现在让我们看看这些超越基准测试的图表。这里我们看的是按努力程度划分的智能体搜索性能,
00:01:51比较了 Opus 4.8、Sonnet 5 和 Sonnet 4.6。
00:01:55所以,我想你会立刻注意到,Sonnet 5 在不同努力程度之间的通过率有很大的差距。
00:02:04在低努力程度下,它的成功率是 55%。但如果我们看 Sonnet 4.6 的低努力程度表现,
00:02:13Sonnet 4.6 在低努力程度下实际上表现更好。而且就成本而言,它便宜得多。
00:02:19我们转到中等程度,基本上得到了和 Sonnet 4.6 一样的性能,
00:02:25但价格有显著折扣。直到进入高努力程度,我们才开始超过 Sonnet 4.6。
00:02:34但在那个点上,我们获得了比 Sonnet 4.6 更好的性能,但成本却
00:02:41相当于 Sonnet 4.6 在低努力程度时的水平。所以这种努力程度的划分,
00:02:49我认为非常重要,因为它不仅仅是说 Sonnet 5 在各方面都更好,
00:02:53比如 5 的低努力程度并不一定优于 4.6 的低努力程度。Sonnet 5 的低努力程度实际上只意味着这会非常便宜。
00:02:59但就获得更高水平的性能而言,正如我们在过去所看到的,
00:03:03可能需要做一些在高范围内的任务。话虽如此,当我们处于 Sonnet 5 的
00:03:08高努力程度范围时,我们支付的费用与 Opus 差不多。Opus 在中等和高程度下的成本
00:03:14与 Sonnet 在高程度下相同,但我们获得了更好的通过率。所以这给讨论带来了很多细微差别。
00:03:21在智能体搜索等方面,我们是否需要使用 Sonnet 5 对比 Opus 4.8?我认为这真的取决于情况。
00:03:27如果是更复杂的问题,最终,Opus 4.8 可能更便宜,因为它在 token 使用上非常高效,
00:03:33而 Sonnet 并不是这项工作的最佳选择。
00:03:38然而,当我们处理的任务对这些 AI 模型来说不是那么具有挑战性时,
00:03:44也许根本不需要使用 Opus 4.8。这时我们就会引入 Sonnet 5。所以我认为这是一个
00:03:49有趣的现状,现在我们需要根据具体情况来判断应该使用哪种模型。
00:03:54现在,这里有另一个有趣的例子,智能体计算机使用。现在,在整个领域,
00:03:58大部分情况下,Sonnet 5 击败了 Sonnet 4.6,而且成本很低。所以,
00:04:05智能体搜索可能情况并非如此,但智能体计算机使用,突然之间,
00:04:09我们总是会选择使用 Sonnet 5 而非 4.6。再次强调,这回到了我们需要根据情况
00:04:14来判断使用哪种模型的观点。有趣的是,看看 Opus。Opus High 的表现
00:04:20优于 Sonnet 5 的最大值,而且更便宜。所以,你看这些,你会觉得,
00:04:26哇,Opus 在它所做的事情上真的很高效。更不用说它能达到 Sonnet 无法企及的更高水平。
00:04:30所以,虽然 Opus 的每百万 token 成本更低,但仍然有很多情况是 Opus 是最好的。
00:04:36现在,如果不谈论失调行为,就不算是一次 Anthropic 模型发布。我们可以看到 Sonnet 5 有了改进,
00:04:41但仍然低于我们对 Opus 4.8 和 Mythos Preview 的预期。
00:04:45在漏洞和网络安全问题方面,这是 Mythos 几乎被锁定的原因,
00:04:50但这在 Sonnet 类模型中不是一个问题,或者说你不需要担心这些。
00:04:55所以总的来说,老实说,我不会太关注这些基准测试。
00:04:59这些基准测试、这些图表让我更犹豫,因为我不认为问题是 Sonnet 5 和 4.6 的对比。
00:05:05我们几乎总是会选择 Sonnet 5。问题是 Sonnet 5 和 Opus 4.8 的对比。
00:05:11问题是 Opus 实际上是否更便宜?我希望能看到 Anthropic 做更多测试,
00:05:18能划出一条分界线,比如:Ok,Sonnet 5 在这个任务上做得很好,而且比 Opus 便宜,
00:05:24对比:嘿,这是一个更复杂的任务,Opus 在完成任务时实际上会比 Sonnet 更高效。
00:05:29所以,这些是需要考虑的事情,绝对是一个不错的选择。
00:05:34我认为总体而言,低级别的任务使用 Sonnet 会是一个福音,
00:05:40因为对于我们这些将 API token 用于应用程序的人,或者是那些不在 Claude Max Plan 生态系统中的人,
00:05:46使用 Anthropic 真的很困难。它太昂贵了。
00:05:51我一直告诉人们,去看看 OpenAI,看看他们的一些迷你模型,
00:05:55因为这对于很多人的工作来说通常已经足够了。
00:05:59现在我们有了 Anthropic 的中端选择,这很好。
00:06:05所以今天我就讲到这里。我认为这已经在各地可用了。
00:06:09我觉得大家需要经过一番摸索,才能找到最适合的使用方式。所以请告诉我
00:06:13你们的想法。如果你想学习我的Claude代码大师课,记得查看Chase AI Plus。
00:06:17Code Masterclass,请务必查看 Chase AI Plus,我们下次见。

핵심 요약

Sonnet 3.5 作为 Anthropic 的中端模型,以不到 Opus 4.8 一半的成本提供了极具竞争力的性能,尤其适用于常规任务,但复杂任务仍需根据具体场景权衡模型选择。

하이라이트

  • Sonnet 3.5 的输入 token 价格为每百万 2 美元,仅为 Opus 4.8 成本的 40%。

  • 在 Sweebench Pro 基准测试中,Sonnet 3.5 得分为 63%,与 Opus 4.8 的 69% 差距有限。

  • Sonnet 3.5 在智能体计算机使用任务中表现全面优于 Sonnet 4.6。

  • 低努力程度任务下,Sonnet 4.6 的成功率表现实际上优于 Sonnet 3.5。

  • 针对复杂任务,由于 Opus 4.8 的 token 使用效率极高,其总执行成本可能低于 Sonnet 3.5。

타임라인

性能与基准测试对比

  • Sonnet 3.5 在多学科推理与智能体编码方面相比 4.6 版本有显著提升。
  • Sonnet 3.5 在关键基准测试中与 Opus 4.8 的表现差距极小,部分知识工作领域甚至表现更佳。
  • 输入与输出 token 价格分别为每百万 2 美元和 10 美元,成本大幅低于 Opus 4.8。

Sonnet 3.5 定位为性能略低于 Opus 但性价比更高的模型。数据对比显示,在计算机使用和智能体编码方面,其与 Opus 4.8 的表现差距仅在 2% 左右。虽然 Sweebench Pro 测试中落后 6 个百分点,但考虑到成本仅为 Opus 的不到一半,该模型在常规工作中具有明显优势。

努力程度与模型适用性

  • 低努力程度任务中,旧款 Sonnet 4.6 的通过率表现反而优于 Sonnet 3.5。
  • 高努力程度任务下,Sonnet 3.5 的性能表现超越了 Sonnet 4.6。
  • 复杂任务中,Opus 4.8 的 Token 高效性可能使其在总成本上反而比 Sonnet 3.5 更具经济性。

模型选择不再是简单的性能对比,而是取决于任务的复杂度和“努力程度”。Sonnet 3.5 在低努力程度下成本极低,适合简单任务;而在高努力程度下,虽然成本增加,但表现更强。Opus 4.8 在极高复杂度的任务中展现了更高的执行效率,通过减少总 token 用量,在某些极端场景下比中端模型更划算。

场景化选择与生态价值

  • 在智能体计算机使用任务中,Sonnet 3.5 全面替代了 4.6 版本。
  • Opus 4.8 在处理超高难度任务时依然具有不可替代的性能上限。
  • Sonnet 3.5 的推出填补了 Anthropic 产品线中对于 API 用户而言极其关键的中端空白。

在计算机操作任务中,Sonnet 3.5 相比 4.6 展现了压倒性的性能提升。针对安全与漏洞研究等领域,Opus 4.8 仍保持领先。对于依赖 API token 的开发者而言,Sonnet 3.5 的发布提供了除 OpenAI 模型之外的有力中端选择,有效解决了过往使用 Anthropic 模型成本过高的问题。

커뮤니티 글

모든 글 보기