Fable 5.1 是史上最伟大的模型(而且比 Fable 5 更便宜)

CChase AI
Computing/Software

Transcript

00:00:00Fable 5.1 现已推出,它更好、更便宜,
00:00:02今天我来向大家介绍
00:00:04关于它你需要了解的一切。
00:00:05首先,我们来谈谈价格。
00:00:07Fable 5.1 的价格预计比 Fable 5 低约 25%,
00:00:11这是因为他们降低了
00:00:13缓存读取的价格。
00:00:14如果你经常进行长时间运行的智能体任务,这绝对是个重大利好,
00:00:19他们也特别指出了这一点,
00:00:21在那些情况下,你的成本降幅甚至可能高达 45%,
00:00:23也就是当你处理的任务
00:00:24包含数千甚至上万个 Token,
00:00:27并且上下文窗口长度达到
00:00:2850%、60%、70% 的时候。
00:00:30他们正在更新数据保留策略,
00:00:32并逐步向企业客户推出这一政策,
00:00:34而在安全防护方面,
00:00:35他们降低了误报率,
00:00:37这在最初的 Fable 5 中
00:00:38可以说是让人相当头疼,
00:00:40因为如果你向它询问
00:00:41诸如网络安全相关的问题,
00:00:43你经常会遭到拦截,
00:00:44而在这种情况下,现在误报的可能性降低了 60%。
00:00:47误报率大幅下降。
00:00:49现在让我们来看看基准测试。
00:00:50在各个方面,它几乎在所有项目上都击败了 Fable 5、Opus 5
00:00:53以及 GPT 5.6。
00:00:56而且,其中一些性能提升相当显著。
00:00:58当我们看智能体科学研究能力时,
00:01:00它的表现达到了 Fable 5 的两倍。
00:01:03智能体编程能力也迎来了巨大的飞跃。
00:01:05我们看到分数从 Fable 5 的 42% 跃升至 Fable 5.1 的 55.8%。
00:01:09我还记得当我们查看 Opus 5 的基准测试时,
00:01:11Opus 5 在纯数据指标上带给我们的表现
00:01:14曾让我们感到相当惊艳。
00:01:16但在实际使用中,我认为大多数人仍然更喜欢 Fable 5 而不是 Opus 5,
00:01:19不过我觉得对比 Fable 5 和 5.1 的情况
00:01:23可能要准确得多,
00:01:24无论从实际感受上来说,
00:01:26还是当你真正使用它的时候。
00:01:28除此之外,大多数基准测试的提升
00:01:29相对来说都是渐进的。
00:01:31我们讨论的是各处几个百分点的提升,
00:01:32唯一的例外是使用自动化基准测试的
00:01:34商业工作流。
00:01:37现在,重要的不仅仅是基准测试本身,
00:01:39而是为了获得这些分数我们要付出多少成本,
00:01:41以及当我们调整思考努力程度时,
00:01:43会看到什么样的变化?
00:01:44因为观察这一点总是非常有趣,
00:01:46因为通常当我们看超高
00:01:48或最大努力程度级别时,
00:01:49与高或甚至中等水平相比,
00:01:51我们真的得不到太多的性价比。
00:01:53所以我们这里看到的是 Terminal Bench 4.0。
00:01:56我们有 Mythos 5.1 在最上方,
00:01:59Fable 5.1 在中间,
00:02:00然后 Mythos 5 在这里,
00:02:02你可以想象 Fable 5 略低于 Mythos。
00:02:05所以 Fable 5.1 和 Mythos 5.1,
00:02:07相比 Mythos 5 显然有了很大的跃升,
00:02:10而且它更便宜。
00:02:12真正酷的地方在于,当我们看像
00:02:13“高”这样的设置时,
00:02:15我认为这也是大多数人使用的设置,
00:02:16虽然我在使用 Fable 时
00:02:17通常使用的是中等水平,
00:02:20实际上,
00:02:20如果我们看中等水平,
00:02:21我们的性能匹配了 Mythos 5 的最高输出,
00:02:25但它不是 26 美元,
00:02:27而只需要 7.80 美元。
00:02:30当我们切换到高水平,
00:02:32并且将高水平与比如最大水平进行比较时,
00:02:34你只会看到,
00:02:35输出性能只有约 6% 的变化,
00:02:38然而费用却是 19.50 美元对 10.50 美元。
00:02:42所以这些新模型真正酷的地方在于
00:02:43你可以获得极其出色的性能,
00:02:45而使用的却是这些中等的努力程度级别,
00:02:47并真正节省成本。
00:02:50我们在其他基准测试中也看到了同样的模式,对吧?
00:02:52这是人类的最后一次考试。
00:02:53同样,我们并没有看到巨大的提升
00:02:55当我们从高一直跳到最大级别时,
00:02:57然而我们在中间层设置上却以相当合理的成本
00:02:59但我们在中等档位的设置下
00:03:00也能以相当合理的成本
00:03:02获得非常出色的性能。
00:03:04唯一的例外是当我们查看
00:03:05Cursor Bench 上的智能体编程时,
00:03:07也就是 Fable 5.1,
00:03:08从“高”到“超高”确实有相当大的性能跃升,
00:03:11但话说回来,在“超高”和“极大”之间,
00:03:13提升并不大。
00:03:14不过,你知道的,如果我使用“高”档位,
00:03:15在 Fable 5.1 上,
00:03:17它和使用 Fable 5 的“超高”档位效果一样,
00:03:18但成本还不到一半。
00:03:20所以这里的价格节省非常巨大,
00:03:22即使你不是那种
00:03:24必然在做极其复杂工作的人,
00:03:25如果你只是所谓的普通独立开发者,
00:03:27你的问题没那么复杂,
00:03:29但你又喜欢使用这些前沿模型,
00:03:30你现在就有能力
00:03:32直接调低推理努力水平,
00:03:33并且基本上能达到
00:03:34和之前一样的工作效果,
00:03:36而且成本减半,
00:03:37这一点怎么强调都不为过。
00:03:38现在,科学研究
00:03:40一直都是一大卖点,
00:03:41尤其是对于 Fable 和 Mythos 模型而言。
00:03:42所以在 5.1 版本中,
00:03:44这方面没有改变。
00:03:46他们花了很多篇幅讨论分子设计、
00:03:48计算分析与建模,
00:03:49以及计算生物学。
00:03:51同样,这些更多是某些人在解决的
00:03:53较为小众的问题,
00:03:55但看看这些领域的发展情况,
00:03:57总归是件挺有趣的事,
00:03:58相比之下,它们在这个
00:04:00智能体编程基准测试上的表现又是标准如何。
00:04:01正如我在开场白中提到的,
00:04:03这到底在
00:04:03这个智能体编程基准上表现如何。
00:04:05正如我在开场白中提到的,
00:04:07已经发生了一些变化
00:04:08误报更少了。
00:04:09你可以向它询问更多
00:04:09关于网络安全之类的问题,
00:04:11它足够聪明,
00:04:12不会动不动就大惊小怪,
00:04:13无论如何都把你转给 Opus。
00:04:14如果你想深入了解这一点,
00:04:15他们提供了一份系统卡片,
00:04:16你随时可以去查看。
00:04:18这东西,你知道的,
00:04:19有几百页厚,
00:04:20准确来说是 212 页,
00:04:21但他们在这里给我们做了一个很好的总结。
00:04:21你只需要关心的是,
00:04:23这些护栏更加精准了,
00:04:24因此它们不太可能
00:04:25把良性内容标记出来,
00:04:27准确来说有212页
00:04:28不过这里给出了很好的总结
00:04:30但你真正需要关心的是
00:04:31这些护栏更加精准
00:04:32因此它们不太可能
00:04:33将无害的内容
00:04:34误判并拦截
00:04:35从而将你降级到
00:04:36更低的模型
00:04:37特别是在网络安全相关的问题上
00:04:40Cloud Code 用户
00:04:40他们在这里确实有一个有趣的段落,
00:04:41谈到了抗蒸馏机制,
00:04:43这是一种
00:04:44基本上可以从 Fable 5
00:04:46和 Fable 5.1 中提取
00:04:46精华并在其他模型中
00:04:47使用的方法。
00:04:48这在开源模型相关的讨论中
00:04:49是一个非常大的话题。
00:04:51你可能已经听过无数次
00:04:53关于所有这些
00:04:53内容了。
00:04:54这其实是一个
00:04:55非常关键的防线。
00:04:57它能够阻止竞争对手
00:04:58本质上是一种提取
00:04:59Fable 5 最佳效果的方法
00:05:01以及 Fable 5.1
00:05:02以便在其他模型中使用。
00:05:03这是一个非常大的
00:05:04讨论话题
00:05:05与以下内容相关
00:05:06开源模型。
00:05:07你可能听过很多关于
00:05:08所有这些
00:05:08非常优秀的开源模型
00:05:09不断涌现,
00:05:10毫无疑问
00:05:11它们还将继续推出
00:05:13因为它们是从
00:05:14这些前沿模型中提炼出来的。
00:05:15所以这就是那种
00:05:17你可能想要
00:05:17密切关注的
00:05:18讨论类型。
00:05:18它其实并不会影响你,
00:05:20也就是最终用户,
00:05:21但这确实是,你知道的,
00:05:22有点像这种元层面上的事情
00:05:23我们有所有这些
00:05:24开源模型
00:05:25来自中国
00:05:26而许多前沿
00:05:26类的公司
00:05:27都在美国,
00:05:28而且总会有
00:05:29这样的言论,你知道的,
00:05:31说所有这些
00:05:32开源模型
00:05:32其实都只是在
00:05:33借鉴类似
00:05:35Opus 和 Fable 的东西。
00:05:36他们举了一个例子
00:05:37说明这是如何运作的
00:05:38即新的 API 账户
00:05:39不能像这样编辑
00:05:40Claude 先前的上下文
00:05:42从而本质上提取
00:05:43Claude 思考
00:05:44以及得出
00:05:44其答案的
00:05:45方式。
00:05:46再说一次,
00:05:46这专门针对
00:05:47新账户,
00:05:48所以如果你已经有了一个,
00:05:48就像我说的,
00:05:49这其实不会影响你。
00:05:50现在,就成本
00:05:51和可用性而言,
00:05:52可用性方面,
00:05:52它现在
00:05:53在各地都可用。
00:05:54费用方面。
00:05:55按 Token 计算,
00:05:56如果你看一下,
00:05:56它与 Fable 5
00:05:58完全相同。
00:05:58我们看到的是
00:05:59每百万输入 Token 10 美元
00:06:00以及每百万
00:06:02输出 Token 50 美元,
00:06:03但在现实中,
00:06:04当你实际使用这个时
00:06:05就比如,
00:06:06比如,让它去
00:06:07执行这个任务,
00:06:08它的花费将会更低
00:06:09而且成本会更低
00:06:10因为有缓存读取。
00:06:12现在,如果你完全不知道
00:06:12什么是提示词缓存,
00:06:14你可以去看我
00:06:14上周做的一个视频
00:06:16我在里面讨论了这一点。
00:06:18本质上,
00:06:18如果你是
00:06:19那种正在进行
00:06:20长时间运行的
00:06:20智能体任务的人,这就非常巨大。
00:06:23所以你会有诸如
00:06:23非常大的会话、
00:06:25大量的上下文,
00:06:26并且你是在
00:06:27连续不断地使用它。
00:06:28你不是让它
00:06:29做点什么
00:06:29然后第二天再回来。
00:06:30你只是在跟它
00:06:31不停地、不停地、
00:06:32对话。
00:06:32所以这些缓存读取
00:06:33成本降低了 75%,
00:06:35这是一个巨大的改变,
00:06:37这也是导致
00:06:39这些成本降低的原因。
00:06:40这张图表在这里
00:06:41清楚地说明了这一点。
00:06:42普通任务的成本
00:06:42大致可以减少约 25%,
00:06:44在常规任务成本方面能节省约25%
00:06:45不过话说回来
00:06:46高度智能化的工作负载,
00:06:47成本最多可减少 45%。
00:06:49因此,能够升级到
00:06:49Fable 模型
00:06:50真的令人兴奋。
00:06:51我一直很喜欢 Fable 5,
00:06:53相比之下 Opus 5
00:06:53就显得有点一般了,
00:06:54但对于你们当中
00:06:55实际亲自动手使用过
00:06:56Fable 的人来说,
00:06:57我想你们一定都会同意,
00:06:58与我们从 Anthropic
00:06:59获得的其他所有模型相比,
00:07:01这个模型给我们带来的东西
00:07:02有着
00:07:03显著的变化。
00:07:03因此,能拥有一个
00:07:04更好、
00:07:05更便宜,
00:07:06并且在安全护栏方面
00:07:07让我们少操点心的模型,
00:07:09我认为是一件
00:07:10非常棒的事情。
00:07:11所以一定要去试一试。
00:07:12让我知道
00:07:13你的看法。

Key Takeaway

Fable 5.1 在性能全面超越前代及同类模型的同时,通过降低缓存读取费用将整体使用成本削减高达 45%。

Highlights

  • Fable 5.1 的价格比 Fable 5 低约 25%,主要得益于缓存读取价格的降低。

  • 在长时间运行的智能体任务中,成本降幅可达 45%。

  • 安全防护机制的误报率降低了 60%。

  • 智能体科学研究能力达到了 Fable 5 的两倍。

  • 智能体编程能力基准测试分数从 42% 提升至 55.8%。

  • 每百万输入 Token 价格为 10 美元,每百万输出 Token 价格为 50 美元。

Timeline

价格变动与缓存优化

  • Fable 5.1 的整体价格比 Fable 5 低约 25%。
  • 缓存读取价格的大幅降低削减了长期智能体任务的开支。
  • 安全防护机制的误报率下降了 60%。

Fable 5.1 的价格下调直接受益于缓存读取费用的削减。在处理包含数千甚至上万个 Token 且上下文窗口达到较高比例的长任务时,成本降幅最高可达 45%。此外,针对网络安全等领域的询问,新模型减少了误报拦截的情况。

基准测试与性能表现

  • 智能体科学研究能力达到 Fable 5 的两倍。
  • 智能体编程能力基准测试分数从 42% 跃升至 55.8%。
  • 中等努力程度级别的输出性能匹配了 Mythos 5 的最高输出水平。

在各项基准测试中,新模型击败了 Fable 5、Opus 5 以及 GPT 5.6。通过调整推理努力程度,用户可以在中等档位下以更低的价格获得媲美顶级输出的性能,从而在实际应用中大幅节省计算开支。

安全护栏与防蒸馏机制

  • 系统卡片显示护栏更加精准,减少了良性内容的误判。
  • 新 API 账户无法编辑 Claude 先前的上下文。
  • 抗蒸馏机制阻止了竞争对手从模型中提取核心效果。

分子设计和计算生物学等科学研究领域继续保持优势。同时,针对开源模型领域的蒸馏现象,平台通过限制新 API 账户编辑先前上下文的方式,防止推理过程被直接提取用于其他模型。

成本结构与总结

  • 每百万输入 Token 价格为 10 美元,输出 Token 为 50 美元。
  • 连续对话中的缓存读取成本降低了 75%。
  • 常规任务可节省约 25% 的成本,高强度工作负载最多可节省 45%。

标面 Token 价格与 Fable 5 保持一致,但由于缓存读取成本降低了 75%,频繁对话和长时间运行的智能体任务在实际花费上大幅减少。这使得独立开发者和普通用户能够以更低的成本使用前沿模型。

Community Posts

No posts yet. Be the first to write about this video!

Write about this video