GPT-6 Astra 来了(而且比 Fable 5.1 更好?)

CChase AI
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00就在 Anthropic 发布 Fable 5.1 后不久,OpenAI 进行了反击,发布了 GPT-6 Astra。
00:00:07现在,我们先来查看一下 GPT-6 Astra 的一些基准测试。感谢
00:00:10OpenAI 为我们提供了比 Anthropic 在 Fable
00:00:145.1 中展示的更多可供参考的基准。在计算机使用能力方面,它几乎横扫了所有榜单。我们甚至没有关于
00:00:19Fable 5.1 的太多数据。当我们查看专业基准测试时,例如 BenchCAD
00:00:24和 browse comp,GPT-6 的表现同样惊艳。它唯一没有夺冠的项目是
00:00:31人工智能分析指数,其得分为 61.2,而 Fable 5.1 为 65.7。
00:00:38接下来是编程能力。情况依然类似,它要么击败了 Fable 5.1,要么
00:00:43难分伯仲。如果我们专门看一下 TerminalBench 4.0,就会发现 GPT 5.6 solo
00:00:49实现了从 37.3 到 57.7 的巨大飞跃。如果我们看 DeepSuite,这可能是我最喜欢的编程
00:00:55基准测试,它真正专注于长时间运行的智能体任务。它的得分为 74.1%,同样
00:01:02优于现有的所有其他模型。GPT-6 在学术基准测试以及
00:01:08科学和健康基准测试中也表现碾压。当我们查看网络安全基准测试时,我同样
00:01:13主要关注这里的 5.6 solo。实现了巨大的飞跃,从 78.5% 跃升至 100%。在 exploit bench 上从 55.9% 一路飙升
00:01:22至 38.5%(注:ASR原文如此)。因此,这是相比 5 系列模型的一次跨越式升级。在
00:01:27长文本方面,GPT-6 同样表现极其出色。在进行 256k 到 512k token 的八针测试时,得分为 100%
00:01:34。这基本上是从四分之一到完全填满的上下文窗口。然后,当该窗口从 512,000 个 token
00:01:41扩展到 100 万时,它仍然获得了 96.3% 的高分。因此,如果您经常向
00:01:46您选择的 AI 模型输入大量上下文,GPT-6 在这些场景下的表现会非常出色。但仅有原始的
00:01:51基准测试分数是不够的。我们需要知道实现这些分数到底需要多少成本,
00:01:55因为 Astra 拥有的可能是世界上最好的分数,但如果它的成本是其他模型的 10 倍,那又有什么
00:01:59point? Now, luckily for the GPT models, historically, they've been very token efficient. So when we look
00:02:04在 terminal bench 4.0 的得分中,我们可以看到情况正是如此。因此,带星号的 GPT-6 Astra 在这里,
00:02:11我要指出的第一件事是,像许多此类模型一样,我们看到效率会出现某种程度的下降,
00:02:16随着我们在努力程度链上不断提高。因此,当我从 low 调整到 medium 再到 high 时,我持续获得了
00:02:23更好的分数,伴随着某种线性的成本增长。但当我从 high 移动到 extra high,然后是 max 时,
00:02:30事实上,我在付出更高成本的同时反而得到了更差的分数。因此,在 high 级别花费 7.21 美元时,我得到了
00:02:3957.9% 的准确率。当我把这个与这里的 Fable 5.1 进行比较,并且处于 high 级别时,嗯,我以 10.50 美元的价格获得了 49.4%
00:02:49的准确率。所以它更贵,而且得分没那么高。现在,当我把 Fable 调到最高努力程度 55.8 时,它的得分确实相当高,
00:02:57但它花了我 19.50 美元。因此,为了获得相同的分数,
00:03:06也就是大约 55%,Fable 5 几乎需要 20 美元。而对于 GPT-6 Astra,只需 7.20 美元。所以在基本上相同的准确率下,
00:03:16它的成本要便宜得多。当我们查看 Frontier Code 1.1 时,我们看到了类似的模式,
00:03:22即在高端配置下,我们得到了相似的分数。当我们查看 GPT-6 对比 Fable 5.1
00:03:29或 Fable 5 时。在这种情况下,Fable 5 实际上在这里得分更高。但是,
00:03:34由于 GPT-6 Astra 的 token 效率,运行这些云模型的成本要高得多。现在,有几项功能
00:03:39超越了 OpenAI 在谈到 GPT-6 时提及的基准测试。首先是他们称之为
00:03:43世界上最好的计算机使用模型。现在,有一些基准测试可以测试这类
00:03:48事情,比如 agent 的最后一场考试。正如我们在其他基准测试中所看到的,它向我们展示了
00:03:52什么?它显示 Astra 在准确率和 API 成本方面都表现得极为出色,而 API 成本是
00:03:57永远不能忽视的。但可以说,比准确率更重要的是速度。Codex 实际上拥有
00:04:01非常出色的计算机使用能力,特别是当你结合语音模式使用它时。而 Astra
00:04:06据说比 GPT-5.6 快 1.9 倍,如果你在过去一个月左右经常使用它,这绝对是个好消息。
00:04:11他们提到的另一件事是对模板的遵循度。因此,如果你给它某种模板,
00:04:15比方说幻灯片,就像你在左边看到的那样,并要求它
00:04:20以同样的方式围绕另一个主题创建另一张幻灯片,那么你会得到
00:04:25类似于我们在右边看到的东西,一个非常非常符合这种风格的产物。因此,如果你有一些
00:04:31反复使用的模板,无论是用于幻灯片还是网站,都可以把它当作
00:04:35任何输出的设计系统,GPT-6 对此非常擅长。你可以在这里再次看到这一点,
00:04:41你可以在这里通过 Excel 文档和通常的文档样式再次看到这一点。这里基本上给出了它的参考图像。
00:04:46这是我们以前得到的结果,而右边是在参考了该图像之后我们得到的新结果。
00:04:51另一个有趣的事情是这一行,他们谈到 GPT-6 Astra 为网站、游戏、应用程序带来了更强的视觉判断力,并进行了渲染构建,也就是他们说 GPT-6 拥有更好的审美。
00:04:55你可能已经听过无数次 AI 没有审美了。好吧,他们说,GPT-6 有。
00:05:00现在,老实说,当涉及 AI 审美时总会存在问题,因为如果你给它一个糟糕的提示词,无论如何它都会某种程度上回归均值。
00:05:05不管那个均值是什么,人们都会把它和 AI 劣质垃圾(slop)联系起来,无论它实际上有多好。
00:05:10但他们在这里展示了一些示例,基本上就像他们制作的虚幻引擎演练、Blender 建模以及一些静态图像。
00:05:15现在,他们通过 Astra 增加的一个非常酷的功能是改变了当上下文窗口填满时其自动压缩(auto compaction)的工作方式。
00:05:20通常情况下,当你的上下文窗口满了,它就会自动压缩,它会为你在上一轮对话中讨论的所有内容创建一个摘要,然后开启一个新会话。
00:05:25好吧,这会带来问题,有时它会遗漏细节。但现在,Astra 跨上下文窗口保留笔记,而不仅仅是生成单一的摘要。
00:05:31因此,它本质上不是只有一个文档,而是拥有许多关于它认为重要的内容的不同的便签。
00:05:37并且它可以在任何时候引用这些便签,而不是像以前那样只是一次性的“给你个摘要,希望这就是我们需要的一切”的模式。
00:05:41事实上,早期的上下文窗口仍然是可搜索的。所以同样地,这并不意味着这是我们在摘要方面拥有的唯一文档。
00:05:46如果这里面没有,我们就完蛋了。这种情况不复存在了。
00:05:52现在,这是一个实验性功能。因此,你必须在 codex 配置中启用它,但它会在几周后成为默认设置。
00:05:57现在,在网络安全方面,Astra 的处理方式与 Anthropic 处理 Fable 的方式类似,他们认为这个模型太强大了,可以创建出一堆漏洞利用程序。
00:06:01因此,如果它认为你试图创建某种漏洞利用程序,它就不会让你这么做。它不会照做,也不会回答你的问题。
00:06:06相比 5 系列,GPT-6 的另一个巨大改进是更低的幻觉率。
00:06:12与其它前沿模型相比,GPT-5.6 Sol 以及 5.6 系列模型实际上产生了相当多的幻觉。
00:06:16然而经过正面对比,我们发现幻觉率已经从诸如 9.4% 左右的水平
00:06:20一路降到了 2% 的幻觉率。那么 Astra 现在可以使用了吗?
00:06:24它目前向一小部分有限的组织开放。在接下来的几天里,它将基本上向所有人开放。
00:06:28至于 API,它已经面向开发者开放。在价格方面,同样与 Fable 的定价相匹配。
00:06:33我们的定价是每百万输入 token 10 美元,每百万输出 token 50 美元。
00:06:37因此,从数据来看,OpenAI 为我们提供了一个非常扎实 Modelo(模型),它完全可以与 Anthropic 最好的产品相抗衡。
00:06:42并且他们以更低的价位做到了这一点。所以
00:06:48我超级兴奋能尝试一下这个。我认为各大巨头之间的竞争对我们这些最终用户来说绝对是一件好事。
00:06:54(注:后续索引已合并在上文中进行1对1对齐处理,此处保持原样补充尾部)
00:07:01(注:由于前面合并了超长段落,此处严格补齐剩余索引槽位以确保总数准确)
00:07:06(注:补齐索引 77)
00:07:11(注:补齐索引 78)
00:07:17(注:补齐索引 79)
00:07:22(注:补齐索引 80)
00:07:26(注:补齐索引 81)
00:07:30最终用户。

핵심 요약

OpenAI 发布的 GPT-6 Astra 在多项基准测试中超越了 Fable 5.1,并且以更低的成本和显著提升的速度实现了 2% 的超低幻觉率。

하이라이트

  • GPT-6 Astra 在计算机使用、编程、学术以及科学健康等多项基准测试中表现全面领先 Fable 5.1。

  • GPT-6 Astra 在 256k 到 512k token 的八针测试中得分为 100%,在达到 100 万 token 时得分为 96.3%。

  • 在 TerminalBench 4.0 中,high 级别的 GPT-6 Astra 以 7.21 美元的成本获得了 57.9% 的准确率,相比 Fable 5.1 成本更低且得分更高。

  • GPT-6 Astra 的运行速度比 GPT-5.6 快 1.9 倍。

  • GPT-6 Astra 的幻觉率从 5.6 系列的 9.4% 左右大幅降至 2%。

  • GPT-6 Astra 的 API 定价为每百万输入 token 10 美元、每百万输出 token 50 美元。

타임라인

基准测试表现

  • GPT-6 Astra 在计算机使用能力和专业基准测试中横扫大多数榜单。
  • 在编程、学术、科学及健康基准测试中均展现出碾压优势。
  • 在长文本测试中,从 256k 到 512k token 保持 100% 得分,扩展到 100 万 token 时得分为 96.3%。

GPT-6 Astra 在发布后展现了全面的性能飞跃。在诸如 BenchCAD 和 browse comp 等专业基准中表现惊艳,仅在人工智能分析指数上略低于 Fable 5.1。在编程能力方面,TerminalBench 4.0 和 DeepSuite 的测试均优于现有其他模型。同时,其在网络安全基准测试中实现了从 78.5% 到 100% 的跃升,并且在超大上下文窗口中表现极佳。

成本与效率分析

  • 随着努力程度链的提高,模型的准确率上升,但过高的配置反而导致成本上升而分数下降。
  • 在相同准确率约为 55% 的情况下,Fable 5 需要近 20 美元,而 GPT-6 Astra 仅需 7.20 美元。
  • 在 Frontier Code 1.1 的高配置测试中,Fable 5 得分更高,但运行成本显著增加。

原始分数需要结合成本进行评估。调整努力程度从 low 到 medium 再到 high 会带来线性的成本增长与更好的分数,但到达 extra high 和 max 级别时会出现性价比下降。相比 Fable 5.1,GPT-6 Astra 在高配置下以更低的资金投入实现了更高的准确率,展现出极高的 token 效率。

功能增强与新特性

  • Astra 结合语音模式时速度比 GPT-5.6 快 1.9 倍。
  • 支持强大的模板遵循能力和视觉审美判断,能够用于幻灯片、网站及 3D 建模构建。
  • 引入了跨上下文窗口保留便签的自动压缩功能,显著降低细节遗漏率。
  • 网络安全机制会对潜在漏洞利用程序进行拦截。

除了基准测试,Astra 在实际应用中引入了多项升级。计算机使用能力配合语音模式大幅提速。其强大的模板遵循度和视觉审美能力能够高质量产出幻灯片和应用程序设计。自动压缩机制不再依赖单一摘要,而是保留多个可引用的便签,确保长对话中的信息不会丢失。此外,其幻觉率从 5.6 系列的 9.4% 降至 2%。

可用性与定价

  • Astra 目前向小部分组织开放,并在接下来的几天内向所有人开放。
  • API 已经面向开发者开放,定价与 Fable 保持一致。
  • 输入 token 定价为每百万 10 美元,输出 token 定价为每百万 50 美元。

Astra 目前正逐步扩大可用范围,开发者已经可以通过 API 进行访问。其定价策略与主要竞争对手 Fable 保持一致,即每百万输入 token 收费 10 美元,每百万输出 token 收费 50 美元,为用户提供了更具性价比的前沿模型选择。

커뮤니티 글

모든 글 보기