AI 模型界狂欢 24 小时

MMaximilian Schwarzmüller
Computing/SoftwareBusiness NewsInternet Technology

Transcript

00:00:00在过去 36 小时里,许多新的 AI 模型密集发布,我相信大家肯定会看到大量相关的视频。
00:00:06在这期视频中,我只想简单聊聊哪一个是最好的,哪一个是令人失望的,
00:00:11哪一个是表现平平的,哪一个是大家(或我们大多数人)都忽视了的,
00:00:15以及那些没那么隐蔽的新星,以便大家清楚针对不同需求该选择哪个模型。
00:00:19我就不卖关子了,直接告诉大家最好的那一款。
00:00:25毫无悬念,那便是 Opus 5.5。
00:00:29Claude 在几个小时前发布或公布了 Opus 5.5,如果你订阅了,现在就可以在 Claude code 中直接体验。
00:00:37当然,就像往常一样,它有着惊人的基准测试数据,在绝大多数领域都优于其他顶尖模型。
00:00:45不过这些数据仅供参考,大家都清楚跑分是怎么一回事。
00:00:51针对基准测试专门做模型优化并不难,我们以前也见过不少跑分惊艳
00:00:59但实际表现却不尽如人意的模型;不过单看这些数据,Opus 5.5 确实令人印象深刻。
00:01:06随后官方也公布了更多细节,比如非常关键的一点:它的使用成本更低了。
00:01:13它不仅仅是相比 Opus 5 降低了输入和输出 Token 的单价,其推理算力开销更小,整体效率也更高。
00:01:24据官方表示,它的成本比 Opus 5 降低了约 40%,这意味着如果你拥有 Claude 订阅,你在订阅限额内能使用 Opus 的次数和额度也会大幅提升。
00:01:40有趣的是,如果我们看类似的对比图表——其中横轴是单次尝试成本(越低越好),纵轴是得分(越高越好)——在这项测试中,Opus 不仅远超 GPT-6 Astra,还击败了绿色的 Fable。
00:02:02如果相信这些跑分的话,这基本上意味着你几乎没有任何理由再去选择 Fable 了,因为 Opus 各方面都更胜一筹。
00:02:14特别是在高使用率区间,至少在这项测试中表现出了极佳的性价比,因为它不仅得分极高,而且成本远低于 Fable。
00:02:29请注意,这里采用的是对数刻度。
00:02:31在这张包含更多模型的图表中也能看出这一点,我重点标出了最新的 Opus 模型、Fable 和 Astra;最新的 Opus 5.5 曲线在所有推理深度上都提供了更高的智能度,且通常成本更低,尤其是对比 Fable,Fable 在最大推理开销下的智能度依然低于 Opus 5.5,但成本却更高。
00:03:00当然,正如刚才所说,跑分仅仅是跑分,但从我目前在 X 上看到的反馈来看,大家对 Opus 5.5 的满意度非常高。
00:03:10不过我们还是要保持理智,大家心知肚明,每当新模型发布,就会有常见的网红 KOL 冒出来大夸特夸,说什么终于能聊这个模型了、简直太厉害了、天下第一等等,这些套路大家都懂。
00:03:23但我看越来越很多非网红的普通用户发帖,他们是真的被这个模型给震撼到了;在我初步试用的过程中,它确实展现出了极高智商,能够严格遵循指令、逐步破译复杂难题,而且还有一点不容小觑:
00:03:43Anthropic 在 X 上的官方推文中也提到了这一点:它拥有更好的沟通表达能力。
00:03:49他们给出了这段对比展示:它不再一鼓脑吐出长篇大论、满是行业黑话的解释和长篇大论,而是更加简明扼要,用接地气的语言直接给出你想要的答案。
00:04:05这一点我也能证实,它的实际表现确实好很多。
00:04:10所以这看起来确实是个非常惊艳的模型。
00:04:13如果你有 Anthropic 或 Claude 的订阅,我觉得果断用它就对了。
00:04:19目前我实在看不出在特定场景下还有什么理由非要用 Fable 5.1,不过这还需要我做更多测试。
00:04:28但相比 Opus 5,它绝对是首选。
00:04:31如果你还没有 Claude 订阅,这或许是个入手的好契机。
00:04:35在深入探讨所有其他模型之前,这里正好适合打个自我宣传的广告。
00:04:42我正在筹备一个全新的训练营项目,目前尚未正式上线,但你可以先预约登记,以便在开放报名时第一时间收到通知,我会在其中分享如何利用 AI 构建 Web 应用程序。
00:04:53这是一个为期两周的课程,我会带你走过全流程:从调研、规划、搭建项目、设置护栏机制,到讨论架构约束、进行系统设计,并使用我最喜欢的技术栈(其实就是 Alchemy Cloudflare)。
00:05:10全程带你体验我是如何借力 AI 高效实战开发,拒绝凭感觉乱写代码,拒绝迷失方向,一举拿下出色的成果。
00:05:19在这两周的项目结束时,我们将交付一个完整的应用程序。
00:05:22相关的链接我当然会放在下方评论区。
00:05:25如果你对此感兴趣,欢迎注册登记,以便在报名通道开启时收到通知。
00:05:30至于令人失望的那款,并不是 GPT-6 Sol,我们待会儿会聊到它。
00:05:35它虽然算不上赢家,但也绝不至于令人失望。
00:05:38真正令人失望的反而是 Grok 4.7。
00:05:42大约是在 30 个小时前发布的。
00:05:48它的跑分固然也很亮眼,但实话实说,它并没有在所有领域都取得压倒性优势。
00:05:56在这份公布的基准测试中,它实际上只在两个类别中拔得头筹,而且没有一项与代码开发相关。
00:06:03不过对比 4.6,它在软件工程能力上确实有所提升,而且价格保持不变。
00:06:10这么看似乎还不错对吧?
00:06:11并不是。
00:06:12Grok 4.7 之所以坐上这个位置,是因为在我自己的实测以及其他用户的反馈中,
00:06:23它的效率实在太低了。
00:06:26不仅运行速度慢,而且完成任务需要花费极长的时间。
00:06:31我看到了很多类似的吐槽贴,大家普遍反映它只是疯狂消耗配额,
00:06:38实际用起来却并没有比 4.6 聪明多少。
00:06:42我个人的实际体验也基本一致。
00:06:46我把它用于各种不同的任务,表现倒也不算差。
00:06:50显而易见,它并不是一个烂模型。
00:06:52只是相比 4.6,它似乎并没有带来多大的飞跃,而且速度明显慢得多,Token 消耗量也大得多。
00:07:01因此如果是用 Grok,建议大家继续使用 Grok 4.6,而不是 4.7。
00:07:09至少在现阶段,我觉得并不值得升级。
00:07:12如果后续官方进一步优化,或者微调定价策略之类的,情况可能会有所改变。
00:07:17但就目前而言,它确实令人失望。
00:07:20那么,哪一个是表现平平的那个呢?
00:07:22或许大家已经猜到了。
00:07:24那就是 GPT-6 Sol。
00:07:27我们昨天可不仅仅迎来了 Opus 5.5。
00:07:30OpenAI 还发布了 GPT-6 Sol。
00:07:33而它就是那个令人感到中规中矩的模型。
00:07:37Astra GPT-6 本身是个非常出色的模型。
00:07:40它虽然有自己的小脾气。
00:07:41驾驭起来可能会有点难度,需要一番折腾才能发挥出它的最佳效果。
00:07:47但根据我的经验,它确实是个好模型。
00:07:50关键在于,GPT-6 Sol 也是个不错的模型。
00:07:54我觉得如果昨天没有同时发布 Opus 5.5 的话,市场对它的反响可能会好得多。
00:08:02但现在给人的感觉是,这个模型夹在中间显得有些尴尬。
00:08:09如果我们看一下 OpenAI 官方发布的跑分,即 Automation Bench 的基准测试数据,
00:08:15可以看到 GPT-6 Sol 比 5.6 Sol 更聪明,性价比也更高。
00:08:23这也正是官方对其定位和希望大家看待它的方式。
00:08:28它就是 5.6 Sol 的全面升级版。
00:08:31不过在智商层面,它依然逊色于 Astra。
00:08:36但成本效益确实更高。
00:08:38这也就是为什么我说它中规中矩。
00:08:40它谈不上让人失望。
00:08:42它完全符合自身的产品定位——做一款更好的 5.6 Sol。
00:08:48只是在智力水平上,它还无法与 Astra 媲美。
00:08:54单看这项基准测试,两者之间就有着不小的差距。
00:08:58不过它的价格确实更便宜。
00:09:00所以官方的核心逻辑在于:在你的 ChatGPT 或 OpenAI 订阅中,
00:09:06你能用同样的订阅额度处理更多任务,
00:09:09你可以把 GPT-6 Sol 拿去处理所有
00:09:12不需要极致顶尖智商的日常工作。
00:09:16可问题在于,有了 Opus 5.5,
00:09:21你根本不需要做出这种取舍。
00:09:24当然,用不了多久我们大概率会迎来 Fable 5.5 或类似的更新,
00:09:29到时候竞争格局又会大洗牌。
00:09:30但仅就昨天的发布来看,
00:09:32我们手头拥有了一个 Opus 模型,
00:09:35价格比 Fable 更便宜,
00:09:37性能却比 Fable 更强。
00:09:40或者至少也是平分秋色,取决于你怎么看。
00:09:43但 GPT-6 Sol 就不具备这种优势了。
00:09:46它的表现确实逊色于 Astra。
00:09:50我自己接下来还需要做更多实际测试,
00:09:53看看它在我实际项目中的表现究竟如何。
00:09:55不过至少在目前,
00:09:58鉴于它更高的性价比,我确实能想象
00:10:02自己会把它用于大量的日常工作中。
00:10:06但是当你在处理复杂项目时,
00:10:09你肯定想要追求尽可能高的智商表现。
00:10:13这也是为什么在此之前,
00:10:15你大概率应该选择 Fable,
00:10:17而不是委曲求全在所有场景下都用 Opus 5,
00:10:21或者什么都用 GPT-5.6 Sol。
00:10:25这也是为什么大家愿意去用 Astra
00:10:27并费心对其进行约束管控,
00:10:29而不是直接妥协使用 GPT-6 Sol。
00:10:33所以说它中规中矩。
00:10:35它有自己的生态定位。
00:10:36有它的用武之地。
00:10:39只是它的局限性更大一些,
00:10:41在使用时需要衡量考量的细节
00:10:43远多于 Opus 5.5。
00:10:46用后者你几乎不需要动太多脑筋。
00:10:48从 Artificial Analysis 上这张
00:10:50智能指数对比单位智力成本的图表中
00:10:54可以清晰地看到这一点。
00:10:57图中顶部的这根线就是 Opus 5.5,
00:10:59即最上方的那条线。
00:11:02我刚才已经给大家展示过了。
00:11:03而 GPT-6 Sol,
00:11:05则是这条黑线。
00:11:07旁边另一条黑线是 Astra。
00:11:09大家可以看到,
00:11:10它比 Opus 5.5 稍逊一筹,
00:11:12但依然很优秀,
00:11:13就是价格贵了些。
00:11:15GPT-6 Sol 相对来说要弱一些,
00:11:18如果你非要这么形容的话,
00:11:19但它的价格也更便宜。
00:11:21所以,是的,它确实有些中规中矩。
00:11:24如果你拥有 ChatGPT 订阅,
00:11:26而且这是你唯一的订阅,
00:11:28平时用它来进行代码开发,
00:11:30我的建议是
00:11:31优先使用 Astra,
00:11:33只有当你面临严重的
00:11:36使用额度危机,
00:11:37或者是在处理
00:11:38规模较小、复杂度较低的任务时,
00:11:41才考虑切换到 GPT-6 Sol。
00:11:45至少我是这么认为的。
00:11:46不过话又说回来,
00:11:47在 AI 智能工程化
00:11:48和 AI 编程的实践中,
00:11:50这或许并不是最理想的工作流程。
00:11:51但不管怎样,
00:11:52如果换作是我不得不去用它,
00:11:53我就会采取这种策略。
00:11:54而如果你有选择的余地,
00:11:56在目前阶段,
00:11:56Opus 5.5 绝对是最稳妥的选择。
00:11:59现在,在聊那个被大家忽视的模型之前,
00:12:01我们先来看看
00:12:01那颗没那么隐蔽的新星,
00:12:03因为它也是一个 GPT-6 旗下的模型,
00:12:06它就是 Luna。
00:12:08我可以直接明确地说,
00:12:09先说清楚,这并不是一款
00:12:11适合所有使用场景的模型。
00:12:14绝对不是那种
00:12:15你想用来处理复杂
00:12:18甚至常规编程工作
00:12:22或 AI 任务的模型。
00:12:25但 GPT-5.6 Luna
00:12:26在某些特定场景下
00:12:28就已经挺有意思了。
00:12:29对于 GPT-6 Luna 来说,
00:12:31情况也是如此。
00:12:32我们再次
00:12:33回到
00:12:33这里的官方基准测试。
00:12:36这里关键的一点是
00:12:38X 轴采用的是
00:12:40对数刻度。
00:12:41它不是线性的。
00:12:43这其实对
00:12:45GPT-6 Luna
00:12:47——也就是这里的这条曲线——
00:12:48太不公平了。
00:12:50这会让它看起来
00:12:51比实际情况
00:12:51更差,因为
00:12:53这个模型便宜得离谱。
00:12:55该模型的最高算力投入版本
00:12:59在这项基准测试中,
00:13:00每个任务的成本
00:13:04甚至还不到 5 美分。
00:13:07它的智力水平
00:13:08与 GPT-5.6 Sol
00:13:11在中等算力设置下的表现
00:13:15处于同一水平,
00:13:18或者相当于 GPT-6 Sol
00:13:22模型
00:13:23在低算力设置下的水平。
00:13:26所以再次强调,
00:13:27这当然
00:13:28并不一定
00:13:28是你想要用来
00:13:29做前沿编程工作的工具。
00:13:32但对于琐碎任务
00:13:34以及非编程类任务,
00:13:37这绝对是
00:13:38一个值得关注的模型,
00:13:39因为并不是每个人
00:13:39整天都在
00:13:40写代码。
00:13:41而且这个模型
00:13:42在你的订阅套餐中
00:13:44基本上算免费使用,
00:13:45哪怕你通过
00:13:47API 使用也是如此。
00:13:49我是说,
00:13:49如果你想获取
00:13:50最顶尖版本的 Astra,
00:13:52功能最强版本的
00:13:53Astra,
00:13:54每个任务
00:13:56的成本大约在
00:13:57略低于
00:13:582 美元的水平。
00:14:00而顶级版本的 Luna,
00:14:01虽然
00:14:02没那么聪明,
00:14:03但还是那句话,
00:14:04应对特定场景
00:14:05非常合适,
00:14:06其价格只有前者的几分之几。
00:14:09这就是为什么
00:14:10我想顺便
00:14:10提它一下,
00:14:11可以说是为它宣传一下。
00:14:12为什么我想让大家
00:14:13了解它。
00:14:14GPT-6 Luna
00:14:15实际上
00:14:17是一款极佳的模型,
00:14:19只要你不需要
00:14:21最顶尖的
00:14:23智力水平。
00:14:24所以,
00:14:25如果你有一些
00:14:26比较简单的任务,
00:14:29或者可能
00:14:30需要将
00:14:31大量数据
00:14:33从格式 A
00:14:34转换
00:14:35为格式 B
00:14:36的任务,
00:14:37或者类似的任何工作,
00:14:38任何不需要
00:14:39不需要
00:14:40高智商,
00:14:41但需要
00:14:42主力苦力活的模型,
00:14:45不妨看看 Luna。
00:14:46这或许会是
00:14:46一个好主意。
00:14:48而且必须
00:14:48明确指出的是,
00:14:49它的智力
00:14:51远不如
00:14:52Astra。
00:14:53但在最高
00:14:54推理算力设置下,
00:14:55它可以轻松击败
00:14:57大约一年前的
00:14:57在最高级别的
00:14:58推理努力下。
00:14:59这其实涉及
00:15:00预期管理,
00:15:01你需要有合理的预期,
00:15:02但这绝对是
00:15:04你不应该
00:15:05忽视的东西。
00:15:06那么真正
00:15:07被忽视的是哪个呢,
00:15:08对我而言——
00:15:09我这里仅谈
00:15:10最近
00:15:11发布的新模型——
00:15:12那就是
00:15:12MIMO 2.6。
00:15:14可能你
00:15:15以前从未听说过
00:15:15这个名称。
00:15:16我承认,
00:15:17我之前也没听说过
00:15:17MIMO 系列
00:15:18模型。
00:15:20这是由
00:15:21小米推出的模型。
00:15:22他们推出了
00:15:23两个版本,
00:15:24Pro 和 Flash,
00:15:25而我仅仅
00:15:26是通过
00:15:27Open Router 使用它们的,
00:15:28所以在测试中
00:15:29我支付的是
00:15:30API 费用。
00:15:31我没有
00:15:32那边的
00:15:33订阅,
00:15:33而且我觉得
00:15:34可能需要
00:15:34通过中国大陆的
00:15:35VPN 之类的
00:15:37才能开通
00:15:38订阅,
00:15:39但这确实是
00:15:40一款优秀的模型。
00:15:40他们公布了
00:15:41一些基准测试
00:15:42数据。
00:15:44值得注意的是,
00:15:45他们在这里并没有
00:15:46纳入 Astra,
00:15:47也没有 Fable 5.1,
00:15:48显然更没有
00:15:49Opus 5.5,
00:15:51但他们的模型
00:15:532.6 Pro,
00:15:55击败了 Fable 5,
00:15:56例如,
00:15:57在深度
00:15:58软件工程
00:15:59基准测试中。
00:16:01它在这些基准测试中的
00:16:02表现真的很棒,
00:16:03我可以证实这一点,
00:16:04过去这一天里
00:16:05我大量使用了它。
00:16:07这是个出色的模型。
00:16:08不过我想说,
00:16:09它的思考
00:16:10简直来自
00:16:11另一个世界。
00:16:13我昨天发过一条
00:16:14关于这个的帖子。
00:16:15它会思考
00:16:1610分钟、
00:16:1815分钟。
00:16:18在它真正开始
00:16:19动手做事情之前,
00:16:20我曾让它思考了
00:16:21好半天。
00:16:22当然,
00:16:23你可以控制
00:16:24思考深度(effort level),
00:16:25而且我这里
00:16:26说的是 Pro
00:16:27模型,
00:16:29Flash 版本,
00:16:30显然顾名思义,
00:16:31速度更快,
00:16:32但能力也弱些。
00:16:33不过是的,
00:16:34虽然花时间长,
00:16:35但价格非常非常便宜。
00:16:37我只花了没几块钱,
00:16:39真的就几块钱,
00:16:40就让它连续工作了
00:16:41好几个小时,
00:16:43去处理那些不算
00:16:45超高难度,
00:16:46但也很具
00:16:47挑战性的问题,
00:16:49我是指这类问题。
00:16:50而它的结果
00:16:51真的让我印象深刻。
00:16:52不过,
00:16:53我猜它并不是那种
00:16:55能被广泛使用的模型,
00:16:56被广泛使用
00:16:57因为说到底,
00:16:58它并没有提供
00:16:59便捷的
00:17:00订阅服务或
00:17:01类似的东西。
00:17:02但如果你
00:17:03正在构建应用,
00:17:05需要内置 AI,
00:17:06需要一个智能大脑,
00:17:07或者你在
00:17:08开发自己的
00:17:09编程 Agent,
00:17:10而你无法
00:17:11或不想使用
00:17:12付费订阅
00:17:12这类模式,
00:17:15诸如此类的情况,
00:17:16那这个模型非常
00:17:17值得关注。
00:17:18我是说,总体来看,
00:17:19这也不是什么新鲜事了。
00:17:20所有这些来自中国的大模型
00:17:21都非常惊艳,
00:17:23我也超级期待
00:17:24看看
00:17:25Qwen 4 会给我们带来什么
00:17:27等等。
00:17:28不过话说回来,
00:17:28这个模型是
00:17:30在过去
00:17:31几个小时内发布的,
00:17:32我想
00:17:33大多数人都错过了,
00:17:34但我觉得
00:17:34你不应该错过它。
00:17:35它有其独特价值,
00:17:36而且是个很出色的模型,
00:17:39特别是对比
00:17:40像 Grok 4.7
00:17:41这样的模型时,
00:17:42后者相当
00:17:43令人失望,
00:17:43既缓慢
00:17:45又昂贵。
00:17:46而眼前这个模型
00:17:47虽然 Pro 版本速度慢,
00:17:48但并不昂贵,
00:17:49而且表现相当不错。
00:17:50以上就是我对这些模型的
00:17:52盘点与个人见解,
00:17:54以及关于
00:17:55在不同场景下
00:17:56推荐使用哪款模型
00:17:57的建议。

Key Takeaway

近期密集发布的大模型中,Opus 5.5 凭高智商与低成本成为综合首选,而 Grok 4.7 则因效率低下表现垫底。

Highlights

  • Opus 5.5 在各项基准测试中全面领先,使用成本较 Opus 5 降低约 40%。

  • Grok 4.7 运行速度慢且 Token 消耗量大,整体效率较 4.6 版本显著下降。

  • GPT-6 Sol 性能符合预期,性价比高于 5.6 Sol,但智力水平仍低于 Astra。

  • GPT-6 Luna 定位苦力任务,最高算力投入下单任务成本低于 5 美分。

  • 小米推出的 MIMO 2.6 Pro 在深度软件工程基准测试中击败 Fable 5,具备极高性价比。

Timeline

综合表现最佳:Opus 5.5 的高性价比优势

  • Opus 5.5 在绝大多数领域的基准测试中表现优于其他顶尖模型。
  • Opus 5.5 的推理算力开销更小,总体使用成本比 Opus 5 降低约 40%。
  • Opus 5.5 在更高智能度的同时维持了远低于 Fable 的调用成本。
  • Anthropic 优化了模型的沟通表达能力,回答更加简明直接。

Opus 5.5 已经在 Claude code 中开放使用。虽然基准跑分仅供参考,但用户实测反馈普遍极佳,模型在复杂推理与遵循指令方面表现突出。此外,由于单价和算力开销降低,订阅用户在配额内可以获得更多的使用频次。

效率显著下滑:Grok 4.7 令人失望的原因

  • Grok 4.7 在发布的基准测试中仅在两个非代码领域取得第一。
  • Grok 4.7 运行速度缓慢且大幅消耗额度,实际智商提升有限。
  • 使用 Grok 体系时,当前阶段继续保留 Grok 4.6 是更好的选择。

Grok 4.7 虽然保持价格不变并在软件工程指标上有所提升,但实际运行效率过低。大量用户反馈该模型在处理任务时耗时极长并过度消耗 Token,体验相比 4.6 版本并未带来实质性飞跃。

中规中矩的日常替代方案:GPT-6 Sol

  • GPT-6 Sol 在性能和性价比上全面超越 GPT-5.6 Sol。
  • GPT-6 Sol 的智力水平低于 Astra,定位为日常轻量任务工具。
  • 在没有 Opus 5.5 的情况下,GPT-6 Sol 适合消耗大量订阅额度的非核心工作。

GPT-6 Sol 完全符合其作为 5.6 Sol 升级版的定位,能帮助用户在相同订阅额度下处理更多日常事务。但在处理高难度复杂项目时,其智力和推理上限依然无法媲美 Astra 或 Opus 5.5。

极低成本苦力模型:GPT-6 Luna

  • GPT-6 Luna 不适合前沿编程任务,但能胜任格式转换等重复性苦力活。
  • GPT-6 Luna 最高算力版本的单任务成本不足 5 美分。
  • GPT-6 Luna 在最高推理开销下的表现可击败一年前的顶级模型。

GPT-6 Luna 的核心价值在于极高的性价比,其最高版本的使用成本仅为顶级 Astra 模型(单任务约 2 美元)的几十分之一。对于不需要极致智商但包含大量简单文本处理的场景,它是极其划算的算力选择。

被忽视的高性价比新星:小米 MIMO 2.6

  • MIMO 2.6 Pro 在深度软件工程测试中的表现超越了 Fable 5。
  • MIMO 2.6 Pro 思考深度极深,单次思考时间可长达 10 至 15 分钟。
  • MIMO 2.6 的 API 调用费用极低,适合构建 AI Agent 或嵌入应用。

小米推出的 MIMO 2.6 Pro 虽然缺乏便捷的海外订阅服务,但通过 API 接入的性价比极高。花费数元即可让模型连续工作数小时处理高难度问题。尽管单次响应速度较慢,但对于需要深度推理且成本敏感的开发者而言具备极高实用价值。

Community Posts

No posts yet. Be the first to write about this video!

Write about this video