스크립트
00:00:00-
00:00:12大家好。
00:00:15谢谢大家来听这场充满极客趣味的演讲。
00:00:20这个演讲的标题非常长,
00:00:22所以让我先直接说简短的版本。
00:00:23你写了技能文件,里面塞满了各种指令。
00:00:27在某个时刻,模型就无法再记住所有这些指令了。
00:00:31问题是,这个临界点在哪里?
00:00:33当你向技能文件中放入多少条指令时,
00:00:35就会到达极限?
00:00:36而在过去的一年里,这个答案已经发生了很大变化。
00:00:40我是劳瑞,我是 Arise AI 的开发者关系主管。
00:00:44在过去的生活中,我共同创立了 NPM Inc.
00:00:46所以有些人可能在 JavaScript 的时代就认识我。
00:00:48如今,我花了很多时间思考人工智能
00:00:50以及如何对其进行测试。
00:00:53几个月前,我是一名在迈阿密的 AI 工程师,
00:00:55那是一场很棒的会议。
00:00:57当时我在听德克斯特·霍蒂(Dexter Horthy)的演讲。
00:00:59那是一个很棒的演讲。
00:01:00它完全不是关于这个主题的。
00:01:02但在他做那个演讲的时候,
00:01:04他顺便提到了一件事,
00:01:06即代理在开始忘记这些指令之前,
00:01:10最多可以遵循大约 200 条指令。
00:01:13然后他在演讲中继续讲别的,
00:01:15那完全只是一个题外话。
00:01:17他提到这个数字是 2025 年的数据,
00:01:20所以现在情况可能有所改善。
00:01:22我有一秒钟没听进去了,
00:01:25因为我想,200 条指令
00:01:27根本算不上什么指令,对吧?
00:01:31一个像样的技能文件几乎转眼间
00:01:33就会突破 200 条指令。
00:01:35如果用户说 X,就做 Y,
00:01:37总是包含关于 Z 的部分,
00:01:39绝不要使用短语 W,
00:01:40这里面的每一条都是一个独立的指令。
00:01:42如果模型在超过 200 条后就悄悄停止追踪它们,
00:01:45那对于你所能构建的系统复杂性来说,
00:01:47这是一个非常硬性的上限。
00:01:49所以我首先想知道他从哪里得到这个数字,
00:01:52我也想知道这是不是真的。
00:01:55所以你懂我在说什么感觉。
00:01:57你写了这个庞大而精美的技能文件,
00:01:58里面有几页的规则、边缘情况、语气、格式。
00:02:00你把它交给了代理。
00:02:01它执行了任务。
00:02:03然后你看着输出结果心想:
00:02:05它真的注意听了吗?
00:02:07它真的遵循了所有这些规则吗?
00:02:09还是它只是随心所欲地做了一通,
00:02:11然后给了我一个我所期望的
00:02:14近似仿真结果?
00:02:16你真的看不出来,不是吗?
00:02:18稍后会详细讲。
00:02:20所以每次你点击运行的时候,
00:02:23你都带着这种低度焦虑生活。
00:02:24这种感觉正是这项研究所关注的,
00:02:27也是我们试图找出能否避免的。
00:02:30所以我对你接下来 18 分钟的承诺是这样的。
00:02:33我要向你展示那个 200 的数字是从哪里来的,
00:02:36它是否仍然真实,
00:02:37以及今天的真实数字是多少,
00:02:39因为它已经提升了一个数量级。
00:02:41然后我们将讨论这对你有什么启示。
00:02:44你的技能和提示词实际上可以有多长,
00:02:46以及作为结果你应该对工作流做什么样的更改。
00:02:49以及你应该做出什么样的改变
00:02:51来调整你的工作流。
00:02:54所以 200 这个数字并不是民间传说。
00:02:57它来自于一个名为 IfScale 的真实基准测试,
00:02:59出自去年由这位我名字可能会念错的家伙
00:03:03Jaroslawicz 以及合著者发表的一篇论文。
00:03:06这个测试简单得令人赞叹。
00:03:10IfScale 的工作原理如下。
00:03:12你要求模型写一份商业报告,
00:03:14并给它一个特定词汇列表,
00:03:16它必须在报告中准确包含这些词汇。
00:03:19包含准确的词汇“客户”,
00:03:20包含准确的词汇“收入”,
00:03:22以此类推,随你想要多少个词。
00:03:24每一个都是它必须遵循的指令。
00:03:27然后你计算其中有多少个确切的词出现了。
00:03:32因为这个测试非常简单,
00:03:34你只需要记住两个数字。
00:03:36一个是密度,我们称之为 n。
00:03:38也就是我们同时讨论的规则数量。
00:03:41第二个是准确率,
00:03:42即它实际能够遵循的
00:03:43这些规则的百分比。
00:03:46现在你可能会说,在报告中包含随机词汇
00:03:50与遵循真正的指令并不一样,
00:03:52这倒也公允,我们接下来会谈到这一点。
00:03:55但关键词是一个代理指标。
00:03:57包含“收入”一词与包含“关于定价的部分”
00:04:01的任务形态是相同的,对吧?
00:04:02或者“绝不使用这个短语”。
00:04:04这是一个离散的、具名的约束,
00:04:06你已经告诉代理它必须遵循。
00:04:09如果一个模型在一个提示词中无法追踪 200 个词,
00:04:11它在面对 200 个更复杂的指令时
00:04:13绝对会挣扎。
00:04:16所以如果说有什么不同的话,那就是它会表现得更糟。
00:04:20所以这个数字是一个上限。
00:04:22这个数字就是你能达到的最高水平。
00:04:23如果你给它更复杂的指令,
00:04:25这个数字可能会变得更低。
00:04:27而 200 是一个非常低的上限。
00:04:30所以在追逐新模型之前,
00:04:32你必须做好科学研究,
00:04:33这意味着你必须复制旧的结果,
00:04:36并确保 200 的上限是真实的。
00:04:39所以我重新运行了最初的基准测试。
00:04:42原论文测试了一大批模型,
00:04:45而模型的生命周期更迭非常快。
00:04:47所以等我着手进行这项测试时,
00:04:50他们使用的最初 10 个模型中,
00:04:52只有三个模型
00:04:54仍然可以通过任何类型的 API 使用。
00:04:57它们是 GPT 4.1、Claude Sonnet 4
00:04:59和 Gemini 2.5 Pro。
00:05:01这些是 12 个月前可用、
00:05:03现在依然可用的模型。
00:05:05这就是为什么我们测试这三个模型,
00:05:07因为它们是仅存的。
00:05:08自从几周前我首次发表这项研究以来,
00:05:12这三个模型中有一个已经退役了。
00:05:14所以这是我能够运行此测试的
00:05:16最后可能的时间。
00:05:17所以在那个阵容中,我们已经只剩两个了。
00:05:20所以不要对你的模型产生感情。
00:05:22以下是我们复制最初的 if scale 发现时
00:05:25这是复现原始 IF 缩放发现的结果。
00:05:27纵轴表示准确率。
00:05:29它从 100% 开始并开始下降。
00:05:32底部沿着对数刻度上升的则是规则数量。
00:05:35使用的是对数刻度。
00:05:36也就是说,每向右推进一半距离,
00:05:37它处理的规则数量就翻了一番。
00:05:42因此,到 500 条规则时,你就会失去 30%、40%、50% 的规则。
00:05:46我们的曲线与原论文中的结果相吻合
00:05:49在噪声容限之内,因此这一发现是真实的。
00:05:52一年前,在大约 200 到 300 条规则时,
00:05:55前沿模型就开始崩溃了。
00:05:57这是一个非常低的上限。
00:06:00所以这是我们的基准,现在是有趣的部分了
00:06:03我们采用了完全相同的测试
00:06:05并将其指向当前的前沿模型,
00:06:07或者更准确地说,当我运行这个测试时,
00:06:09当时的前沿模型是什么样的。
00:06:10所以我运行了 GPT 5.5、Claude Opus 4.7,
00:06:13因为 4.8 在我运行这个测试一周后发布了,
00:06:17还有 Gemini 3.1 Pro 和 Deep Seek V4 Pro。
00:06:20所以我给了它们相同的提示词、相同的文字、
00:06:22完全相同的一切,然后我立即遇到了一个问题,
00:06:25那就是它们完美通过了。
00:06:27它们在这个测试中立刻全部得到了 100 分,
00:06:30绝对没有任何漏洞。
00:06:34所以我们构建了一个用来寻找上限的测试,
00:06:36而这些模型直接穿过了这个上限,
00:06:37甚至都没有注意到头顶上有个上限。
00:06:40这倒成了个问题,因为这个基准测试
00:06:42最初设计的上限是 500 个词,
00:06:43所以我不得不修改这个基准测试
00:06:45以便能够找到新的上限。
00:06:47所以我移动了目标,让它包含更多的词。
00:06:50我把它从 500 翻倍到 1,000,
00:06:52又从 1,000 翻倍到 2,000,
00:06:55我一直这样做,直到达到了 10,000
00:06:56个词的词汇量,也就是在那里,我开始发现了
00:07:00如今模型能力的上限。
00:07:03让我展示一下,这就是核心图表,
00:07:06这就是测试结果。
00:07:07记住,x 轴使用的是对数刻度。
00:07:12所以它是从 500 到 1,000、5,000 再到 10,000。
00:07:16所以看起来那个刻度像是在从悬崖上跌落,
00:07:18而实际上它跨越了大约 1,000 个数字的范围。
00:07:20但看看这些新曲线在发生弯折之前
00:07:25向右延伸了多远。
00:07:26一年前,它们在 200 到 300 条指令时就会崩塌,
00:07:29而现在根据模型的不同,这个界限接近 2,000,
00:07:32对于其中最好的模型来说,甚至能达到 5,000 条指令
00:07:36之后它们才开始断崖式下跌。
00:07:38所以在大约 12 个月的时间里,前沿模型在同时遵循
00:07:41多条指令方面变好了近 10 倍。
00:07:44这就是最主要的发现,其中还有很多细节
00:07:47我们需要深入探讨。
00:07:49在一个提示词中追踪 2,000 个命名约束的
00:07:53能力已经具备了。
00:07:55这真的很有趣,因为我认为,
00:07:57我不知道其他人是不是也这么觉得,
00:07:59但对我而言,从...比如说,
00:08:04GPT 5.1 到 GPT 5.5 的跃升似乎只是渐进式的,对吧?
00:08:07感觉并没有变好 10 倍,
00:08:09但这是一个与非常实际的问题息息相关的测试,
00:08:14比如我的技能文件可以有多长?
00:08:17而在短短一年时间里,我们提升了 10 倍。
00:08:21让我惊奇的是,这个基准测试
00:08:23诞生还不到一年。
00:08:25一年后,500 已经成了一个可以忽略不计的误差,
00:08:27而且这个标准还在不断超越我的预期。
00:08:29我测试了 4.7,而 Opus 4.8 甚至更好。
00:08:35所以这张图表已经有点过时了,
00:08:36这也是我想表达的重点。
00:08:37如果你对技能文件应该如何运作、
00:08:39提示词可以有多长等问题
00:08:41抱有某种工程学假设,
00:08:44而且这个假设是六个多月前做出的,
00:08:46那么你现在就已经落伍了,
00:08:48你大概应该重新设计你的做事方式了。
00:08:52但这背后还有更多故事
00:08:54因为这些模型失效的方式
00:08:59发生了戏剧性的变化,
00:09:00而且它们失效的方式非常重要。
00:09:02当我开始进行这项实验时,这部分是一个完全意料之外的发现。
00:09:06一开始它彻底打乱了我的测试,
00:09:07因为旧的失效模式很无趣。
00:09:10它们只会忘记指令,
00:09:13而我可以统计出它们
00:09:14记住或忘记了多少条指令。
00:09:16但新模型崩溃时有着它们自己诡异的、
00:09:17极具个性的方式。
00:09:20所以,让我带大家看看这四个模型是如何崩溃的。
00:09:22Deep Seek 4 是一个传统的模型。
00:09:26它就是会忘事。没有什么戏剧性。
00:09:29它在 750 条规则左右开始忘记指令,
00:09:30到了 2000 条时,它已经丢掉了将近一半的指令。
00:09:31所以它只是单纯地遗忘,坦率地说,
00:09:35这是我最信任的失效模式,因为它具有可预测性。
00:09:38而且非常容易衡量。
00:09:41而其他模型可就没那么配合了。
00:09:43Opus 4.7 会反复认定
00:09:44这个测试具有危险性。
00:09:48它会做的是,它会在 API 级别
00:09:52拒绝完成测试。
00:09:54我以前不知道从 Claude 那里会得到这样一种 API 响应,
00:09:57就好像是:不,我能做这个,但我偏不。
00:09:59但Claude 确实支持这种 API 级别的响应,
00:10:01因为它们极其注重安全性,
00:10:03而我开始频繁遇到这种情况。
00:10:06出现这种情况的原因是,
00:10:09Claude 拥有非常敏感的安全分类器。
00:10:10如果你输入了某些词语的组合,
00:10:13比如炭疽和氰化物,
00:10:15它就会判定整个请求是危险的并直接退出。
00:10:16如果你还记得我的测试是做什么的,
00:10:19我的测试是在指令文件中塞入 5,000 到 10,000 个随机词。
00:10:22因此,我随机选择的词汇组合起来
00:10:24包含了各种在安全过滤器看来很危险的东西。
00:10:26所以它不断退出,说我在要求它
00:10:27制造炸弹之类的事。
00:10:29所以为了让 Claude 配合,
00:10:33我不得不把我所有的词汇
00:10:35通过 OpenAI 的安全过滤器运行一遍,
00:10:38过滤掉所有看起来违规的词汇,
00:10:39这样测试才能顺利进行。
00:10:41一旦我提供了这样的数据,Claude 表现得非常出色。
00:10:43但它的失效模式是,Claude 更有可能
00:10:47很早就判定你的行为具有危险性——比如,
00:10:52甚至在只有两三百条指令时,
00:10:54并用OpenAI的安全过滤器对它们进行处理
00:10:56因为医疗事务通常具有双重用途。
00:10:58它们既可能是危险的,也可能是安全的。
00:10:59第三种失效模式是 Gemini 3.1 Pro。
00:11:03Gemini 在高达 5,000 条指令的范围内都稳如磐石。
00:11:05它表现得极其出色。
00:11:08绝对是排行榜上表现最好的模型之一。
00:11:11而在那之后,情况就变得诡异了。
00:11:13如果所做的事情包含任何与医疗建议相关的内容
00:11:15因为医疗相关事务通常具有两重性。
00:11:17它试图做的是,它使用思考词元
00:11:20因此,第三种失效模式是 Gemini 3.1 Pro。
00:11:24Gemini 在处理多达 5,000 条指令时表现得极其稳健。
00:11:28当指令数量变得非常庞大时,
00:11:30它耗尽了所有的思考词元。
00:11:32它把整个词元预算都花在了思考上,
00:11:35然后却无法给出任何输出。
00:11:37它达到了差不多九千——
00:11:39如果你给它相当于 10,000 个词元的量,
00:11:44它会花掉 9,500 个词元的思考额度,
00:11:45然后给你一个 500 字的回复,
00:11:46而这个回复里却不包含任何要求的词元。
00:11:48它就会用光所有的思考Token。
00:11:50它把整个Token预算都花在思考上
00:11:53然后却不给出任何输出。
00:11:55它会达到差不多九千,你知道的
00:11:57如果你给了它相当于1万Token的量
00:11:59它会花掉相当于9500个Token的时间去思考
00:12:02然后给你一个500字的回复
00:12:04而这其中根本不包含任何要求的Token。
00:12:07所以它自己把路走窄了
00:12:09弄得没有空间来真正回答问题
00:12:10这代价非常高昂,而且完全没有帮助
00:12:13这倒挺符合它的作风的,不是吗?
00:12:19当然,这话我可绝不会大声说出来。
00:12:23最后登场的是赢家,也就是GPT 5.5。
00:12:26GPT 5.5是这批模型里表现最好的,准确率达99%
00:12:29一直到5000条规则都没问题。
00:12:32但如果你把它逼得太紧
00:12:33它绝对是这堆模型里最古怪的一个。
00:12:35因为它不会直接拒绝
00:12:37也不会默默地遗忘。
00:12:38相反,它会变得很不耐烦
00:12:41然后告诉你这个测试太蠢了。
00:12:45它会开始写报告,写上那么一点……
00:12:47重点就在这儿
00:12:48它一开始并不是直接说不。
00:12:50它会开始写报告
00:12:51开始撰写这份报告
00:12:52当报告写了大概500字的时候
00:12:54它就会觉得:不,这太蠢了。
00:12:55我才不干这事儿。
00:12:56然后它会礼貌地告诉你这很蠢
00:12:58它再也不想干了。
00:13:00这就是它实际给我的回应。
00:13:02但这可是在我要求它生成的商业报告写了快5000字的时候发生的
00:13:05才这么说的。
00:13:08所以它也没错,对吧?
00:13:10我要求的是一份连贯的商业报告
00:13:12不针对任何特定主题
00:13:14里面还得包含5000个随机单词。
00:13:17你说的对,GPT。
00:13:19提出这种要求确实挺蠢的。
00:13:23这本来就是一个极其无理的要求
00:13:25而GPT当场指出了这一点。
00:13:27但在测试中这依然算作失败。
00:13:29因为呈献给你的半成品报告
00:13:31漏掉了大部分关键词
00:13:32而且这也是最难察觉的一种失败。
00:13:35因为Claude会立刻甩手不干。
00:13:36Claude会说:不
00:13:37我才不做这事儿。
00:13:39Deep Seek 会尽力而为。
00:13:41但 GPT 做出的结果看起来很不错,
00:13:44除非你一直读到报告的末尾,
00:13:46那里写着,不,实际上,
00:13:47我要放弃了,因为这太蠢了。
00:13:51因此,如果你退后一步把这四个放在一起看,
00:13:53Deep Seek 会默默地遗忘。
00:13:54Claude会被吓退并直接拒绝。
00:13:56Gemini则会陷入过度思考而闭口不言。
00:13:58而GPT 5.5完成了一半的工作
00:14:00然后告诉你剩下的部分有失它的身份。
00:14:04关键不在于它们之中哪个最搞笑。
00:14:07尽管确实挺好笑的。
00:14:09重点在于“它是否遵循了我的指令”
00:14:12现在不再只有一种失败模式了。
00:14:14它有四种不同的失败方式。
00:14:16而且除非你清楚你在和哪个模型打交道
00:14:19以及它的失败模式会是什么,否则你根本无法识别这种失败。
00:14:23所以,模型性能提升了10倍。
00:14:27它们以滑稽的方式失败。
00:14:29为什么当你回到办公桌前时应该关心这一点?
00:14:31因为你的工作流程发生了三个变化。
00:14:34首先,在一年前,明智的做法是让每个技能文件都保持得非常非常短。
00:14:39指令控制在200条以内,然后指向子技能,形成一个错综复杂的额外技能文件、子文件之类的迷宫。
00:14:50过去你必须压缩指令以适应非常有限的可用空间,而现在你不需要这样做了。
00:14:57你的技能文件可以写得很长。
00:14:59第二点是,如果你的用例需要100条或300条具体的规则,你完全可以直接把它们全部放进提示词里。
00:15:06你不用再夜不能寐地琢磨模型到底默默忽略了哪几条。
00:15:12如果你回想一下自己使用模型的实际体验,你可能也意识到了这一点。
00:15:21你发现自己不再那么担心提示词会变得多长了,因为模型在遵循提示词方面确实进步了10倍。
00:15:322000个具名约束就是一个完整的风格指南,对吧?
00:15:35它包含了每一项品牌规则、每一条法律免责声明。
00:15:38一年前,你不得不把这些内容拆分到十几个专门的代理中,并祈祷这些专业代理之间能够清晰地交接。
00:15:46但现在你可以忽略这些了。
00:15:48不过第三点才是最重磅的。
00:15:50过去的问题是:模型到底能不能做到这一点?
00:15:53而现在的回答是肯定的。
00:15:55嗯,算是相当肯定吧。
00:15:58新问题则是:这是否划算?
00:16:01因为你可以在提示词中加入1万个字——抱歉,是1万条不同的指令,但这会变成一个极其庞大的提示词。
00:16:07这将是一个成本高昂的提示词。
00:16:09这将是一个非常缓慢的提示词。
00:16:10所以,过去那种让你碰壁的硬约束,现在变成了一种柔性权衡:如果加入所有这些额外的指令会导致更高的成本和延迟,到底值不值得?
00:16:19接下来讲讲几个注意事项,好提前回答大家可能提出的问题。
00:16:25首先也是最重要的一点,我刚才提到过,这是一个代理任务——在虚假的商业报告中包含随机单词,这证明了长技能文件的可行性。
00:16:38但这并不等于证明长技能文件在所有情况下都管用。
00:16:41此外,不同模型碰壁的临界点差异巨大,从750到9000多不等,所以你必须非常仔细地选择模型。
00:16:49我们的测试没有做的是:衡量模型在面对超大提示词时是否能进行清晰的推理。
00:16:57所以好消息是,自从我几周前做完研究以来,一大群人蜂拥而至开展了相关研究,现在已经有了很棒的研究成果。
00:17:05真正的科学家们参与进来并开展了工作——Chroma在18个模型上进行了上下文衰减(context rot)测试,结果表明,在触及上下文窗口限制之前,对长输入的准确率可能会下降30%到50%。
00:17:21他们研究中诡异的地方在于,连贯、结构良好的文本比单纯把指令打乱顺序随机塞进去更容易触发这种失败模式。
00:17:33我不知道为什么会这样,我得去读读他们的报告。
00:17:37因此,模型可以追踪2000、5000甚至10000条指令,但这并不意味着它能对这些指令进行清晰的推理。
00:17:46如果这些指令相互冲突、存在张力,它不一定能把事情处理对。
00:17:53然后就是我刚才简要提到的另一个问题。
00:17:56Claude的拒绝虽然烦人,但动静很大。
00:18:00你会收到一个错误,知道它失败了。
00:18:02而GPT那礼貌的半成品报告则危险得多,因为它看起来像是一个真正的答案。
00:18:07你必须通读全文才能发现它在半道上悄悄放弃了,这意味着你无法信任输出结果。
00:18:13这意味着你每一次都必须阅读输出结果,以确认它到底有没有起作用。
00:18:17所以,模型会接受你的2000条规则,并交给你一份至少一开始看起来自信且精炼的答卷,但它可能在半途中就撂挑子了。
00:18:30顺便说一句,人们总会问我所有这些花了我多少钱。
00:18:34运行所有这些查询花了我209美元。
00:18:37跨越七个模型的2300次调用总共花费了209美元。
00:18:43事实证明,开拓性的研究其实花不了多少钱。
00:18:46这就是演讲中我要说的部分:你必须在生产环境中检查这些东西,因为你无法盲目相信模型不会悄悄拉胯。
00:18:55所以,你早就知道我迟早会提到评测(evals),因为我在Arise工作,这就是我每天干的事。
00:19:01不过我就不为Arise做太多硬广了。
00:19:03我只想说一个无可辩驳的事实:如果你正在构建一个真正的AI应用,并且给它指派了相当棘手的任务
00:19:10你迟早会用前沿模型遇到上述的一种或多种失败模式。
00:19:14除非是Claude在API层直接对你说“滚蛋”,否则知道哪里出问题的唯一方法就是用另一个大模型来监控你的输出。
00:19:23这就是评测,也就是Arise所做的事情,我话就说这么多。
00:19:27我刚才提到过,在我们自己的研究之后又出现了新的研究。
00:19:30这里还有另一个重要发现。
00:19:31有一篇测试了46个模型的论文发表了,题为《重访语言模型在指令遵循方面的可靠性》(Revisiting the Reliability of Language Models in Instruction Following)
00:19:37你可以想象,在我自己做完那项研究之后,看到这个名字立刻让我竖起了耳朵。
00:19:41他们发现了一个令人不安的事实:一个模型可以在像我们这样的基准测试中拿高分,但依然极其不可靠。
00:19:47因为如果你用稍微不同的方式重新表述同一条指令,会对它遵循指令的效果产生颠覆性的巨大差异。
00:19:56所以模型可以遵循2000条指令,而且能做得非常好。
00:20:00但如果你把完全相同的指令——同样的2000条指令换个顺序,突然之间就会让模型遵循指令的能力大大退化。
00:20:08至于具体该怎么做、给模型提供指令的正确顺序究竟是什么才能让它完美遵循而不是搞砸,这仍然是目前正在进行中的研究课题。
00:20:19所以,模型容量上去了,但可靠性依然是个问题。
00:20:24接下来纯属自我吹嘘一下,因为我当时挺高兴的:我不是科学家,我只是做了点研究。
00:20:31然后一大群真正的科学家蜂拥而至,针对同一个问题做出了真正的科学研究。
00:20:36现在已经涌现出了一大堆基准测试来专门衡量这个问题。
00:20:40Firebench、CCRbench、Guidebench都在试图衡量同一件事。
00:20:44即模型在同时面对大量真实、杂乱的约束时表现如何。
00:20:49现在整个领域都在关注它,所以如果你想要比我那“1万个随机单词”更严谨的科学,真正的科学现在已经有了。
00:20:58这就是我要向大家交代的核心内容。
00:21:00一年前,编写技能文件的难点在于如何在不让模型逻辑崩溃的前提下塞进所有东西。
00:21:05那是一个压缩问题,而压缩问题现在已经不复存在了。
00:21:08模型完全可以记住你的2000条指令。
00:21:11新的难点在于如何知道它是否真的照你说的做了,而这是一个验证问题。
00:21:16验证问题没法通过写出更好的提示词来解决。
00:21:20它的解决方式就像测试任何其他代码一样,每次都对输出进行检查,也就是进行评测。
00:21:26在短短一年内,能力上限直接飙升了10倍。
00:21:29所以大家不妨回头检查一下半年前对“提示词应该多长”、“指令可以有多丰富”所做出的那些假设,因为它们可能已经过时了。
00:21:41这就是本次演讲的内容。
00:21:42如果你想要所有的代码和数据,可以在这个GitHub网址找到。
00:21:48至于这另一个二维码,是市场部硬要我放进来的。
00:21:51我们今晚5点要举办一场世界杯观赛派对。
00:21:55欢迎大家来参加我们的派对。
00:21:56那个链接是通往Luma活动的地址,可以带你加入派对。
00:22:01希望这次演讲能带给大家一些新颖的信息,或者至少博得你们的一笑,非常感谢大家的时间与关注。
00:22:07谢谢大家。
00:22:08谢谢。
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기