使用 Claude 3.5 Sonnet 的 7 个技巧,超越 90% 的人

AAI LABS
컴퓨터/소프트웨어

스크립트

00:00:00Fable 5.1 是 Anthropic 推出的最新版本,也是目前最好用的模型之一。
00:00:05但它的表现与以往的模型有所不同,你在使用它时需要做出一些小小的调整。
00:00:09因为如果你照搬以前使用旧模型的方式来用它,你就无法发挥它的全部潜力,
00:00:13甚至可能会得到更糟糕的效果。
00:00:18例如,Anthropic 表示该模型最适合长时间运行的任务,但前提是你必须用特定的方式对它进行提示。
00:00:23而且有一个设置,Anthropic 建议保持开启,但实际上却让结果变得更糟。
00:00:28如果你是第一次来,我们是一家软件公司,这是我们的频道 AI Labs。
00:00:32在这段视频中,我们将介绍充分利用 Fable 5.1 的 7 个技巧。
00:00:37但在进入这些技巧之前,我们首先需要说明关于这个新模型的一些事情。
00:00:42随着 Fable 5.1 的发布,Anthropic 声称该模型在完成任务方面要好得多。
00:00:48但 Fable 5.1 并不是工作质量更高,而是以更少的成本完成了更多的工作。
00:00:54我们在自己的客户项目中也看到了这一点。我们将相同的任务交给 Fable 5 和 Fable 5.1,
00:01:00并且每个模型都运行了多次。虽然我们不能透露项目的细节,但 Fable 5 在大多数任务上表现得更好,
00:01:05而 Fable 5.1 只有在一个任务上表现更好。那个任务是其中最艰难的,
00:01:10在那个任务上 Fable 5.1 做得更好,速度快了约 40%,成本还不到一半。
00:01:16因此,当工作变得更加困难时,Fable 5.1 的实力更强。即使在它的工作质量不算最好的任务中,
00:01:22它也能坚持到底。Fable 5 在某些尝试结束前就停止了,而 Fable 5.1 每一个都完成了。
00:01:27而且它在每个任务上的成本都更低。现在你可能已经知道,Claude Code 有一个 usage 命令,
00:01:33它基本上可以估算,如果你是按使用量付费而不是按订阅付费,一次会话会花掉你多少钱。
00:01:38通过这个估算,Fable 5.1 比 Fable 5 便宜了大约 47%。
00:01:45但它便宜并不是因为模型突然使用了更少的 Token,而是因为 Anthropic 的定价变了。
00:01:50但在我们讨论价格变动之前,你需要了解一件事。任务运行得越久,对话增长得就越大。
00:01:55正因如此,模型在回答新提示之前必须阅读更多内容。
00:02:00模型并不会从一条消息到下一条消息自动记住整个对话。因此,每当模型需要给出另一个回应时,
00:02:05整个对话都必须重新发送给它。但 Claude 不会每次都从头开始处理相同的对话,
00:02:10而是会保留它已经处理过的内容的保存副本,并在你下次提示时重复使用该副本。
00:02:16这基本上被称为缓存读取(cached read)。这些缓存读取也会产生费用,
00:02:21但与通常的输入和输出相比,它们的价格更低。随着 Fable 5.1 的推出,
00:02:27Anthropic 将这部分的费用削减了 75%。因此,在每次回应之前重新发送的对话现在成本低得多。
00:02:33这种节省在单个提示上可能看起来很小,因为没有多少对话需要重新发送。
00:02:39但在长时间的任务中,相同的不断增长的对话被一遍又一遍地发送,
00:02:44所以每次模型回应时,节省的金额都在增加。现在这只涵盖了模型读取的内容。
00:02:50模型写入的内容是单独定价的,而且这个价格没有变。Artificial Analysis 是一家独立测试模型并为其评分的机构,
00:02:55他们发现 Fable 5.1 编写的内容比 Fable 5 多得多。
00:03:01因此,即使读取变便宜了,账单还是上升了。在他们的测试中,它生成的输出大约是 Fable 5 的 1.7 倍,
00:03:07每个任务的成本高了约 20%。
00:03:14Anthropic 的 Fable 模型具有安全护栏,这些规则可以阻止它们执行某些类型的任务。
00:03:19而对于 Fable 5.1,Anthropic 表示这些护栏中断 Claude Code 会话的频率减少了约 60%。
00:03:25但当它现在确实触发其中一个护栏时,Claude Code 会在不通知你的情况下切换到一个较弱的模型并继续运行。
00:03:31并且这个较弱的模型会处理接下来的会话,即使你的下一个请求与触发它的原因毫无关系。
00:03:36因此,你得到的不是拒绝,而是较弱的工作质量,并且误以为是 Fable 5.1 生成的。
00:03:41这已经发生在一个构建游戏的开发者身上,该游戏有一个包含单词 biological 的笑话文件。
00:03:46该项目与生物学毫无关系,但那一个词就足以让处理工作的模型发生切换。
00:03:51如果你的项目实际上涉及这些护栏所涵盖的主题之一,例如安全或生物学,
00:03:55没有任何设置或措辞能够避免这种情况。这只是 Fable 5.1 代价的一部分。
00:04:00现在,在 Artificial Analysis 的测试中,Fable 5.1 在准确性上的得分高于 Fable 5,
00:04:06但它也更容易产生幻觉,也就是模型不知道答案,却凭空捏造一个并把它当成真的呈现出来。
00:04:13当 Fable 5.1 不知道答案时,它有 72.6% 的概率产生幻觉。
00:04:18Fable 5 的这一比例为 63.6%。模型承认自己不知道,实际上比装作无所不知要好,
00:04:26因为那样你可以自己去核实事情。
00:04:31但当它胡编乱造而你因为模型这么说而信任它时,那个编造的答案就会直接进入你的工作成果中。
00:04:35当你将它用于研究或写作时,这一点尤为重要,因为事后验证这些内容会变成一项浩大的工程。
00:04:40但在我们进入这些技巧之前,如果你能订阅本频道并点赞,那就太好了。
00:04:45这个小小的支持举动对我们意义重大。
00:04:50在听了这些之后,你可能会说旧模型在某些方面明显更好。这确实是真的,
00:04:56但与此同时,它将成为你所使用的应用程序中的默认模型。
00:05:01这就是为什么你需要遵循我们即将讨论的技巧。否则,你将无法发挥它的全部潜力。
00:05:06现在,真正更好地使用 Fable 5.1 的第一个方法是降低努力程度(effort)。
00:05:11对于不了解的人来说,effort 是决定模型在给出答案之前做多少工作的设置。
00:05:16而这一个设置同时影响着工作质量和成本。
00:05:21制作代码审查工具的 Code Rabbit 在实际审查工作中测试了 Fable 5.1,
00:05:26发现它在低努力程度下捕获了 61% 的问题,而高努力程度下为 57.1%,
00:05:33并且它还快了大约 3 分钟。当我们使用 Fable 5.1 为我们的社区网站添加功能时,我们也看到了同样的情况。
00:05:39在高努力程度下,它花了好长时间在功能的某一部分上反复拉锯,
00:05:44而在低努力程度下,它完成了整个任务并给我们带来了更好的结果。
00:05:49我们在之前的 Fable 视频中也推荐过低努力程度,在使用过 Fable 5.1 之后,这依然是我们的建议。
00:05:54所以你应该从低努力程度开始,只有在结果给你理由时才调高它。
00:06:00否则,你是在浪费时间和 Token,却换回极少的回报。
00:06:05你需要做的下一件事是移除你为旧模型编写的指令。
00:06:10当你切换到 Fable 5.1 时,这些指令仍然保留在你的设置中,尽管它们试图解决的行为已经消失了。
00:06:15因此,Fable 5.1 仍然不得不遵循一连串针对它并不存在的问题的修复方案。
00:06:21它们只会浪费你的额度,其中一些现在还会引发新的问题。我们在之前的视频中也提到过这一点。
00:06:25现在你可能会想,你怎么知道哪条指令重要,哪条不重要呢?
00:06:30你可以通过从 Claude.md 中移除一条指令并再次让 Claude 做同样的工作来进行测试。
00:06:36如果没有它,结果是一样的,那么这条指令就不需要存在。但你不需要凡事亲力亲为。
00:06:41Claude Code 有一个名为 Claude API Prompt Audit 的命令,可以为你找出这些指令。
00:06:46你需要在终端中运行该命令,它会检查你为 Claude 保存的所有内容。
00:06:51然后它会向你展示哪些指令是为旧模型编写的,并为你提供它推荐的具体更改。
00:06:56它不会自行更改任何内容,因此你可以先审查列表,只批准你同意的更改。
00:07:01但在我们进入下一个技巧之前,先听听我们赞助商 Porkbun 的介绍。
00:07:06你终于发布了你的应用,但它卡在某个随机的默认 URL 上,它真正需要的是一个属于它自己的规范域名。
00:07:12这就是 Porkbun 登场的时候了,它提供专门为科技项目打造的 .app 和 .dev 域名。
00:07:18.app 域名非常适合你的应用或 SaaS 落地页,
00:07:23而 .dev 则专为你的代码作品集或文档而生,因此当别人看到它的那一秒,
00:07:28就知道这是一个真正的项目。这些不仅仅是好听的名字,每个 .app 和 .dev 域名都位于
00:07:33HSTS 预加载列表上,这意味着每个连接都自动支持 HTTPS 且无需设置,
00:07:39并且包含免费的 SSL 证书,因此你的网站开箱即保安全。
00:07:45最棒的是,你第一年只需花 5.99 美元即可获得域名,并享受免费的 WHOIS 隐私保护,没有附加销售或隐藏费用。
00:07:52第一年后,续费价格仍保持成本价,因此长期来看依然很便宜。前往 [porkbun.com/ailabs26](https://www.google.com/search?q=https%3A%2F%2Fporkbun.com%2Failabs26)
00:07:58以 5.99 美元获取你的域名。链接在下方的描述栏中。
00:08:03现在,Anthropic 销售 Fable 5.1 是为了让你可以无需多加看管就能让它运行漫长的任务,
00:08:09但它在执行一个已经在你原始请求中涵盖的步骤之前,仍然会暂停以征求许可。
00:08:14它只是问一个问题然后等待,而当没有人去回答时,等待就等于停止。
00:08:19发生这种情况是因为它的常规行为假设你在与它协同工作。因此,Anthropic 针对 Fable 5.1 的提示指南
00:08:24指出,你需要在提示中告诉它没有人正在监视,
00:08:29并且只要可以撤销,它就应该继续执行你的请求中已经涵盖的任何内容。
00:08:34这赋予了模型完成漫长任务的权限,而不会因为不必要的问题而停下来。
00:08:39Fable 5.1 还有一个习惯,就是做比你要求更多的工作。
00:08:43例如,如果你要求它添加一个功能,它可能会注意到附近的其他问题并将其一并修复,
00:08:48或者将该功能扩展到超出你描述的范围。我们在一个客户项目中看到了这一点,
00:08:53我们要求它实现一个功能,结果它还修改了没有人要求它去碰的测试文件。
00:08:58问题在于,这些额外的修改可能会改变你希望保持原样的产品部分。
00:09:03因此,当你给 Fable 5.1 布置任务时,你也应该告诉它什么不要动,这意味着它只改变请求需要改变的部分。
00:09:08这意味着它只会修改需求所需的部分。如果它发现了其他问题,
00:09:13它会在最后提及。当我们在项目中这样做并明确告诉它不要修改
00:09:18测试文件时,它就只处理了我们要求的功能。Fable 5.1 还有另一个习惯,而且每当它
00:09:24修改文件时都会发生。当它在处理任务且只需要编辑文件的一小部分时,
00:09:29它反而会重写整个文件,尽管其余部分根本没有发生任何变化。
00:09:33这在你看来可能没什么问题,因为你依然得到了正确的结果,但每一行
00:09:38代码都会消耗输出 Token,如果它处理大量文件,就会极大地加快额度的消耗速度。
00:09:43我们在自己的第二大脑项目中就遇到了这种情况,每一次小修改消耗的资源都比本应需要的更多,
00:09:48因为它总是重写那些本可以直接编辑的文件。为了阻止这种情况,
00:09:52你需要告诉 Fable 5.1,当一个小修改就能达到相同效果时,
00:09:56它就应该只编辑那一部分。下一个问题不是 Fable 5.1 写了多少,
00:10:01而是它是怎么写的。我们在 Opus 5 上就已经见识过这一点了,它使用了大量 Anthropic 称之为
00:10:06“矫揉造作的散文”。对于不了解的人来说,”矫揉造作的散文”是指模型使用华丽的
00:10:11短语和隐喻,而不是直接表达字面意思。例如,模型不说某个设置
00:10:16值得更改,而是称之为值得转动的表盘。而在长篇的研究任务中,
00:10:20这种语言让人很难看出模型到底想表达什么观点。
00:10:24现在,Fable 5.1 比 Opus 5 和 Fable 5 使用的这种文风更少,它也减少了陈词滥调和
00:10:31未经解释的专业术语。但它的行文中依然存在这个问题,而且与 Fable 5 相比,
00:10:36它的句子更长,段落分隔更少,这使得它更难让人跟上思路。
00:10:41所以你只需要告诉它移除所有矫揉造作的散文,这样就能把这两个问题都解决。我们在其中一个
00:10:46研究任务中运行它时就是这么做的,当时我们用它来进行写作而不是构建代码。
00:10:51最后一点是你给 Fable 5.1 分派什么样的工作。到目前为止我们涵盖的所有内容都是关于如何从它身上
00:10:56榨取更多价值,但任务的类型同样重要,因为 Fable 5.1 在处理宏大任务时表现最佳。
00:11:01当我们在项目中运行任务时,Fable 5 在最简单的任务上其实表现更好,
00:11:07但在最困难的任务上,Fable 5.1 的表现更出色,它的完成速度快了约 40%,成本降低了 58%。
00:11:14因此,宏大复杂的任务才是 Fable 5.1 胜出的领域,因为在这些任务中,无需中途停顿就能
00:11:19完成整个工作才真正重要。这就是为什么你不应该把一个功能拆成许多小提示词,然后
00:11:23一步一步地喂给它。你应该把完整的功能交给他,并清晰地描述你想要的结果,
00:11:28然后你就会看到它独自完成整个功能。现在,如果你想获取我们在视频中展示的所有
00:11:33技能和工作流,你可以在我们的社群 AI Labs Pro 中获取它们。
00:11:38如果你觉得我们的工作有价值并想支持这个频道,这就是最好的方式。
00:11:43链接就在简介里。这也让我们来到了本视频的尾声。如果你想支持这个
00:11:48频道并帮助我们继续制作这样的视频,你可以通过点击下方的“超级感谢”按钮来做到这一点。
00:11:53一如既往,感谢大家的观看,我们下期再见。

핵심 요약

通过将努力程度设为低、移除旧指令并允许自主执行,能够充分发挥 Fable 5.1 在复杂任务中的性能优势并降低成本。

하이라이트

  • 在面对最艰难的任务时,Fable 5.1 的速度比旧模型快约 40%,且成本不到一半。

  • Fable 5.1 在遇到未知答案时有 72.6% 的概率产生幻觉,高于旧模型的 63.6%。

  • 将努力程度(effort)设置为低可以捕捉到 61% 的代码审查问题,而高努力程度为 57.1% 且多耗时约 3 分钟。

  • Anthropic 将缓存读取的费用削减了 75%,但由于 Fable 5.1 生成的输出量约为旧模型的 1.7 倍,整体任务成本仍高出约 20%。

  • Fable 5.1 在触发安全护栏时会静默切换到较弱的模型并继续运行,导致工作质量下降。

타임라인

Fable 5.1 的性能特征与成本变化

  • Fable 5.1 专为长时间运行的复杂任务设计,在艰难任务中速度提升约 40%。
  • 缓存读取费用虽然下调了 75%,但输出量的大幅增加导致每个任务的总成本高出约 20%。
  • 安全护栏触发时会自动切换到较弱模型,且不会提前通知用户。

Fable 5.1 改变了模型的成本与运行结构。虽然单次会话的缓存读取费用降低,但由于其生成的文本内容比旧模型多出约 1.7 倍,最终账单往往不降反升。此外,其在遇到安全护栏时会自动降级,容易让用户误以为是新模型本身的质量。

充分利用 Fable 5.1 的前两个技巧

  • 低努力程度设置在实际测试中捕获了更多的代码问题,同时运行速度更快。
  • 通过 Claude API Prompt Audit 命令可以自动清理专为旧模型编写的冗余指令。

降低 effort 设置不仅能节省 Token 和时间,还能避免模型在代码审查中陷入不必要的反复拉锯。同时,清理遗留指令能够防止模型被无效规则干扰,确保新模型以最高效率执行任务。

优化提示词与任务分配的最后四个技巧

  • 在提示中明确说明无人监视并赋予其继续执行的权限,可防止模型在中途因等待许可而停滞。
  • 限制修改范围以及禁止无故重写整个文件,能够有效节约输出 Token。
  • Fable 5.1 适合处理宏大复杂的整体任务,而非被拆解为碎片的小提示词。

为了避免 Fable 5.1 过度工作或频繁暂停,必须在提示中施加明确边界,禁止其修改无关文件或重写未变动的代码。将完整的大型任务一次性交由其处理,能够彻底发挥其在复杂场景下的性能优势。

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기