Transcript
00:00:00单个技能能让 CloudCode 的效率大幅提升吗?
00:00:03它能让 CloudCode 更快、更省钱,并编写更少的代码
00:00:06同时还能保持我们习惯的高水平结果吗?
00:00:10嗯,这正是 Ponytail 声称能够做到的事情,
00:00:13这也使得它在发布仅七天后就获得了 40,000 个 Star。
00:00:18当然,Ponytail 并不是我们见过的第一个声称能做到这一点的工具.
00:00:22我们过去讨论过 Caveman,所有这些工具往往都有相同的理念。
00:00:26这个理念就是 CloudCode 天生比较冗长,
00:00:29如果我们告诉它,嘿,别说那么多废话,
00:00:32我们就能得到一个更加简洁的答案,它最终同样正确
00:00:36或者,就像我们对 Caveman 的记忆一样,甚至可能更正确。
00:00:40Ponytail 只是它的最新版本,
00:00:42但它声称的数据比我们以往见过的任何工具都要好。
00:00:45我们可以在这里看到这些数据。
00:00:47我们可以看到代码行数对比、Token 消耗对比、成本对比以及时间对比。
00:00:52总体而言,灰色是没有使用这些工具的基准,
00:00:55绿色则是 Ponytail,
00:00:58Ponytail 几乎在所有地方都领先,或者非常接近领先。
00:01:03现在,你在这里看到的数据是聚合数据。
00:01:05这是在多次不同测试中取出的平均值,
00:01:08这也是使用 Haiku 4.5 完成的。
00:01:11别担心,等一下我们要 A. 验证这些测试,
00:01:14看一个真正的模型,因为实际上我们没有人真正在使用 Haiku 4.5。
00:01:18我们使用的是 Opus 4.8,所以让我们看看那些数字是什么样的。
00:01:20当谈到代码行数时,代码量大约减少了 50%。
00:01:24而如果我们看 Token、成本和时间,
00:01:27与基准相比大约有 20% 到 30% 的改进。
00:01:31这可不是一个小数目,
00:01:32特别是当我们把它推广到像 Fable 这样
00:01:36费用极其昂贵的工具时。
00:01:37所以如果我能告诉你,嘿,如果你在使用像 Fable 这样的工具,
00:01:40它会更快、更便宜。
00:01:42那么,我们肯定会喜欢它,对吧?
00:01:43现在,在我讲解它是如何工作的
00:01:45并向你们展示基准测试得分之前,
00:01:47先听一下今天赞助商(也就是我)的简短介绍。
00:01:50所以在 Chase AI+ 里面,我有我的 Claude Code 大师班,
00:01:53这是从零基础迈向 AI 开发者的首选途径,
00:01:56特别是如果你没有技术背景的话。
00:01:59我每周都会对其进行更新,
00:02:01并且它还包含有关编解码器(codecs)
00:02:03以及如何构建你自己的智能体操作系统的大师班。
00:02:06你可以在置顶评论中找到它的链接。
00:02:08再次强调,我每周都会更新它,
00:02:10而且我们专注于实际用例。
00:02:12所以如果你想开始精通 Claude Code,
00:02:15这里就是你的不二之选。
00:02:16那么 Ponytail 是如何工作的呢?
00:02:17嗯,它在编写代码之前
00:02:19会经历一个六步流程。
00:02:20所以第一个问题是,
00:02:22这个东西甚至有存在的必要吗?
00:02:24如果答案是否定的,
00:02:26那么我们就根本不用为它编写代码。
00:02:28这相对来说显而易见。
00:02:29在那之后,我们问,标准库能实现这个功能吗?
00:02:33如果答案是肯定的,
00:02:34我们就使用标准库。
00:02:36你在基准测试中看到的一大重点是
00:02:38有时 Claude Code
00:02:41会从头重新创建那些已经存在的功能,
00:02:45这些功能要么存在于某种库中,要么作为平台特性存在。
00:02:49所以 Claude Code 存在这样一个问题:
00:02:51嘿,车轮其实早就被造出来了。
00:02:52我们在这个程序里就已经有现成的车轮了。
00:02:53而它却好像在说:
00:02:55你知道吗?我要从头造一个车轮。
00:02:56正因如此,
00:02:57当你其实并不需要的时候,
00:02:59就会产生大量代码。
00:03:01这是你在这些基准测试中
00:03:03一遍又一遍看到的情况。
00:03:04暂且岔开一下,
00:03:05这六个步骤基本上都在问 Claude Code,
00:03:09比如说,嘿,这个功能是不是已经原生存在了?
00:03:12我们真的需要创建自定义的东西吗?
00:03:15因为 Claude 喜欢创建自定义的东西,
00:03:17即使它根本没必要这么做。
00:03:18所以如果标准库不能实现,
00:03:20它就会问,嘿,这是不是一个原生的平台功能?
00:03:22这是一个已安装的依赖项吗?
00:03:24这可以写成一行吗?
00:03:26我们需要长篇大论吗?
00:03:27如果它完成了所有这些检查,
00:03:28本质上就像是在说,不,不,不,不,不,
00:03:30那么我们的要求是,无论你写什么,
00:03:33只写能起作用的最低限度。
00:03:35不要做得过头。
00:03:36如果不需要,就不要去创建它。
00:03:37而如果我们确实需要,就只做最基本的改动。
00:03:40所以这里的核心理念是让 Claude Code 变得懒惰,
00:03:42但并非疏忽大意。
00:03:44任何与信任边界验证、数据丢失处理、
00:03:47安全性和无障碍访问相关的内容
00:03:48永远不会被削减。
00:03:50因此它在应用这个流程时显得很聪明。
00:03:53现在就安装而言,相对比较直接。
00:03:55你只需要复制这里的这个命令。
00:03:57我当然会在简介里放一个链接
00:03:58指向这个代码库,
00:04:00它会为你完成安装。
00:04:01你也可以将它用于编解码器,
00:04:03或者实际上任何现有的 AI 智能体。
00:04:05关于 Ponytail,有几个命令。
00:04:07即:light、full、ultra 和 off。
00:04:10再次说明,这非常让人想起 Caveman,
00:04:12就像我们所追求的 Caveman 的级别一样。
00:04:14我们可以让它审查我们的代码。
00:04:16我们可以让它审计一个代码库。
00:04:18然后我们还有 debt、gain 和 help 技能。
00:04:20同样的,如果你想深入了解,
00:04:22可以在 GitHub 仓库里仔细钻研它们。
00:04:24但如果基准测试站不住脚,
00:04:24所有这些其实都不重要。
00:04:26这个仓库的好处在于
00:04:28他们提供了基准测试。
00:04:29我们可以自己运行这些测试。
00:04:31你猜怎么着?
00:04:32这正是我所做的。
00:04:34你也可以自己亲自尝试。
00:04:36这里有一份完整的说明文档,
00:04:37介绍了他们是如何得出这些基准测试结果的,
00:04:39就在 README 上。
00:04:40它还为你提供了重现这些结果的能力。
00:04:43所以我要向你们展示的是
00:04:44当我重现所有这些基准测试时
00:04:45我所得到的数据。
00:04:48我不仅用 Haiku 4.5 重现了它们,
00:04:51也就是你在仓库里看到的那个版本,
00:04:52同时我也用 Opus 4.8 进行了测试。
00:04:54因为再次说明,我们没有人真正在使用 Haiku。
00:04:56我其实并不关心 Haiku。
00:04:58我关心的是 Opus。
00:05:00老实说,结果非常有趣。
00:05:02所以,这就是测试,这就是得分。
00:05:04你可以看到他们公布的数据。
00:05:07你可以看到我们使用 Haiku 运行的结果。
00:05:09然后最右边这里
00:05:10是我们使用 Opus 运行的结果。
00:05:12在底部,你可以看到聚合数据。
00:05:14因此,这 54% 再次体现了对代码行数的观察。
00:05:17根据 Ponytail 的说法,代码行数减少了 54%。
00:05:21而当我们运行它时,在 Haiku 上这一比例是 56%。
00:05:24所以基本上完全一样。
00:05:27而在 Opus 上,这一比例达到了 71%。
00:05:29因此在使用 Opus 时,我们看到使用 Ponytail 获得了更大的收益或更高效的代码。
00:05:36这是为什么呢?
00:05:36因为这些更强大的模型有点喜欢喋喋不休,对吧?
00:05:40它们喜欢长篇大论。
00:05:41再次呼应了 Caveman。
00:05:43你会记得其中讨论过的一项研究
00:05:45就是这个整体观点:非常冗长的模型喜欢说很多话,
00:05:50以至于有时它们通过自言自语反而错失了正确的答案。
00:05:53所以这挺有意思的,实际上就像是对这个工具的一种促进。
00:05:57而且很有趣。
00:05:58他们谈到了在测试中使用 Haiku 的原因是为了节省成本。
00:06:02我真的认为他们应该用 Opus 来完成整件事,
00:06:04因为当我们运行它时,Opus 实际上让它看起来更好。
00:06:09你知道的,这也是大家真正在使用的模型。
00:06:11所以如果要说的话,他们在代码行数方面反而有点低估了它的效率。
00:06:15这一点也适用于成本。
00:06:17当我们看 Haiku 4.5 时,我们测试的聚合结果是多少?
00:06:21我们看到成本大约降低了 25%;而对比 Opus 4.8,成本降低了 53%,
00:06:28这太疯狂了。
00:06:30成本为我们减少了 53%。
00:06:32想象一下这是在 Fable 上。
00:06:33你可以看到各项测试以及全面的数据。
00:06:35最低的降幅是 13%。
00:06:38而在某些情况下,对于多步向导(multi-step wizard),降幅高达 73%。
00:06:42现在你可能会想,其中有些测试我们真的需要 Opus 吗?
00:06:45也有道理。
00:06:45但请理解这里究竟阐明了什么。
00:06:48在不使用该技能、仅用标准 Opus 时正常情况下需要花费 1.39 美元的东西,在使用 Ponytail 后
00:06:55只需 0.38 美元。
00:06:57如果我们看 Haiku,在某些情况下,这些较小的模型在使用 Ponytail 时实际上最终成本更高了。
00:07:04因此,当我们讨论更强大的模型时,这种减少代码行数并使其更高效的整体思路要好得多。
00:07:11在某些情况下,较小的模型会产生相反的效果,因为它们本来就很高效,因为它们有点像那种“又笨又快”的类型。
00:07:18你可以在这里的 count items 基准测试中看到,在 Haiku 中使用 Ponytail 的成本反而高出了 21%。
00:07:27虽然我们谈论的是两美分的差异,但道理依然存在。
00:07:31模型越强大,这种架构就越有效。
00:07:34我很想看看在 Fable 上运行会是什么样子。
00:07:37再说一次,53% 可真不是开玩笑的。
00:07:39速度又如何呢?
00:07:40同样,我们在 Haiku 身上也看到了类似的情况。
00:07:43它快了多少?
00:07:44与不用 Ponytail 相比,在 Haiku 中使用 Ponytail 大约快了 31%,提速 31%。
00:07:51而对于 Opus,速度提升了 71%。
00:07:55快了 71%。
00:07:56再来看看 Haiku 的情况是怎么样的?
00:07:58有几个实例(实际上是三个),在使用 Ponytail 时速度反而变慢了。
00:08:03你知道,在某些情况下,相比 Opus 全面的各项基准测试最高达 88% 的提升,它慢了 22%。
00:08:10在某些实例中,它总是更快,对吧?
00:08:13我们再次看到多步向导提速 78%,日期选择器(date picker)提速 88%。
00:08:17而在最坏的情况下,差异为 27%。
00:08:22所以当我们看到 Ponytail 的这些数字时,我们可能会想,啊,还是持保留态度吧,即便我能运行这些基准测试,20% 到底意味着什么呢?
00:08:31然后你又会想,哦,这是 Haiku。
00:08:33所以这有点扯淡。
00:08:34然后我们在 Opus 上测试它,结果就完全不同了。
00:08:36它要高效得多。
00:08:37我想显而易见的问题变成了,那么基准测试本身呢?
00:08:41比如这些基准测试有多大效力?
00:08:42它们现实吗?
00:08:44首先,去仓库里亲自试一试,或者运行你认为符合你所认为合理的标准的你自己的基准测试。
00:08:52无论如何,我认为当我们讨论它所运行的 19 个不同的基准测试时,我们开始看到各方面都呈现出相同的情况。
00:08:59当我们审视像 Opus 这样更强大的模型时,老实说,我对 Haiku 的这些数据基本上选择忽略。
00:09:04我不关心 Haiku。
00:09:06它更便宜。
00:09:07它更快。
00:09:08因此,它更有效率。
00:09:11再说了,既然我们讨论的本质上只是一个技能(skill),尝试一下又有什么坏处呢?
00:09:16这些数据看起来真的很好。
00:09:17我强烈建议你去这个仓库下载并开始自己使用它。
00:09:21最坏的情况下,比方说对于你的特定项目,它太复杂了,以至于让它少说废话反而适得其反。
00:09:30嗯,我觉得这可以说是“有百利而无一害”的情况,对吧?
00:09:34所以这就是最坏的情况。
00:09:37最好的情况是你的 Opus 使用量节省了大约 50%,并且速度提升了 70%。
00:09:43所以确实很有意思。
00:09:45我肯定会在日常工作中开始使用它。
00:09:47我用 Caveman 已经有一两个月了,一直都在用,而且是自动加载的。
00:09:52而我打算切换到 Ponytail 看看自己有多喜欢它。
00:09:55我觉得这类新东西出来得越多越好。
00:09:58你现在听到所有人都在谈论的都是 Token 成本,Token 成本,Token 成本。
00:10:03所以任何能为我们降低这一成本的东西都会受到热烈欢迎。
00:10:07那么这就是我本期视频要结束的地方。
00:10:08和往常一样,如果你想获取我的 Claude Code 大师班,请务必去看看 Chase AI Plus。
00:10:13在评论区让我知道你的想法,我们下期见。