스크립트
00:00:00你不能相信Claude会自己批改自己的工作,这是一个巨大的问题,但这个技能
00:00:05解决了它。它被称为Claudex Loop,其前提很简单。与其让Claude负责
00:00:09规划、执行和批改自己的工作,为什么我们不引入Codex也来看一看
00:00:16Claude的计划和执行,然后说,嘿,这个看起来不错,这个不行,这是我认为
00:00:22你应该改变的地方。因为现有的每一个AI模型都有一个大问题,
00:00:25那就是它们对自己的工作评价非常高。当我问Claude它所创建的计划有多好时,
00:00:30它会说,这个东西太棒了。所以重要的是,我们要建立这样的系统,
00:00:35即我们可以引入第二双眼睛来查看第一个模型构建的内容,并说,竖起大拇指,
00:00:40竖起大拇指还是朝下,以及为什么。所以今天,我不仅要给你这个技能,我还要剖析
00:00:44它在底层是如何工作的,我们还将做一个快速演示。现在,这个技能分为四个阶段,
00:00:48其理念是你在添加某种功能之前,或者如果你正在启动一个全新的
00:00:53绿地项目时调用它。一般的想法是,无论第一个模型提出的计划是什么,或者它执行了什么,
00:00:58我们都要等到第二个模型看一眼并说,嘿,这看起来很棒,
00:01:02然后我们再推进重大的事情。现在,在第一阶段,我们在做一些侦察。我们
00:01:07实际上会去网上,Claude将去寻找答案是否真的
00:01:10存在。如果我们想对收到的答案进行非常深入的探讨,我们有权选择调用深度研究,这是内置的动态工作流。
00:01:15在此之后,我们进入审讯阶段。把它想象成一组增强的计划模式问题,
00:01:20在这里,我们试图在Claude创建第一个计划之前与它达成共识。
00:01:25其次,这是我们引入第二个模型的地方。这是审查阶段。所以Claude code,在根据我们讨论过的和完成研究的一切内容提出计划后,
00:01:28第二个阶段是审查阶段。因此,Claude Code 在根据我们讨论过和研究过的一切
00:01:34制定出计划后,将创建标准的 plan.md 文件。
00:01:38从那里开始,Codex将在只读沙盒中审查该计划,它会说,
00:01:43嘿,要么这个被批准了,要么我们需要修改x、y和z。然后它将把带有修改的答案发送给Claude code。
00:01:49Claude code将看一看,说,我同意,我不同意。
00:01:55然后它将发回它的更改。这个循环将继续最多五次。现在,我
00:02:01从来没有遇到过它在五次时真正停滞不前,或者我们没有达到批准的状态。然而,我有
00:02:06它在五次时停止,你可以通过该技能轻松地改变这一点,这样它就不会陷入某种奇怪的无休止循环中,
00:02:11而你只是永远在消耗token。这为你提供了一个非常清晰的硬性墙,
00:02:15这样你就不会陷入那种情况。最后,一旦Claude和Codex达成一致并创建了计划,我们就进入构建阶段。
00:02:20现在,这个技能让你不仅可以让Claude构建,还可以让Codex也开始构建东西。但无论哪个模型
00:02:24构建它,第二个模型都会在推进任何事情之前,再次看看它实际创建了什么。
00:02:34而且,在底层,有很多不同的变量可以调整。正如我之前提到的,我们有审查部分,它被设置为五。
00:02:38在构建部分,
00:02:43当我们让Codex查看我们构建的内容时,我再次把它减少到两个循环,
00:02:48只是为了不陷入这种无休止的循环场景中。我真的没有遇到过
00:02:52让我觉得,哦,我需要调高这个的问题。但你可以摆弄一下。此外,
00:02:56你可以更多地摆弄这个,实际上可以引入一个本地模型来代替Codex,
00:03:00如果这也是你想采用的方法的话。现在,如果你使用的是该技能的先前版本,
00:03:04被称为Grill Me Codex,你需要通过Claudix loop关注的更改
00:03:08是更增强的审讯模式。所以它的提问方式更深入。在执行阶段,我们更多地整合了Codex。
00:03:13所以同样,当涉及到实际创建的代码时,我们可以得到监督。
00:03:18接下来是实际的演示。但在我们跳进去之前,
00:03:23来自今天赞助商的我的一句简短的话。我刚刚在Chase AI plus内部发布了
00:03:28我的Claude code大师班的完全更新版本,这是从零到AI开发的头号途径,
00:03:33特别是如果你没有技术背景的话,我们专注于真实的使用案例。这个
00:03:38每周都会更新。所以如果你想精通这个疯狂的工具,
00:03:42而你又没有软件开发背景,这就是为你准备的。所以如果你想
00:03:47查看它,置顶评论中有它的链接。现在对于今天的演示,我们将使用
00:03:51Claudex loop来重新创建Calendee。如果你不知道Calendee是什么,它是一个日程安排网络应用,
00:03:56你给人们一个链接,他们可以看到你的日历,他们可以选择时间,它会自动
00:04:00创建一个zoom链接或Google Meet。所以这是很多人使用并且实际上
00:04:05付费的东西。但我想,嘿,为什么我们不自己创建这个,为我们省下,你知道的,一个月10块钱
00:04:09或者我付的任何费用,我可能应该知道这一点。所以我要做的是,我只需
00:04:13调用斜杠Claudex loop,然后我将给它一串意识流并说
00:04:18类似这样的话,我想用Claudex loop本质上创建我们自己的Calendee版本。
00:04:25截至目前,我可能会让它使用Google Meet而不是zoom。但我希望它与我的日历绑定,
00:04:32并且基本上重新创建Calendee的所有主要功能。所以让我们继续
00:04:38这样做。所以在开始时,我们处于零阶段,即研究阶段。所以它说,
00:04:41嘿,你实际上想如何进行这项研究?要么我们进行网页搜索,这有点像你的标准clause,将派遣几个子代理,
00:04:50或者我们想要全力进行深度研究吗?现在有了这个技能,我把它固定在Opus上。所以如你所知,对于深度研究,如果你在Fable上做
00:04:56并且你只运行斜杠深度研究,它会调用Fable子代理,这可能会在你的使用量上有点发疯。
00:05:01所以截至目前,我让它直接使用Opus,只是为了帮助你。同样,
00:05:05你完全可以做到这一点。它推荐网络,但老实说,我打算让它深入研究,看看它会返回什么。
00:05:10它将向我展示拟议的深度研究提示以及它试图获得答案的问题。
00:05:14所以它需要了解Google Calendar、Meet、日程安排领域的陷阱,以及通常的技术栈。所以如果我批准了,
00:05:19我们只需说,继续发射。如果我想编辑它,做起来也非常简单。
00:05:25Claude完成了深度研究,然后创建了一个假设分类账,
00:05:29这本质上是它假设你希望为这个项目发生的一切事情的列表。
00:05:36现在,在此之后,它会给我们提出更多问题,我们可以沿着不同的路径分支。
00:05:40但这些是它觉得,嘿,这里没有太多问题的东西。现在你可以给这个竖起大拇指,它会完成所有这些。
00:05:44并且这会被烘焙到计划中。或者你可以说,嘿,实际上,我想更改技术栈,或者,嘿,我想更改
00:05:53我们处理提醒和类似性质事情的方式。但现在,我们要说,嘿,这已确认。
00:05:57然后我们将进入它称之为承重层的部分。
00:06:01你知道,我们都喜欢承重这个词。现在这个词被附加到Claude做的所有事情上了。
00:06:05所以现在我们正在进入那些承重问题。第一个问题是,
00:06:09你的真实日历在哪个谷歌账户上?对于所有这些问题,无论你的项目是什么,
00:06:13它都会给你一系列问题以及建议。所以如果你毫无头绪,
00:06:17你只需选择推荐的。但坦率地说,作为最佳实践,如果你对Claude在潜在答案方面对你说了什么一无所知,
00:06:27或者甚至发生了什么,我强烈建议你进入其他部分,基本上说一些类似于进一步解释的话。这就是
00:06:32你如何在涉及AI和构建事物时真正变得优秀,而不仅仅是一个接受猴子,一次又一次地点击推荐。
00:06:40如果你不知道,请让Claude继续向你解释,直到你理解为止。这是你真正能够学习的唯一途径,
00:06:44但这有点超出了本视频的范围。所以我们将选择个人Gmail,我实际上将快进到我回答完所有这些问题之后,
00:06:53因为我想你大概理解这个阶段是如何工作的了。现在,在我们回答了承重问题之后,我们进入一些
00:06:58外观决策,这些决策再次并没有真正改变应用程序的基本功能。
00:07:02在这种情况下,它把它们全部列出来了,类似于假设分类账。所以你可以说
00:07:08这是可接受的,它将直接推进,或者你可以说,嘿,更改一,更改二,随便改什么。
00:07:12我这样设置是为了你可以加快这个过程。现在,在我们回答了那些外观问题之后,我们进入第二阶段。Claude将编写
00:07:20那个plan.markdown文件,然后使用GPT 5.6 Sol将其发送给Codex。从那里,
00:07:27他们将进行来回交流,最多五轮,或者直到他们达成接受的裁决。
00:07:32所以Claude和Codex来回交流了五轮。在开始时,有27个问题
00:07:37在第一轮中被提出,我们已经到了第五轮,问题是仍然有一些
00:07:43更多的问题。他们没有达成接受的裁决。我之前提到过我以前从未有过这种情况,
00:07:47所以我有点高兴这里发生了。所以我们已经达到了五轮。他们还没有弄清楚
00:07:51。仍然有一些小问题。你想做什么?你有选择。
00:07:56你可以停在这里,保持原样。你可以直接接受死锁状态,或者你可以延长两轮。
00:08:01所以我们打算这么做,然后看看当它们
00:08:05终于达成一致时会发生什么。不过很高兴你能看到,尽管我们有诸如
00:08:11五轮这样的硬性停止限制,但这并不是死胡同。如果你像我们一样遇到这种情况,
00:08:15可以非常轻松地延长轮数。所以在经过七轮之后,它们达成了协议,现在它会
00:08:19问你,你究竟想让谁来构建这个东西?所以我们可以让 Claude 负责构建,而 Codex
00:08:24来审查,或者反过来,由 Codex 构建,Claude 来审查。在某些情况下,
00:08:29根据我们正在做的事情,它还会为你提供进行协同构建的选项。所以假设
00:08:33我们正在创建一个需要诸如资产生成之类功能的东西,或者需要将类似 GPT 生成的图像
00:08:38引入其中的项目。这时它也会说,嘿,让我们针对项目的这个特定部分引入 Codex。
00:08:43但在这种情况下,我们打算由 Claude 来构建。现在它将要
00:08:47开始创建所谓的“开卷”(open book)。这样 Claude 就能完成日历演示的创建,
00:08:51也就是我们在这里看到的内容。让我们看看它是否真的能运行。然后我们再回过头来,
00:08:55深入探讨 Codex 为整个流程添加了什么。所以我们有介绍通话,然后是一个工作会话。
00:09:01因此,如果转到介绍通话,我们就可以看到一堆与我的 Gmail 日历实际同步的不同时间和日程安排。
00:09:07比方说,我选择 31 号的某个时间。
00:09:12我选择了上午 10 点。你只需要输入我的名字,再填入我的邮箱。然后点击确认预订。
00:09:23我们可以看到系统向我们发送了一封带有加入链接的电子邮件。我还能查看我的所有日历,
00:09:28我还让它创建了一个简单的构件(artifact),用视觉化的方式分解了 Codex 对整个流程所做的贡献。
00:09:33我们之前讨论过这一点,也就是 Claude 拥有计划而 Codex 做出调整的那个来回交互阶段,
00:09:38或者说它提出的调整意见,这一过程一直持续到了
00:09:42七轮。最初有 27 个问题。你可以看到每一轮中,问题数量都在不断减少,直到
00:09:48第七轮时,我们终于得到了批准的裁决。现在,以下是 Codex 实际上
00:09:52在规划阶段提请 Claude 注意的一些事情,比如双重预订的约束条件
00:09:57无法编译的问题,例如 OAuth 连接流程出现故障。还有并发方面的问题,
00:10:03即对同一预订进行两次重新安排可能会同时成功,诸如此类的大量边缘情况相关内容。
00:10:08现在在构建阶段,Claude 实现了我们在经历七轮之后得到的改进版计划。
00:10:12然后我们弹出了一个新的 Codex 会话,它拥有完全崭新的记忆和全新的上下文窗口,
00:10:17它没有读过那个计划。接着它对照实际规范检查了代码,也就是比较了实际创建的内容
00:10:23与实际计划的内容。因此它返回了 23 个发现,其中 19 个被接受并修复,4 个
00:10:29被拒绝。所以以下是 Codex 在这个构建阶段发现的一些问题:时间网格在每次会议后发生偏移,
00:10:34管理令牌以纯文本形式存放,所有事件都阻塞了错误的时间段。
00:10:39还有更多类似的事情,你可能会争辩说这些都是边缘情况,但
00:10:44Claude 需要很长时间才能找到它们。因此,如果从一开始房间里就没有 Codex,
00:10:48情况会是什么样呢?嗯,我们会遇到崩溃的功能,会有只存在于数据库中却无处可寻的预订,诸如此类。
00:10:53然而在现实中,如果我们只是依赖 Claude,真的会是这样吗?可能在刚开始时,
00:10:58我们只需要进行更多次的迭代,最终也能得到某种大概能用的东西。
00:11:03但有了 Codex,我们在规划阶段就发现了许多此类问题。
00:11:08因此我们不必耗费令牌,事后又得消耗更多令牌。而且我们能够利用 Codex 来测试这些事情,
00:11:14在投入生产之前让 Codex 对其进行审查。总而言之,
00:11:21这为你节省了大量的时间和金钱。这就是正在运行中的 Claudex 循环。如果你想亲自体验一下,
00:11:26我会把链接放在置顶评论中。除此之外,我们回头见。
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기