这项新技能终于解决了 AI Agent 的思考难题

AAI LABS
Computing/SoftwareInternet Technology

Transcript

00:00:00Claude Code、Codex 以及你使用的几乎所有其他 Agent 都有一个严重的问题,而只要你需要它们做出决策,就会立刻碰到这个问题。
00:00:08这些模型能够深入思考问题,但它们永远想不出任何新颖的点子。
00:00:12无论你用的是哪一个都没用,因为一旦你需要创意,它们无一例外都会败下阵来。
00:00:17所以当你找它们要创意时,得到的永远是最稳妥的平庸答案,最终你不得不一遍又一遍地引导它们寻找本该由它们自己发现的切入点。
00:00:24除非你亲自把这些切入点喂给它们,否则它们根本不会进行创造性思考。
00:00:28但奇妙的是,解决这个问题的良方居然是 ADHD(多动症)——也就是人的注意力无法集中在单一事物上、不断跳跃的状态。
00:00:35事实证明,当应用于 AI Agent 时,ADHD 反而变成了一种超能力,而这也正是我们现在赋能它们的方式。
00:00:41最近有一款热门工具做的正是这件事。
00:00:44如果你是第一次来到这里,我们是一家软件公司,这是我们的频道 AI Labs,在这里我们将展示如何像优化我们自身流程一样,用 AI 来优化你的工作流。
00:00:54所以在本期视频中,我们将探讨给你的 Agent 赋予“ADHD”究竟是如何起到实效的。
00:00:59在介绍这个工具之前,你得先了解为什么会需要它。
00:01:03如果你使用过 Claude Code、Codex 或任何其他 Agent,你一定知道它们非常擅长把你给的大任务拆解成小块。
00:01:10它们会将这些小任务分发给子 Agent,让每个子 Agent 在独立的上下文窗口中工作,从而避免挤爆主会话。
00:01:16你甚至都不用特别去要求。
00:01:18它们会自动创建待办事项并尽可能进行委派,以便并行开展工作。
00:01:22但这种拆解分流只发生在具体执行的工作上。
00:01:26当你要求它们构思创意时,这种拆解完全不会发生;如果你曾尝试过让它们从不同角度构思创意,就一定体会过这种痛苦。
00:01:34你要求提供变体方案,读起来好像各有不同,但实际上全都是同一个想法换汤不换药的表达。
00:01:40因此,创意构思是最难外包的工作,因为寻找真正不同的思考方向并非 Agent 所长。
00:01:47归根结底,这源于这些模型的训练方式。
00:01:50Agent 总是倾向于选择在其训练数据中最常出现的形式,因为反复看到同一个答案,会让它误以为这就是最佳答案。
00:01:59这并不代表它的回答是错的,通常给出的结果也不错,但有些其他角度它甚至压根不会去考虑,这就失去了与它一起头脑风暴的意义。
00:02:08而且这种安全模式只是一方面,另一方面是它从不独立评估每一个想法。
00:02:13所有的可能性都在同一个上下文窗口中推演,导致各种想法相互干扰,上下文被大量噪音填满。
00:02:20思考质量不仅没有提升反而变差了,这就是为什么它无法清晰评估任何事物,最终只能给你提供换了措辞的同质化想法。
00:02:28这个 ADHD skill 推出时间不长,但在短短几天内就收获了大量的 Star。
00:02:33这个名字非常贴切,因为就像现实中的 ADHD 那样思维发散,它不会让思考沿着一条直线单向运行,而是将思维发散开来。
00:02:42因此,它会把创意构思或任何存在多种可能方向的任务,作为“思维树”(Tree of Thought)拆分给多个独立的 Agent。
00:02:49思维树本质上是一种结构,就像树枝分叉一样,由多个子 Agent 分支独立研究不同的想法。
00:02:58最后,当每个分支都确定了一种可能性后,它会把所有这些想法重新汇总,合并为最终答案。
00:03:06所以它会启动多个在各自上下文窗口中思考的 Agent,每个 Agent 都会获得对同一个问题的不同视角切入(Framing)。
00:03:12它们是相互隔离的,共享零上下文,谁也不知道其他 Agent 在研究什么。
00:03:17但这里的隔离并不是为了拆分工作量,而是为了保持每个想法的独立性,防止它们相互影响。
00:03:24它保持独立性的方式是通过 Frame(框架),这本质上是审视问题的不同视角。
00:03:29它内部有一个完整的框架库,包含了 Agent 可以尝试的所有不同方向,每个 Agent 都会挑选一个框架来进行深入分析。
00:03:37因此,它会将该框架提示词与系统提示词以及问题本身一起接收。
00:03:41然后,一个 Critic Agent(评审 Agent)会对返回的所有内容进行打分,因为必须有人来决定哪些想法值得保留。
00:03:48它从三个维度对每个想法进行评分。
00:03:50首先是 Novelty(新颖度),即这个想法究竟有多新颖、多富有创意。
00:03:54其次是 Viability(可行性),即你是否能现实地把它构建出来。
00:03:57最后是 Fit(契合度),即它与你要解决的问题匹配得有多好。
00:04:01这种打分过程在一个独立的 Agent 中运行,其提示词要求它扮演一个充满批判精神的资深工程师。
00:04:07所以它的核心任务就是对其看到的所有内容进行严格挑刺。
00:04:10根据分数,它会决定一个想法是保留下来还是直接废弃。
00:04:15最后,该 Skill 会精选出最强有力的想法,并穿过“陷阱列表”,这基本上就是如果真按该方案执行可能会引发的问题。
00:04:23然后,它会优先考虑那些被标记为“非显而易见”的想法。
00:04:26在我们向大家展示这个 Skill 的具体实用玩法之前,希望大家能订阅我们的频道并点个赞。
00:04:33这小小的一份支持对我们至关重要。
00:04:36以上就是它在底层运行的原理。
00:04:38现在让我们把它安装起来。
00:04:40你可以在该项目的 GitHub 仓库中找到安装命令。
00:04:43复制命令后,在你正在处理的任何项目目录下打开终端并运行它。
00:04:47接着它会询问你想为哪款 AI 编程 Agent 安装,它支持多达 45 种以上的 Agent。
00:04:53所以你直接选择你平时用的那款即可。
00:04:55之后,它会询问是仅在当前项目内部可用(即 Project Scope),还是无论在哪个项目中都全局可用。
00:05:03如果你只需要在单个项目中使用,选择 Project Scope 即可。
00:05:06安装完成后,该 Skill 会保存到一个名为 .agents 的文件夹中。
00:05:10许多像 Codex 这样的 Agent 都使用该文件夹保存配置,但 Claude Code 默认只能识别 .claude 文件夹。
00:05:18因此如果你使用的是 Claude Code,需将该文件夹重命名为 .claude,这样它就能被正常识别了。
00:05:22打开文件夹,你就会看到该 Skill 躺在里面。
00:05:25它只是一个单独的 skill.md 文件,无需任何额外的参考文件或依赖项,就能独立处理所有逻辑。
00:05:31指令还会强力推动 Agent 跨越其给出的前三个初始答案。
00:05:36文件中明确指出,前三个答案是这些模型训练数据中最常见的响应,
00:05:41也是任何资深 Agent 能立刻脱口而出的常规方案。
00:05:44而一个资深 Agent 真正具备的更有趣的思考,只有在这前三个答案之后才会显现。
00:05:50不过启动这么多 Agent 会消耗大量 Token,
00:05:52因此它设计了一个预检步骤,用来决定该 Skill 是否应该运行。
00:05:56如果你通过斜杠命令(/)调用它,或者直接明确要求使用它,它会立即触发。
00:06:01如果你没有在提示词中明确提及直接调用该 Skill,
00:06:04而你的 Agent 决定自动调用该 Skill 时,
00:06:07它就会将问题带入构成预检步骤的三个问题进行评估。
00:06:11第一个问题是该问题是否属于开放式问题,
00:06:14意思是有经验的人在此处是否会给出几种不同的可行答案,
00:06:19还是只有一个唯一标准答案。
00:06:20如果只有一个正确答案,
00:06:22那么从多个角度思考就没有意义,纯粹是在浪费 Token,
00:06:26所以它会在此时终止。
00:06:27第二个问题是风险是否足够高,
00:06:29意思是如果显而易见的答案最终证明是错误的,是否真的会让你付出不小的代价。
00:06:34第三个问题是你提问的方式。
00:06:36如果你使用了诸如“快速”或“标准”之类的词汇,
00:06:38很明显你只需要直接了当的答案,
00:06:40因此它会在此停止,而不是调用 Skill。
00:06:43除了预检步骤之外,
00:06:44你还能看到循环的各个阶段以及框架表,这些框架构成了交由各个 Agent 执行的不同方向。
00:06:50它还列出了明确要求 Agent 避开的思维模式。
00:06:54在我们深入探讨有趣的实际应用场景之前,先来看一段赞助商广告。
00:06:59Top View。
00:06:59如果你制作过 AI 视频,就一定懂这种痛苦。
00:07:02每个模型都在不同的平台上,你必须一次生成一个片段。
00:07:05Top View 解决了这个问题。
00:07:06它是全球首款全合一的 AI 视频 Skill,直接内置于你的编程 Agent 中。
00:07:11如 Claude Code、Cursor、Codex。
00:07:13它将所有顶尖模型聚合在一处。
00:07:16包含 Veo、Kling、Seaweed、Nano Banana 等等。
00:07:19无需切换平台,无需管理多个订阅。
00:07:22我们亲自试用了一下。
00:07:23我们给 Agent 发送了一条指令:
00:07:25“根据这张产品图片,生成 10 个不同版本的 15 秒 TikTok 广告。”
00:07:29几秒钟后,我们就拿到了 10 个可以直接发布的成品广告。
00:07:32这才是真正的变革。
00:07:34Top View 能把你的 Agent 变成流水线式的视频生产线。
00:07:36只需描述一次需求,它就能在一个会话中,跨不同模型、风格和宽高比批量生成几十个视频。
00:07:44它甚至能为具体任务自动选择最合适的模型。
00:07:47无需离开 Agent,就能实现从一行文本到视频成品的跃升。
00:07:51点击简介中的链接,体验 Top View 的 Skill 吧。
00:07:54这就是它的配置方式。
00:07:54现在让我们看看它究竟在哪里能发挥大作用。
00:07:57一个大显身手的场景是测试驱动开发(TDD),也就是让 Agent 先编写测试用例,
00:08:03然后逐个构建应用组件,直到所有测试都通过为止。
00:08:07正如我们在之前的视频中讨论过的,在写代码之前先写测试非常重要,
00:08:12因为当所有需求都被严格写成代码测试时,任何破坏应用的修改都会被测试捕获。
00:08:18Agent 被迫必须遵守这些测试规则。
00:08:20而编写测试非常适合交给这个 Skill,因为这恰恰是 Agent 最容易偷懒的地方。
00:08:26它们无法覆盖所有应该覆盖的场景,因为正如刚才所说,它们习惯退回到常见的标准答案,只针对那些场景写测试。
00:08:33它们从不去考虑用户可能在应用中采取的其他同样需要覆盖的路径。
00:08:37你当然可以给它一份关于如何编写测试的详细 Prompt,甚至构建一个专职编写测试的 Agent,
00:08:45但它们依然会落入相同的固有模式。
00:08:47不过在运行之前,Agent 需要在动笔前明确你要构建的是什么。
00:08:51为此,你需要写下需要构建的内容,比如 PRD(产品需求文档),它基本上概述了应用应该具备的功能、要解决的问题、期望达成的目标以及目标用户。
00:09:03与此同时,你还应该给它一份技术规格文档,明确并固定技术细节,这样就不必反复告诉它该使用哪些工具了。
00:09:11你在 .claude.md 文件中关联这两份文档,这样它从一开始就能获取这些上下文。
00:09:16然后通过斜杠命令调用该 Skill,提供描述应用的 Prompt,并要求它使用 TDD 方法编写测试用例。
00:09:25由于你是显式调用的,它会跳过预检,立刻启动 5 个 Agent。
00:09:30每个 Agent 使用与问题最匹配的框架,沿着各自的思考方向探索,并带回不同的测试编写思路。
00:09:38接着根据前面提到的标准对每一种进行打分,筛选出前三名并展开更深入的探索。
00:09:44当所有这些 Agent 完成工作后,你将获得一份关于测试方向及对应评分的详细报告。
00:09:50评分采用简写形式,例如 N9 代表新颖度 9 分,V8 代表可行性 8 分,F10 则代表契合度满分。
00:10:00每个方案还附带构建草图、潜在风险以及入门的第一步指导。
00:10:07而且返回的这些想法看起来完全不同于常规的测试套件。
00:10:11通常 Agent 编写的测试只会检查应用能否正常运行。
00:10:15但该 Skill 给出的方案覆盖了更多的极端情况(Edge Cases),甚至还能捕获性能问题。
00:10:21因此你最终能获得一个更健壮的测试套件,分布在三个深度探索的分支中,每个分支测试应用的不同路径。
00:10:30不过这里需要明确一点:该 Skill 负责规划测试,而不是直接编写测试代码。
00:10:34你得到的是整体策略,此后你只需告诉 Agent 你想要哪个方向,它就会去实现那一个。
00:10:40如果你只需要一个方向,选一个即可;或者也可以让它把三个全部实现。
00:10:44如果性能对你构建的项目至关重要,你会希望全要,但这需要一点时间,因为 Agent 必须逐个路径进行推演。
00:10:52然而一旦完成,你可以清晰地看到测试比平时要详细得多,
00:10:57因为在写下任何一行测试代码之前,整个测试策略都已经过深度的规划。
00:11:02因此在开始构建之前这非常有效,因为它预先覆盖了大部分情况,大幅降低了后期破坏应用的风险。
00:11:09不过这些都是构建前的准备工作。
00:11:11另一种用法是在产品发布前作为临门一脚的审核步骤。
00:11:14在即将上线的应用上运行该 Skill,并让它评估用户体验。
00:11:18它会指出用户在浏览网站或使用产品时可能遇到的阻碍,
00:11:23以及任何可能导致流失(Churn)的问题,即用户在使用后选择放弃你的产品。
00:11:29当网站上线并面对真实用户时,流失非常普遍,尤其是付费产品。
00:11:34他们一开始很喜欢,但后来离开,仅仅是因为某个功能没按预期工作,
00:11:38于是他们便要求退款。
00:11:40很多时候,这只是开发过程中被忽视的小细节,
00:11:44带到了线上版本中,并在此后引发了连锁问题。
00:11:48我们在自己的社区网站上运行了它,当时我们正准备上线一项新功能。
00:11:53社区里已经有很多会员,所以任何新功能都必须非常谨慎地检查,
00:11:57因为我们不想发布任何破坏现有用户体验的东西。
00:12:01因此我们用斜杠命令调用它,提供该功能,并要求它分析
00:12:05哪些地方可能导致用户流失,以及哪些地方可能带来糟糕体验。
00:12:09它首先深入分析了应用以收集上下文,
00:12:12然后以同样的方式启动 Agent,提出了大约 30 个不同的想法。
00:12:17从中挑选出前三名并作进一步探索。
00:12:20完成后,它将针对新颖度、可行性和契合度打分的所有发现呈现给我们。
00:12:25它成功捕获了此前完全没被察觉的盲点,
00:12:28比如在 PRD 中承诺了但实际上根本没开发的功能,
00:12:32这意味着我们差点发布一个与宣传不符的产品,
00:12:35此外还有一堆其他发现。
00:12:37针对每一项发现,它都给出了修复建议,并列出了随之而来的陷阱和风险。
00:12:42它的运作方式与测试完全一致。
00:12:44它本身不会自动修补问题,你只需将需要的评估发现交还给 Agent,
00:12:48它就会去具体实施修复。
00:12:50这样你就能在发布前而不是发布后解决所有这些隐患,
00:12:53从而在正式面向公众时,让你的应用处于更好的状态。
00:12:57我们在视频中展示的所有 Skill、工作流和资源,
00:13:01均可在我们的社群 AI Labs Pro 中获取。
00:13:04因此,如果你觉得我们的内容有价值并希望支持本频道,
00:13:07这是最好的支持方式。
00:13:09链接就在下方简介中。
00:13:10本期视频到这里就结束了。
00:13:12如果你想支持本频道并帮助我们继续制作这样的视频,
00:13:16可以通过点击下方的“超级感谢”(Super Thanks)按钮给予支持。
00:13:18一如既往,感谢观看,我们下期视频再见!

Key Takeaway

通过将 ADHD 的发散思维机制引入 AI Agent,利用独立上下文窗口的“思维树”多分支探索与 Critic Agent 严格打分,能彻底解决 AI 决策与构思时方案同质化及平庸化的难题。

Highlights

  • AI Agent 普遍存在同质化思考与过度拟合训练数据最常见答案的问题,难以自发生成具备新颖度的创意解法。

  • ADHD Skill 通过“思维树”机制,将开放性任务分发给多个在独立上下文窗口中运行的子 Agent,消除共享上下文导致的思路干扰。

  • 系统内建 Critic Agent(评审 Agent),从新颖度(Novelty)、可行性(Viability)及契合度(Fit)三个维度对所有分支方案进行严肃打分与筛选。

  • 该 Skill 支持超过 45 种 AI 编程工具(如 Claude Code、Cursor、Codex),其核心配置仅包含一个独立的 skill.md 文件。

  • 为节省 Token 消耗,系统内置包含三个门槛问题的预检机制(Pre-check),仅针对风险高且无唯一标准答案的开放性问题触发。

  • 在测试驱动开发(TDD)与上线前 UX/留存风险排查中,该 Skill 能显著提升边缘情况覆盖率并捕捉盲点。

Timeline

AI Agent 在创意决策与构思上的瓶颈

  • 现有 AI Agent 擅长拆解并执行常规任务,但在面对需要创意的决策时往往给出同质化的平庸方案。
  • 模型倾向于输出训练数据中最常出现的安全答案,缺乏考虑非显而易见切入点的能力。
  • 在单一上下文窗口中推演多种可能性会导致思路相互干扰与上下文噪音,进而降低思考质量。

Claude Code 和 Codex 等 Agent 在自动化执行与任务分发方面表现出色,但由于训练机制的限制,模型总是倾向于选择概率最高、最稳妥的解答。当要求它们针对同一问题提供不同角度的变体时,输出往往只是换汤不换药的文本重述。此外,将所有推演过程挤在同一个上下文窗口中,会让各种想法混杂在一起产生干扰,导致 Agent 失去客观评估能力。

ADHD Skill 的底层架构与思维树机制

  • ADHD Skill 运用“思维树”(Tree of Thought)结构,将任务并行分发给多个零共享上下文的子 Agent。
  • 框架库(Frame Library)为每个子 Agent 提供独有的切入视角,确保各分支思考路径的独立性。
  • 独立的 Critic Agent 充当资深工程师角色,按新颖度、可行性与契合度三项指标对方案打分挑刺。

该 Skill 借用注意力发散的特性,打破传统的线性单向思考模式。系统从框架库中提取不同的视角提示词,与系统 Prompt 一起分配给独立的子 Agent。这些 Agent 在互不干扰的上下文窗口中并行推演,从源头上保证了思路的多元化。随后,充当资深工程师的 Critic Agent 从新颖度(Novelty)、可行性(Viability)与契合度(Fit)三方面进行严格打分,直接废弃平庸方案并精选出“非显而易见”的高价值想法。

安装配置与预检 Token 控制机制

  • Skill 安装包兼容 45 种以上的 Agent 工具,且仅依赖单个 skill.md 配置文件独立运行。
  • 指令会强制要求 Agent 跨越训练数据中最易出现的前三个初始答案,去发掘更具创意的方案。
  • 预检机制通过评估问题类型、风险高低与用户措辞,自动拦截不必要的 Skill 调用以节省 Token。

用户可以通过 GitHub 仓库中的命令行将 Skill 安装在项目局部(Project Scope)或全局。对于 Claude Code 用户,需将配置文件夹重命名为 .claude 即可自动识别。文件内明确设定指令,要求 Agent 跳过前三个最常出现的常规解答,以进入深度思考区间。为了防止多 Agent 并行导致 Token 消耗过高,系统会在非显式调用时运行预检逻辑:只有当问题属于开放式、决策风险较高且无“快速”或“标准”等简化要求时,才会真正触发思考循环。

测试驱动开发(TDD)与上线前风险审核应用

  • 在 TDD 模式下,Skill 负责规划覆盖更多极端情况与性能隐患的测试策略,而非直接生成代码。
  • 上线前审核应用能精准识别 PRD 遗漏项与可能引发用户流失(Churn)的体验盲点。
  • Agent 会给出带有 N9/V8/F10 等简写评分的报告与修复路径,由开发人员选择具体落地方向。

在 TDD 开发流程中,结合 PRD 与技术规格文档使用该 Skill,可让 5 个并行 Agent 生成包含多元测试路径的策略报告,有效规避传统 AI 编写测试时偷懒、漏掉边缘场景的问题。此外,将该 Skill 运行在即将上线的应用上,能全面排查导致付费用户退款或流失的盲点(例如实际代码未实现 PRD 承诺功能等)。它提供包含评分、风险提示与修复建议的报告,帮助开发者在正式发布前补齐短板。

Community Posts

View all posts