Transcript
00:00:00自从我们上手 Hermes 以来,我们在上面构建了大量工作流,长期以来,
00:00:04我们一直通过 OpenAI 订阅在 GPT 模型上运行所有这些工作流。起初效果还不错。
00:00:09但我们的整个团队都在使用 Hermes,每个人都有自己的流程设置,面对如此多
00:00:14的人同时使用它,我们不断遇到使用限额问题。这会导致我们的工作直接停摆。
00:00:18所以我们转用了 OpenRouter。这确实解决了我们面临的限额问题,但又导致了一个新
00:00:24的问题。OpenRouter 对每一个 token 都要收费,我们第一次能够清晰地看到
00:00:29Hermes 给我们带来的成本。这个数字远高于我们的预期,而奇怪的是
00:00:34大部分成本并非来自我们主动使用它,而是来自人们设置错误的自动化任务。
00:00:39因此,我们着手削减账单,但我们也不愿在输出质量上妥协。
00:00:44于是我们检查了所有设置,找到了那些既能降低成本又不影响 Hermes
00:00:49表现的方案。如果是你第一次来到这里,我们是一家软件公司,这是我们的频道 AI Labs,
00:00:54在这里我们向你展示如何像我们优化自身流程一样,用 AI 优化你的工作流程。
00:00:59所以在这期视频中,我们将介绍我们修改的所有设置,这些改变如何影响我们的
00:01:03工作流,以及它实际节省了多少成本。在我们深入探讨如何节省 Hermes 成本之前,
00:01:08我们首先需要弄清楚究竟是什么在消耗 token。你为 Hermes 支付的费用取决于
00:01:12它使用了多少 token。token 本质上是模型读取和编写内容的基石。
00:01:17每个模型都基于你输入和获得的 token 构建。但输入不仅仅是
00:01:22你的提示词,它还包括系统提示词、你到目前为止的所有对话历史,
00:01:27以及随每条消息发送的其他内容。这包括你添加的每项技能的头部信息,
00:01:31也就是它的名称和描述,这些总是会被加载,此外还有你设置的 MCP
00:01:36工具、记忆以及用户文件。所有这些都会增加你的输入 token,而技能
00:01:41占据了很大一部分。Hermes 预装了 90 项技能,而且这个数字只会随着你使用时间的增加而增加。
00:01:46这是因为它会将任何值得重复使用的工作流转化为一项新技能。所以每一项技能
00:01:51都会增加你每条消息的成本。不仅是技能头部信息,Hermes 还会扫描你的对话,
00:01:56寻找构建新技能的机会,这也会消耗 token。Hermes 还有一种自我进化的记忆。
00:02:03它不断浏览你的对话,以提取关于你的特定细节,并将其
00:02:07写入记忆。它能自行更新记忆,从而保持关于你的上下文,并定制它未来的回答。
00:02:13这些都不是免费的,因为进化的技能和自动更新的记忆都在
00:02:19消耗你最终需要支付的 token。另一个主要因素是 Hermes 全天候 24/7 运行。它不像我们使用 Claude Code 时那样,
00:02:25启动一次后运行完毕即停止。你可以在本地服务器上运行它,就像我们已经为团队设置的那样,或者在 VPS 上,
00:02:30也就是你自己租用并运行的服务器,以便你的团队其余成员可以访问它。
00:02:35因为 Hermes 一直处于开启状态,后台运行着大量任务。如果你不加以管理,这些任务会推高你的使用量。
00:02:40单次运行其中一个任务很便宜,但一旦它不断重复,或者你设置了大量类似任务,成本就会累积起来。
00:02:45此外,你设置的 MCP 工具和钩子也会被加载到
00:02:50上下文窗口中,因此它们也会消耗 token。如果你在 Hermes 上运行目标,那也会花钱。
00:02:56好消息是 Hermes 提供了追踪所有这些数据的方法。它将每一笔 token 使用数据存储在根文件夹的一个数据库中。
00:03:01你可以让任何与你协作的 agent 去查看
00:03:07那个数据库,并给你一份详细的分类报告。这个 agent 可以追溯到
00:03:13数据库中你首次安装 Hermes 的时间。从那里开始,它可以告诉你你运行了多少会话,
00:03:17使用了多少 token,以及总共花费了多少钱。它会详细列出你的支出,
00:03:22这样你就可以和 Claude 一起商量如何更好地管理预算。Hermes 还有一个
00:03:27洞察指令 (insights command),功能大致相同。它会给你一份过去 30 天的成本明细,
00:03:31并告诉你每一部分消耗了多少,以及你使用最多的工具和技能。它甚至会显示
00:03:36你的活动模式和最长的会话。好了,既然你知道是什么在消耗 token,让我们从
00:03:42单一最大的消耗源开始,那就是模型本身。你为 Hermes 连接的模型
00:03:47驱动了你账单的大部分。Hermes 提供了很多可以连接的模型,所以如果你已经支付了
00:03:52某种订阅费用,比如我们有的 codec 订阅,你就可以直接通过它运行 Hermes。一旦
00:03:56设置完成,你支付的就是你现有的订阅费用,不会有额外的叠加成本。
00:04:01现在你可能想对 Anthropic 或 Gemini 的订阅做同样的操作,但尽管 Hermes
00:04:06将其列为可用,但实际上并不行。你不能直接使用 Claude Code。你需要一个
00:04:11单独的 API,因为它们双方都将这种订阅使用方式视为违反了它们的
00:04:16政策。所以目前为止,codec 订阅是你最好的选择。我们起初在自己身上使用了 OpenAI
00:04:21订阅,但最终切换到了 OpenRouter,因为它让我们能在单一 API Key 下访问更多
00:04:26模型,并且最适合全公司使用。所以如果你像我们一样使用 OpenRouter,你可以通过 Pareto 路由器节省成本。
00:04:30它会评估你的任务实际需要什么,并将其路由到最适合这项工作的模型。它有 13 个模型分布在不同层级中,
00:04:36从廉价基础款到昂贵强大型。除了服务商之外,你的 config.yaml 文件中也有一些设置
00:04:41能帮你节省 token。Hermes 运行着大量后台任务,默认情况下,
00:04:46这些任务的模型被设置为自动。这意味着即使是小任务,它也会退回到你的主模型。
00:04:51这些被称为辅助任务,也就是 Hermes 运行的小型后台作业,它们
00:04:57不需要你的主模型所具备的重型推理能力。像读取图像、搜索
00:05:02你的技能库、加载 MCP 工具以及编写个人描述等任务,完全可以在更轻量的模型上运行。
00:05:07所以你可以将这些任务指向更便宜的模型,这样你的主模型就不会在简单的事情上消耗昂贵的 token。
00:05:11同样的思路也适用于我们之前提到的子 agent。
00:05:17Hermes 可以生成多个子 agent 并分配任务给它们。每个子 agent 都在自己的上下文窗口中运行并
00:05:21独立工作。但这非常消耗 token,因为每个子 agent 基本上都是一个单独的会话,
00:05:26它只汇报发现的结果,所以成本累积得很快。所以你可以为子 agent 设置一个更便宜的模型,
00:05:32这样每次启动一个时你就能省下钱。无论你使用什么模型,还有一件事值得调整,
00:05:38那就是工作强度水平。这基本上是模型在回答之前思考的程度。
00:05:43如果你将其调到最大,输出效果确实更好,但你也会消耗更多的 token,从而导致成本更高。
00:05:48所以你需要根据你正在做的任务匹配工作强度。当任务
00:05:53比较简单、不需要太多推理时,你可以直接关闭思考功能。但在我们
00:05:58继续之前,让我们先听听赞助商 Luma 的消息。如果你从事创意工作,真正的瓶颈不是
00:06:03创意。而是为一个项目同时使用八种不同的 AI 工具,结果花了一半的时间在管理它们上。
00:06:08Luma 通过代理式 AI (agentic AI) 解决了这个问题。普通 AI 只是辅助你,但 Luma 的 agent 实际上是与你一起创作,
00:06:13而且它们理解物理世界,理解事物如何移动、表现以及在空间中存在,而不仅仅是像素。
00:06:19你提供品味和方向,agent 在幕后编排一切,
00:06:24在整个项目中保持上下文,并为每一步调用合适的模型。从最初的
00:06:30想法到最终剪辑,agent 让整个项目持续推进,而且绝不是简单的“一个指令,一个输出”。
00:06:35你与它们逐轮协作,逐步细化,这样你无需付出 10 倍的努力,就能探索 10 倍多的创意,
00:06:40并且拥有最好的模型,而不是分散在 10 个标签页中。使用 Luma 创作,通过下方链接获取抢先体验,
00:06:45或扫描屏幕上的二维码。但模型并不是唯一消耗你 token 的东西。
00:06:51上下文窗口也会消耗。你的 Hermes agent 自带一套完整的工具和
00:06:56技能,你发送的每一条消息都会连同所有这些内容一起携带,加上迄今为止你建立的整个对话
00:07:02历史。对话运行的时间越长,历史记录就越多,
00:07:07每一轮发送的内容也就越多,上下文窗口增长很快,所以养成经常点击压缩的习惯是个好方法。
00:07:12这样做会开启一个基于到目前为止所有内容的总结的全新会话。
00:07:16你节省了大量 token,而模型依然保持了对话的上下文,只是以一种更精简的形式。
00:07:21默认情况下,压缩阈值设置为 50%,这意味着当上下文窗口填充到一半时,Hermes 就会压缩
00:07:26对话。你可以调整这个数值,在大多数情况下,将其保持在较低水平更好。
00:07:31这样做减少了每轮需要发送的消息数量,有助于保持上下文使用的高效,并降低每条消息的成本。
00:07:37压缩后,Hermes 还会保留一部分未压缩的 token,并将它们添加到一起以保留更多
00:07:42上下文,这就是它所说的目标比例。你可以将其设置为更低的百分比,以便更少的旧对话
00:07:47带入上下文窗口,每轮发送的消息也就更少。
00:07:52你还可以控制多少工具结果真正进入上下文。以前我们在
00:07:58OpenAI 订阅上时,我们将这些值设置得很高,以免 Hermes 错过细节,
00:08:03正如我们在上一期视频中介绍的那样。但一旦转用 OpenRouter,我们不得不更密切地关注成本,
00:08:08所以我们将这些值调低了。如果你有只需要用于单个会话的
00:08:13一次性指令,不要将其写入 Hermes 上下文文件。相反,你可以使用
00:08:18临时系统提示词,它本质上只会将其添加到那个会话中,仅此而已。这样,
00:08:23你就可以使用该指令,而不会浪费上下文文件中的空间。如果你正在运行
00:08:28像“第二大脑”这样的本地系统,正如我们之前展示的那样,你需要妥善组织这些信息。这样,
00:08:34agent 就可以在需要时一点一点地加载它,而不是拉入它不需要的额外 token。
00:08:39除了你自己创建的文件,你还可以精简 Hermes 依赖的文件,比如
00:08:44记忆文件和 agent 文件。这些文件一直位于你的上下文窗口中,所以它们
00:08:49越小,每次消息中模型需要处理的内容就越少。Hermes 还允许你开关
00:08:54其自动记忆功能,这会阻止它收集记忆并阻止记忆文件
00:08:59出现在你的上下文窗口中。这能为你省钱,因为每条消息发出的 token 更少了。
00:09:05但关闭自动记忆功能意味着放弃让 Hermes 如此出色的功能之一。
00:09:10所以,即使要花钱,我们在自己的工作流中还是保持开启状态。我们希望它拉取
00:09:14关于我们公司的详细信息,并与整个团队共享该上下文,因为大家都在通过 Slack 使用它。
00:09:20当 Hermes 确实出错时,不要只是再次发送提示词。使用 undo 命令
00:09:25回退一条消息。这不是倒退几条消息的彻底撤销,但它
00:09:30确实允许你撤销最近的那一条。这是更好的做法,因为从那里你可以给它一个新的
00:09:35提示词,说明出了什么问题以及需要避免什么。如果你喜欢这个视频,
00:09:40请订阅频道并点击支持按钮。这个小小的支持对我们意义重大。
00:09:45精简所有这些内容可以降低你的使用量,接下来要看的是工具。你 agent 拥有的每一个
00:09:50工具也会作为上下文窗口的一部分随每条消息发送,所以精简你实际上不使用的工具很划算。
00:09:54Hermes 预装了超过 17 种工具,你可以通过 Hermes list 指令查看所有这些工具。
00:10:00要禁用一个工具,你可以通过桌面应用,或者运行 tools disable 指令加上你想要关闭的
00:10:05工具名称。例如,我们为整个团队设置的 AI Labs 个人资料并不需要
00:10:10在代码库上进行任何工作,所以那里根本不需要代码执行功能。
00:10:15我们有专门处理该功能的个人资料。我们禁用了它,连同任何其他我们未
00:10:20使用的工具,这样就不会无故留在上下文中。Hermes 还附带了大量技能,
00:10:26而且其中大多数你可能永远不会使用,所以你可以关闭所有你不需要的技能。
00:10:31你的技能列表最终只会保留你真正使用的那些,而不是一个只是
00:10:36放在那里增加上下文负担的长列表。你的 MCP 服务器也是如此。每一个你连接的服务器都会带来自己的一套
00:10:41工具进入上下文窗口,所以断开任何你实际上没有使用的服务器,对于你保留的
00:10:46那些,确保工具搜索设置为自动。它的工作方式类似于 Claude 中的工具搜索功能。
00:10:51它只在真正需要时加载工具,而不是一直把它们全部保留在上下文窗口中。
00:10:56如果你的不是自动模式,请切换过来,这样你就不会浪费 token,并且能从你花费的资源中获得最大收益。
00:11:01硬性限制是保持 token 使用量下降的另一种方法。它们限制了 agent
00:11:06在必须停止之前可以执行的操作量。第一个是设置模型 max tokens 的特定数值,
00:11:11它控制了模型作为输出可以产生的 token 数量。这节省了你的输出成本,并推动
00:11:16模型给出更简练的回答,而不是胡言乱语。默认情况下,agent 的最大轮数设置为 150。
00:11:22这意味着,当它处理任务时,它可以进行多达 150 轮的思考、调用工具、读取
00:11:27输出并权衡结果,然后才会结束。问题在于,当 agent 困惑时,
00:11:33它可能会消耗完所有轮数,在尝试解决问题时反复发送整个上下文。
00:11:39所以你可以将其降低到更小的值。我们将自己的设置为 60,这样 agent 就不会在卡住的问题上
00:11:46浪费轮数。还有一个值得开启的设置,可以防止循环。
00:11:51你可以将硬停止 (hard stop) 设置从 false 切换为 true,这可以防止 agent 无缘无故地循环。
00:11:56因此,当它卡住且没有取得进展时,硬停止功能会介入并停止它,
00:12:01防止它继续无效消耗。接着是你的 cron 任务。基本上就是按计划
00:12:06自行运行的任务,默认情况下没有设置最大轮数限制。你可以将其设置为特定
00:12:10数值,从而对 cron 任务可以进行的轮数进行上限限制。这能防止后台任务
00:12:15消耗 token,并阻止它们无限制地产生费用。现在,为了开始使用 Hermes
00:12:21Agent,我们策划了一个完整的入门包,可在 AI Labs Pro(我们的社区)中获取。
00:12:26在那里你将获得资源、入门包等,以及一个与
00:12:31志同道合的人(包括我们的团队)交流的地方。所以如果你发现我们所做的事情有价值,
00:12:36并想支持该频道,这是最好的方式。链接就在描述中。
00:12:41视频到这里就结束了。如果你想支持频道并帮助我们继续制作
00:12:45像这样的视频,可以通过使用下方的超级感谢按钮来做到。一如既往,感谢
00:12:50观看,我们下一期再见。
00:12:54(注:该片段原内容为频道介绍的补充,此处不再重复翻译以保持完整性)
00:12:59(注:该片段原内容为结束语的补充,此处不再重复翻译以保持完整性)
00:13:04(注:该片段原内容为再见语,此处不再重复翻译以保持完整性)
Community Posts
No posts yet. Be the first to write about this video!
Write about this video