这款 Claude Code x Obsidian 智能体操作系统将成为新潮流

스크립트

00:00:00你可能用错了 Obsidian 里的 Cloud Code,或者至少只触及了它的皮毛
00:00:05我们可以用 Obsidian 做更多事情,而不只是追踪 Markdown 文件,相反,我们可以用
00:00:11它来为整个云端操作系统创建指挥中心,这个系统包含了一系列技能和
00:00:16自动化、一个记忆层,以及最外层的可视化包装,它能为你提供洞察,而这些洞察
00:00:22你在终端或桌面应用中是根本无法获得的。我还提到过我们可以赋予它完全
00:00:27本地的语音功能吗?但我们该如何做到这一点,才能真正提供价值,而不会
00:00:31演变成毫无实质内容的视觉奇观呢?这正是我们今天要探讨的内容,并且
00:00:37到本视频结束时,你将明白如何自己构建它。现在,如果你关注这个
00:00:42频道一段时间了,你就会知道我们已经经历了这个云端操作系统的几个迭代版本。不久
00:00:47前它看起来像是这样的,这是一个基于网页的版本,在此之前我们还有一个 Obsidian
00:00:54版本。现在,我们拥有的这个基于网页的版本的酷炫之处在于其语音功能,一个完全
00:00:59本地的语音设置,允许我们获得非常快速的响应,并通过我们的
00:01:03麦克风控制一些事情。现在我所做的是,我们本质上升级了 Obsidian 指挥中心,并将
00:01:10网页版最棒的部分引入并组合成了你在这里看到的内容。这赋予了我们 Obsidian 的全部强大功能
00:01:16,我还加入了一个语音设置,它的灵感很大程度上来自于我们在 Codex 和 ChatGPT
00:01:23语音模式中看到的功能,现在我们拥有了一个一站式商店,可以满足我们对 Cloud Code 的所有需求。但
00:01:29是这整个东西到底能给我们带来什么我们在终端里得不到、在桌面
00:01:32应用里也得不到的东西?我们必须回答这个问题,否则这一切就有点毫无意义了。让我们从
00:01:37视觉端开始,看看我们实际在看什么。首先,它让我们能够一眼看到
00:01:41任何我们想要的单一指标 我特别想强调的是 这一切都是100%可定制的
00:01:46,所以任何你想看到的东西都可以放进这里,这只是一个 Cloud Code 实际上为我构建的自定义 Obsidian 插件
00:01:51。如果我想要关于我的 Token 使用情况的某种洞察,
00:01:56我可以查看我在各个社交媒体渠道上的所有指标,我可以查看从我的
00:02:01谷歌日历中拉取的时间表,它会从中为我分解出具体的任务,然后我还可以在
00:02:07这里获得有关早间新闻头条的洞察。你可以看到我只需点击按钮就能运行的
00:02:12不同自动化和技能,我这里还有不同的标签页,可以深入查看我每天运行的
00:02:18这些不同报告。例如,这是我的研究报告,它来自早间情报自动化,它向我
00:02:24提供基于过去 7 天、过去 30 天的所有 GitHub 热门仓库,然后我还可以看到
00:02:29YouTube 上的异常视频、不同的内容角度,接着我能获得一个关于 Hacker News 上热门趋势的持续概览
00:02:35。当我查看受众标签页时,它在审视我的特定内容在
00:02:40YouTube 上的表现如何、什么管用、什么不管用以及原因。既然这是 Obsidian,我就不只限于
00:02:45这一点,我可以使用 Obsidian 内部的终端,这也是我喜欢这些语音模式的部分原因,因为我可以
00:02:51在任何时候调出它并说类似“打开终端”之类的话
00:02:57,然后酷,它就在那儿了。现在,这东西确实具备实际的语音功能,所以如果我说类似于“嘿,今天是
00:03:03什么最大的 AI 新闻故事?”Claude 昨天在全球范围内推出了模型级水印功能
00:03:13,肉眼不可见且在复制粘贴时依然存在,这是由欧盟人工智能法案触发的。DeepSeek 框架也在两天内
00:03:23爆发到了 10.9 万颗星,并且正在统治 GitHub 趋势。所以这挺酷的,我可以像这样让它在 Obsidian 内部执行待办
00:03:32命令,比如我说“打开我的终端”或别的什么,我还可以向它询问
00:03:37关于我已经运行过的报告的问题。这就是为什么它相对较快,它不必去
00:03:41接收我的命令、到网上去寻找该信息、处理它然后再回应,它已经被连线来
00:03:47查看我业已运行的这些报告——再次强调,比如我的研究报告——然后快速
00:03:50回答关于它的问题。语音模式的另一个酷炫之处在于,即使我不在
00:03:54Obsidian 内部时这也管用,所以假设我切换出去了,我在别处做别的工作,例如我在 Claw 桌面应用里
00:04:00,但我还是想问它一个关于某事的问题,我本质上是想呼叫 Claude 与我进行语音
00:04:05对话,这与我们通过 Codex 内部可以使用的 GPT 实时模式非常相似,这是一个
00:04:10非常棒的工具。所以在这种情况下,我只需按下热键,然后就可以问类似“我今天日程上最大的一
00:04:16件事是什么”
00:04:23你今天最大的工作承诺是上午 11 点针对 Warp 的赞助商交付成果审查,然后是
00:04:30下午 3 点的 Chase AI Plus 辅导通话,但整天的时间安排确实是围绕着 9 点 30 分的
00:04:37语音球演示录制时间块展开的,这也是核心重点。因此,就像你看到的那样,我能够询问关于不同事物的
00:04:46问题,它能迅速回应。现在,这种语音模式它不只是回答
00:04:52你知道的关于我正在进行的报告的问题,它实际上还可以在后台呼叫 Claude 并
00:04:57运行它的无头版本。所以如果我在做别的事情,而我实际上想让 Cloud
00:05:02Code 继续并做一些相对深入的事情,比如“嘿,去开始(你知道的)规划
00:05:07这个项目”或“开始(你知道的)对 X、Y 和 Z 进行深入研究”,它就会继续去做,它会
00:05:12以无头模式运行。现在,语音响应可能不会那么快,因为它必须(你知道的)
00:05:16实际去执行然后响应,但对于这些正在拉取我
00:05:21已经找到的信息的快速任务来说,它相对顺畅。再次说明,这全都是本地运行,这是一个运行在我 GPU 上的本地语音模式
00:05:27,我会向你展示它是如何配置的。但总的来说,我认为就
00:05:31可视页面而言,这就是这种封装式操作系统 Obsidian 设置带给你的价值所在
00:05:37,我认为这相当酷,特别是当切换出去时的语音模式,因为
00:05:40能够与 Cloud Code 进行语音互动,甚至在你切换出去时,以一种
00:05:44类似于 GPT 语音模式的方式,是我想要引入的功能,因为 Cloud 桌面应用内部的语音模式
00:05:48确实还不够成熟。所以这就是用户界面和语音模式
00:05:53真正带到桌面的内容。第二件在 Cloud OS 设置中实际提供价值的事情
00:05:57是那个技能和自动化骨干。你看所有这些已经被(你知道的)
00:06:03基本上变成按钮的技能,我可以随时点击它们,或者让语音模式来运行它们
00:06:07,这很棒。真正的价值在于,我已经把我日常所做的一切都
00:06:12变成了技能和自动化,这是一个足够简单的概念,但极少有人能把它们
00:06:16做好。你在这里看到的是我运行的所有技能和自动化的
00:06:21可视化展示,这个概念相对简单:你有一系列在日常和
00:06:28每周(无论是个人还是工作上)运行的任务。这些任务被细分为不同的领域
00:06:34,对我而言,这包括记忆、生产力、研究、内容、我的社群、我的代理机构销售等等
00:06:41。在这些领域中的每一个里面,都有我具体要做的事情,例如对于研究,我有一个
00:06:48专门针对 YouTube 的流水线,我深入研究特定的主题,我有进入我的 Light RAG
00:06:53数据库的东西,我有我的早间趋势扫描(本质上就是你之前看到的报告),我希望
00:06:57能够查看我的竞争对手等。我可以手动完成所有这些,或者在我弄清楚我
00:07:04实际上希望它如何手动工作之后,我把它们变成技能,一旦它们被变成了技能,我就
00:07:09会问自己:让它成为一个自动化合理吗?如果答案是“是”,这就是我现在做的。这样做与
00:07:14Obsidian 仪表盘中的 Cloud OS 实际上没有太大关系,你说这只是最佳实践
00:07:18,每个人都应该这么做。然而,构建这个才是云端操作系统的
00:07:26根本基础,如果你没有这个,创建像这样的东西就有点毫无意义了,就好比我们到底
00:07:31在干什么?这里不会有什么信息流转,你将无法
00:07:34定期调用特定的技能和自动化,这会变成一个视觉奇观
00:07:39如果我们没有这个基础的话。所以这才是真正的实质内容,我们将探讨为自己
00:07:44创建这样东西的最佳实践,因为这其实并不难
00:07:47。最后但并非最不重要的一点是,我们有 Obsidian 记忆层,我认为人们对它有所
00:07:52误解。Obsidian 记忆层的重点不一定是超级
00:07:57充能 Cloud Code,就像我们看到所有这些东西然后变得超级兴奋一样:哦天哪,快看
00:08:02像这样的图表,这看起来太酷了,这就像一个图谱 RAG 吗?其实它根本不是图谱 RAG
00:08:06。实际上,Obsidian 做的是为人类(也就是你)在 Markdown 文件中组织信息
00:08:12,而对于 Cloud Code 本身而言,有一个很小的切线益处。Cloud Code 的
00:08:19这个切线益处体现在:当我们拥有数千个文件,并且以一种真正合理的方式设置了 Obsidian 库时
00:08:25,它使得 Cloud Code 能够轻松导航,从而快速给我们准确的答案
00:08:29,这本质上为我们节省了 Token 并稍微提升了性能,而这完全是
00:08:34你如何设置它的结果。你在这里看到的是到处都能见到的 Karpathy Obsidian RAG 系统,这也是它的模板
00:08:40,再次说明,我们将深入探讨你将如何设置它,因为你不需要
00:08:45完全照搬 Karpathy 的做法,但我们可以从中吸取一些基本原则。所以这就是
00:08:50这个 Obsidian 加 Cloud OS 所做的事情,这就是它能为你带来的价值,也是你在
00:08:54终端里或桌面应用中无法获得的内容。现在我们来谈谈你将如何为自己实际创建这个
00:09:00,但在那之前,先听一下今天赞助商(也就是我)的简短寄语。我刚刚发布了我的
00:09:06Cloud Code 大师班的全新版本,这是掌握这个工具的首选途径,特别是如果你没有
00:09:11技术背景的人也能轻松上手。我们聚焦于实际的应用场景,
00:09:17让你能够掌握核心基础,然后将其应用到你想要的任何个人项目中。
00:09:22我们目前正在进行会员促销活动,如果你想加入,请查看置顶评论中的链接,
00:09:26你可以在 Chase AI Plus 内部找到它。现在,在我解释如何为你的 Cloud OS
00:09:31创建自己的技能和自动化骨干网之前,让我带你了解一下语音设置,以便你了解它的实际工作原理。
00:09:37所以在这个例子中,你正在说:“嘿,今天最大的 AI 新闻是什么?”这个语音命令
00:09:46会发送到语音模块(你可以叫它 Jarvis 或任何你喜欢的名字),然后该语音录音会通过
00:09:53Faster Whisper 进行转录,这是一个开源仓库,它将运行在你的计算机上并进行转录。
00:09:59接下来 你的声音被转化为文字,这些文字会发送给Haiku 4.5,我使用Haiku是因为
00:10:06是因为它是最小、最便宜、最快的模型。如果你愿意,我们也可以随时将 Haiku
00:10:12替换为任何类型的本地模型。我之所以没有采用本地设置,是因为
00:10:16我会把这个具体的设置分享给别人,你可以在 Chase AI Plus 里面找到它,而我
00:10:21不一定知道他们的硬件配置会是什么样,所以他们本地模型的性能可能会有很大差异。
00:10:26因此 Haiku 是一个很好的标准选择,但如果你拥有相应的硬件,你可以将其更改为
00:10:30你真正想要的任何模型,比如 Qwen 等等。所以“最大的 AI 新闻是什么”变成了文本,
00:10:35该文本发送给 Haiku,然后 Haiku 现在弄清楚将其路由到哪里,这里实际上分为了三个层级。
00:10:40第一层是技能。如果我对 Jarvis 说,嘿,我想让你运行早间
00:10:47情报报告,那么这将被路由到第一层,它知道只需执行
00:10:51一个技能,不需要添加任何其他词语,只需执行技能,做你被告知要做的事,
00:10:55然后在完成时告诉我。第二层是:嘿,我只想让你拉取指标。所以这就是
00:11:01我们在这里要求的,我说今天最大的 AI 新闻是什么,我只想让它查看一个
00:11:05已经存在的报告。所以如果我询问新闻,它知道它可以基本上转到研究选项卡,
00:11:11查看我们的早间情报报告,并告诉我这些事情。我们划分出这个特定的层级是因为
00:11:15我们希望这个过程是快速的,我不想让它自己做任何搜索或研究,只需找到
00:11:19现有的内容并告诉我。所以这就是这个命令进入第二层的方式。然后我们有
00:11:24第三层,我之前提到过。如果我打开语音模式并说:嘿,我希望你继续
00:11:28拉取 Fable 5,我希望你开始对任务 X、Y 和 Z 进行深度研究,然后想出
00:11:32一个行动计划。好吧,那不是一个特定的技能,那不是一个我们需要实际去
00:11:38拉取 Claude Code 的实际实例的指标,这就是它将要做的事情——它将
00:11:42完全无头(headless)地运行所有事情,然后会在完成时进行汇报,
00:11:45所以这变成了一种万能方案,这需要最多的算力,显然也
00:11:49会是最慢的。现在,一旦它执行了这些任务中的任何一个(无论是第一层、第二层还是第三层),
00:11:54响应显然会是文本格式,但我们希望那是一个语音响应,
00:11:59所以这就是 Kokoro 发挥作用的地方,它同样是一个开源工具,然后被发回这里,
00:12:06接着它用语音回应我们(无论它要说什么)。这就是语音模式的工作原理:[
00:12:11你发出命令,它被转录,被路由,命令被执行,转化为语音并传回,
00:12:18而且它实际上足够简单,就像我说的,如果你愿意,你可以将这个 100% 本地化,
00:12:22只需将 Haiku 替换为你所选的本地模型。现在我们来谈谈技能,我在这里拥有
00:12:28一些我最常使用的技能。因此,在任何时候我想运行它们时,我都可以打开这个标签页,
00:12:32只需点击它们。正如你在我们体验语音模式时所看到的,我们只需通过语音系统说出名称,
00:12:37就能轻松触发它们,甚至不需要切换标签页。但问题是,
00:12:42我们实际上是如何创建这些技能的?这些技能应该是什么样的?幸运的是,
00:12:46这并不复杂,这样做的工作流程实际上非常简单。第一步是定义
00:12:52任务。你在日常生活中到底做些什么事是可以被编成代码的?记住,人工智能的其中一个问题
00:12:59在于它本质上是非确定性的。我让它做一件事,并通过这同一件事告诉它 10 次,
00:13:05它就会用 10 种不同的方式去做。如果我能够改为指定我想要完成
00:13:11事情的方式并指定一个最终状态,我们就可以将其转化为技能,基本上将其代码化,
00:13:16使其尽可能具有确定性。但我们必须知道这些任务到底是什么,所以我们可以做的方法是,
00:13:21幸运的是我们确实有几种选择来做到这一点。第一种选择是,我们只需给它
00:13:27提供一段意识流(stream of consciousness)。好吧,你打开麦克风,
00:13:33然后你对着 Claude Code 喋喋不休,解释你每天做什么、每周做什么。根据那次对话,
00:13:39我们接着会问 Claude Code:嘿,我刚刚给了你一堆关于我的工作的信息,
00:13:44其中哪些部分我们可以转化为技能?然后它就会为你将其转化为技能。第二种
00:13:50方法是,让它查看你实际的日志——你在 Claude Code 中所做的一切,
00:13:55每一次工具调用、每一个命令、每一段文本都被记录在你的电脑上,我们可以让
00:14:01Claude Code 查看过去 30 天、60 天、90 天的这些日志,并从中提取出技能。这
00:14:07非常棒,因为我们脑海中对我们实际做的事情有一个概念,
00:14:13但现实究竟是什么呢?你实际上用 Claude Code 来做什么?我们将能够
00:14:18在日志中看到这一点。理想情况下,你实际上应该做第三步,
00:14:22也就是结合这两者。你进行意识流输出,告诉 Claude Code 你认为你实际
00:14:27do and it creates skills from that then we take a look at the logs themselves and pull that out and
00:14:33将这两者结合起来,你就可以开始构建这个技能库了。现在,哪些技能
00:14:40我们应该转化为自动化呢?通常情况下,这往往是不言自明的:这是你需要
00:14:46在每天特定时间运行的事情吗?如果是的话,那就把它变成自动化,把它变成一个常规任务,
00:14:51只需要一个命令,你只要告诉 Claude Code 帮你做就行了。现在,当涉及到自动化和
00:14:56技能时,真正的最佳实践是先将它作为技能保留一段时间,实际确保它正以
00:15:01你想要的方式和方式运行,然后一旦你对通过技能获得的输出感到满意,
00:15:05我们再继续将它变成一个成熟的自动化,我们不再手动运行它,
00:15:10它就会自己运转。我们可以对此进行更深入的探讨(我不会在这节课中这样做),
00:15:15本质上开始添加一些诸如循环工程(loop engineering)原则之类的内容,
00:15:19我们审视这些自动化及其运行结果,将它们与过去的输出进行比较,并构建某种系统,
00:15:25使其能够自我完善。我们赋予它某种特定的目标、某种试图达到的标准,
00:15:29如果该自动化没有达到标准,我们可以继续调整,但这是更高级一点的内容,
00:15:34只要明白你可以朝这个方向发展即可,但这一切都建立在技能的基础之上,
00:15:39对吧?我们能否将你每天所做的事情编成技能?答案是肯定的,而且很简单。从那里开始,
00:15:46将其集成到你的 Cloud OS 中实际上就像这样简单:你每天使用哪些技能?
00:15:50就语音模式部分而言,它已经知道哪些技能存在,所以你甚至不需要做任何事情,
00:15:56记住,就像 Haiku 一样,Claude 拥有你在后台所做一切的列表,
00:16:00并且这些技能也将构成你的命令中心外观的基础,
00:16:04对吧?你在这里看到的一切本质上都是某种技能或某种自动化,
00:16:08无论是从谷歌拉取我的日程安排,还是早间头条新闻,
00:16:13或者是从社交媒体拉取指标,又或者是这个研究部分,这些全部都只是
00:16:18来自自动化的输出和数据。现在,你的系统看起来会与众不同,这是一件好事,
00:16:24这就是我认为这个系统很棒的原因,因为它是完全可定制的。无论你想看到什么,
00:16:30都应该是某个技能的输出,然后我们把它扔到这里,轰,它就是你的了。现在我们来谈谈
00:16:36内存方面的问题,以及 Obsidian 在“改善 Claude 的内存”方面
00:16:40实际上带来了什么。现在,这就是 Karpathy 那条让所有人为 Obsidian
00:16:45以及这种 Claude Code 连接疯狂的推文。这在 4 月份发布时获得了将近 2200 万次浏览,
00:16:51他列出的系统相对简单,这就是它的样子:我们的 Obsidian
00:16:56命令中心、我们的 Claude OS 主要生活在一个被称为 Vault(资料库)的文件夹中,
00:17:02虽然不一定非要叫 Vault,但那是 Obsidian 使用的命名惯例,它只是你电脑上的一个文件夹。
00:17:06在该文件夹内,我们有三个子文件夹:我们有 raw(原始数据)、we have wiki(维基)和 output(输出)。
00:17:15所以我想让你想象一下,我们在该 Vault 文件夹中打开了 Claude,然后我们说:“我希望你对 RAG 系统做一些研究”,
00:17:23于是它出去寻找了一堆数据、一堆来源、一堆关于人工智能代理的原始信息,
00:17:31所有这些原始数据基本上都被放进了 raw 文件夹中,它就存放在这里,
00:17:37比如关于 RAG 的文章。现在,假设你想更进一步,想把所有这些
00:17:44原始信息变成类似维基百科风格的文章,那么这个东西就会进入 wiki 部分,
00:17:49你可以看到,我们在 wiki 部分有一个专门针对 RAG 系统的子文件夹,所以所有这些数据
00:17:56都被转化为了一篇关于向量数据库的新文章,并且我们还有第二篇文章,是关于
00:18:02切块策略(chunking strategies)的。我们本质上只是在综合我们找到的所有原始信息。
00:18:07现在,假设我们想把它变成一个幻灯片,我想要一个谈论 RAG 系统的幻灯片,
00:18:12那么这个幻灯片就会被放入 output 文件夹中,我们把它变成了一个实际的交付成果,现在它是一个幻灯片。
00:18:17所以简单的想法是,我们有一个存放原始信息的区块
00:18:24我们有一个存放某种综合整理后数据的区块,然后是我们从综合数据中创建的交付成果
00:18:28现在,这里重要的不是我们有这种,你知道的,分类方式
00:18:34而是它为人工智能提供了一条清晰的寻找信息的前进路径,而它之所以能做到这一点,不仅是因为我们有这些文件夹
00:18:41而是因为在每一步中,我们基本上都有一个主索引或 index.markdown 文件
00:18:48它充当目录的角色,上面写着:嘿,一旦你进入 wiki 文件夹
00:18:53你现在就可以阅读这个 markdown 文件,里面写着这里面有三个子文件夹
00:18:59我们有关于人工智能智能体、RAG 系统和内容创作的文件夹。人工智能在拥有三个子文件夹时
00:19:04需要主索引或目录吗?完全不需要。但如果你有三千个呢?如果你有三万个呢?
00:19:08如果你有三百万个呢?如果有一个目录,在其中涉及的每个人都会变得更容易一点,对吧?
00:19:12当我们深入一层时,这个想法就会重复出现,所以
00:19:18我去了 wiki,看到了主索引,我想了解 RAG 系统,于是我进入了 RAG 系统内部
00:19:23我想了解关于 RAG 系统的什么?你猜怎么着,这里有另一个索引文件
00:19:27上面写着:嘿,向量数据库、分块策略等。而这一切的全部意义在于
00:19:33实际上有两点:第一,如果你这个人类想要找到东西,这相当容易;
00:19:38第二,有一条清晰的路径,我们为 Claude Code 提供了一张寻找事物的地图,正因为有了这张地图
00:19:44它能更快地给我们答案,并且在此过程中会消耗更少的 Token,所以这就是 Obsidian 内存的全部目的
00:19:48它并不是真的给它更多的内存,而是给它一张地图。现在,就实际应用而言
00:19:52你非得完全按照这种 raw、wiki 和 output 的方式来设置吗?绝对不是,你
00:19:57完全不需要。但你需要设置一些对你来说有意义的东西。你可以看到,左边我有
00:20:03一个用于内容、日常笔记、收件箱、运维、项目系统和 wiki 的文件夹,所以它确实有点不同
00:20:09而且稍微复杂一些。如果你做了一些稍微更复杂的东西,我们如何
00:20:14依然获得所谓“地图”的好处呢?很简单,你只需向 Claude 明确说明即可,这就是
00:20:18我在 claude.md 里所做的事情。你在存放在保管库中的 claude.md 里做的最重要的事情
00:20:22就是详细说明保管库的结构以及它需要如何浏览各种事物,因为
00:20:27通过导航模式和保管库结构,我为它提供了一张地图和如何阅读它的指令
00:20:32这就是你需要做的全部。如果你对这一切感到困惑,你知道你能做什么吗?
00:20:36你甚至可以直接让 Claude 指向你的保管库,你可以复制 Karpathy 的这条完整推文,然后说
00:20:41嘿,你能根据这里阐述的原则来设置这个吗?现在,我们来谈谈
00:20:45如何把这一切结合起来,并真正构建这种完全自定义的用户界面,而且它
00:20:49字面意思就是 Claude Code 自己创建并自行安装到 Obsidian 中的一个插件,你
00:20:54可以在社区插件下方看到,我拥有 chase 笔记指挥中心。另一个社区插件
00:21:00当你做这一切时,你绝对希望启用的另一个社区插件是热重载(hot reload)社区插件
00:21:05你将无法找到它,至少你一直无法通过官方的
00:21:09Obsidian 社区插件的用户界面找到它,但你可以在 GitHub 上找到它
00:21:14只需搜索 hot reload 就在这里,让 Claude Code 指向它,它就会为你安装到 Obsidian 中
00:21:19所以你只需要与 Claude Code 进行对话,说你想构建一个
00:21:23充当指挥中心的自定义 Obsidian 插件,然后你只需详细说明你希望它
00:21:29实际长什么样。一个很好的方法其实是使用 Claude Design,让它为你构思
00:21:35一堆不同的视觉模型。你可以从这里看到我经历过
00:21:40多少次不同的迭代,所以我会给它一些灵感,比如你字面意思上可以去
00:21:46像 Pinterest 这样的地方,查找诸如仪表盘之类的内容,或者像指挥中心来帮助你
00:21:52开始。把那些截图放进来,然后说:嘿,我正试图为一个
00:21:57Obsidian 插件做一个模型,我希望它引入某些指标,这些特定的指标将取决于
00:22:02你实际想要看到的内容,我希望它显示我的日历,我希望它显示这些技能,我希望它
00:22:07显示我的 Token 消耗,无论你想要什么,然后你会说我希望你创建五个
00:22:12非常不同的变体。如果你在 Claude Design 内部这样做,它会把它们全部放在
00:22:17像这样的同一页上,所有这些可能都相对不同,然后当你找到一个
00:22:22你喜欢的时,我建议你深入挖掘,让它为该指挥中心创建多个变体
00:22:28所以起初我有点偏向于这个粘土硬件风格的,然后我发现这个很酷的背景
00:22:33我想,如果我们在这里放一个背景,然后让它分层叠加在上面会怎么样?于是我开始
00:22:38做这方面的变体,最终我落脚于这个,我们有点那种毛玻璃效果
00:22:43所以你可以看到云彩从后面透进来,如果你仔细看,我还让它
00:22:49几乎添加了这种星星闪烁的效果,它非常微妙,因为我不想
00:22:55让它显得过于压抑,嗯,但这就是我所做的,我添加了一点动效,所以当我点击概览时
00:23:00你可以看到它在跳动,但话说回来,你可以随心所欲,你可以把它做得
00:23:06像你希望的那样炫酷、逊色或者无聊,完全取决于你。但如果你在 Claude Design 内部这样做,一旦
00:23:12你确定了要继续推进的设计,你只需告诉它,然后它就会
00:23:17获取它为这些模型创建的所有代码,把它放到一个 zip 文件中,然后你
00:23:22就可以拿着这个 zip 文件,就像你在这里看到的那样,把它丢进 Claude Code 里说:嘿,根据这个构建插件
00:23:28它就会构建它,安装它,然后你就能在 Obsidian 内部看到它了
00:23:32如果你想更进一步,你实际上可以在 Claude Code 内部
00:23:37启用计算机使用功能,让它在对自身进行截图的同时
00:23:42完成所有设计迭代,所以这让它变得几乎不需要人工干预,但这基本上是我经历的过程
00:23:47用来创建我自己的,这就是创建你自己的 Obsidian Claude OS 指令的工作流
00:23:51中心,并带有语音功能。正如我所说,你需要对此进行定制才能充分利用它
00:23:56但如果你想要我的确切设置,包括整个语音功能以及一切,我都放在
00:24:01Chase A+ 里面,你可以在置顶评论中找到它,所以一如既往,让我知道你的想法
00:24:06我很想知道你能够创建什么样的指挥中心设置,以及你做了什么
00:24:11来定制你自己的,因为你可以用这个搞出各种疯狂的花样,但除此之外,我们回头见

핵심 요약

通过将 Obsidian 与 Claude Code、本地语音模式及结构化记忆层相结合,用户可以构建一个100%可定制的云端操作系统指挥中心。

하이라이트

  • Obsidian 作为云端操作系统的指挥中心,集成了自定义插件、技能自动化、语音模式和记忆层。

  • 基于本地 GPU 运行的语音模式支持 Faster Whisper 转录、Haiku 路由以及 Kokoro 语音合成。

  • 系统通过三层架构处理语音命令:直接执行技能、从现有报告中检索指标,以及在后台以无头模式运行深度研究。

  • Karpathy Obsidian 结构包含 raw、wiki 和 output 三个子文件夹,并借助 index.markdown 文件为 Claude Code 提供导航地图,从而节省 Token 并提升响应速度。

  • 用户可以利用 Claude Design 生成视觉模型,导出 zip 文件并交付给 Claude Code 自动构建 Obsidian 插件。

타임라인

Obsidian 云端操作系统指挥中心概览

  • Obsidian 超越 Markdown 文件追踪,成为集成技能、自动化、记忆层和可视化界面的云端操作系统指挥中心。
  • 自定义 Obsidian 插件支持一眼查看 Token 使用情况、社交媒体指标、谷歌日历任务及早间新闻头条。
  • 完全本地化的语音模式允许用户在 Obsidian 内部或切换出应用后通过热键进行语音交互。

通过升级 Obsidian 界面并引入类似于实时语音模式的设置,用户能够随时调出终端或向 Claude 询问日程安排与新闻动态。语音模式不仅能快速回答关于已有报告的问题,还支持在后台以无头模式运行深度研究任务。

技能与自动化的构建骨干网

  • 日常及每周运行的个人与工作任务被细分为记忆、生产力、研究、内容和代理机构销售等领域。
  • 将日常操作转化为技能后,用户可以进一步评估将其升级为自动化的可行性。
  • 技能和自动化构成了整个云端操作系统的实质内容,避免指挥中心流于表面形式。

系统将用户日常所做的一切编成代码化的技能,并在确保输出满足预期后升级为自动化任务。这一骨干网确保了信息在系统内部的顺畅流转,是支撑可视化仪表盘的基础。

Obsidian 记忆层与导航地图机制

  • Karpathy Obsidian RAG 系统在资料库文件夹内划分为 raw、wiki 和 output 三个子文件夹。
  • 每一层目录均包含 index.markdown 文件,充当目录和地图的角色,为 Claude Code 提供清晰的寻路路径。
  • 结构化的地图导航大幅降低了 Token 消耗并提升了 Claude Code 回答的准确性。

Obsidian 记忆层的主要价值在于为 Claude Code 提供一张通往海量文件的导航地图。通过在 raw 文件夹存放原始信息、wiki 文件夹存放综合整理后的维基文章、output 文件夹存放最终交付成果,配合各层级的索引文件,人工智能能够高效定位信息。

自定义用户界面插件的创建流程

  • 用户可以通过与 Claude Code 对话并结合 Hot Reload 社区插件来安装自定义指挥中心插件。
  • 利用 Claude Design 根据灵感图片生成多个视觉模型变体,最终选定毛玻璃效果等设计风格。
  • 将设计代码打包成 zip 文件并交由 Claude Code 构建和安装,实现全自动的 Obsidian 界面定制。

通过向 Claude Design 提供视觉灵感,系统能够生成不同的指挥中心界面模型。在确定最终样式后,Claude Code 直接根据模型代码构建插件并部署到 Obsidian 中,完成整个自定义云端操作系统的搭建。

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기