给我9分钟,告诉你为什么绝不能忽视 Jev

MMaximilian Schwarzmüller
컴퓨터/소프트웨어창업/스타트업AI/미래기술

스크립트

00:00:00几个小时前,一款新的 AI 模型发布了,我真心觉得它可能会改变游戏规则。
00:00:07我知道,我知道,我们几乎每周都能看到新模型,但我说的可不是什么新的
00:00:13大语言模型。我要说的是 TypeSafe AI 推出的 Jeff。我知道这听起来
00:00:19很像个人助理,比如叫 Jeff 的机器人对吧?而 TypeSafe AI 听起来
00:00:25又像个 TypeScript 库,但其实完全不是那么回事。它是一种全新类型的 AI 模型,
00:00:31虽然不是大语言模型,但它看起来相当聪明,而且能做到大语言模型
00:00:39目前只能勉强做到的事。顺便说明一下,这绝对不是
00:00:44赞助视频或类似的内容。你可以直接访问他们的网站 typesafe.ai,在上面
00:00:51加入候补名单。我昨晚(德国时间)也跟大家一样申请了,今天早上
00:00:56就获得了访问权限。所以我就来跟大家聊聊了。不过它到底是什么呢?它的核心概念是,拥有一个重点不在于
00:01:04生成文本,而在于理解文本的模型。你可以传入任何你想要的文本,然后给它一些
00:01:12选项。例如,这里有个基础示例:我有一些示例文本,可能是某些电子邮件,或者
00:01:21客户的聊天消息对吧?比如你的网站上有在线客服,客户可以发送消息,
00:01:28可能就是这里的这些消息。然后你希望决定如何处理它们。当然,
00:01:34你可以把它们喂给大语言模型,但这有几个问题:首先是提示词注入问题;
00:01:40第二个问题是成本可能非常昂贵,因为你需要足够聪明的模型,所以
00:01:48你会消耗大量 Token,因为你必须把所有工具描述都传给那个模型,
00:01:54还要向模型传递额外的背景信息,当然还有客户消息本身,
00:02:00在这个过程中会消耗大量 Token。第三,它相对较慢,对吧?那些前沿的大语言
00:02:06模型需要一些时间才能做出响应。而 Jeff 确实超级快,我们谈论的是毫秒级别的
00:02:12响应。它不是在你本地运行,依然是在云端,但速度极快。它的核心理念是
00:02:18你把消息交给 Jeff。这里的 ask Jeff 只是我在使用这个客户端与 AI 进行对话。
00:02:26所以你把消息交给它,实际上你也可以传入更复杂的结构化数据,而不必
00:02:32局限于字符串,然后再向它提供关于应该对该消息做什么的信息。
00:02:39准确地说,就是给它提出你的问题。这里有三种类型的问题:
00:02:46Choices(选择题)、Scoring(评分题)和 Now(判断题)。选择题顾名思义,就是你提供一些选项,
00:02:53然后 AI 模型会返回关于哪个选项最合适的置信度。
00:02:58评分题则是让模型去打分,你设定一些
00:03:02等级标准,它会基于这些标准生成评分。而 Now 则是“是或否”的判断题。
00:03:10所以在当前这个基础示例中,我收到一些用户消息并发送给模型,
00:03:15然后在此定义我的问题。第一个问题是“应该由哪个团队处理此消息”,我给出了
00:03:21三个选项。这完全取决于你,你可以根据需要自由定义,
00:03:26甚至添加更多选项,目前最多好像支持 10 个。你需要描述每个选项的作用,比如
00:03:33我有一个财务团队,并明确说明该团队负责处理扣款、开发票等事务。
00:03:38在这个演示中我还有其他几个团队。这是我根据客户消息发送给 Jeff 的第一个问题,
00:03:44但还没完,因为你可以在一轮交互中提出多个问题。
00:03:49我们可以有多个选择题,但这里我想展示每个类别各一个:所以我有一个选择题,
00:03:53还有一个判断题,我想问“这条消息是否表达了紧急性”。我们会把所有
00:04:00三条消息都过一遍,以便查看每条消息是否具有紧急性。第三种
00:04:07问题是评分题,我想知道客户看起来有多沮丧。
00:04:11如果我像这样运行它,可以看到它执行了,而且速度非常快。
00:04:20这是发送到云端 AI 模型并进行处理的,但整个过程完全没有使用
00:04:25大语言模型。相反,你可以看到对于第一条客户消息,选择结果是
00:04:30应该由技术团队来处理,并附带由 Jeff 自动生成的置信度得分。
00:04:36对于“是否紧急”这个判断题,是的,这里相当紧急,我们得到了一个相当确定的
00:04:42接近 1 的紧急度分数,而且正如我们所见,挫败感相当高。第二条
00:04:49消息是关于“被重复扣款,希望立即退款”,所以它应该被分发
00:04:56给财务团队。Jeff 判断它相当紧急,挫败感也挺高的。然后
00:05:03第三条消息是给销售团队的,既不紧急,也没有表现出挫败感。
00:05:09正如大家所见,或者至少在我看来,这真的非常非常有实用价值。我们确实可以用
00:05:18大语言模型来构建这些,但我刚才已经列出了它们的缺点。而 Jeff 速度快,而且成本
00:05:24极低。我们聊聊价格吧,它的费用是每 10 亿——是 10 亿,不像其他模型是按百万计算——
00:05:33每 10 亿输入 Token 仅需 42 美元,而且输出 Token 是免费的!输出 Token 零成本。所以这要比
00:05:40那些大语言模型便宜得多。你可以向 Jeff 发送大量复杂的问题,但几乎不需要
00:05:49花什么钱,况且输出 Token 还完全免费!它的响应超快,并且就是专门
00:05:56为这些决策场景而设计的。如果你仔细想想——这也是为什么我对此感到非常兴奋——如果你
00:06:02仔细想想,我们构建的大多系统归根结底都是在做决策。你构建的每个 AI Agent 内部都充满了
00:06:08各种决策:什么时候调用哪个工具,这些全都是决策。正如我刚才提到的,你当然也可以将它
00:06:15与大语言模型结合使用。这里我有另一个例子,我构建了一个助手,里面包含
00:06:22几个非常简单的工具调用。假设这是一个智能家居助手,我们可以
00:06:29打开或关闭某个房间的灯,这里有一个用于该功能的 Dummy 函数/工具;
00:06:35但同时在某些任务上,我们可能依然希望使用大语言模型,因为 Jeff 无法
00:06:42撰写文本。因此,每当你想生成文本时,例如给客户回复邮件或类似任务,
00:06:48你就需要引入大语言模型。你完全可以做到这一点。在这里我使用了一个大语言
00:06:54模型,配合 Vercel 的 AI SDK 来实现,使用的是设置为中等思考浓度的 GPT 5.6 Terra,
00:07:02价格相对亲民。然后我让 Jeff 来做出选择,决定使用哪个工具。所以做出决策的是 Jeff,而不是
00:07:10大语言模型。接着我去执行这些工具,其中某些工具内部会使用大语言模型,
00:07:15而某些则不会。这才是真正让人惊艳的地方。我们构建的系统
00:07:21时刻都需要做出决策,需要时刻对内容进行评分或回答“是与否”的问题。
00:07:26现在我们经常使用大语言模型来做这些事,它们确实表现
00:07:31不错,别误会。大语言模型目前依然具备的一大优势,比如上下文
00:07:36窗口大小。Jeff 的文档中提到,在你提的问题中可以传入的文本预算上限
00:07:45大约是 32,000 个 Token。所以它会有这方面的局限。官方文档里还有一整篇文章
00:07:50专门讨论了他们当前前沿模型的能力局限(Jaggedness),比如它不擅长数学计算、数字处理以及
00:07:56日期和时间的比较。因此在某些方面它确实还有短板。但一方面,我预计就像所有其他 AI
00:08:05模型一样,它未来会变得越来越好,这些问题也会被解决;另一方面,这并不是一个
00:08:12非此即彼的选择,而是一种补充。在大语言模型之外,它可以作为一个极佳的辅助工具。如果它
00:08:18同样既慢又贵,那我也看不到有什么必要非用它不可,但事实并非如此。凭它
00:08:24所展现出的种种优势,看起来真的非常有前景。接下来我们需要进行长期测试,看看它在
00:08:32生产环境以及更复杂的实际场景中的表现,评估它是否极易出错,或者是否
00:08:40极易受到提示词注入等攻击,看看它是否会遭受此类问题的困扰。但目前来看,它
00:08:47确实非常实用。而且不同于几个月前引起热议的整个 Subquadratic(亚二次复杂度)概念,
00:08:53这是一个你现在就能实际使用和测试的东西,只要你获得了访问权限,它就是触手可及的。
00:08:57你可以去报名排队,对我来说也就等了几个小时。它看起来真的
00:09:03非常实用。我认为通过将 Jeff 与传统编程(即常规的确定性代码)
00:09:12以及大语言模型结合起来,我们能够构建出非常出色的程序和系统,并创作出极其惊艳的
00:09:20作品。所以,希望这篇关于 Jeff 的概览能给大家留下一个不错的第一印象。如果你想
00:09:27亲自上手体验,不妨去申请加入候补名单,深入探索并好好试用一番吧。

핵심 요약

Jev 通过每 10 亿 Token 42 美元的高性价比与毫秒级响应,将软件系统的决策逻辑与文本生成解耦,与大语言模型协同构建高效 Agent。

하이라이트

  • Jev 是由 TypeSafe AI 推出的新型 AI 模型,专注于文本理解与决策分发而非文本生成。

  • Jev 的调用成本仅为每 10 亿输入 Token 42 美元,且输出 Token 完全免费。

  • 模型支持选择题(Choices)、评分题(Scoring)和判断题(Now)三种决策问题类型,单次请求最多支持 10 个选项。

  • Jev 可以在单个请求中并行处理多个不同类型的决策问题,响应速度达到毫秒级。

  • Jev 的上下文窗口上限约为 32,000 个 Token,且目前不擅长数学计算、数字处理及日期时间比较。

타임라인

Jev 的定位与传统大语言模型的局限

  • Jev 不是大语言模型,其核心在于理解文本并做出决策,而非生成文本。
  • 使用大语言模型处理文本分类和决策面临提示词注入风险、高昂 Token 成本以及较高延迟的问题。

传统大语言模型在处理客户消息分类或路由等基础决策时,需要传入大量工具描述和背景信息,导致 Token 消耗巨大且响应缓慢。Jev 采用云端运行架构,将重点放在文本理解与结构化选择上,实现了毫秒级的决策响应速度。

Jev 的三种问题类型与实际应用演示

  • Jev 提供 Choices(选择题)、Scoring(评分题)和 Now(判断题)三种决策模式。
  • 系统可以在单次请求中同时执行多项评估并输出置信度得分。

选择题允许定义最多 10 个带功能描述的选项(如财务、技术、销售团队);判断题用于评估紧急程度等布尔状态;评分题则针对客户挫败感等维度进行量化打分。测试显示,模型能精准将重复扣款请求分发给财务团队,并准确标注高紧急度与高挫败感。

成本结构与大语言模型协作模式

  • Jev 的资费为每 10 亿输入 Token 42 美元,输出 Token 完全免费。
  • 软件系统与 Agent 内部的绝大多数节点本质上是决策流程,可由 Jev 接管路线选择。

由于大多 AI Agent 的核心逻辑在于判断何时调用何种工具,将决策权交给 Jev 能大幅降低运行成本。在智能家居控制等复杂场景中,Jev 负责挑选具体的执行工具,仅在需要撰写回复文本时才调用 GPT-5.6 等传统大语言模型。

已知局限与实际落地展望

  • Jev 的上下文预算上限约为 32,000 个 Token。
  • 模型当前对数学计算、数值处理以及日期时间比较能力较弱。

官方文档指出了模型目前的能力短板,但这并非取代大语言模型的单一选择,而是互补关系。结合确定性代码、Jev 的决策能力以及大语言模型的文本生成能力,能够显著提升生产环境中复杂系统的整体效率。

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기