Transcript
00:00:00昨天,Anthropic 推出了 Fable 5.1,这是他们发布的首个模型
00:00:04其生成的所有内容现在都会加上水印。今天,我将向大家展示如何去除
00:00:10这个水印。但首先,我们来谈谈这个水印到底是什么,因为把这
00:00:14叫作水印其实有点名不副实,它最初为什么会出现,以及它是如何工作的。
00:00:19因为如果你理解了这些,那么绕过这个水印的解决方案就会
00:00:23好理解得多。那么,我们为什么非得处理这个不可呢?嗯,这是因为
00:00:26为了遵守欧盟人工智能法案(EU AI Act),基本上所有主要的尖端实验室都签署了该法案
00:00:31XAI 除外。这个准则规定,他们需要——这里指的“他们”是欧盟——
00:00:38需要有一种方法来识别某种文本或某种输出是否由人工智能创建。
00:00:43为了做到这一点,Anthropic 为 2026 年 8 月 2 日之后发布的
00:00:50所有模型的所有输出都添加了水印,其中就包括 Fable 5.1。现在,Anthropic 声称这
00:00:56对它给你的实际输出没有任何实际影响,而且就
00:00:59它将改变的内容而言,范围非常有限(如果我们谈论的是代码)。但这个东西到底是如何工作的呢?为什么
00:01:03我一开始说它名不副实?现在,Anthropic 在其输出中植入这些水印的
00:01:07策略基于 Google 2024 年发表的一篇名为《用于识别大语言模型输出的可扩展水印》的论文。
00:01:13这是一篇相对技术性的论文。它深入探讨了
00:01:19SynthID 基于锦标赛的水印机制。但让我为你提供一个简单的心理模型,以便你
00:01:25能够理解。大家知道,大语言模型及其输出是基于概率的,并且涉及
00:01:29一定程度的随机性。如果我给它一个句子说“她很___”,它需要
00:01:34将其填完整,那么它会有一个词语列表,可以用来完成这个句子。
00:01:41所以,假设这些词是:美丽、迷人、绝美和漂亮。现在,实际上,
00:01:48这些词中的每一个都会有不同的百分比或不同的概率与之关联,
00:01:54决定大语言模型会选择哪一个。你经常会听到一个术语叫 softmax(归一化指数函数),但你只需要
00:01:58明白所有这些词都关联着一个概率,关于大语言模型将
00:02:04选择哪一个。对于这个心理练习,我希望你想象所有这些词都有
00:02:08完全相同的百分比,对吧?因此,用来完成句子的这些词中,每一个都有 25% 的几率
00:02:14被选中。通常在水印生效之前,它就会随机选择其中一个。
00:02:20所以,假设它掷了四面骰子,然后选择了“美丽”。很酷,对吧?它有 25% 的
00:02:26几率,所有这些词被选中的几率都是一样的。但现在我们在一个不同的系统中运作,这个系统
00:02:31就是水印系统。有了水印系统,我们仍然可以处于相同的情境中,我说:
00:02:38“嘿,我需要你填补这个句子:她很___,你有四个选项,对吧?”假设
00:02:42再次强调,就是这四个词,并且它们的概率相同。当我们加入水印
00:02:49结构时,它将要做的事情本质上就是对这个骰子进行加权。如果这是一个
00:02:54四面骰子,嗯,它随后会说:“嗯,出于水印的目的,‘美丽’现在将
00:03:01占 50%,‘绝美’将占 30%。”因此,当我们加入某种水印系统时,
00:03:10它会选择某些词并赋予它们更高的权重。由于某些词拥有
00:03:15更高的权重,当大语言模型选择它们时,嗯,这些词就会
00:03:19更频繁地出现,对吧?使用水印系统,它更有可能会说她很
00:03:25美丽。现在,作为最终用户的你根本不知道这些词是什么,也不知道哪些词被赋予了
00:03:32更高的权重。但是拥有密钥的人——水印的密钥——可以看出来。现在,
00:03:40他们无法绝对确定地看出来,因为就像以前一样,你知道,总是有机会
00:03:45它会说“她很美丽”。你不知道它是否必然
00:03:49因为水印而有更高的几率。但拥有密钥的人会知道哪些词被赋予了
00:03:55更高的权重。然后,这会给拥有密钥的用户(即欧洲监管机构)提供某种概率,
00:04:01告诉他们:“好吧,这段文本有 90% 的几率、100% 的几率、99% 的几率
00:04:09是用 Claude 编写的,或者这段文本是用人工智能编写的。”这就是它的工作原理。现在,
00:04:15这里的核心思想是,它选择更改并通过水印赋予更高权重的这些词,
00:04:20并不会改变句子的整体含义。它不会改变你的输出结果。
00:04:24它不会影响你的性能表现。而当我们具体谈到代码时,
00:04:28如果会影响输出结果,它就不会修改代码。而且它也不会改变事实。
00:04:34你知道,如果它说:“嘿,这个历史事件发生在 8 月 10 日。”嗯,
00:04:41它不会改变这种说法,对吧?这是一个事实。它发生在 8 月 10 日。这不会被
00:04:45改变。但这是一个简化版——再次强调,是简化版的解释,说明这个系统是如何运作的。
00:04:52现在,Anthropic 并没有完全公开其运作的确切算法,但我们可以
00:04:57从 DeepMind 的论文中推断出来。你也应该从中明白的一点是,
00:05:02拥有这个密钥是根据水印系统判断它是否由人工智能编写的唯一方法。
00:05:08而这个密钥并不是公开的。要获得密钥的访问权限,你必须申请访问。没有公开的
00:05:12名单。你大概得是某种欧盟监管机构。所以任何跳出来说
00:05:16“哦,嘿,这是我的网站,能看出它有没有加水印”的人,都在撒谎,根本不存在这种东西
00:05:21如果你想深入了解文本水印的运作原理,Anthropic 也有相关文章。
00:05:25他们极力强调的一点是,这不会影响输出结果。
00:05:29所以,从本质上讲,水印系统就是让某些词被选中的概率更高。
00:05:35这是一个统计学算法,作为最终用户的你,在没有密钥的情况下永远无法摸透。
00:05:40那么我们该如何解决这个问题?是对 Claude 给出的文本输出进行简单的轻度修改,然后碰碰运气吗?
00:05:47还是说我们需要基本上重写整篇内容?
00:05:52而且我们该如何重写?因为你不能用 Claude 来重写这些句子,
00:05:56因为那样做也会带有水印。你同样不能使用 ChatGPT,也不能使用 Gemini。
00:06:01所以你的选择就很明了了。你需要重写文本的大部分内容,同时保留整体的语感。
00:06:09你需要使用 XAI,也就是使用 Grok,或者更可能的情况是,你会选择某种开源模型,对吧?
00:06:16某种可以下载并在你自己的电脑上运行的中国模型,
00:06:21这样一来,A 是免费的,B 不受这些水印法律的约束。那么,从实际角度来看,这个系统是怎样的呢?
00:06:28你可以用 Claude 完成所有常规的输出。如果你创作了一些内容,
00:06:33比如某种长篇博客文章,并且不希望它被标记上水印,我们就会获取该输出。
00:06:37然后将其发送给某种本地模型。你可以通过 Ollama 下载大量非常优秀的本地模型来实现这一点。
00:06:42发送到某种本地模型。Claude就能为你做到这一点,市面上有很多
00:06:47非常优秀的本地模型,你可以通过Ollama下载。那个本地模型会开始
00:06:51你会给它下一个提示词,比如:”嘿,我希望你……”
00:06:55保留实际的语感,你可以融入自己的语气习惯等等。一旦完成,
00:07:01它就会将修改后的准确回复逐字传回给 Claude。到那个时候,你想对它做什么都可以。
00:07:05现在,在这个整套流程中,你需要考虑的另一个变量是输出的长度。
00:07:09比如我们究竟在讨论多少个 Token?因为——虽然这不是一个我们能确切知道的数字——
00:07:14为了让检测 API 在运行(如果运行的话)时有一定把握断定它是用 AI 写的,
00:07:19这个输出到底需要达到多长?
00:07:25因为如果我只是写一些诸如”她真漂亮”这样的领英评论,API 真的能分辨出那是用 Claude 写的吗?
00:07:31不能。所以,如果你是一个非常担心内容被加上水印并归类为 Claude 创作的人,
00:07:37不妨问问自己:”我写的东西长度真的足够让这成为一个问题吗?”
00:07:41如果我们讨论的是像领英帖子、100 字左右的评论,
00:07:46大概率不会。但如果我们讨论的是长达数千字的巨型博客文章,
00:07:51是的,你确实会被打上水印,而且一眼就能看出是用 Claude 写的。
00:07:56现在,要搞定这一切,最简单的方法就是下载 Ollama,
00:08:00下载一个适合你特定硬件的本地模型,然后在 Claude 内部创建一个技能:
00:08:05当你调用它时,它会将你的输出发送给那个本地模型进行全面重写,
00:08:10然后再带回来。为了让你更轻松,我创建了一个完整的提示词,引导你和 Claude 完成整个过程。
00:08:15你只需将它复制并粘贴到 Claude 中。它会对你的硬件进行一些研究,
00:08:20找出适合你的本地模型。如果你还没安装 Ollama,它会帮你下载并安装。
00:08:24如果你还没安装的话,它会帮你下载并安装 Ollama,
00:08:28然后为你创建一个技能,并向你提问,以便确定这种改写最终呈现的具体措辞。
00:08:35基本上就是注入你的个人风格、给出例子诸如此类。因此,我会在下方放置一个链接来实际操作。
00:08:40与其在接下来的 10 分钟里一步步带你过完整套流程,不如直接运行这个提示词,它会为你搞定一切。
00:08:44所以,希望关于水印的这一大堆解释能说得通。这并不是一个实际的水印,幕后并没有写入任何东西,
00:08:48也没有任何代码。只是某些特定的词被使用的频率更高罢了。
00:08:53你根本不会知道那些特定的词是什么。唯一的辨别方法就是拥有水印的密钥,
00:08:57而除非你是什么监管机构,否则你是不可能有的。
00:09:02所以,任何跟你说他们能看出内容带有水印的人基本上都在对你撒谎,这一点你要马上清楚。
00:09:07根据这个原理,再次说明,如果你愿意,可以去深入研究那篇 DeepMind 的论文。
00:09:11基于这种工作原理,如果你有兴趣,可以去深入阅读 DeepMind 的那篇论文。唯一的方法是
00:09:16你绕过这一点的唯一方法就是进行大刀阔斧的编辑,
00:09:20轻度修改可不行。你必须全部重写,而唯一能做到这一点的办法就是使用开源模型。
00:09:24这也将是最便宜的方式。如果你想获取那个提示词,可以在下方找到它。
00:09:29希望这能帮到你们中的一些人。老实说,
00:09:33我觉得整件事情在内容被加水印诸如此类的问题上有点被过度夸大了。
00:09:38你看到的大多数使用 AI 来写作的人,其实明眼人一看就知道那是 AI 写的,
00:09:43因为他们根本不知道如何将其人性化,或者让它听起来像他们自己的声音。
00:09:49除非我们进入这样一个阶段:你发布的每一个地方、
00:09:52每一个网站都有某种水印检测器,而这变成了一种巨大的禁忌。
00:09:58话说回来,我们所要做的就是把内容跑一遍本地模型,然后你基本上就安然无恙了。
00:10:02所以请告诉我你的看法。务必查看 Chase AI+
00:10:06以获取 Cloud Code 大师班,如果你想深入了解的话。
00:10:10除此之外,祝大家避开这些水印玩得开心。
Community Posts
No posts yet. Be the first to write about this video!
Write about this video