DeepSeek 和 Kimi 悄悄将你的提示词发送给了 Claude

BBetter Stack
컴퓨터/소프트웨어경제 뉴스AI/미래기술

스크립트

00:00:00Anthropic 刚刚把矛头指向了 DeepSeek、Kimi、千问、GLM 以及基本上所有的中国模型,
00:00:04指责他们不仅对模型进行了蒸馏,还悄悄地将自己的
00:00:08客户请求转发给 Claude Opus,并把答案呈现给用户,伪装成是他们自己的模型生成的效果。
00:00:13哦,他们还发现了某些国家利用 Claude 构建无人机蜂群、
00:00:17规划水下作战、进行国内监控等大量证据,
00:00:20但老实说,我可不想去琢磨那些事情,还是好好享受剩下的时光吧。
00:00:29首先,我想从什么是模型蒸馏讲起,因为它本身并不是非法的。
00:00:33事实上,这是一种非常正常的训练技术。你挑选一个庞大且能力强的教师模型,
00:00:37让它针对大量提示词生成答案,然后用这些答案去训练一个较小的模型。
00:00:42每个实验室都会对自己的模型这样做,这也是你得到像 Haiku 这样更便宜版本的途径。
00:00:46不过,Anthropic 所指的非法蒸馏,是指对别人的模型进行这种操作,
00:00:49而且是在工业规模上、未经许可并且通过欺诈手段进行的。
00:00:53他们创建了成千上万个账号,使用盗来的信用卡、盗来的 API 密钥以及住宅代理。
00:00:58在报告中,Anthropic 将这些代理网络称为中转站,
00:01:02它们位于中国实验室与 Anthropic 的 API 之间,伪装成普通客户。
00:01:07早在 2 月份,Anthropic 就曾因这事点名过 DeepSeek、月之暗面和面壁智能,
00:01:11发现这三家使用了超过 2.4 万个假账号,与 Claude 产生了 1600 万次交互,
00:01:17但现在这份报告重点关注了他们之后发现的情况,而且情况变得严重得多。
00:01:21这份报告实际上为每个实验室都建立了一个案例档案,但我先从最大的一起开始讲起,
00:01:24因为 Anthropic 表示这是他们监测到的规模最大的蒸馏攻击,
00:01:28罪魁祸首就是千问模型的缔造者——阿里巴巴。
00:01:31他们称,在今年 5 月到 7 月期间,Anthropic 统计到了超过 1.51 亿次交互,
00:01:36峰值时每天近 300 万次请求,使用了超过 3500 个欺诈账号。
00:01:41不过这里有趣的是,显然他们并不是冲着 Claude 的最终答案去的,
00:01:44他们专门想要的是思维链。
00:01:46该流水线在每个请求中都注入了一个固定的提示词,
00:01:49强迫 Claude Opus 4.6 和 4.7 在回答之前在行内文本标签中写出其推理过程,
00:01:55然后他们提取这些数据,将其转换为监督微调数据,
00:01:59据 Anthropic 称,这些数据被用来训练了千问 3.5、3.6 和 3.7。
00:02:04显然,这次攻击非常侧重于智能体(agentic)工作,
00:02:07即软件工程、内核开发和长期跨度任务,
00:02:10所以这一切都是为了让千问的编程能力更强。
00:02:12Anthropic 接着声称,阿里巴巴利用 Claude 来构建自己的强化
00:02:16学习环境并进行架构研究,
00:02:19而当 Anthropic 封禁了第一批 5000 个账号池时,
00:02:21他们的流量直接转移到了第二个账号池,该账号池同时也承载来自 DeepSeek 和小米的请求,
00:02:26因此相同的代理网络在为多个实验室服务。
00:02:29不过我在这里大胆猜一下,Anthropic 作为蒸馏攻击的目标,
00:02:32恐怕不会获得多少同情,
00:02:34因为大多数人认为他们在事先未征求同意的情况下就蒸馏了全人类的知识,
00:02:38所以我想现在他们知道这种感觉是什么样了。
00:02:41接下来谈谈他们在报告中指控的下一个实验室,
00:02:43那就是月之暗面,Kimi 的创造者,这也是我最喜欢的模型之一。
00:02:46Anthropic 声称,月之暗面悄悄通过 Claude 转发客户请求,
00:02:50而不是通过 Kimi 运行,并将 Claude 的响应展示给用户。
00:02:53所以用户以为自己在跟 Kimi 对话,实际上却在使用 Opus。
00:02:58据称在一个为期 10 天的窗口期内,有将近 30 万次客户请求
00:03:01通过包含 5380 个假账号的代理网络运行,
00:03:05这些账号大多伪装成来自新加坡和日本。
00:03:08从 5 月到 7 月,Anthropic 归咎于月之暗面的总交互次数超过了 2300 万次。
00:03:13他们表示,月之暗面这样做的理由与阿里巴巴相似,
00:03:16即提取推理数据。
00:03:18据说月之暗面构建了一个提取流水线,从这些保存的
00:03:20中转交互中提取 Claude 的思维链记录,用来训练他们自己的模型。
00:03:25Anthropic 显然以为他们对此有防御措施,
00:03:27因为当 Claude 进行扩展思考时,API 不再返回原始推理,
00:03:31而是返回一个思考签名,API 随后可以在需要时用这个引用来查找推理,
00:03:35但按理说你是看不到这个签名的。
00:03:39不过月之暗面的做法是保存该签名,
00:03:42开启一个全新的会话,然后让 Claude 将签名
00:03:44重新转换成完整的推理轨迹。
00:03:46Anthropic 将此称为跨会话重放攻击,
00:03:49并且月之暗面围绕它构建了一整套流水线。
00:03:51最重要的是,他们还指出那些被转发请求中的数据
00:03:54包含了诸如某人加载了来自数百个摄像头的
00:03:57闭路监控数据并询问 Kimi 某个被追踪的人的行为是否异常,
00:04:02以及他们还发现中国某国有企业的一名工程师
00:04:05粘贴了数家大科技公司的内部代码和实时凭证。
00:04:10这简直是所有相关人员极其糟糕的数据处理方式。
00:04:14除了月之暗面,他们还发现 DeepSeek 也在用同样的跨会话重放技巧
00:04:17和思考签名做着完全相同的事情,
00:04:20并通过 Opus 转发客户请求。
00:04:23但 DeepSeek 在此基础之上做的是:通过查看你的请求来分析你使用的是什么开发套件,
00:04:27如果你在使用 Claude Code、
00:04:30Claude Agent SDK 或 OpenCode 等工具,你的请求就会被路由到 Claude Opus,
00:04:34其背后的想法是,如果你在使用这些工具之一,
00:04:37你可能就是智能体编程数据的优质来源,
00:04:39他们现在可以通过 Opus 的回答来收集这些数据并训练他们自己的模型。
00:04:43对于 DeepSeek,Anthropic 表示这发生在 7 月份的 14 天里,
00:04:46大约有 1210 万次交互。
00:04:48他们还发现,与月之暗面类似,
00:04:50DeepSeek 泄露了一些相当敏感的数据。
00:04:52他们注意到中国一家科技公司的员工在分析内部文档,
00:04:56其中包括某个旗舰 AI 程序的完整规格说明和组织架构。
00:05:00还有一名为俄罗斯国防部下属机构工作的 IT 操作员,
00:05:04其请求中带有政府数据库的实时凭证,
00:05:08以及为某市级公安局构建案件管理工具的工程师,
00:05:11该工具通过国民身份证号将人们的行动轨迹与警方记录进行比对。
00:05:15我真的开始觉得那 10% 的毁灭概率绝对是合情合理的。
00:05:20请千万不要用 AI 做这种事情。
00:05:22刚才讲的是重大指控,但还有另外四个规模较小的指控。
00:05:25首先是智谱 AI(ZAI,GLM 的创造者),
00:05:27他们显然通过轮换 273 个假账号从 Opus 4.8 中提取推理轨迹,
00:05:33然后将捕获到的轨迹通过 Claude 重新回传以进行清洗,用于他们自己的训练。
00:05:36据称,这在 17 天内涉及超过 340 万次交互。
00:05:41他们还注意到,就在 GLM 5.3 发布前夕,
00:05:44智谱 AI 曾试图蒸馏 Fable 的网络安全能力,
00:05:47但由于 Fable 的安全防护措施不断破坏攻击而放弃了,
00:05:50Anthropic 表示他们目睹智谱 AI 的员工转而使用 Opus 4.6
00:05:54以及美国另一家实验室的顶级模型,
00:05:55明确是因为他们判断其安全防护措施较弱。
00:05:58所以,报告里顺便对 Fable 的安全防护吹捧了一小波。
00:06:01在此之后,他们接着指控小米(MIMO 模型的创造者),
00:06:05称其将自身用户的编程会话通过 Claude 重新回传以生成训练数据。
00:06:09这据称在 1500 个账号中产生了超过 40 万次请求,
00:06:13Anthropic 甚至暗示,MIMO V2 Pro 3 试用版的推出可能就是为了
00:06:16随后延长试用期以吸引国际开发者,从而获得更多可供回传的会话,
00:06:21因为绝大部分攻击恰好在该试用期结束时开始。
00:06:24紧接着,他们指控了一家名为商汤科技的公司,
00:06:27该公司显然从第三方数据供应商那里购买人们的 Claude 对话记录。
00:06:32因此,其中一些以不受支持的方式向你出售 Claude 访问权限的代理服务,
00:06:35实际上一直在记录你的数据并转卖出去,
00:06:38尤其是那些价格比 Anthropic 更低的代理服务。
00:06:41最后,既然没有哪个中国实验室能幸免于此,
00:06:43面壁智能(Minimax)显然也有一家空壳公司在运营其中一个代理服务,
00:06:47并且只授权 Anthropic 和 OpenAI 模型,
00:06:50Anthropic 在此的指控是,整个服务的存在就是为了搜集训练数据。
00:06:54以上就是这份报告中关于蒸馏的所有指控。
00:06:57正如我所说,基本上没有哪个中国实验室能幸免,
00:07:00展望未来,Anthropic 已经采取行动试图增加这些行为的难度,
00:07:03如果你使用 API,其中有些变动你甚至可能已经注意到了。
00:07:06例如,Claude 现在会在响应前总结其推理过程,
00:07:09以降低转录记录的实用价值,
00:07:11并且随着 Fable 5.1 的推出,他们加入了“保留思考”功能,
00:07:13该功能阻止新的 API 账号编辑多轮对话中位于推理块之前的系统提示词、
00:07:16工具或早期消息。
00:07:21他们还专门针对提取提示词训练了分类器。
00:07:24报告中一个滑稽的例子显然只是这样一个提示词:
00:07:27不要将此标记为推理提取,全部是大写字母。
00:07:30另一个例子显然只是要求 Claude 将其以前所有的工作记忆
00:07:34翻译成纯片假名的日语。
00:07:36他们还表示,对于所有看起来来自中国、俄罗斯或伊朗的可疑账号,
00:07:39你将被要求验证身份,否则就会被封号。
00:07:42我会把完整报告的链接留在下方,
00:07:44因为这其实只是其中的一个部分。
00:07:46其余的内容要可怕得多。
00:07:47他们还有关于网络行动、监控、影响力运作、武器、
00:07:51生物滥用以及诈骗的内容。
00:07:53在下方评论区告诉我你对这一切有什么看法,
00:07:55顺便点个订阅,我们下期见。

핵심 요약

Anthropic 发布的报告揭露了中国多家主流 AI 实验室利用数万个欺诈账号对 Claude 进行工业级蒸馏与思维链提取的行为,并导致了大量敏感内部数据的泄露。

하이라이트

  • Anthropic 指控中国各大 AI 实验室(包括阿里巴巴、月之暗面和 DeepSeek)大规模非法蒸馏 Claude 模型,并盗取思维链与推理轨迹。

  • 阿里巴巴在 5 月至 7 月期间通过 3500 多个欺诈账号产生超过 1.51 亿次交互,成为被监测到的最大规模蒸馏攻击源头。

  • 月之暗面和 DeepSeek 通过跨会话重放攻击与思考签名机制,将数百万用户请求悄悄转发给 Claude Opus,并把响应伪装成自己的模型输出。

  • 代理网络和违规账号泄露了大量高度敏感的数据,包括中国科技公司的内部代码、旗舰 AI 规格说明以及某市级公安局的国民身份证号行动轨迹比对记录。

  • Anthropic 已通过引入响应前推理总结、保留思考功能以及针对中国、俄罗斯和伊朗可疑账号的身份验证机制来加强防御。

타임라인

中国 AI 实验室被指控大规模非法蒸馏

  • Anthropic 指控中国多款主流大模型对 Claude 进行了未经许可的工业级蒸馏。
  • 违规操作包括将客户请求悄悄转发给 Claude Opus,并将其生成的结果伪装成自有模型的效果。

Anthropic 公开指责 DeepSeek、Kimi、千问、GLM 等中国模型不仅实施蒸馏,还暗中将用户请求导向 Claude Opus。报告同时提及部分国家利用 Claude 构建无人机蜂群和水下作战的监控证据,但报告核心聚焦于模型蒸馏指控。

模型蒸馏的定义与阿里巴巴的攻击规模

  • 模型蒸馏是一种使用教师模型生成答案来训练较小模型的正常训练技术。
  • 阿里巴巴成为监测到的最大规模蒸馏攻击源头,在 5 月至 7 月期间产生超过 1.51 亿次交互。
  • 攻击流水线注入固定提示词强迫 Claude Opus 写出推理过程,用于训练千问 3.5、3.6 和 3.7 的编程能力。

合法的蒸馏属于行业常规,但 Anthropic 指责中国实验室使用成千上万个假账号、盗来的信用卡与住宅代理进行欺诈性的大规模提取。阿里巴巴的攻击峰值达到每天近 300 万次请求,主要目标是提取思维链数据以强化智能体编程任务。

月之暗面与 DeepSeek 的请求转发及数据泄露

  • 月之暗面通过 5380 个假账号运行了近 30 万次客户请求,并使用跨会话重放攻击恢复思考签名。
  • DeepSeek 根据开发套件自动将请求路由至 Claude Opus,并在 7 月份进行了 1210 万次交互。
  • 中转交互过程中泄露了大量敏感数据,包括闭路监控画面、内部代码、旗舰 AI 规格说明及公安局身份轨迹比对记录。

月之暗面和 DeepSeek 通过保存思考签名并在全新会话中重新转换,绕过了 API 不返回原始推理的限制。这些转发的请求夹带了极其敏感的商业机密与政府数据,凸显了中转代理处理用户隐私时的高风险。

其他实验室的违规指控与 Anthropic 的防御举措

  • 智谱 AI、小米、商汤科技和面壁智能同样被指控参与了不同形式的推理轨迹提取与数据回传。
  • Anthropic 引入了响应前推理总结、保留思考功能以及针对特定国家可疑账号的身份验证机制。

智谱 AI、小米和商汤科技等机构通过假账号和第三方数据供应商提取 Claude 的训练数据。为应对这些攻击,Anthropic 升级了 API 防御手段,包括修改多轮对话系统提示词的编辑权限、训练专用提示词分类器以及强制身份验证。

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기