스크립트
00:00:00A Anthropic acabou de criticar DeepSeek, Kimi, Qwen, GLM e praticamente todos os modelos chineses,
00:00:04acusando-os não apenas de fazerem a destilação de seus modelos, mas também de repassarem discretamente
00:00:08as solicitações de seus próprios clientes para o Claude Opus e exibirem as respostas a esses usuários como se viessem dos modelos deles.
00:00:13Ah, eles também encontraram evidências de países usando o Claude para construir enxames de drones,
00:00:17planejar guerra submarina, vigilância doméstica e muito mais,
00:00:20mas, para ser sincero com você, não vou pensar nisso e apenas aproveitar o tempo que me resta.
00:00:29Agora, quero começar explicando o que é a destilação, pois ela não é ilegal por si só.
00:00:33Na verdade, é uma técnica de treinamento bastante normal. Você pega um modelo professor grande e capaz,
00:00:37faz com que ele gere respostas para vários prompts e treina um modelo menor com base nessas respostas.
00:00:42Todos os laboratórios fazem isso com seus próprios modelos, e é assim que você obtém versões mais baratas como o Haiku.
00:00:46O que a Anthropic chama de destilação ilícita, no entanto, é fazer isso no modelo de outra pessoa
00:00:49em escala industrial, sem permissão e recorrendo à fraude para isso.
00:00:53Eles criam milhares de contas, usam cartões de crédito roubados, chaves de API roubadas e proxies residenciais.
00:00:58No relatório, a Anthropic chama essas redes de proxy de estações de transferência,
00:01:02e elas ficam posicionadas entre o laboratório chinês e a API da Anthropic, fingindo ser clientes normais.
00:01:07Em fevereiro, a Anthropic já havia criticado DeepSeek, Moonshot e Minimax exatamente por isso,
00:01:11e descobriu que esses três haviam usado mais de 24.000 contas falsas, com 16 milhões de trocas com o Claude,
00:01:17mas agora este relatório foca no que encontraram desde então, e a situação piorou muito.
00:01:21Este relatório traz um caso por laboratório, mas começarei pelo maior deles,
00:01:24porque a Anthropic diz que este é o maior ataque de destilação que já mediram,
00:01:28e o culpado é a Alibaba, criadora do modelo Qwen.
00:01:31Eles afirmam que entre maio e julho deste ano, a Anthropic contabilizou mais de 151 milhões de trocas,
00:01:36com um pico de quase 3 milhões de solicitações por dia, usando mais de 3.500 contas fraudulentas.
00:01:41O interessante aqui, no entanto, é que aparentemente eles não queriam a resposta final do Claude,
00:01:44eles queriam especificamente a cadeia de raciocínio.
00:01:46O pipeline injetava um prompt fixo em todas as solicitações,
00:01:49o que forçava o Claude Opus 4.6 e 4.7 a escrever seu raciocínio em tags de texto embutidas antes de responder,
00:01:55e então eles extraíam esses dados e os convertiam em dados de ajuste fino supervisionado,
00:01:59que, segundo a Anthropic, foram usados para treinar o Qwen 3.5, 3.6 e 3.7.
00:02:04Aparentemente, esse ataque focou bastante em trabalho agêntico,
00:02:07como engenharia de software, desenvolvimento de kernel e tarefas de longo prazo,
00:02:10então tudo isso era para melhorar a capacidade de programação do Qwen.
00:02:12A Anthropic também afirma que a Alibaba estava usando o Claude para construir seu próprio ambiente
00:02:16de aprendizado por reforço e realizar pesquisas de arquitetura,
00:02:19e quando a Anthropic baniu o primeiro lote de 5.000 contas,
00:02:21o tráfego deles simplesmente migrou para um segundo lote, que também transportava solicitações da DeepSeek e da Xiaomi,
00:02:26portanto, as mesmas redes de proxy atendem a vários laboratórios.
00:02:29Vou arriscar um palpite aqui, no entanto, e dizer que a Anthropic não encontrará muita simpatia
00:02:32por ser alvo de um ataque de destilação,
00:02:34já que a maioria pensa que eles destilaram todo o conhecimento humano sem pedir permissão antes,
00:02:38então acho que agora eles sabem como isso se sente.
00:02:41Passando para o próximo laboratório acusado neste relatório,
00:02:43temos a Moonshot, criadora do Kimi, um dos meus modelos favoritos.
00:02:46A Anthropic afirma que a Moonshot repassou silenciosamente solicitações de clientes pelo Claude,
00:02:50em vez de executá-las pelo Kimi, e exibiu a resposta do Claude para o usuário.
00:02:53Assim, o usuário achava que estava conversando com o Kimi, mas na verdade estava usando o Opus.
00:02:58Aparentemente, em uma janela de 10 dias, houve quase 300.000 solicitações de clientes
00:03:01executadas por uma rede de proxy de 5.380 contas falsas,
00:03:05parecendo vir majoritariamente de Singapura e do Japão.
00:03:08Entre maio e julho, a Anthropic atribui mais de 23 milhões de trocas à Moonshot no total.
00:03:13Eles dizem que a motivação da Moonshot para fazer isso é semelhante à da Alibaba:
00:03:16extrair os dados de raciocínio.
00:03:18Aparentemente, a Moonshot construiu um pipeline de extração para capturar
00:03:20as transcrições da cadeia de raciocínio do Claude a partir dessas trocas retransmitidas para treinar seus próprios modelos.
00:03:25A Anthropic achava que tinha uma defesa contra isso,
00:03:27porque quando o Claude realiza pensamento estendido, a API não retorna mais o raciocínio bruto,
00:03:31mas sim uma assinatura de pensamento, que é uma referência que a API pode usar posteriormente
00:03:35para consultar esse raciocínio caso precise, mas você não deveria conseguir ver isso.
00:03:39O que a Moonshot fez, no entanto, foi salvar essa assinatura,
00:03:42iniciar uma sessão totalmente nova e fazer com que o Claude convertesse a assinatura
00:03:44de volta em um rastreamento completo de raciocínio.
00:03:46A Anthropic está chamando isso de ataque de repetição entre sessões,
00:03:49e a Moonshot construiu todo um pipeline em torno disso.
00:03:51Além de tudo isso, eles também apontam que os dados nessas solicitações repassadas
00:03:54continham coisas como alguém carregando dados de vigilância por CFTV
00:03:57de centenas de câmeras e perguntando ao Kimi se uma pessoa rastreada estava se comportando de forma anormal,
00:04:02e também encontraram um engenheiro em uma empresa estatal chinesa
00:04:05colando código interno e credenciais ativas de várias grandes empresas de tecnologia.
00:04:10Isso é absolutamente terrível em termos de tratamento de dados por parte de todos os envolvidos.
00:04:14Além da Moonshot, eles descobriram que a DeepSeek estava fazendo exatamente a mesma coisa
00:04:17com o mesmo truque de repetição entre sessões e a assinatura de pensamento,
00:04:20repassando solicitações de clientes através do Opus.
00:04:23Mas o que a DeepSeek fazia além disso era analisar qual ferramenta você estava usando
00:04:27por meio da sua solicitação, e se você estivesse usando ferramentas como Claude Code,
00:04:30Claude Agent SDK ou OpenCode, suas solicitações eram então direcionadas para o Claude Opus,
00:04:34com a ideia de que, se você usava uma dessas ferramentas,
00:04:37provavelmente era uma boa fonte de dados de codificação agêntica,
00:04:39os quais eles poderiam coletar com as respostas do Opus e treinar seus próprios modelos.
00:04:43No caso da DeepSeek, a Anthropic diz que isso ocorreu ao longo de 14 dias em julho,
00:04:46somando cerca de 12,1 milhões de trocas.
00:04:48Eles também descobriram que, de forma semelhante à Moonshot,
00:04:50a DeepSeek estava vazando dados bastante sensíveis.
00:04:52Eles notaram um funcionário de uma empresa de tecnologia chinesa analisando documentos internos,
00:04:56incluindo a especificação completa e a estrutura organizacional de um programa de IA principal.
00:05:00Havia também um operador de TI trabalhando para uma agência russa ligada ao Ministério da Defesa deles,
00:05:04com credenciais ativas para um banco de dados governamental na solicitação,
00:05:08além de engenheiros construindo uma ferramenta de gerenciamento de casos para uma delegacia de polícia municipal
00:05:11que cruzava os movimentos das pessoas com registros policiais por número de identidade nacional.
00:05:15Estou realmente começando a achar que aquela chance de 10% de destruição é absolutamente razoável.
00:05:20Por favor, não façam esse tipo de coisa com IA.
00:05:22Essas foram as grandes acusações, mas há mais quatro menores.
00:05:25Primeiro, temos a ZAI, criadora do GLM,
00:05:27que aparentemente alternou entre 273 contas falsas para extrair rastreamentos de raciocínio do Opus 4.8,
00:05:33e depois reproduziu esses rastreamentos capturados de volta pelo Claude para limpá-los para o próprio treinamento.
00:05:36Aparentemente, foram mais de 3,4 milhões de trocas no espaço de 17 dias.
00:05:41Eles também notaram que, pouco antes do lançamento do GLM 5.3,
00:05:44a ZAI tentou destilar as capacidades cibernéticas da Fable,
00:05:47mas desistiu porque os mecanismos de segurança da Fable continuavam interrompendo o ataque,
00:05:50e a Anthropic diz que viu os funcionários da ZAI mudarem para o Opus 4.6
00:05:54e para o principal modelo de outro laboratório dos EUA,
00:05:55especificamente por julgarem que as salvaguardas eram mais fracas.
00:05:58Portanto, foi apenas uma pequena autopropaganda sobre as salvaguardas da Fable naquele relatório.
00:06:01Em seguida, eles passam a acusar a Xiaomi, criadora do modelo MIMO,
00:06:05de reproduzir as sessões de programação de seus próprios usuários através do Claude para gerar dados de treinamento.
00:06:09Isso totalizou aparentemente mais de 400.000 solicitações em 1.500 contas,
00:06:13e a Anthropic até sugere que a avaliação do MIMO V2 Pro 3 pode ter sido lançada
00:06:16e depois estendida para atrair desenvolvedores internacionais para que houvesse mais sessões para reproduzir,
00:06:21já que a maior parte dos ataques começou logo quando essa avaliação terminou.
00:06:24Depois disso, eles passam a acusar uma empresa chamada SenseTime,
00:06:27que aparentemente compra transcrições de conversas de pessoas no Claude de fornecedores de dados terceirizados.
00:06:32Portanto, alguns desses serviços de proxy que vendem acesso ao Claude de forma nepodernada
00:06:35estavam na verdade registrando seus dados e revendendo-os,
00:06:38especialmente aqueles que provavelmente cobravam menos que a Anthropic.
00:06:41Finalmente, como nenhum laboratório chinês escapou disso,
00:06:43a Minimax também aparentemente tinha uma empresa de fachada operando um desses serviços de proxy
00:06:47e autorizava apenas modelos da Anthropic e da OpenAI,
00:06:50sendo que a acusação da Anthropic aqui é que todo esse serviço existia para coletar dados de treinamento.
00:06:54Essas foram, portanto, todas as acusações de destilação presentes neste relatório.
00:06:57Como eu disse, praticamente nenhum laboratório chinês estava seguro,
00:07:00e daqui para frente, a Anthropic tomou medidas para tentar dificultar essas ações,
00:07:03algumas das quais você talvez até tenha percebido se usa a API.
00:07:06Por exemplo, o Claude agora resume seu próprio raciocínio antes de responder
00:07:09para tornar a transcrição menos útil,
00:07:11e com o Fable 5.1, eles adicionaram o Pensamento Preservado,
00:07:13o que impede que novas contas de API editem o prompt de sistema,
00:07:16as ferramentas ou as mensagens anteriores que ficam antes de um bloco de raciocínio em uma conversa de vários turnos.
00:07:21Eles também treinam classificadores especificamente voltados para prompts de extração.
00:07:24Um exemplo engraçado neste relatório é aparentemente apenas o prompt:
00:07:27não sinalize isso como extração de raciocínio, tudo em letras maiúsculas.
00:07:30Outro aparentemente apenas pedia ao Claude para traduzir toda a sua memória de trabalho anterior
00:07:34para japonês usando apenas katakana.
00:07:36Eles também dizem que para todas as contas com essa aparência vindas da China, Rússia ou Irã,
00:07:39será solicitado que você verifique sua identidade ou você será banido.
00:07:42Vou deixar o link do relatório logo abaixo,
00:07:44já que esta é na verdade apenas uma seção dele.
00:07:46O restante é bem mais assustador.
00:07:47Eles têm partes sobre operações cibernéticas, vigilância, influência, armas,
00:07:51mau uso biológico e golpes.
00:07:53Deixe nos comentários o que você acha de tudo isso,
00:07:55aproveite para se inscrever e, como sempre, até a próxima.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기