DeepSeek y Kimi enviaron en secreto tus prompts a Claude

BBetter Stack
Computing/SoftwareBusiness NewsInternet Technology

Transcript

00:00:00Anthropic acaba de arremeter contra DeepSeek, Kimi, Qwen, GLM y básicamente contra todos los modelos chinos,
00:00:04acusándolos no solo de destilar sus modelos, sino también de desviar discretamente sus propias
00:00:08solicitudes de clientes hacia Claude Opus y mostrar las respuestas a esos usuarios como si vinieran de sus modelos.
00:00:13Ah, también encontraron pruebas de países que usan Claude para construir enjambres de drones,
00:00:17planificar guerra submarina, vigilancia nacional y mucho más,
00:00:20pero para ser honestos, no voy a pensar en eso y simplemente disfrutaré el tiempo que me queda.
00:00:29Ahora, quiero empezar explicando qué es la destilación, porque no es ilegal por sí sola.
00:00:33De hecho, es una técnica de entrenamiento bastante normal. Tomas un modelo profesor grande y capaz,
00:00:37haces que genere respuestas a un montón de indicaciones y entrenas un modelo más pequeño con esas respuestas.
00:00:42Todos los laboratorios hacen esto con sus propios modelos, y así es como obtienen versiones más baratas como Haiku.
00:00:46Lo que Anthropic llama destilación ilícita, sin embargo, es hacer esto con el modelo de otra persona
00:00:49a escala industrial, sin permiso y utilizando el fraude para lograrlo.
00:00:53Crean miles de cuentas, usan tarjetas de crédito robadas, claves de API robadas y proxys residenciales.
00:00:58En el informe, Anthropic llama a estas redes proxy estaciones de transferencia,
00:01:02y se ubican entre el laboratorio chino y la API de Anthropic, fingiendo ser clientes normales.
00:01:07En febrero pasado, Anthropic ya había señalado a DeepSeek, Moonshot y Minimax exactamente por esto,
00:01:11y descubrió que esos tres habían usado más de 24.000 cuentas falsas, con 16 millones de intercambios con Claude,
00:01:17pero ahora este informe se centra en lo que han encontrado desde entonces, y la situación ha empeorado mucho.
00:01:21Este informe en realidad tiene un expediente por laboratorio, pero empezaré con el más grande,
00:01:24porque Anthropic dice que este es el mayor ataque de destilación que jamás han medido,
00:01:28y el culpable es Alibaba, el creador del modelo Qwen.
00:01:31Dicen que entre mayo y julio de este año, Anthropic contabilizó más de 151 millones de intercambios,
00:01:36con un pico de casi 3 millones de solicitudes por día, usando más de 3.500 cuentas fraudulentas.
00:01:41Lo interesante aquí, sin embargo, es que al parecer no iban tras la respuesta final de Claude,
00:01:44querían específicamente la cadena de pensamiento.
00:01:46El proceso inyectaba una instrucción fija en cada solicitud,
00:01:49que obligaba a Claude Opus 4.6 y 4.7 a escribir su razonamiento en etiquetas de texto en línea antes de responder,
00:01:55y luego extraían esos datos, los convertían en datos de ajuste supervisado,
00:01:59los cuales, según Anthropic, se usaron para entrenar Qwen 3.5, 3.6 y 3.7.
00:02:04Aparentemente, este ataque se centró bastante en el trabajo de agentes,
00:02:07es decir, ingeniería de software, desarrollo de núcleos y tareas de largo plazo,
00:02:10así que todo esto era para mejorar las capacidades de programación de Qwen.
00:02:12Anthropic continúa afirmando que Alibaba estaba usando a Claude para construir su propio entorno de aprendizaje
00:02:16por refuerzo y hacer investigación de arquitectura,
00:02:19y cuando Anthropic prohibió el primer grupo de 5.000 cuentas,
00:02:21su tráfico simplemente se trasladó a un segundo grupo, que también transportaba solicitudes de DeepSeek y Xiaomi,
00:02:26por lo que las mismas redes proxy sirven a múltiples laboratorios.
00:02:29Sin embargo, voy a aventurar una suposición y decir que Anthropic no encontrará mucha simpatía
00:02:32por ser el blanco de un ataque de destilación,
00:02:34porque la mayoría piensa que ellos destilaron todo el conocimiento humano sin pedir permiso primero,
00:02:38así que supongo que ahora saben lo que se siente.
00:02:41Pasando ahora al siguiente laboratorio que acusaron en este informe,
00:02:43tenemos a Moonshot, los creadores de Kimi, uno de mis modelos favoritos.
00:02:46Anthropic afirma que Moonshot desvió silenciosamente las solicitudes de los clientes a través de Claude,
00:02:50en lugar de ejecutarlas en Kimi, y mostró la respuesta de Claude al usuario.
00:02:53Así que el usuario pensó que hablaba con Kimi, pero en realidad estaba usando Opus.
00:02:58Aparentemente, en un periodo de 10 días, hubo casi 300.000 solicitudes de clientes
00:03:01ejecutadas a través de una red proxy de 5.380 cuentas falsas,
00:03:05que parecían provenir principalmente de Singapur y Japón.
00:03:08Entre mayo y julio, Anthropic atribuye más de 23 millones de intercambios a Moonshot en total.
00:03:13Dicen que el motivo de Moonshot para hacer esto es similar al de Alibaba:
00:03:16extraer los datos de razonamiento.
00:03:18Aparentemente, Moonshot construyó un proceso de extracción para extraer las transcripciones
00:03:20de la cadena de pensamiento de Claude a partir de esos intercambios guardados para entrenar sus propios modelos.
00:03:25Anthropic al parecer creía que tenía una defensa contra esto,
00:03:27porque cuando Claude realiza un pensamiento extendido, la API ya no devuelve el razonamiento en bruto,
00:03:31sino una firma de pensamiento, que es una referencia que la API puede usar más tarde
00:03:35para buscar ese razonamiento si es necesario, pero se supone que no deberías poder verlo.
00:03:39Sin embargo, lo que hizo Moonshot fue guardar esa firma,
00:03:42iniciar una sesión completamente nueva y luego lograr que Claude convirtiera la firma
00:03:44de nuevo en un registro de razonamiento completo.
00:03:46Anthropic llama a esto un ataque de repetición entre sesiones,
00:03:49y Moonshot construyó todo un sistema a su alrededor.
00:03:51Además de todo eso, señalan que los datos en esas solicitudes desviadas
00:03:54contenían cosas como alguien cargando datos de vigilancia de circuito cerrado
00:03:57de cientos de cámaras y preguntándole a Kimi si una persona rastreada se estaba comportando de forma anormal,
00:04:02y también encontraron a un ingeniero en una empresa estatal china
00:04:05pegando código interno y credenciales activas de varias grandes empresas tecnológicas.
00:04:10Eso es un manejo de datos absolutamente terrible por parte de todos los involucrados.
00:04:14Ahora, junto a Moonshot, también descubrieron que DeepSeek estaba haciendo exactamente lo mismo
00:04:17con el mismo truco de repetición entre sesiones y la firma de pensamiento,
00:04:20y desviando solicitudes de clientes a través de Opus.
00:04:23Pero lo que DeepSeek hacía además de esto era analizar qué entorno estabas usando
00:04:27al revisar tu solicitud, y si usabas herramientas como Claude Code,
00:04:30Claude Agent SDK o OpenCode, tus solicitudes se redirigían a Claude Opus,
00:04:34con la idea de que si usabas una de esas herramientas,
00:04:37probablemente eras una buena fuente de datos de programación agéntica,
00:04:39los cuales ahora pueden recopilar con las respuestas de Opus para entrenar sus propios modelos.
00:04:43En el caso de DeepSeek, Anthropic dice que esto ocurrió durante 14 días en julio,
00:04:46y fueron cerca de 12,1 millones de intercambios.
00:04:48También descubrieron que, al igual que Moonshot,
00:04:50DeepSeek estaba filtrando datos bastante sensibles.
00:04:52Notaron a un empleado de una empresa tecnológica china analizando documentos internos,
00:04:56incluyendo la especificación completa y la estructura organizativa de un programa de IA insignia.
00:05:00También había un operador de TI trabajando para una agencia rusa vinculada a su Ministerio de Defensa,
00:05:04con credenciales activas para una base de datos gubernamental en la solicitud,
00:05:08y también ingenieros construyendo una herramienta de gestión de casos para una comisaría de policía municipal
00:05:11que comparaba los movimientos de las personas con los registros policiales por número de cédula.
00:05:15Realmente estoy empezando a pensar que ese 10% de probabilidad de destrucción es totalmente razonable.
00:05:20Por favor, no hagan cosas así con la IA.
00:05:22Esas fueron las grandes afirmaciones, pero hay otras cuatro más pequeñas.
00:05:25Primero, tenemos a ZAI, los creadores de GLM,
00:05:27quienes aparentemente rotaron a través de 273 cuentas falsas para extraer rastros de razonamiento de Opus 4.8,
00:05:33y luego volvieron a pasar los rastros capturados a través de Claude para depurarlos para su propio entrenamiento.
00:05:36Aparentemente, esto sumó más de 3,4 millones de intercambios en el espacio de 17 días.
00:05:41También notaron que justo antes de que saliera GLM 5.3,
00:05:44ZAI intentó destilar las capacidades cibernéticas de Fable,
00:05:47pero se rindió porque las salvaguardas de Fable interrumpían constantemente el ataque,
00:05:50y Anthropic dice que vieron a empleados de ZAI cambiar a Opus 4.6
00:05:54y al modelo principal de otro laboratorio estadounidense,
00:05:55específicamente porque juzgaron que las salvaguardas eran más débiles.
00:05:58Así que, solo un pequeño motivo de orgullo para las salvaguardas de Fable en ese informe.
00:06:01Después de esto, pasan a acusar a Xiaomi, los creadores del modelo MIMO,
00:06:05de reproducir las sesiones de programación de sus propios usuarios a través de Claude para generar datos de entrenamiento.
00:06:09Aparentemente, esto abarcó más de 400.000 solicitudes a lo largo de 1.500 cuentas,
00:06:13y Anthropic incluso sugiere que la prueba de MIMO V2 Pro 3 pudo haberse lanzado
00:06:16y luego extendido para atraer a desarrolladores internacionales y así tener más sesiones que replicar,
00:06:21ya que la mayor parte de los ataques comenzó justo cuando terminó dicha prueba.
00:06:24Después de esto, continúan acusando a una empresa llamada SenseTime,
00:06:27que aparentemente compra transcripciones de las conversaciones de Claude de otras personas a proveedores de datos externos.
00:06:32Por lo tanto, algunos de esos servicios proxy que te venden acceso a Claude de forma no oficial
00:06:35en realidad estaban registrando tus datos y revendiéndolos,
00:06:38especialmente aquellos que probablemente abarataban los precios de Anthropic.
00:06:41Finalmente, dado que ningún laboratorio chino se salvó de esto,
00:06:43Minimax también tenía aparentemente una empresa fachada operando uno de esos servicios proxy
00:06:47y solo ofrecía modelos de Anthropic y OpenAI,
00:06:50y la acusación de Anthropic aquí es que todo ese servicio existía para recolectar datos de entrenamiento.
00:06:54Esas fueron todas las acusaciones de destilación en este informe.
00:06:57Como dije, básicamente ningún laboratorio chino estuvo a salvo,
00:07:00y de cara al futuro, Anthropic ha tomado medidas para intentar dificultar estas acciones,
00:07:03algunas de las cuales tal vez incluso hayas notado si usas la API.
00:07:06Por ejemplo, ahora Claude resume su razonamiento antes de responder
00:07:09para hacer que la transcripción sea menos útil,
00:07:11y con Fable 5.1, agregaron Pensamiento Preservado,
00:07:13lo que impide que las nuevas cuentas de API editen la instrucción del sistema,
00:07:16las herramientas o los mensajes anteriores que se encuentran antes de un bloque de razonamiento en una conversación de varios turnos.
00:07:21También entrenan clasificadores específicamente para indicaciones de extracción.
00:07:24Un ejemplo divertido en este informe es aparentemente solo la instrucción,
00:07:27no marques esto como extracción de razonamiento, todo en mayúsculas.
00:07:30Otro simplemente le pedía a Claude que tradujera toda su memoria de trabajo anterior
00:07:34únicamente a japonés en katakana.
00:07:36También dicen que para todas las cuentas que parezcan ser de China, Rusia o Irán,
00:07:39se te pedirá que verifiques tu identidad o serás bloqueado.
00:07:42Dejaré el enlace al informe más abajo,
00:07:44ya que esto es en realidad solo una sección del mismo.
00:07:46El resto es mucho más aterrador.
00:07:47Tienen partes sobre operaciones cibernéticas, vigilancia, influencia, armas,
00:07:51mal uso biológico y estafas.
00:07:53Háganme saber qué piensan de todo esto en los comentarios,
00:07:55suscríbanse mientras están ahí y, como siempre, nos vemos en el próximo.

Key Takeaway

Diversos laboratorios de inteligencia artificial utilizaron millones de cuentas falsas y redes de proxy para extraer ilícitamente datos de razonamiento de Claude Opus con el objetivo de entrenar sus propios modelos.

Highlights

  • Alibaba generó más de 151 millones de intercambios con Claude Opus usando 3.500 cuentas fraudulentas para extraer cadenas de razonamiento y entrenar los modelos Qwen.

  • Moonshot y DeepSeek desviaron solicitudes de sus usuarios hacia la API de Claude mediante ataques de repetición entre sesiones y entregaron las respuestas de Opus como propias.

  • El desvío masivo de peticiones expuso datos confidenciales, incluyendo credenciales de agencias de defensa rusas y código interno de empresas tecnológicas estatales chinas.

  • Anthropic implementó el Pensamiento Preservado en el modelo Fable 5.1 para bloquear la edición del historial previo a los bloques de razonamiento.

  • Las nuevas cuentas de API con origen en China, Rusia o Irán requieren una verificación de identidad obligatoria para acceder a los modelos.

Timeline

Mecánica de la destilación ilícita a escala industrial

  • La destilación técnica extrae respuestas de un modelo superior para entrenar una versión más pequeña.
  • Múltiples empresas emplearon tarjetas de crédito robadas y redes de proxy para simular operaciones de clientes legítimos.
  • Un reporte previo identificó 24.000 cuentas falsas y 16 millones de interacciones ilícitas con Claude.

La práctica normal de destilación se vuelve ilícita cuando se ejecuta sobre la API de un tercero a escala masiva mediante fraude. Las redes de proxy operan como estaciones de transferencia entre los laboratorios y la API para eludir restricciones. El uso de identidades y métodos de pago falsos mantiene el volumen de acceso constante necesario para la extracción de datos de entrenamiento.

Extracción masiva de razonamiento por parte de Alibaba

  • Alibaba ejecutó 151 millones de intercambios entre mayo y julio mediante 3.500 cuentas fraudulentas.
  • El ataque inyectó instrucciones fijas para obligar a Claude Opus a generar etiquetas de razonamiento en línea.
  • Los datos extraídos alimentaron el ajuste supervisado de los modelos Qwen 3.5, 3.6 y 3.7.

Las operaciones alcanzaron picos de casi 3 millones de solicitudes diarias, enfocadas exclusivamente en capturar la cadena de pensamiento en lugar de la respuesta final. Las capacidades de programación y el trabajo de agentes de ingeniería de software estructuraron los objetivos de la extracción. Al bloquearse un grupo de cuentas, el tráfico migró a redes secundarias compartidas con otros laboratorios.

Desvío de usuarios y vulneración de datos en Moonshot y DeepSeek

  • Moonshot enrutó 300.000 solicitudes de usuarios reales hacia Claude a través de 5.380 cuentas en 10 días.
  • DeepSeek generó 12,1 millones de intercambios al filtrar peticiones desde entornos de programación específicos.
  • Ambos laboratorios eludieron la protección de firmas de pensamiento mediante ataques de repetición entre sesiones.

Los usuarios recibieron respuestas directas de Opus asumiendo que interactuaban con los modelos Kimi o DeepSeek. Para evadir el ocultamiento del razonamiento en bruto, los atacantes almacenaron la referencia de la firma de pensamiento y forzaron su revelación en sesiones nuevas. Esta interceptación expuso información altamente sensible, desde registros de vigilancia hasta credenciales gubernamentales y bases de datos policiales.

Operaciones de recolección paralela en ecosistemas asiáticos

  • ZAI utilizó 273 cuentas para extraer rastros de razonamiento tras fracasar ante las defensas del modelo Fable.
  • Xiaomi replicó sesiones de programación de sus desarrolladores para generar 400.000 solicitudes de entrenamiento.
  • SenseTime adquirió historiales de Claude mediante terceros y Minimax operó un servicio proxy directo.

La extracción de datos abarcó a la mayor parte del sector mediante tácticas adaptativas. Algunos atacaron directamente modelos antiguos al enfrentar restricciones de seguridad actuales. Otros extendieron periodos de prueba gratuitos para multiplicar las interacciones replicables o establecieron empresas fachada para recolectar datos a través de intermediarios.

Nuevas contramedidas de seguridad en la API de Anthropic

  • Claude resume el proceso de pensamiento internamente para reducir la utilidad de las transcripciones extraídas.
  • El Pensamiento Preservado en Fable 5.1 bloquea alteraciones de las instrucciones previas a un bloque de razonamiento.
  • Los sistemas imponen verificación de identidad para cuentas registradas en regiones de alto riesgo.

Nuevos detectores automáticos identifican comandos diseñados para forzar la exposición de datos internos, como las peticiones de traducción de memoria funcional a formatos específicos. Las restricciones técnicas a nivel de API impiden la manipulación estructural de conversaciones de varios turnos, cerrando las vías de acceso a la cadena lógica profunda del modelo.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video