스크립트
00:00:00Anthropic lanzó Claude Sonnet 5 la semana pasada y fue decepcionante, pero al menos Fable 5 ha vuelto,
00:00:04aunque quizás algo limitado, y oh, Claude Code podría tener código tipo “spyware” para detectar
00:00:09su uso en China. Vamos a entrar en materia. Empezaré con Sonnet 5. Esta es, de hecho, la primera actualización de Sonnet en cuatro
00:00:18meses y medio, y Anthropic dice que está diseñado para ser su modelo Sonnet más agente hasta la fecha,
00:00:22con un rendimiento cercano a Opus 4.8, pero a precios más bajos. El precio es un aspecto realmente interesante
00:00:28de este modelo, así que volveremos a ello. Primero, echemos un vistazo a los puntos de referencia
00:00:31que proporciona Anthropic. Supera a su predecesor en todos ellos, y se acerca a Opus en algunos
00:00:35como Terminal Bench y Computer Use, incluso superando ligeramente a Opus en trabajo de conocimiento. Prefiero mirar
00:00:40los puntos de referencia de terceros, y los que confío son los de Artificial Analysis, y en ese
00:00:44índice de codificación, queda unos puntos por detrás de Opus, pero ligeramente por delante de GPT 5.4. Ha dado un muy
00:00:50buen salto respecto a su predecesor, Sonnet 4.6. La misma historia ocurre en el índice de Inteligencia,
00:00:56situándose entre GPT 5.5 y GPT 5.4, pero curiosamente, en el índice agente, superó a GPT 5.5.
00:01:03Así que cuando dijeron en el blog que pusieron mucho trabajo en sus capacidades agentes,
00:01:06parece que ha dado sus frutos. Por los puntos de referencia, parece un modelo bastante competente,
00:01:10y es sin duda un paso adelante respecto a Sonnet 4.6, pero hablemos ahora de ese elemento del precio.
00:01:14En el precio de la API, están ofreciendo un descuento a 2 dólares por un millón de tokens de entrada,
00:01:18y 10 dólares por un millón de tokens de salida, hasta el 31 de agosto. Luego volverá al mismo
00:01:23precio que los otros modelos Sonnet, que era 3 dólares por un millón de tokens de entrada y 15 dólares por un millón de
00:01:28tokens de salida. Esto lo sitúa alrededor de Gemini 3.5 Flash y GPT 5.6 Terra, si alguna vez obtenemos acceso,
00:01:34y como dijeron, es más barato que Opus 4.8. El problema es que, en la práctica, esto simplemente
00:01:39no es cierto en absoluto. Este modelo consume muchísimos tokens. Usa alrededor de 69,000 tokens para ejecutar una tarea en el
00:01:45índice de Inteligencia de Artificial Analysis, lo que lo hace más que a Sonic 4.6, Opus 4.8, Fable 5, GPT 5.4
00:01:52y 5.5. Si lo miras en este cuadrante, donde el verde es el lugar donde estar, está lo más lejos posible
00:01:57de estos modelos. Esto obviamente tiene un efecto dominó en el costo real de una tarea,
00:02:02y Artificial Analysis descubrió que Sonic 5 resultó ser más caro que Opus 4.8 por tarea,
00:02:07solo superado por Fable. Además, si tomas un modelo como GPT 5.5, que de hecho obtiene mejores resultados en la mayoría de los
00:02:12puntos de referencia, es la mitad del precio de Sonic 5. Cabe señalar que Artificial Analysis
00:02:16está utilizando el precio estándar del modelo y no el descontado, así que tendría muchísima
00:02:20curiosidad por ver si Anthropic intenta arreglar esto extendiendo quizás ese descuento o simplemente dejando eso
00:02:25como precio permanente. Peor aún que el costo por tarea, Artificial Analysis descubrió que
00:02:29ejecutar todo su conjunto de pruebas con Sonic 5 costaba más que con Fable 5. ¿Qué ha pasado aquí? Incluso en
00:02:34Cursor Bench, si miras Sonic 5 High, tiene aproximadamente el mismo precio que Opus 4.8 para un resultado
00:02:39similar, y a medida que subes los niveles de esfuerzo, Sonic 5 Max obtiene peores puntuaciones que Opus 4.8 Extra High mientras
00:02:44cuesta más. Realmente parece que necesitan actualizar o arreglar algo aquí, o simplemente no veo
00:02:48dónde encaja este modelo. No es de ninguna manera un mal modelo en cuanto a capacidades, solo económicamente, y he
00:02:54sido un gran fan de los modelos Sonic. Creo que fueron los primeros que muchos de nosotros usamos a diario,
00:02:58pero en los últimos meses siempre he usado Opus 4.8, y nada de esto me ha hecho cambiar de opinión.
00:03:02Especialmente con el regreso de Fable, será Fable para las tareas difíciles,
00:03:05y Opus 4.8 para el uso diario, y Sonic para nada. Hablando de Fable 5, los controles
00:03:11de exportación se levantaron, y ya está de vuelta para todos, sin importar tu ciudadanía, pero lamentablemente
00:03:15tuviste una semana para usar esto dentro de los límites de tu plan, o al menos el 50% de los límites de tu plan, y después del 7 de julio
00:03:20solo estará disponible a través de créditos de uso. Hubo algunos puntos interesantes en ese blog sobre
00:03:24la prohibición inicial. De hecho, provino de un supuesto “jailbreak” de un investigador de Amazon que logró
00:03:29inducirlo a encontrar vulnerabilidades de seguridad y, en un caso, demostró cómo explotar una,
00:03:33pero al investigar esto, Anthropic descubrió que muchos modelos como Claude Opus 4.8,
00:03:37GPT 5.5 y Kimi K 2.7 podían identificar exactamente la misma vulnerabilidad que Fable 5 en ese informe,
00:03:43y cuando se trató de una demostración de cómo explotar la única vulnerabilidad,
00:03:47todos y cada uno de los modelos probados podían hacerlo, incluidos Claude Haiku 4.5, Sonic 4.6, Opus 4.6,
00:03:524.7, 4.8, GPT 5.4, 5.5 y Kimi K 2.7. Así que me parece que la prohibición fue bastante inútil
00:03:58entonces, y todo lo que realmente han logrado es que Anthropic ahora ha hecho que esas salvaguardias sean aún
00:04:02más estrictas en Fable, haciendo que muchas más solicitudes normales sean bloqueadas, y en su anuncio
00:04:06en Twitter, de hecho dijeron que las tareas rutinarias como la depuración y la codificación recurrirían a Opus 4.8,
00:04:11pero un empleado de Anthropic corrigió esto más tarde diciendo que solo debería ser un pequeño número de ellas.
00:04:14Pero aparentemente ha impactado algunos puntos de referencia más que otros, con afirmaciones de que Fable ha sido ahora
00:04:18limitado. Básicamente, está recurriendo más a Opus 4.8, por lo que está funcionando mucho peor en estos
00:04:23puntos de referencia. Sobre un tema similar a los controles de exportación y las prohibiciones, algunas personas notaron que Claude
00:04:27Code ahora tiene algunos intentos de huellas dactilares de una manera muy sigilosa, al modificar su cadena
00:04:32de fecha en los mensajes del sistema. Esta es una gran publicación de blog que entra en todos los detalles, y dejaré esto
00:04:35vinculado a continuación, pero el resumen es que hay una función en Claude Code que verifica si tu zona horaria está en
00:04:40China. Si lo está, tu cadena de fecha cambiará de usar guiones a usar barras. Luego también
00:04:44verificará si tu URL basada en API coincide con esta lista, o si el nombre de host contiene palabras clave específicas de laboratorios de IA
00:04:49como DeepSeq, Minimax o ZAI, y si es así, cambiará el apóstrofo en “today's” a un carácter
00:04:55Unicode diferente que básicamente se ve exactamente igual. Es una técnica muy inteligente llamada esteganografía,
00:05:00y la mayoría de ustedes no se verán afectados por esto. Básicamente está destinado a intentar detectar esos revendedores
00:05:03de API, puertas de enlace no autorizadas de Claude Code y ataques de destilación de modelos. Realmente no tengo
00:05:08ningún problema con que intenten hacer eso, solo preferiría que fueran un poco más honestos sobre las cosas que
00:05:12están en Claude Code, y no intentaran ocultarlo de esta manera. ¿Crees que eso es un problema, y qué
00:05:16opinas de Sonic 5 y el regreso de Fable? Házmelo saber en los comentarios de abajo, o si ya estás suscrito,
00:05:20y como siempre, nos vemos en el próximo.