Claude Sonnet 5 es una decepción... (¡Pero Fable ha vuelto!)

BBetter Stack
컴퓨터/소프트웨어경제 뉴스AI/미래기술

스크립트

00:00:00Anthropic lanzó Claude Sonnet 5 la semana pasada y fue decepcionante, pero al menos Fable 5 ha vuelto,
00:00:04aunque quizás algo limitado, y oh, Claude Code podría tener código tipo “spyware” para detectar
00:00:09su uso en China. Vamos a entrar en materia. Empezaré con Sonnet 5. Esta es, de hecho, la primera actualización de Sonnet en cuatro
00:00:18meses y medio, y Anthropic dice que está diseñado para ser su modelo Sonnet más agente hasta la fecha,
00:00:22con un rendimiento cercano a Opus 4.8, pero a precios más bajos. El precio es un aspecto realmente interesante
00:00:28de este modelo, así que volveremos a ello. Primero, echemos un vistazo a los puntos de referencia
00:00:31que proporciona Anthropic. Supera a su predecesor en todos ellos, y se acerca a Opus en algunos
00:00:35como Terminal Bench y Computer Use, incluso superando ligeramente a Opus en trabajo de conocimiento. Prefiero mirar
00:00:40los puntos de referencia de terceros, y los que confío son los de Artificial Analysis, y en ese
00:00:44índice de codificación, queda unos puntos por detrás de Opus, pero ligeramente por delante de GPT 5.4. Ha dado un muy
00:00:50buen salto respecto a su predecesor, Sonnet 4.6. La misma historia ocurre en el índice de Inteligencia,
00:00:56situándose entre GPT 5.5 y GPT 5.4, pero curiosamente, en el índice agente, superó a GPT 5.5.
00:01:03Así que cuando dijeron en el blog que pusieron mucho trabajo en sus capacidades agentes,
00:01:06parece que ha dado sus frutos. Por los puntos de referencia, parece un modelo bastante competente,
00:01:10y es sin duda un paso adelante respecto a Sonnet 4.6, pero hablemos ahora de ese elemento del precio.
00:01:14En el precio de la API, están ofreciendo un descuento a 2 dólares por un millón de tokens de entrada,
00:01:18y 10 dólares por un millón de tokens de salida, hasta el 31 de agosto. Luego volverá al mismo
00:01:23precio que los otros modelos Sonnet, que era 3 dólares por un millón de tokens de entrada y 15 dólares por un millón de
00:01:28tokens de salida. Esto lo sitúa alrededor de Gemini 3.5 Flash y GPT 5.6 Terra, si alguna vez obtenemos acceso,
00:01:34y como dijeron, es más barato que Opus 4.8. El problema es que, en la práctica, esto simplemente
00:01:39no es cierto en absoluto. Este modelo consume muchísimos tokens. Usa alrededor de 69,000 tokens para ejecutar una tarea en el
00:01:45índice de Inteligencia de Artificial Analysis, lo que lo hace más que a Sonic 4.6, Opus 4.8, Fable 5, GPT 5.4
00:01:52y 5.5. Si lo miras en este cuadrante, donde el verde es el lugar donde estar, está lo más lejos posible
00:01:57de estos modelos. Esto obviamente tiene un efecto dominó en el costo real de una tarea,
00:02:02y Artificial Analysis descubrió que Sonic 5 resultó ser más caro que Opus 4.8 por tarea,
00:02:07solo superado por Fable. Además, si tomas un modelo como GPT 5.5, que de hecho obtiene mejores resultados en la mayoría de los
00:02:12puntos de referencia, es la mitad del precio de Sonic 5. Cabe señalar que Artificial Analysis
00:02:16está utilizando el precio estándar del modelo y no el descontado, así que tendría muchísima
00:02:20curiosidad por ver si Anthropic intenta arreglar esto extendiendo quizás ese descuento o simplemente dejando eso
00:02:25como precio permanente. Peor aún que el costo por tarea, Artificial Analysis descubrió que
00:02:29ejecutar todo su conjunto de pruebas con Sonic 5 costaba más que con Fable 5. ¿Qué ha pasado aquí? Incluso en
00:02:34Cursor Bench, si miras Sonic 5 High, tiene aproximadamente el mismo precio que Opus 4.8 para un resultado
00:02:39similar, y a medida que subes los niveles de esfuerzo, Sonic 5 Max obtiene peores puntuaciones que Opus 4.8 Extra High mientras
00:02:44cuesta más. Realmente parece que necesitan actualizar o arreglar algo aquí, o simplemente no veo
00:02:48dónde encaja este modelo. No es de ninguna manera un mal modelo en cuanto a capacidades, solo económicamente, y he
00:02:54sido un gran fan de los modelos Sonic. Creo que fueron los primeros que muchos de nosotros usamos a diario,
00:02:58pero en los últimos meses siempre he usado Opus 4.8, y nada de esto me ha hecho cambiar de opinión.
00:03:02Especialmente con el regreso de Fable, será Fable para las tareas difíciles,
00:03:05y Opus 4.8 para el uso diario, y Sonic para nada. Hablando de Fable 5, los controles
00:03:11de exportación se levantaron, y ya está de vuelta para todos, sin importar tu ciudadanía, pero lamentablemente
00:03:15tuviste una semana para usar esto dentro de los límites de tu plan, o al menos el 50% de los límites de tu plan, y después del 7 de julio
00:03:20solo estará disponible a través de créditos de uso. Hubo algunos puntos interesantes en ese blog sobre
00:03:24la prohibición inicial. De hecho, provino de un supuesto “jailbreak” de un investigador de Amazon que logró
00:03:29inducirlo a encontrar vulnerabilidades de seguridad y, en un caso, demostró cómo explotar una,
00:03:33pero al investigar esto, Anthropic descubrió que muchos modelos como Claude Opus 4.8,
00:03:37GPT 5.5 y Kimi K 2.7 podían identificar exactamente la misma vulnerabilidad que Fable 5 en ese informe,
00:03:43y cuando se trató de una demostración de cómo explotar la única vulnerabilidad,
00:03:47todos y cada uno de los modelos probados podían hacerlo, incluidos Claude Haiku 4.5, Sonic 4.6, Opus 4.6,
00:03:524.7, 4.8, GPT 5.4, 5.5 y Kimi K 2.7. Así que me parece que la prohibición fue bastante inútil
00:03:58entonces, y todo lo que realmente han logrado es que Anthropic ahora ha hecho que esas salvaguardias sean aún
00:04:02más estrictas en Fable, haciendo que muchas más solicitudes normales sean bloqueadas, y en su anuncio
00:04:06en Twitter, de hecho dijeron que las tareas rutinarias como la depuración y la codificación recurrirían a Opus 4.8,
00:04:11pero un empleado de Anthropic corrigió esto más tarde diciendo que solo debería ser un pequeño número de ellas.
00:04:14Pero aparentemente ha impactado algunos puntos de referencia más que otros, con afirmaciones de que Fable ha sido ahora
00:04:18limitado. Básicamente, está recurriendo más a Opus 4.8, por lo que está funcionando mucho peor en estos
00:04:23puntos de referencia. Sobre un tema similar a los controles de exportación y las prohibiciones, algunas personas notaron que Claude
00:04:27Code ahora tiene algunos intentos de huellas dactilares de una manera muy sigilosa, al modificar su cadena
00:04:32de fecha en los mensajes del sistema. Esta es una gran publicación de blog que entra en todos los detalles, y dejaré esto
00:04:35vinculado a continuación, pero el resumen es que hay una función en Claude Code que verifica si tu zona horaria está en
00:04:40China. Si lo está, tu cadena de fecha cambiará de usar guiones a usar barras. Luego también
00:04:44verificará si tu URL basada en API coincide con esta lista, o si el nombre de host contiene palabras clave específicas de laboratorios de IA
00:04:49como DeepSeq, Minimax o ZAI, y si es así, cambiará el apóstrofo en “today's” a un carácter
00:04:55Unicode diferente que básicamente se ve exactamente igual. Es una técnica muy inteligente llamada esteganografía,
00:05:00y la mayoría de ustedes no se verán afectados por esto. Básicamente está destinado a intentar detectar esos revendedores
00:05:03de API, puertas de enlace no autorizadas de Claude Code y ataques de destilación de modelos. Realmente no tengo
00:05:08ningún problema con que intenten hacer eso, solo preferiría que fueran un poco más honestos sobre las cosas que
00:05:12están en Claude Code, y no intentaran ocultarlo de esta manera. ¿Crees que eso es un problema, y qué
00:05:16opinas de Sonic 5 y el regreso de Fable? Házmelo saber en los comentarios de abajo, o si ya estás suscrito,
00:05:20y como siempre, nos vemos en el próximo.

핵심 요약

Aunque Sonnet 5 ofrece capacidades agentes mejoradas, su ineficiencia en el consumo de tokens y su elevado costo operativo lo hacen menos competitivo que Opus 4.8 para tareas diarias.

하이라이트

  • Claude Sonnet 5 presenta un alto consumo de tokens, utilizando cerca de 69,000 por tarea, lo que eleva su costo por encima de Opus 4.8.

  • El costo de la API de Sonnet 5, tras finalizar el descuento el 31 de agosto, será de 3 dólares por millón de tokens de entrada y 15 dólares por millón de salida.

  • Fable 5 vuelve a estar disponible para todos los usuarios sin restricciones de ciudadanía, aunque su uso quedará limitado a créditos tras el 7 de julio.

  • Las salvaguardias en Fable 5 se han vuelto más estrictas, lo que provoca que una mayor cantidad de solicitudes de codificación y depuración rutinarias sean bloqueadas.

  • Claude Code emplea técnicas de esteganografía para detectar usos no autorizados y revendedores de API en China, modificando caracteres en los mensajes del sistema según la zona horaria.

타임라인

Evaluación de rendimiento y costos de Claude Sonnet 5

  • Sonnet 5 supera a su predecesor en puntos de referencia de codificación y trabajo de conocimiento.
  • El modelo consume significativamente más tokens por tarea que sus competidores directos, incluyendo a Opus 4.8 y GPT 5.5.
  • El costo operativo de Sonnet 5 supera al de Opus 4.8 por tarea realizada debido a su ineficiencia en el consumo de tokens.

Anthropic posiciona a Sonnet 5 como un modelo con capacidades agentes avanzadas. Sin embargo, los datos de Artificial Analysis muestran que el modelo es ineficiente en el uso de recursos. A pesar de los descuentos promocionales, el costo final resulta superior al de modelos más capaces, situando a Sonnet 5 en una posición económica poco atractiva para usuarios frecuentes.

Retorno y restricciones de Fable 5

  • Fable 5 está nuevamente disponible sin restricciones de ciudadanía.
  • La prohibición inicial de Fable fue motivada por la detección de vulnerabilidades que también pudieron ser identificadas por otros modelos como Opus 4.8 y GPT 5.5.
  • Las nuevas salvaguardias bloquean rutinariamente tareas de codificación, obligando a derivar cargas de trabajo hacia Opus 4.8.

El regreso de Fable 5 viene acompañado de controles más estrictos tras una controversia por seguridad. La investigación reveló que la capacidad de identificar vulnerabilidades era común a múltiples modelos del mercado, haciendo que la restricción inicial fuera ineficaz. Ahora, las restricciones aplicadas han degradado la experiencia de usuario en tareas cotidianas de programación.

Detección de uso en Claude Code

  • Claude Code utiliza esteganografía para identificar el origen geográfico de las conexiones.
  • El sistema modifica caracteres Unicode específicos cuando detecta que la API se ejecuta en China o mediante laboratorios de IA prohibidos.
  • Estas medidas buscan identificar revendedores y prevenir ataques de destilación de modelos sin transparencia explicita.

Se ha identificado un mecanismo oculto en Claude Code que altera la estructura de los mensajes del sistema para marcar el origen del usuario. El software verifica la zona horaria y el nombre de host para aplicar cambios sutiles en la sintaxis, permitiendo a Anthropic identificar el uso no autorizado de su API de forma sigilosa.

커뮤니티 글

모든 글 보기