스크립트
00:00:00Anthropic acaba de lanzar Sonnet 5, así que veamos todo lo que necesitas saber sobre él.
00:00:04Empecemos con los puntos de referencia. Y recuerda, Sonnet 5 es un modelo menos potente,
00:00:08menos costoso que otros como Opus y definitivamente Fable. No habíamos tenido una actualización aquí
00:00:13desde la 4.6. Ahora, comparando la 5 con la 4.6, vemos que es un gran salto adelante en cuanto a codificación agentica,
00:00:21razonamiento multidisciplinario, uso de computadora y trabajo de conocimiento. Así que es una mejora directa en
00:00:26todos los aspectos. Ahora, cuando lo comparamos con Opus 4.8, la pregunta no es, ¿está cerca? Es, ¿cuánta
00:00:32caída tenemos? Y sinceramente, no es tanta caída. De hecho, cuenta con mejores números
00:00:39cuando vemos el trabajo de conocimiento, lo cual es increíble. El uso de computadora está solo un 2% por detrás, y solo
00:00:44un 2% detrás en codificación agentica, y solo un par de puntos porcentuales detrás en razonamiento
00:00:49multidisciplinario. La mayor brecha está aquí con Sweebench Pro, donde vemos 63 frente a 69%.
00:00:56Pero bueno, Terminal Bench 2.1, 80 frente a 82. Así que no es mucha diferencia. Y esta discusión
00:01:03sobre el rendimiento tiene que hacerse en el contexto del precio. Recuerden, Fable 5, Mythos 5,
00:01:08estamos viendo 10 dólares por millón de tokens de entrada, que es el doble que Opus. Opus cuesta 5 dólares por millón de tokens de entrada.
00:01:16Y para la salida, son 25 dólares. Así que 5, 25. Para Sonnet 5, estamos viendo 2 dólares. Así que solo el 40% del costo de
00:01:26Opus en tokens de entrada. Y para la salida, son 10 dólares. Así que es significativamente más barato, menos de la mitad del costo de
00:01:34Opus. Sin embargo, cuando miramos los números, está bastante cerca. Así que esta es una gran noticia si eres alguien que
00:01:40no está haciendo tareas de vanguardia con IA, sino tareas más rutinarias, y
00:01:46aún quieres potencia, bueno, Sonnet 5 ahora está cubriendo esa brecha. Ahora veamos estos gráficos que van
00:01:51más allá de los simples puntos de referencia. Aquí vemos el rendimiento de búsqueda agentica por nivel de esfuerzo, comparando
00:01:55Opus 4.8 con Sonnet 5 y Sonnet 4.6. Entonces, de entrada, creo que notarán aquí, Sonnet 5, hay una gran
00:02:04brecha en las tasas de éxito a medida que avanzamos entre los niveles de esfuerzo. Entonces, en bajo, hace un 55%. Pero si vemos
00:02:13bajo en Sonnet 4.6, bajo en Sonnet 4.6 en realidad funciona mejor. Sin embargo, en términos de costo, es mucho menor.
00:02:19Pasamos al medio, esencialmente obtenemos el mismo rendimiento que vimos con Sonnet 4.6,
00:02:25pero con un descuento significativo. Y es solo hasta que pasamos a niveles de esfuerzo alto, donde comenzamos a superar
00:02:34a Sonnet 4.6. Pero en ese punto, estamos obteniendo un mejor rendimiento que Sonnet 4.6, pero a un costo que
00:02:41habría estado en el nivel de esfuerzo bajo para Sonnet 4.6. Así que este tipo de distinción de nivel de esfuerzo,
00:02:49creo que es muy importante porque no es solo, oye, Sonnet 5 es mejor en todos los ámbitos, donde bajo
00:02:53en 5 es necesariamente mejor que bajo en 4.6. Bajo en Sonnet 5 realmente solo significa que va a ser súper
00:02:59barato. Pero en términos de obtener un rendimiento de nivel superior, lo que hemos visto en el pasado,
00:03:03probablemente necesitemos hacer algo que esté en el rango alto. Dicho esto, cuando estamos en el rango
00:03:08alto con Sonnet 5, prácticamente estamos pagando lo mismo que pagaríamos con Opus. Opus en medio
00:03:14y alto cuesta lo mismo que Sonnet en alto, pero estamos obteniendo una mejor tasa de éxito. Así que esto
00:03:21aporta muchos matices a esta discusión. ¿Necesitamos usar Sonnet 5 frente a Opus 4.5 y cosas como
00:03:27búsqueda agentica? Creo que realmente depende. Si es un problema más complejo, al final, Opus 4.8 puede ser
00:03:33más barato simplemente porque es muy eficiente en tokens y Sonnet simplemente no es lo adecuado para el trabajo.
00:03:38Sin embargo, cuando hacemos tareas que simplemente no son tan desafiantes para estos modelos de IA, entonces quizás
00:03:44no tiene sentido usar Opus 4.8 en absoluto. Ahí es cuando traemos a Sonnet 5. Así que creo que este
00:03:49es un lugar interesante en el que estamos ahora, donde es una especie de caso por caso sobre qué modelo
00:03:54deberías usar. Ahora, aquí hay otro interesante cuando vemos el uso de computadora agentica. Ahora, en general,
00:03:58en su mayor parte, Sonnet 5 está superando a Sonnet 4.6 y lo hace a un costo bastante bajo. Así que
00:04:05en búsqueda agentica, definitivamente ese no era el caso, pero en uso de computadora agentica, de repente,
00:04:09siempre usaríamos Sonnet 5 sobre 4.6. Y de nuevo, esto vuelve a la idea de que ahora es un caso por caso
00:04:14sobre qué modelo deberías usar. Curiosamente, sin embargo, mira a Opus. Opus High funciona
00:04:20mejor que el Sonnet 5 máximo y es más barato. Entonces, quiero decir, miras esto y piensas,
00:04:26wow, Opus es en realidad bastante eficiente para lo que hace. Sin mencionar que alcanza estos niveles más altos
00:04:30que Sonnet simplemente no puede alcanzar. Así que cosas para pensar, honestamente, solo porque el costo por millón
00:04:36de tokens es más barato con Opus, habrá muchos casos donde Opus sea todavía la mejor opción. Ahora, quiero hacer
00:04:41un lanzamiento de modelo de Anthropic sin hablar de comportamiento desalineado. Podemos ver que es una mejora
00:04:45con Sonnet 5, pero aún por debajo de lo que esperaríamos con Opus 4.8 y Mythos Preview. Y en términos de
00:04:50explotaciones y toda esta cuestión de ciberseguridad que dejó a Mythos prácticamente bloqueado, eso no es
00:04:55un problema o algo por lo que debas preocuparte con la clase Sonnet. Así que, en general, no le prestaría demasiada
00:04:59atención a estos puntos de referencia, para ser honesto. Estos tipos de puntos de referencia, estos tipos de gráficos me dan mucho
00:05:05más que pensar, porque la pregunta no creo que sea Sonnet 5 frente a 4.6. Prácticamente siempre vamos a
00:05:11usar Sonnet 5. Es Sonnet 5 frente a Opus 4.8. Y la pregunta es, ¿es Opus realmente más barato? Y
00:05:18me encantaría ver más pruebas y más material por parte de Anthropic que explique aquí esa especie de
00:05:24línea divisoria entre, okay, Sonnet 5 puede hacerlo bien en esto y es más barato que
00:05:29Opus frente a, oye, esto es ahora una tarea más complicada. Opus será en realidad más eficiente que
00:05:34Sonnet para completar esto. Así que cosas para pensar, definitivamente algo bueno de tener. Creo que en general
00:05:40las tareas de nivel inferior es que Sonnet será una bendición porque para aquellos de nosotros que usamos tokens de API para, ya sabes,
00:05:46nuestras aplicaciones o cosas que no están en el ecosistema del plan Claude Max, es bastante difícil usar
00:05:51Anthropic. Es simplemente demasiado caro. Y le he estado diciendo a la gente durante mucho tiempo, como, solo vayan a mirar
00:05:55OpenAI, ya sabes, mira algunos de sus modelos mini porque eso es a menudo más que suficiente para muchos
00:05:59de los trabajos de la gente. Bueno, ahora tenemos una opción de nivel medio con Anthropic, lo cual es agradable
00:06:05de tener. Así que hasta aquí los voy a dejar hoy. Esto está disponible en todas partes. Creo
00:06:09que será mucho de prueba y error descubrir dónde tiene más sentido esto. Así que déjenme saber
00:06:13lo que pensaron. Asegúrense de revisar Chase AI Plus si quieren tener en sus manos mi
00:06:17Claude Code Masterclass y los veré por ahí.