Sonnet 3.5 ya está disponible y compite con Opus

CChase AI
Computing/SoftwareSmall Business/StartupsManagement

Transcript

00:00:00Anthropic acaba de lanzar Sonnet 5, así que veamos todo lo que necesitas saber sobre él.
00:00:04Empecemos con los puntos de referencia. Y recuerda, Sonnet 5 es un modelo menos potente,
00:00:08menos costoso que otros como Opus y definitivamente Fable. No habíamos tenido una actualización aquí
00:00:13desde la 4.6. Ahora, comparando la 5 con la 4.6, vemos que es un gran salto adelante en cuanto a codificación agentica,
00:00:21razonamiento multidisciplinario, uso de computadora y trabajo de conocimiento. Así que es una mejora directa en
00:00:26todos los aspectos. Ahora, cuando lo comparamos con Opus 4.8, la pregunta no es, ¿está cerca? Es, ¿cuánta
00:00:32caída tenemos? Y sinceramente, no es tanta caída. De hecho, cuenta con mejores números
00:00:39cuando vemos el trabajo de conocimiento, lo cual es increíble. El uso de computadora está solo un 2% por detrás, y solo
00:00:44un 2% detrás en codificación agentica, y solo un par de puntos porcentuales detrás en razonamiento
00:00:49multidisciplinario. La mayor brecha está aquí con Sweebench Pro, donde vemos 63 frente a 69%.
00:00:56Pero bueno, Terminal Bench 2.1, 80 frente a 82. Así que no es mucha diferencia. Y esta discusión
00:01:03sobre el rendimiento tiene que hacerse en el contexto del precio. Recuerden, Fable 5, Mythos 5,
00:01:08estamos viendo 10 dólares por millón de tokens de entrada, que es el doble que Opus. Opus cuesta 5 dólares por millón de tokens de entrada.
00:01:16Y para la salida, son 25 dólares. Así que 5, 25. Para Sonnet 5, estamos viendo 2 dólares. Así que solo el 40% del costo de
00:01:26Opus en tokens de entrada. Y para la salida, son 10 dólares. Así que es significativamente más barato, menos de la mitad del costo de
00:01:34Opus. Sin embargo, cuando miramos los números, está bastante cerca. Así que esta es una gran noticia si eres alguien que
00:01:40no está haciendo tareas de vanguardia con IA, sino tareas más rutinarias, y
00:01:46aún quieres potencia, bueno, Sonnet 5 ahora está cubriendo esa brecha. Ahora veamos estos gráficos que van
00:01:51más allá de los simples puntos de referencia. Aquí vemos el rendimiento de búsqueda agentica por nivel de esfuerzo, comparando
00:01:55Opus 4.8 con Sonnet 5 y Sonnet 4.6. Entonces, de entrada, creo que notarán aquí, Sonnet 5, hay una gran
00:02:04brecha en las tasas de éxito a medida que avanzamos entre los niveles de esfuerzo. Entonces, en bajo, hace un 55%. Pero si vemos
00:02:13bajo en Sonnet 4.6, bajo en Sonnet 4.6 en realidad funciona mejor. Sin embargo, en términos de costo, es mucho menor.
00:02:19Pasamos al medio, esencialmente obtenemos el mismo rendimiento que vimos con Sonnet 4.6,
00:02:25pero con un descuento significativo. Y es solo hasta que pasamos a niveles de esfuerzo alto, donde comenzamos a superar
00:02:34a Sonnet 4.6. Pero en ese punto, estamos obteniendo un mejor rendimiento que Sonnet 4.6, pero a un costo que
00:02:41habría estado en el nivel de esfuerzo bajo para Sonnet 4.6. Así que este tipo de distinción de nivel de esfuerzo,
00:02:49creo que es muy importante porque no es solo, oye, Sonnet 5 es mejor en todos los ámbitos, donde bajo
00:02:53en 5 es necesariamente mejor que bajo en 4.6. Bajo en Sonnet 5 realmente solo significa que va a ser súper
00:02:59barato. Pero en términos de obtener un rendimiento de nivel superior, lo que hemos visto en el pasado,
00:03:03probablemente necesitemos hacer algo que esté en el rango alto. Dicho esto, cuando estamos en el rango
00:03:08alto con Sonnet 5, prácticamente estamos pagando lo mismo que pagaríamos con Opus. Opus en medio
00:03:14y alto cuesta lo mismo que Sonnet en alto, pero estamos obteniendo una mejor tasa de éxito. Así que esto
00:03:21aporta muchos matices a esta discusión. ¿Necesitamos usar Sonnet 5 frente a Opus 4.5 y cosas como
00:03:27búsqueda agentica? Creo que realmente depende. Si es un problema más complejo, al final, Opus 4.8 puede ser
00:03:33más barato simplemente porque es muy eficiente en tokens y Sonnet simplemente no es lo adecuado para el trabajo.
00:03:38Sin embargo, cuando hacemos tareas que simplemente no son tan desafiantes para estos modelos de IA, entonces quizás
00:03:44no tiene sentido usar Opus 4.8 en absoluto. Ahí es cuando traemos a Sonnet 5. Así que creo que este
00:03:49es un lugar interesante en el que estamos ahora, donde es una especie de caso por caso sobre qué modelo
00:03:54deberías usar. Ahora, aquí hay otro interesante cuando vemos el uso de computadora agentica. Ahora, en general,
00:03:58en su mayor parte, Sonnet 5 está superando a Sonnet 4.6 y lo hace a un costo bastante bajo. Así que
00:04:05en búsqueda agentica, definitivamente ese no era el caso, pero en uso de computadora agentica, de repente,
00:04:09siempre usaríamos Sonnet 5 sobre 4.6. Y de nuevo, esto vuelve a la idea de que ahora es un caso por caso
00:04:14sobre qué modelo deberías usar. Curiosamente, sin embargo, mira a Opus. Opus High funciona
00:04:20mejor que el Sonnet 5 máximo y es más barato. Entonces, quiero decir, miras esto y piensas,
00:04:26wow, Opus es en realidad bastante eficiente para lo que hace. Sin mencionar que alcanza estos niveles más altos
00:04:30que Sonnet simplemente no puede alcanzar. Así que cosas para pensar, honestamente, solo porque el costo por millón
00:04:36de tokens es más barato con Opus, habrá muchos casos donde Opus sea todavía la mejor opción. Ahora, quiero hacer
00:04:41un lanzamiento de modelo de Anthropic sin hablar de comportamiento desalineado. Podemos ver que es una mejora
00:04:45con Sonnet 5, pero aún por debajo de lo que esperaríamos con Opus 4.8 y Mythos Preview. Y en términos de
00:04:50explotaciones y toda esta cuestión de ciberseguridad que dejó a Mythos prácticamente bloqueado, eso no es
00:04:55un problema o algo por lo que debas preocuparte con la clase Sonnet. Así que, en general, no le prestaría demasiada
00:04:59atención a estos puntos de referencia, para ser honesto. Estos tipos de puntos de referencia, estos tipos de gráficos me dan mucho
00:05:05más que pensar, porque la pregunta no creo que sea Sonnet 5 frente a 4.6. Prácticamente siempre vamos a
00:05:11usar Sonnet 5. Es Sonnet 5 frente a Opus 4.8. Y la pregunta es, ¿es Opus realmente más barato? Y
00:05:18me encantaría ver más pruebas y más material por parte de Anthropic que explique aquí esa especie de
00:05:24línea divisoria entre, okay, Sonnet 5 puede hacerlo bien en esto y es más barato que
00:05:29Opus frente a, oye, esto es ahora una tarea más complicada. Opus será en realidad más eficiente que
00:05:34Sonnet para completar esto. Así que cosas para pensar, definitivamente algo bueno de tener. Creo que en general
00:05:40las tareas de nivel inferior es que Sonnet será una bendición porque para aquellos de nosotros que usamos tokens de API para, ya sabes,
00:05:46nuestras aplicaciones o cosas que no están en el ecosistema del plan Claude Max, es bastante difícil usar
00:05:51Anthropic. Es simplemente demasiado caro. Y le he estado diciendo a la gente durante mucho tiempo, como, solo vayan a mirar
00:05:55OpenAI, ya sabes, mira algunos de sus modelos mini porque eso es a menudo más que suficiente para muchos
00:05:59de los trabajos de la gente. Bueno, ahora tenemos una opción de nivel medio con Anthropic, lo cual es agradable
00:06:05de tener. Así que hasta aquí los voy a dejar hoy. Esto está disponible en todas partes. Creo
00:06:09que será mucho de prueba y error descubrir dónde tiene más sentido esto. Así que déjenme saber
00:06:13lo que pensaron. Asegúrense de revisar Chase AI Plus si quieren tener en sus manos mi
00:06:17Claude Code Masterclass y los veré por ahí.

Key Takeaway

Sonnet 5 ofrece una alternativa de costo significativamente reducido frente a Opus 4.8 para tareas rutinarias, aunque Opus 4.8 permanece como la opción más eficiente y potente para problemas de alta complejidad.

Highlights

  • Sonnet 5 cuesta 2 dólares por millón de tokens de entrada y 10 dólares por millón de tokens de salida, lo que representa el 40% del costo de entrada de Opus 4.8.

  • Sonnet 5 supera a Sonnet 4.6 en tareas de codificación agéntica, razonamiento multidisciplinario y uso de computadora.

  • Opus 4.8 mantiene una ventaja en tareas de alta complejidad, superando a Sonnet 5 en tasas de éxito cuando se utilizan niveles de esfuerzo alto.

  • Para el uso de computadora agéntica, Sonnet 5 es preferible sobre Sonnet 4.6 debido a su mejor rendimiento y menor costo operativo.

  • La elección entre Sonnet 5 y Opus 4.8 depende del nivel de complejidad de la tarea, ya que Opus puede resultar más eficiente económicamente en problemas altamente desafiantes.

Timeline

Comparativa de rendimiento y costos entre modelos

  • Sonnet 5 mejora el razonamiento y la codificación agéntica respecto a la versión 4.6.
  • Los costos de API de Sonnet 5 son menos de la mitad que los de Opus 4.8.
  • La diferencia en métricas como Terminal Bench 2.1 es marginal entre ambos modelos.

El lanzamiento de Sonnet 5 marca una actualización enfocada en la eficiencia. Mientras Opus 4.8 cuesta 5 dólares por millón de tokens de entrada y 25 dólares de salida, Sonnet 5 reduce estos costos a 2 dólares y 10 dólares respectivamente. A pesar de ser un modelo de menor potencia, su desempeño en tareas de conocimiento se sitúa muy cerca de Opus, con diferencias mínimas en razonamiento multidisciplinario.

Análisis de niveles de esfuerzo y búsqueda agéntica

  • Sonnet 5 funciona mejor en términos de costos en niveles de esfuerzo bajos.
  • El rendimiento superior de Opus 4.8 se manifiesta en tareas de alta complejidad donde se requiere mayor éxito.
  • La selección del modelo depende de la dificultad específica de la tarea asignada.

Los gráficos de rendimiento muestran que Sonnet 5 no supera sistemáticamente a la versión 4.6 en todos los escenarios; es más eficiente en costos para tareas de nivel bajo. Al alcanzar niveles de esfuerzo altos, los costos se equiparan con los de Opus 4.8, pero Opus ofrece una tasa de éxito mayor. Por ello, la elección entre ambos modelos debe evaluarse caso por caso para determinar cuál maximiza la eficiencia.

Uso de computadora y aplicaciones prácticas

  • Sonnet 5 es preferible para el uso de computadora agéntica sobre la versión 4.6.
  • Opus 4.8 demuestra mayor eficiencia en tareas que superan las capacidades máximas de Sonnet 5.
  • Sonnet 5 permite integrar modelos de Anthropic en aplicaciones mediante API sin los costos prohibitivos de Opus.

En el uso de computadora agéntica, Sonnet 5 supera claramente a su predecesor manteniendo un costo bajo. Anthropic proporciona con este modelo una opción intermedia para desarrolladores que necesitan potencia sin el gasto elevado de Opus. Aunque persisten diferencias en el comportamiento de los modelos, el uso de Sonnet 5 resulta especialmente beneficioso para tareas de nivel inferior donde la optimización del presupuesto es prioritaria.

Community Posts

View all posts