¡Opus 5 ya está aquí y es ¿MEJOR QUE FABLE?!

CChase AI
컴퓨터/소프트웨어경제 뉴스AI/미래기술

Transcript

00:00:00Claude Opus 5 acaba de salir, y Anthropic afirma que ahora tenemos un modelo que está logrando
00:00:04resultados cercanos a Fable 5 a la mitad del costo. Así que echemos un vistazo a lo que nos ofrecen.
00:00:09Echemos un vistazo a algunas de las pruebas de rendimiento, y de entrada, hay cifras increíbles. Vemos que
00:00:14supera a Fable 5 y deja muy atrás a Opus 4.8 en varias de estas pruebas, específicamente
00:00:20en programación en terminal basada en agentes, trabajo de conocimiento y búsqueda con agentes. Además, supera a modelos como GPT-5.6
00:00:27también en estas categorías. Las únicas áreas donde Opus 5 rinde peor que Fable 5 son
00:00:33razonamiento multidisciplinario, y no por mucho. De hecho, lo supera cuando usa herramientas, así como en
00:00:39derecho y salud. Pero en todos los demás aspectos, supera a su modelo superior. Y si esas cifras son
00:00:46creíbles, es una locura. Justo aquí dice que en Cursor Bench 3.2 a máximo esfuerzo, el modelo rindió
00:00:51a un 0.5% de la puntuación máxima de Fable 5, pero a la mitad del costo por tarea. Increíble. Y se puede ver justo
00:00:57aquí. Tenemos a Opus 5 en rojo, a Fable 5 en naranja, y abajo en azul está Opus 4.8.
00:01:03Así que sí, con el esfuerzo al máximo, Fable 5 toma la delantera, pero la mayoría de la gente no opera
00:01:08al máximo. Trabajan en nivel alto o extra alto. Y cuando vemos los niveles extra alto y alto
00:01:13en comparación con Fable, obtenemos prácticamente los mismos resultados con Opus 5, pero de nuevo, a como
00:01:17la mitad del costo. Y en algunas de las otras pruebas, como el índice de agentes de código de Artificial Analysis,
00:01:23Opus 5 supera directamente a Fable 5. Y lo mismo con el Frontier Bench. Básicamente,
00:01:27está aplastando a Fable y es más barato. Ahora echemos un vistazo a algunas tareas
00:01:32de trabajo de conocimiento y resolución de problemas. Y de nuevo, creo que lo más asombroso no es solo toda esta
00:01:37dinámica entre Fable 5 y Opus 5. Es el salto de Opus 4.8 a Opus 5. Todo esto
00:01:43en general es un avance enorme, masivo. Y de nuevo, si esto fuera algo como lo de Sonnet
00:01:495, donde vimos que funcionaba mejor que el modelo anterior, pero resultaba prohibidamente
00:01:53costoso porque Sonnet 5 es de alguna manera el modelo más caro del mercado cuando lo analizas
00:01:57por tarea, ese no es el caso aquí. Opus parece ser extremadamente eficiente en uso de tokens en comparación con estos
00:02:03otros dos modelos. Y de nuevo, el hecho de que realmente supere a Fable 5, de verdad no me lo
00:02:07puedo creer. Otra mejora interesante es el resultado visual. Aquí hay una muestra de Opus 5 haciendo
00:02:13un trabajo de túnel de viento. Y de este lado, lo tenemos construyendo un elemento interactivo en 3D
00:02:19de una célula animal. Ahora, una de las desventajas de Claude es que no puede crear sus propias imágenes y eso. Así que
00:02:24que pueda desenvolverse mejor con este tipo de gráficos SVG en 3D, casi como gráficos HTML, es algo enorme.
00:02:31Otra gran mejora es que Anthropic dice que es mucho más sólido verificando su trabajo
00:02:35e iterando cuidadosamente hasta tener éxito. ¿Qué significa esto? Significa que cuando usamos Opus 5
00:02:40en tareas con agentes de largo alcance, cosas que no son de una sola ejecución, son como bucles, ¿cierto? Es
00:02:45como, ya sabes, todo este tema de ingeniería de grafos del que habla la gente. Cualquier cosa que requiera
00:02:49que Claude básicamente revise su trabajo en función de algún objetivo que le asignemos y siga haciendo eso una
00:02:53y otra vez. Bueno, Opus 5 es mucho mejor que Opus 4.8 en ese sentido. Y un ejemplo
00:02:58interesante aquí es que a Opus 5 se le dio el dibujo de una pieza mecánica y se le pidió escribir código para recrearla como un
00:03:03modelo 3D en FreeCAD. Pero al modelo no se le dio ninguna forma de ver realmente el dibujo. Así que, ya sabes,
00:03:09se le indicó alcanzar esa meta. No se le dijo específicamente cómo hacerlo. Así que se adelantó y
00:03:14escribió su propio pipeline de visión por computadora para extraer la geometría a partir de píxeles puros y luego reconstruyó
00:03:19toda la pieza mecánica. De nuevo, cualquier cosa de largo alcance que tenga una guía o meta fija,
00:03:25Opus 5 es mucho mejor que el 4.8 completándola. En cuanto a comportamientos no alineados,
00:03:29también está un paso por encima de todos estos modelos anteriores. Cuanto más bajo sea, mejor aquí. Y vemos un enorme incremento en su capacidad
00:03:35de Opus 4.8 a esta para hallar vulnerabilidades y exploits en código de fuente abierta. Ahora, lo otro genial son las
00:03:40salvaguardas. Este no es el escenario de Fable, donde si mencionas algo sobre ciberseguridad o biología,
00:03:45se va a bloquear. Esas restricciones son mucho menos estrictas con Opus 5 en comparación con Fable 5.
00:03:50Ahora, aunque todavía hay algunos clasificadores integrados, afirman que es un 85% menos probable que se
00:03:56activen en comparación con Fable. Por último, lo más relevante es el costo. Como dije, es la mitad del precio de Fable.
00:04:01Hablamos de $5 por millón de tokens de entrada y $25 por millón de salida. Y como vimos en las pruebas
00:04:07de los gráficos, este es un modelo relativamente eficiente en el uso de tokens. Así que estoy muy entusiasmado de probar este
00:04:12porque si las cifras son ciertas, casi que tenemos un Fable mejor a la mitad del costo.

Key Takeaway

Claude Opus 5 ofrece un rendimiento equivalente o superior a Fable 5 en tareas de programación, agentes de código y búsqueda a la mitad del costo por tarea.

Highlights

  • Claude Opus 5 cuesta $5 por millón de tokens de entrada y $25 por millón de tokens de salida, exactamente la mitad del costo de Fable 5.

  • En Cursor Bench 3.2 con esfuerzo máximo, Opus 5 logra un rendimiento dentro del 0.5% de la puntuación máxima de Fable 5.

  • Las salvaguardas de Opus 5 activan un 85% menos de falsos bloqueos que Fable 5 en consultas sobre ciberseguridad o biología.

  • El modelo supera a Fable 5 en pruebas de referencia como el índice de agentes de código de Artificial Analysis y Frontier Bench.

  • Opus 5 escribió de forma autónoma su propio sistema de visión por computadora para extraer geometría a partir de píxeles y recrear un modelo 3D en FreeCAD sin recibir la imagen de entrada.

Timeline

Rendimiento y costos frente a Fable 5 y Opus 4.8

  • Opus 5 supera a Opus 4.8 y a GPT-5.6 en programación en terminal basada en agentes, trabajo de conocimiento y búsqueda autónoma.
  • Fable 5 solo supera a Opus 5 en razonamiento multidisciplinario, derecho y salud cuando no se utilizan herramientas externas.
  • En los niveles de esfuerzo alto y extra alto, Opus 5 iguala los resultados de Fable 5 reduciendo el gasto a la mitad.

Las pruebas de referencia sitúan a Opus 5 muy por encima de la versión 4.8 previa. En Cursor Bench 3.2, la brecha frente a Fable 5 es de apenas 0.5% bajo esfuerzo máximo, mientras que en los modos de uso convencionales el rendimiento es equivalente. Adicionalmente, el modelo lidera las métricas del índice de agentes de código de Artificial Analysis y Frontier Bench.

Eficiencia en tokens e integración de gráficos 3D

  • Opus 5 consume tokens de manera más eficiente que Sonnet 5 y Fable 5, evitando costos prohibitivos por tarea.
  • El modelo genera elementos interactivos en 3D y gráficos SVG avanzados directamente mediante HTML.
  • La capacidad gráfica integrada compensa la ausencia de generación nativa de imágenes ráster en Claude.

A diferencia de Sonnet 5, que resulta costoso debido al elevado consumo de tokens por tarea, Opus 5 optimiza el uso de contexto. Muestra de ello es su capacidad para renderizar simulaciones como un túnel de viento o una célula animal en 3D interactivo mediante código web.

Verificación autónoma y tareas de largo alcance

  • Opus 5 ejecuta bucles de verificación e iteración de forma autónoma hasta cumplir objetivos complejos.
  • Un pipeline de visión por computadora creado por el propio modelo extrajo geometría directamente desde píxeles puros para reconstruir una pieza mecánica en FreeCAD.
  • El rendimiento en ingeniería de grafos y ejecución de agentes de largo alcance supera ampliamente al de Opus 4.8.

El modelo muestra mejoras drásticas en tareas iterativas sin supervisión paso a paso. Ante la orden de recrear un plano mecánico en FreeCAD sin acceso visual directo al archivo de entrada, Opus 5 programó su propio sistema de procesamiento de imágenes para analizar la fuente y completar la reconstrucción.

Seguridad, detección de vulnerabilidades y precios

  • Opus 5 detecta un mayor volumen de vulnerabilidades y exploits en código fuente abierto que los modelos anteriores.
  • Los clasificadores de seguridad son un 85% menos propensos a bloquear respuestas legítimas sobre ciberseguridad o biología en comparación con Fable 5.
  • El precio oficial es de $5 por millón de tokens de entrada y $25 por millón de tokens de salida.

Anthropic redujo la rigidez de las barreras de protección para prevenir bloqueos accidentales durante investigaciones de seguridad o ciencia. El modelo combina una mayor habilidad para auditorías de código con una estructura de tarifas fijada exactamente al 50% de los valores de Fable 5.

Community Posts

View all posts