¡Opus 5 ya está aquí y es ¿MEJOR QUE FABLE?!
CChase AI
Computing/SoftwareBusiness NewsInternet Technology
Transcript
00:00:00Claude Opus 5 acaba de salir, y Anthropic afirma que ahora tenemos un modelo que está logrando
00:00:04resultados cercanos a Fable 5 a la mitad del costo. Así que echemos un vistazo a lo que nos ofrecen.
00:00:09Echemos un vistazo a algunas de las pruebas de rendimiento, y de entrada, hay cifras increíbles. Vemos que
00:00:14supera a Fable 5 y deja muy atrás a Opus 4.8 en varias de estas pruebas, específicamente
00:00:20en programación en terminal basada en agentes, trabajo de conocimiento y búsqueda con agentes. Además, supera a modelos como GPT-5.6
00:00:27también en estas categorías. Las únicas áreas donde Opus 5 rinde peor que Fable 5 son
00:00:33razonamiento multidisciplinario, y no por mucho. De hecho, lo supera cuando usa herramientas, así como en
00:00:39derecho y salud. Pero en todos los demás aspectos, supera a su modelo superior. Y si esas cifras son
00:00:46creíbles, es una locura. Justo aquí dice que en Cursor Bench 3.2 a máximo esfuerzo, el modelo rindió
00:00:51a un 0.5% de la puntuación máxima de Fable 5, pero a la mitad del costo por tarea. Increíble. Y se puede ver justo
00:00:57aquí. Tenemos a Opus 5 en rojo, a Fable 5 en naranja, y abajo en azul está Opus 4.8.
00:01:03Así que sí, con el esfuerzo al máximo, Fable 5 toma la delantera, pero la mayoría de la gente no opera
00:01:08al máximo. Trabajan en nivel alto o extra alto. Y cuando vemos los niveles extra alto y alto
00:01:13en comparación con Fable, obtenemos prácticamente los mismos resultados con Opus 5, pero de nuevo, a como
00:01:17la mitad del costo. Y en algunas de las otras pruebas, como el índice de agentes de código de Artificial Analysis,
00:01:23Opus 5 supera directamente a Fable 5. Y lo mismo con el Frontier Bench. Básicamente,
00:01:27está aplastando a Fable y es más barato. Ahora echemos un vistazo a algunas tareas
00:01:32de trabajo de conocimiento y resolución de problemas. Y de nuevo, creo que lo más asombroso no es solo toda esta
00:01:37dinámica entre Fable 5 y Opus 5. Es el salto de Opus 4.8 a Opus 5. Todo esto
00:01:43en general es un avance enorme, masivo. Y de nuevo, si esto fuera algo como lo de Sonnet
00:01:495, donde vimos que funcionaba mejor que el modelo anterior, pero resultaba prohibidamente
00:01:53costoso porque Sonnet 5 es de alguna manera el modelo más caro del mercado cuando lo analizas
00:01:57por tarea, ese no es el caso aquí. Opus parece ser extremadamente eficiente en uso de tokens en comparación con estos
00:02:03otros dos modelos. Y de nuevo, el hecho de que realmente supere a Fable 5, de verdad no me lo
00:02:07puedo creer. Otra mejora interesante es el resultado visual. Aquí hay una muestra de Opus 5 haciendo
00:02:13un trabajo de túnel de viento. Y de este lado, lo tenemos construyendo un elemento interactivo en 3D
00:02:19de una célula animal. Ahora, una de las desventajas de Claude es que no puede crear sus propias imágenes y eso. Así que
00:02:24que pueda desenvolverse mejor con este tipo de gráficos SVG en 3D, casi como gráficos HTML, es algo enorme.
00:02:31Otra gran mejora es que Anthropic dice que es mucho más sólido verificando su trabajo
00:02:35e iterando cuidadosamente hasta tener éxito. ¿Qué significa esto? Significa que cuando usamos Opus 5
00:02:40en tareas con agentes de largo alcance, cosas que no son de una sola ejecución, son como bucles, ¿cierto? Es
00:02:45como, ya sabes, todo este tema de ingeniería de grafos del que habla la gente. Cualquier cosa que requiera
00:02:49que Claude básicamente revise su trabajo en función de algún objetivo que le asignemos y siga haciendo eso una
00:02:53y otra vez. Bueno, Opus 5 es mucho mejor que Opus 4.8 en ese sentido. Y un ejemplo
00:02:58interesante aquí es que a Opus 5 se le dio el dibujo de una pieza mecánica y se le pidió escribir código para recrearla como un
00:03:03modelo 3D en FreeCAD. Pero al modelo no se le dio ninguna forma de ver realmente el dibujo. Así que, ya sabes,
00:03:09se le indicó alcanzar esa meta. No se le dijo específicamente cómo hacerlo. Así que se adelantó y
00:03:14escribió su propio pipeline de visión por computadora para extraer la geometría a partir de píxeles puros y luego reconstruyó
00:03:19toda la pieza mecánica. De nuevo, cualquier cosa de largo alcance que tenga una guía o meta fija,
00:03:25Opus 5 es mucho mejor que el 4.8 completándola. En cuanto a comportamientos no alineados,
00:03:29también está un paso por encima de todos estos modelos anteriores. Cuanto más bajo sea, mejor aquí. Y vemos un enorme incremento en su capacidad
00:03:35de Opus 4.8 a esta para hallar vulnerabilidades y exploits en código de fuente abierta. Ahora, lo otro genial son las
00:03:40salvaguardas. Este no es el escenario de Fable, donde si mencionas algo sobre ciberseguridad o biología,
00:03:45se va a bloquear. Esas restricciones son mucho menos estrictas con Opus 5 en comparación con Fable 5.
00:03:50Ahora, aunque todavía hay algunos clasificadores integrados, afirman que es un 85% menos probable que se
00:03:56activen en comparación con Fable. Por último, lo más relevante es el costo. Como dije, es la mitad del precio de Fable.
00:04:01Hablamos de $5 por millón de tokens de entrada y $25 por millón de salida. Y como vimos en las pruebas
00:04:07de los gráficos, este es un modelo relativamente eficiente en el uso de tokens. Así que estoy muy entusiasmado de probar este
00:04:12porque si las cifras son ciertas, casi que tenemos un Fable mejor a la mitad del costo.