Opus 5 supera a Fable... ¿a la mitad de precio?

BBetter Stack
컴퓨터/소프트웨어경제 뉴스AI/미래기술

Transcript

00:00:00Anthropic acaba de lanzar Claude Opus 5, y podría ser incluso mejor que Fable
00:00:04costando la mitad. Si es verdad, será mi nuevo modelo favorito, así que vamos a comprobarlo.
00:00:13Así es como describen a Opus 5. Opus 5 es un modelo reflexivo y proactivo que se acerca
00:00:18a la inteligencia de vanguardia de Claude Fable 5 a la mitad de precio. En evaluaciones de programación
00:00:23y trabajo de conocimiento como Frontier Bench y GDP Val, Opus 5 es el nuevo estado del arte, aunque sigue
00:00:28por detrás de Mythos 5 en tareas de ciberseguridad. Opus 5 está diseñado para usarse a diario, funciona de forma
00:00:33más eficiente que otros modelos y es el nuevo modelo predeterminado en Claude Max y el más potente
00:00:38en los planes de Claude Pro. Después de esto, pasan a mostrar los benchmarks, y está ganando en muchos de
00:00:43ellos, a pesar de que Fable 5 está ahí, y no gana por márgenes pequeños. Según
00:00:47sus datos, es casi un 10% mejor en Frontier Bench que Fable 5, pero una de las cifras más impresionantes
00:00:52es su puntuación en Arc AGI. Opus 4.8 obtuvo un 1,5%, mientras que Sol logró un 7,8%, que era el récord
00:01:00anterior, pero Opus 5 alcanza un 30,2%. El equipo detrás de este benchmark demostró que Opus mostró una nueva
00:01:06capacidad nunca vista en otros modelos: convertía las pruebas
00:01:10a notación algebraica para realizar razonamientos lógicos avanzados. Es algo realmente impresionante.
00:01:15Por cierto, si os preguntáis por qué Fable no aparece aquí, se debe a la política
00:01:19de retención de datos de Fable. Arc AGI no quiere arriesgarse a filtrar detalles de su evaluación a Anthropic, pero la
00:01:24buena noticia es que Opus 5 no requiere retención de datos para el acceso general. Eso va a
00:01:29alegrar a muchísima gente. Siguiendo adelante, echemos un vistazo a los benchmarks independientes de
00:01:33Artificial Analysis. En el índice de programación queda segundo, perdiendo por solo 0,3 puntos frente a GPT 5.6 Sol
00:01:39Extra High, pero supera a Fable por 1,5 puntos, lo cual es un gran salto respecto a Opus 4.8.
00:01:45Mención especial para Kimi K3 aquí, por cierto, por plantar cara a los gigantes. Hice un vídeo sobre él
00:01:49cuando salió, así que deberías suscribirte para estar al día de las novedades de IA
00:01:52y desarrollo. Si miramos el índice de agentes, Opus 5 toma la delantera
00:01:57aquí, quedando un poco por encima de Fable 5 y superando al modelo Sol de OpenAI. Ocurre exactamente lo mismo
00:02:02en el índice de inteligencia, donde Opus 5 también lidera. Así que en cuanto a rendimiento,
00:02:06parece que Opus 5 es un modelo seriamente bueno, y sinceramente, me ha sorprendido bastante. Pensaba
00:02:11que Fable era donde se iban a centrar ahora y que Opus se convertiría en una especie de nuevo
00:02:15modelo Sonic, pero ahora parece que Fable y Opus están casi a la par... hasta que metemos
00:02:19el precio en la ecuación. Si miramos el coste por tarea completada en Artificial Analysis, Opus
00:02:235 resulta 72 centavos más barato que Fable 5, y apenas un poco más caro que
00:02:28Opus 4.8. Ahora bien, en cuanto a relación calidad-precio, GPT 5.6 Sol
00:02:33sigue siendo el ganador, costando casi la mitad que Opus 5. Podéis ver
00:02:37en este gráfico, donde el cuadrante verde es el más atractivo, que los modelos de GPT se sitúan justo ahí,
00:02:42junto con Kimi K3, mientras que los modelos de Anthropic tienen su propia sección en el rango de precios
00:02:46más altos. Cursor Bench también refleja todos estos benchmarks que hemos estado viendo.
00:02:50Aquí, Opus 5 Max obtiene casi la misma puntuación que Fable 5, pero Fable cuesta 17 $ por esa
00:02:56tarea y Opus cuesta 8 $. El precio en sí, por cierto, es el mismo que Opus 4.8, es decir,
00:03:015 $ por millón de tokens de entrada y 25 $ por millón de tokens de salida, así que si os gustaba
00:03:06Opus 4.8, no veo ninguna razón para no usar este modelo. Y como fan
00:03:10de Fable 5 que soy, voy a usar bastante Opus 5 para ahorrar en mi suscripción
00:03:14y mis créditos para que no se agoten tan rápido. Sinceramente, mi opinión sobre Fable frente a Opus
00:03:18es que Fable seguirá siendo el modelo superior si buscas resolver problemas muy complejos y a largo plazo,
00:03:23pero para el 95% del trabajo, Opus 5 puede ocupar su lugar. Pero vamos a verlo
00:03:28en acción con unas pruebas locales. La primera prueba consistió en pedir a los modelos que crearan
00:03:32un juego de carreras de Fórmula 1 completo en un solo archivo HTML usando Three.js. Al final hablaré del tiempo
00:03:37que tardó cada uno y de cuánto costaría usando la API, pero primero,
00:03:40veamos los resultados. Este es el resultado que me dio Opus 5, y debo decir que estoy bastante
00:03:45impresionado con el modelo. No utiliza recursos externos ni nada por el estilo. Todo ha sido creado
00:03:50por Opus 5, y todo se ve realmente bien. Bueno, el trazado del circuito estaba un poco al revés,
00:03:55pero la conducción responde bien. Los tiempos por vuelta, las posiciones, la clasificación,
00:03:59todo funciona correctamente. Sí, estamos conduciendo bajo la hierba aquí, pero como veis la colisión funciona,
00:04:03y realmente hay una pista debajo de esta hierba, así que podría solucionarlo fácilmente con otro prompt.
00:04:07Además, las trampas de grava parecen funcionar genial. Sinceramente, estoy muy impresionado con
00:04:12el resultado que obtuvimos de Opus 5 aquí. Estos F1 son los que mejor se ven de todos, en mi opinión.
00:04:16Os dejo decidir a vosotros. Este es el resultado que me dio Fable. Creo que este también está muy
00:04:20bien en cuanto al trazado, pero los coches son un poco más básicos que los de Opus 5.
00:04:25Me gusta mucho el tambaleo de la cámara al girar y, de nuevo, el resto de
00:04:28funciones funcionan: posiciones, tiempos de vuelta y demás. Así que Fable 5 también
00:04:33ha hecho un trabajo fantástico, aunque prefiero el de Opus. Este es el resultado
00:04:37que obtuve de GPT 5.6 Sol, también en su máximo esfuerzo. Diría que ha hecho un buen trabajo con
00:04:43el modelado y la perspectiva de la cámara, pero podéis ver que no hay pista, hay elementos
00:04:47orientados al revés y, a mitad del circuito, la pista se corta. Por lo tanto, ha hecho un trabajo
00:04:51peor, en mi opinión, que Fable y Opus. Considero que Opus sigue
00:04:56ganando aquí. El último modelo que probé es Kimi K3, y este fue el resultado,
00:05:01que sinceramente es súper impresionante para un modelo de código abierto. Ha hecho un trabajo notable,
00:05:05muy similar a GPT 5.6 Sol. Las barreras funcionan, la pista funciona, la posición en carrera...
00:05:09todo funciona. Me ha creado un juego bastante decente al primer intento. Si nos fijamos
00:05:14en los costes y tiempos de estas ejecuciones, Opus 5 tardó 46 minutos y 51 segundos
00:05:19en completar el juego de F1, y habría costado unos 12,99 $ usando la API. En mi caso,
00:05:25Opus 5 resultó más caro que Fable aquí, y al investigarlo, vi que fue porque consumió
00:05:30cinco veces más tokens. Espero que sea un caso aislado, ya que otros benchmarks no reflejan
00:05:35lo mismo. Cabe añadir que calculo el coste de los modelos de Claude usando la herramienta de uso
00:05:39de Claude Code, por lo que podría haber imprecisiones, ya que no obtienes el precio exacto al
00:05:44usar la suscripción. Además, como dije antes, estos modelos siguen siendo premium, así que si recurres
00:05:49a algo como GPT 5.6, obtendrás un modelo más rápido y barato, aunque los resultados fueron,
00:05:54en mi opinión, peores. Probemos otro test. Esta vez les pedí crear un panel de control
00:05:58de finanzas personales: una aplicación full-stack con frontend y backend, e incluí
00:06:02algunas características que podían añadir. Este es el resultado que obtuve
00:06:06con Opus 5 y, francamente, debo decir que me ha impresionado. Me encanta esta interfaz, encaja
00:06:11mucho con mi estilo personal. Decidme en los comentarios si a vosotros también, y todo funciona
00:06:15a la perfección. Comprobé que cada opción responde y tenemos páginas separadas para cada una de las
00:06:20funciones que pedí. Todas están conectadas entre el frontend
00:06:24y el backend, y el diseño visual me parece excelente. Creo que es el mejor
00:06:28de todos. En cuanto al código, utilizó React y React Router en el frontend, algo que me gusta
00:06:33mucho, y en el backend también suma puntos porque usó una base de datos real: empleó
00:06:37Node SQLite para la base de datos y Express para el servidor. Este es el resultado
00:06:42que me dio Fable 5; prefiero la interfaz de Opus 5, aunque esta tampoco está mal,
00:06:48si bien estos gráficos son bastante inútiles, para ser sinceros. Este de abajo sí está bien, y de nuevo,
00:06:53todas las funciones son operativas. Creo que Opus 5 puso más esmero en la interfaz y
00:06:57destaca más en ese aspecto. En el código hizo algo parecido a Opus 5 al usar
00:07:01React, aunque no usó una librería de enrutamiento; programó un sistema de rutas
00:07:05propio desde cero. Hubiera preferido que utilizase algo como React Router.
00:07:09En cuanto a la base de datos, hizo lo mismo usando Node SQLite, y también
00:07:13está construido sobre Express, así que el backend es muy similar, pero Opus eligió un mejor
00:07:18stack para el frontend. Esto es lo que me dio GPT 5.6 Sol, y debo decir que está
00:07:22al más alto nivel en diseño UI. Rivaliza totalmente con Opus. Es un estilo diferente, por lo que
00:07:26dependerá de las preferencias personales, pero me gusta mucho. Ha hecho un trabajo
00:07:31increíble estructurando toda la interfaz y todas las funciones marchan bien, aunque este
00:07:35no usó páginas independientes para cada función, sino que simplemente te desplaza a otra
00:07:38sección de la misma página. Eligió además el stack más único: utilizó Next.js combinado
00:07:43con Drizzle para la base de datos (lo cual me gusta mucho) siendo un enfoque muy válido
00:07:47para algo así. Sin embargo, usó Cloudflare y Vinext para el alojamiento, lo cual me parece una decisión
00:07:52un poco extraña, ya que Vinext está en una fase muy temprana y creo que no está lo bastante
00:07:56probado; seguro que incluyen instrucciones en el sistema para forzar el uso de Cloudflare
00:08:00y Vinext. Como comenté en mi vídeo de Kimi K3, probablemente se deba a que así es como funcionan
00:08:04sus propios sitios web en ChatGPT. Por último, probé Kimi K3, y este es el resultado
00:08:09que obtuvimos. Ha hecho un trabajo muy sólido. Esta interfaz recuerda a lo que obtenía
00:08:14con GPT 5.4 o 5.5, por lo que está un paso por detrás en diseño, pero todas las funciones
00:08:19funcionan y no me puedo quejar demasiado del aspecto visual. Cumple exactamente con lo pedido.
00:08:24El código restó algunos puntos, eso sí. Eligió React para el frontend
00:08:28y creó su propia librería de rutas como Fable, pero al revisar el servidor,
00:08:32solo implementó un servidor Express sin una base de datos real con Node SQLite
00:08:36o similar. Creó su propio sistema de datos con JavaScript, guardando
00:08:40todo en un archivo JSON. Sin duda no es el enfoque más adecuado.
00:08:44En cuanto a tiempos y precios en la prueba financiera, Fable fue el más caro,
00:08:48costando 30,79 $ y tardando 56 minutos y 55 segundos. Con Opus, el coste
00:08:55estuvo muy cercano a Fable (29,82 $) y tardó incluso más: 59 minutos y 15
00:09:02segundos. Los modelos de GPT tienen un precio sumamente competitivo en comparación (unas tres veces y media
00:09:07más baratos), y espero que esta competencia haga bajar los precios de Anthropic.
00:09:11Tengo sensaciones encontradas. Solo ejecuté cada prueba una vez y únicamente hice dos test,
00:09:16por lo que confío en que los benchmarks de Artificial Analysis sean más precisos, situando a Opus
00:09:20a un tercio del precio de Fable. Tendré que probarlo más a fondo para confirmarlo.
00:09:24Quizá sea cuestión de la herramienta usada para medir los costes. Otro punto a favor de Opus
00:09:28es que resulta un poco menos estricto en ciberseguridad que Fable 5. Sus restricciones son
00:09:33similares a Opus 4.8, con la excepción de protecciones más firmes en tareas cibernéticas muy
00:09:37específicas. Al parecer, estas reglas permiten a Opus 5 detectar vulnerabilidades en código fuente,
00:09:42pero bloquearán el escaneo de binarios, pruebas de penetración
00:09:46y creación de exploits. Sus pruebas indican que los clasificadores intervienen un 85% menos
00:09:51que en Fable 5. Así están las cosas: la competencia entre modelos es realmente impresionante
00:09:55ahora mismo. Tenemos a GPT 5.6 demostrando que los precios pueden bajar, a modelos abiertos como Kimi
00:10:00igualando a los referentes en inteligencia, y a Anthropic elevando
00:10:04constantemente el nivel de esa inteligencia. ¿Cuál es vuestro modelo favorito y qué os parece Opus?
00:10:09Dejadmelo en los comentarios, suscribíos si no lo estáis y, como siempre, ¡nos vemos en el próximo!

Key Takeaway

Claude Opus 5 iguala e incluso supera el rendimiento de Fable 5 en evaluación de agentes y programación a la mitad de su precio oficial, estableciendo un nuevo estándar de 30,2% en Arc AGI gracias al razonamiento algebraico automático.

Highlights

  • Claude Opus 5 cuesta la mitad que Claude Fable 5, manteniendo un precio de 5 $ por millón de tokens de entrada y 25 $ por millón de tokens de salida.

  • Opus 5 alcanzó un 30,2% en el benchmark Arc AGI mediante la conversión automática de pruebas a notación algebraica, superando el récord anterior del 7,8%.

  • El benchmark Cursor Bench registra un coste de 8 $para Opus 5 Max frente a los 17$ de Fable 5 al ejecutar la misma tarea de programación.

  • Las restricciones de ciberseguridad en Opus 5 generan un 85% menos de intervenciones por parte de clasificadores en comparación con Fable 5.

  • GPT 5.6 Sol resulta aproximadamente 3,5 veces más barato que Opus 5 en pruebas de desarrollo de aplicaciones full-stack.

Timeline

Especificaciones y benchmarks comparativos de Opus 5

  • Opus 5 se posiciona como el modelo predeterminado en Claude Max y el más potente en los planes Pro.
  • El modelo logra un 30,2% en Arc AGI al traducir problemas visuales y lógicos a notación algebraica.
  • Opus 5 encabeza los índices de agentes e inteligencia en evaluaciones independientes de Artificial Analysis.

Opus 5 supera a Fable 5 por casi un 10% en Frontier Bench y muestra una evolución drástica desde el 1,5% que registraba Opus 4.8 en Arc AGI. En el índice de programación de Artificial Analysis se sitúa a 0,3 puntos de GPT 5.6 Sol Extra High y 1,5 puntos por encima de Fable. Su despliegue general no requiere retención de datos, resolviendo los riesgos de filtración observados en otros modelos de evaluación. A un coste de 5 $ por millón de tokens de entrada y 25 $ por millón de salida, iguala la tarifa de Opus 4.8.

Prueba de desarrollo 3D en un solo archivo: Juego de F1

  • Opus 5 genera un juego de carreras interactivo completo en Three.js sin recurrir a dependencias externas.
  • La ejecución de la prueba consumió cinco veces más tokens en Opus 5 que en Fable 5, elevando el coste de la API a 12,99 $.
  • Modelos como GPT 5.6 Sol y Kimi K3 completan la prueba con un gasto menor pero con errores en el renderizado del circuito.

El modelo en un solo intento produce gráficos detallados de monoplazas, físicas de colisión en hierba y trampas de grava, además de un sistema funcional de tiempos por vuelta y posiciones. Fable 5 genera vehículos con un modelado visual más simple, tardando menos tiempo. GPT 5.6 Sol presenta interrupciones en la pista y elementos desorientados. Kimi K3, como alternativa de código abierto, logra renderizar el circuito y las barreras correctamente con una complejidad similar a la de GPT 5.6.

Prueba de aplicación full-stack: Panel financiero y políticas de seguridad

  • Opus 5 estructura una arquitectura full-stack utilizando React, React Router, Express y una base de datos real con Node SQLite.
  • La prueba financiera requirió 59 minutos y 15 segundos en Opus 5, registrando un coste API de 29,82 $.
  • Los clasificadores de ciberseguridad en Opus 5 intervienen un 85% menos que los de Fable 5.

El panel de control desarrollado por Opus 5 integra vistas independientes vinculadas entre el frontend y el backend, superando la implementación de Fable 5, la cual omitió librerías de enrutamiento estándar. Por su parte, GPT 5.6 Sol emplea Next.js, Drizzle, Cloudflare y Vinext, alcanzando un diseño visual competitivo por un tercio del precio. Kimi K3 reduce la complejidad del almacenamiento persistente guardando datos en un archivo JSON local sin una base de datos SQL. En el ámbito de la seguridad, Opus 5 permite el análisis de vulnerabilidades en código fuente pero bloquea la creación de exploits y el escaneo de binarios.

Community Posts

View all posts