Transcript
00:00:00Anthropic acaba de lanzar Claude Opus 5, y podría ser incluso mejor que Fable
00:00:04costando la mitad. Si es verdad, será mi nuevo modelo favorito, así que vamos a comprobarlo.
00:00:13Así es como describen a Opus 5. Opus 5 es un modelo reflexivo y proactivo que se acerca
00:00:18a la inteligencia de vanguardia de Claude Fable 5 a la mitad de precio. En evaluaciones de programación
00:00:23y trabajo de conocimiento como Frontier Bench y GDP Val, Opus 5 es el nuevo estado del arte, aunque sigue
00:00:28por detrás de Mythos 5 en tareas de ciberseguridad. Opus 5 está diseñado para usarse a diario, funciona de forma
00:00:33más eficiente que otros modelos y es el nuevo modelo predeterminado en Claude Max y el más potente
00:00:38en los planes de Claude Pro. Después de esto, pasan a mostrar los benchmarks, y está ganando en muchos de
00:00:43ellos, a pesar de que Fable 5 está ahí, y no gana por márgenes pequeños. Según
00:00:47sus datos, es casi un 10% mejor en Frontier Bench que Fable 5, pero una de las cifras más impresionantes
00:00:52es su puntuación en Arc AGI. Opus 4.8 obtuvo un 1,5%, mientras que Sol logró un 7,8%, que era el récord
00:01:00anterior, pero Opus 5 alcanza un 30,2%. El equipo detrás de este benchmark demostró que Opus mostró una nueva
00:01:06capacidad nunca vista en otros modelos: convertía las pruebas
00:01:10a notación algebraica para realizar razonamientos lógicos avanzados. Es algo realmente impresionante.
00:01:15Por cierto, si os preguntáis por qué Fable no aparece aquí, se debe a la política
00:01:19de retención de datos de Fable. Arc AGI no quiere arriesgarse a filtrar detalles de su evaluación a Anthropic, pero la
00:01:24buena noticia es que Opus 5 no requiere retención de datos para el acceso general. Eso va a
00:01:29alegrar a muchísima gente. Siguiendo adelante, echemos un vistazo a los benchmarks independientes de
00:01:33Artificial Analysis. En el índice de programación queda segundo, perdiendo por solo 0,3 puntos frente a GPT 5.6 Sol
00:01:39Extra High, pero supera a Fable por 1,5 puntos, lo cual es un gran salto respecto a Opus 4.8.
00:01:45Mención especial para Kimi K3 aquí, por cierto, por plantar cara a los gigantes. Hice un vídeo sobre él
00:01:49cuando salió, así que deberías suscribirte para estar al día de las novedades de IA
00:01:52y desarrollo. Si miramos el índice de agentes, Opus 5 toma la delantera
00:01:57aquí, quedando un poco por encima de Fable 5 y superando al modelo Sol de OpenAI. Ocurre exactamente lo mismo
00:02:02en el índice de inteligencia, donde Opus 5 también lidera. Así que en cuanto a rendimiento,
00:02:06parece que Opus 5 es un modelo seriamente bueno, y sinceramente, me ha sorprendido bastante. Pensaba
00:02:11que Fable era donde se iban a centrar ahora y que Opus se convertiría en una especie de nuevo
00:02:15modelo Sonic, pero ahora parece que Fable y Opus están casi a la par... hasta que metemos
00:02:19el precio en la ecuación. Si miramos el coste por tarea completada en Artificial Analysis, Opus
00:02:235 resulta 72 centavos más barato que Fable 5, y apenas un poco más caro que
00:02:28Opus 4.8. Ahora bien, en cuanto a relación calidad-precio, GPT 5.6 Sol
00:02:33sigue siendo el ganador, costando casi la mitad que Opus 5. Podéis ver
00:02:37en este gráfico, donde el cuadrante verde es el más atractivo, que los modelos de GPT se sitúan justo ahí,
00:02:42junto con Kimi K3, mientras que los modelos de Anthropic tienen su propia sección en el rango de precios
00:02:46más altos. Cursor Bench también refleja todos estos benchmarks que hemos estado viendo.
00:02:50Aquí, Opus 5 Max obtiene casi la misma puntuación que Fable 5, pero Fable cuesta 17 $ por esa
00:02:56tarea y Opus cuesta 8 $. El precio en sí, por cierto, es el mismo que Opus 4.8, es decir,
00:03:015 $ por millón de tokens de entrada y 25 $ por millón de tokens de salida, así que si os gustaba
00:03:06Opus 4.8, no veo ninguna razón para no usar este modelo. Y como fan
00:03:10de Fable 5 que soy, voy a usar bastante Opus 5 para ahorrar en mi suscripción
00:03:14y mis créditos para que no se agoten tan rápido. Sinceramente, mi opinión sobre Fable frente a Opus
00:03:18es que Fable seguirá siendo el modelo superior si buscas resolver problemas muy complejos y a largo plazo,
00:03:23pero para el 95% del trabajo, Opus 5 puede ocupar su lugar. Pero vamos a verlo
00:03:28en acción con unas pruebas locales. La primera prueba consistió en pedir a los modelos que crearan
00:03:32un juego de carreras de Fórmula 1 completo en un solo archivo HTML usando Three.js. Al final hablaré del tiempo
00:03:37que tardó cada uno y de cuánto costaría usando la API, pero primero,
00:03:40veamos los resultados. Este es el resultado que me dio Opus 5, y debo decir que estoy bastante
00:03:45impresionado con el modelo. No utiliza recursos externos ni nada por el estilo. Todo ha sido creado
00:03:50por Opus 5, y todo se ve realmente bien. Bueno, el trazado del circuito estaba un poco al revés,
00:03:55pero la conducción responde bien. Los tiempos por vuelta, las posiciones, la clasificación,
00:03:59todo funciona correctamente. Sí, estamos conduciendo bajo la hierba aquí, pero como veis la colisión funciona,
00:04:03y realmente hay una pista debajo de esta hierba, así que podría solucionarlo fácilmente con otro prompt.
00:04:07Además, las trampas de grava parecen funcionar genial. Sinceramente, estoy muy impresionado con
00:04:12el resultado que obtuvimos de Opus 5 aquí. Estos F1 son los que mejor se ven de todos, en mi opinión.
00:04:16Os dejo decidir a vosotros. Este es el resultado que me dio Fable. Creo que este también está muy
00:04:20bien en cuanto al trazado, pero los coches son un poco más básicos que los de Opus 5.
00:04:25Me gusta mucho el tambaleo de la cámara al girar y, de nuevo, el resto de
00:04:28funciones funcionan: posiciones, tiempos de vuelta y demás. Así que Fable 5 también
00:04:33ha hecho un trabajo fantástico, aunque prefiero el de Opus. Este es el resultado
00:04:37que obtuve de GPT 5.6 Sol, también en su máximo esfuerzo. Diría que ha hecho un buen trabajo con
00:04:43el modelado y la perspectiva de la cámara, pero podéis ver que no hay pista, hay elementos
00:04:47orientados al revés y, a mitad del circuito, la pista se corta. Por lo tanto, ha hecho un trabajo
00:04:51peor, en mi opinión, que Fable y Opus. Considero que Opus sigue
00:04:56ganando aquí. El último modelo que probé es Kimi K3, y este fue el resultado,
00:05:01que sinceramente es súper impresionante para un modelo de código abierto. Ha hecho un trabajo notable,
00:05:05muy similar a GPT 5.6 Sol. Las barreras funcionan, la pista funciona, la posición en carrera...
00:05:09todo funciona. Me ha creado un juego bastante decente al primer intento. Si nos fijamos
00:05:14en los costes y tiempos de estas ejecuciones, Opus 5 tardó 46 minutos y 51 segundos
00:05:19en completar el juego de F1, y habría costado unos 12,99 $ usando la API. En mi caso,
00:05:25Opus 5 resultó más caro que Fable aquí, y al investigarlo, vi que fue porque consumió
00:05:30cinco veces más tokens. Espero que sea un caso aislado, ya que otros benchmarks no reflejan
00:05:35lo mismo. Cabe añadir que calculo el coste de los modelos de Claude usando la herramienta de uso
00:05:39de Claude Code, por lo que podría haber imprecisiones, ya que no obtienes el precio exacto al
00:05:44usar la suscripción. Además, como dije antes, estos modelos siguen siendo premium, así que si recurres
00:05:49a algo como GPT 5.6, obtendrás un modelo más rápido y barato, aunque los resultados fueron,
00:05:54en mi opinión, peores. Probemos otro test. Esta vez les pedí crear un panel de control
00:05:58de finanzas personales: una aplicación full-stack con frontend y backend, e incluí
00:06:02algunas características que podían añadir. Este es el resultado que obtuve
00:06:06con Opus 5 y, francamente, debo decir que me ha impresionado. Me encanta esta interfaz, encaja
00:06:11mucho con mi estilo personal. Decidme en los comentarios si a vosotros también, y todo funciona
00:06:15a la perfección. Comprobé que cada opción responde y tenemos páginas separadas para cada una de las
00:06:20funciones que pedí. Todas están conectadas entre el frontend
00:06:24y el backend, y el diseño visual me parece excelente. Creo que es el mejor
00:06:28de todos. En cuanto al código, utilizó React y React Router en el frontend, algo que me gusta
00:06:33mucho, y en el backend también suma puntos porque usó una base de datos real: empleó
00:06:37Node SQLite para la base de datos y Express para el servidor. Este es el resultado
00:06:42que me dio Fable 5; prefiero la interfaz de Opus 5, aunque esta tampoco está mal,
00:06:48si bien estos gráficos son bastante inútiles, para ser sinceros. Este de abajo sí está bien, y de nuevo,
00:06:53todas las funciones son operativas. Creo que Opus 5 puso más esmero en la interfaz y
00:06:57destaca más en ese aspecto. En el código hizo algo parecido a Opus 5 al usar
00:07:01React, aunque no usó una librería de enrutamiento; programó un sistema de rutas
00:07:05propio desde cero. Hubiera preferido que utilizase algo como React Router.
00:07:09En cuanto a la base de datos, hizo lo mismo usando Node SQLite, y también
00:07:13está construido sobre Express, así que el backend es muy similar, pero Opus eligió un mejor
00:07:18stack para el frontend. Esto es lo que me dio GPT 5.6 Sol, y debo decir que está
00:07:22al más alto nivel en diseño UI. Rivaliza totalmente con Opus. Es un estilo diferente, por lo que
00:07:26dependerá de las preferencias personales, pero me gusta mucho. Ha hecho un trabajo
00:07:31increíble estructurando toda la interfaz y todas las funciones marchan bien, aunque este
00:07:35no usó páginas independientes para cada función, sino que simplemente te desplaza a otra
00:07:38sección de la misma página. Eligió además el stack más único: utilizó Next.js combinado
00:07:43con Drizzle para la base de datos (lo cual me gusta mucho) siendo un enfoque muy válido
00:07:47para algo así. Sin embargo, usó Cloudflare y Vinext para el alojamiento, lo cual me parece una decisión
00:07:52un poco extraña, ya que Vinext está en una fase muy temprana y creo que no está lo bastante
00:07:56probado; seguro que incluyen instrucciones en el sistema para forzar el uso de Cloudflare
00:08:00y Vinext. Como comenté en mi vídeo de Kimi K3, probablemente se deba a que así es como funcionan
00:08:04sus propios sitios web en ChatGPT. Por último, probé Kimi K3, y este es el resultado
00:08:09que obtuvimos. Ha hecho un trabajo muy sólido. Esta interfaz recuerda a lo que obtenía
00:08:14con GPT 5.4 o 5.5, por lo que está un paso por detrás en diseño, pero todas las funciones
00:08:19funcionan y no me puedo quejar demasiado del aspecto visual. Cumple exactamente con lo pedido.
00:08:24El código restó algunos puntos, eso sí. Eligió React para el frontend
00:08:28y creó su propia librería de rutas como Fable, pero al revisar el servidor,
00:08:32solo implementó un servidor Express sin una base de datos real con Node SQLite
00:08:36o similar. Creó su propio sistema de datos con JavaScript, guardando
00:08:40todo en un archivo JSON. Sin duda no es el enfoque más adecuado.
00:08:44En cuanto a tiempos y precios en la prueba financiera, Fable fue el más caro,
00:08:48costando 30,79 $ y tardando 56 minutos y 55 segundos. Con Opus, el coste
00:08:55estuvo muy cercano a Fable (29,82 $) y tardó incluso más: 59 minutos y 15
00:09:02segundos. Los modelos de GPT tienen un precio sumamente competitivo en comparación (unas tres veces y media
00:09:07más baratos), y espero que esta competencia haga bajar los precios de Anthropic.
00:09:11Tengo sensaciones encontradas. Solo ejecuté cada prueba una vez y únicamente hice dos test,
00:09:16por lo que confío en que los benchmarks de Artificial Analysis sean más precisos, situando a Opus
00:09:20a un tercio del precio de Fable. Tendré que probarlo más a fondo para confirmarlo.
00:09:24Quizá sea cuestión de la herramienta usada para medir los costes. Otro punto a favor de Opus
00:09:28es que resulta un poco menos estricto en ciberseguridad que Fable 5. Sus restricciones son
00:09:33similares a Opus 4.8, con la excepción de protecciones más firmes en tareas cibernéticas muy
00:09:37específicas. Al parecer, estas reglas permiten a Opus 5 detectar vulnerabilidades en código fuente,
00:09:42pero bloquearán el escaneo de binarios, pruebas de penetración
00:09:46y creación de exploits. Sus pruebas indican que los clasificadores intervienen un 85% menos
00:09:51que en Fable 5. Así están las cosas: la competencia entre modelos es realmente impresionante
00:09:55ahora mismo. Tenemos a GPT 5.6 demostrando que los precios pueden bajar, a modelos abiertos como Kimi
00:10:00igualando a los referentes en inteligencia, y a Anthropic elevando
00:10:04constantemente el nivel de esa inteligencia. ¿Cuál es vuestro modelo favorito y qué os parece Opus?
00:10:09Dejadmelo en los comentarios, suscribíos si no lo estáis y, como siempre, ¡nos vemos en el próximo!