스크립트
00:00:00Justo después de que Anthropic lanzara Fable 5.1, OpenAI responde y lanza GPT-6 Astra.
00:00:07Comencemos analizando algunas de las pruebas de rendimiento de GPT-6 Astra. Y un saludo a
00:00:10OpenAI por darnos muchos más puntos de referencia que los que Anthropic nos mostró con Fable
00:00:145.1. Cuando se trata del uso de ordenadores, prácticamente domina la tabla. Ni siquiera tenemos muchos datos
00:00:19aquí en cuanto a Fable 5.1. Si observamos las pruebas profesionales, como BenchCAD
00:00:24y BrowseComp, de nuevo, GPT-6 lo hace increíble. El único lugar donde no gana es en el
00:00:31índice de análisis de inteligencia artificial, donde obtiene 61.2 frente al 65.7 de Fable 5.1.
00:00:38A continuación, tenemos la programación. Y de nuevo, es más o menos la misma historia. O supera a Fable 5.1 o está
00:00:43cabeza a cabeza. Si nos fijamos específicamente en TerminalBench 4.0, vemos un salto enorme desde GPT 5.6 solo
00:00:49del 37.3 al 57.7. Y si observamos DeepSuite, que probablemente sea mi prueba de programación
00:00:55favorita, se centra realmente en tareas agénticas de larga duración. Obtiene un 74.1%, lo que de nuevo,
00:01:02es mejor que cualquier otra cosa en el mercado. GPT-6 también arrasa en los tests académicos, así como en los
00:01:08de ciencia y salud. Y cuando echamos un vistazo a las pruebas de ciberseguridad, de nuevo, prestando atención
00:01:13al 5.6 solo aquí: saltos gigantescos, de 78.5 al 100%. Del 55.9 hasta el 88. Y un 5.5% en exploit
00:01:22bench que sube hasta el 39%. Así que esto supone un cambio radical respecto a los modelos de la serie cinco. Y en cuanto
00:01:27al contexto largo, GPT-6 también se sale. Puntuación del 100% en la prueba de las ocho agujas de 256 a 512k
00:01:34tokens. Es decir, esencialmente desde un cuarto hasta una ventana de contexto completamente llena. Y cuando esa ventana pasa de 512,000
00:01:41tokens a un millón, sigue obteniendo un 96.3%. Así que, si eres de los que siempre saturan de
00:01:46contexto al modelo de IA que elijas, GPT-6 funcionará realmente bien en esos escenarios. Pero las puntuaciones
00:01:51en bruto de los tests no son suficientes. Necesitamos saber cuánto cuesta realmente alcanzar estos resultados,
00:01:55porque Astra puede tener la mejor puntuación del mundo, pero si cuesta 10 veces más que lo demás, ¿qué sentido
00:01:59tiene? Por suerte para los modelos GPT, históricamente han sido muy eficientes con los tokens. Así que cuando miramos
00:02:04aquí la puntuación de Terminal Bench 4.0, vemos que eso se cumple. Vemos que GPT-6 Astra, marcado con estrellas,
00:02:11lo primero que quiero señalar es que, como muchos de estos modelos, se observa cierta caída en la eficiencia
00:02:16a medida que subimos en la cadena de nivel de esfuerzo. Así que cuando paso de bajo a medio y alto, sigo obteniendo
00:02:23mejores puntuaciones con un aumento de coste más o menos lineal. Pero al pasar de alto a extra alto, y luego a máximo,
00:02:30en realidad estoy obteniendo una peor puntuación a un mayor coste. Así que en alto, por 7.21 dólares, obtengo una
00:02:39precisión del 57.9%. Cuando comparo esto con Fable 5.1 aquí mismo, y lo pongo en alto, pues obtengo un 49.4%
00:02:49de precisión por 10.50 dólares. Así que es más caro y no rinde tan bien. Ahora bien, Fable alcanza bastante nivel
00:02:57cuando lo configuro al máximo esfuerzo con 55.8, pero me cuesta 19.50 dólares. Así que para una misma puntuación,
00:03:06de nuevo, alrededor del 55%, cuesta casi 20 dólares con Fable 5. Y con GPT-6 Astra, son 7.20 dólares. Así que es infinitamente más barato
00:03:16para prácticamente la misma precisión. Y cuando observamos Frontier Code 1.1, vemos un patrón similar,
00:03:22donde en los niveles más altos obtenemos puntuaciones parecidas. Si comparamos GPT-6 con Fable 5.1
00:03:29o Fable 5. En este caso, Fable 5 en realidad obtuvo una puntuación mayor aquí. Pero resulta mucho más caro
00:03:34ejecutar estos modelos en la nube debido a la eficiencia de tokens de GPT-6 Astra. Ahora bien, hay algunas funciones
00:03:39más allá de las pruebas que OpenAI destaca en relación con GPT-6. La primera es que lo denominan
00:03:43el mejor modelo del mundo para el uso de ordenadores. Hay varias pruebas que evalúan este tipo
00:03:48de tareas, como el examen final de los agentes. Y al igual que hemos visto en otros benchmarks, ¿qué nos muestra?
00:03:52Muestra que Astra arrasa, tanto en precisión como en los costes de API, los cuales
00:03:57nunca se pueden pasar por alto. Pero posiblemente aún más importante que la precisión sea la velocidad. Codex en realidad ofrece
00:04:01un uso de ordenadores excelente, especialmente si se usa junto con el modo de voz. Y se supone que Astra
00:04:06es 1.9 veces más rápido que GPT-5.6, lo cual es genial si eres alguien que lo ha estado usando
00:04:11intensamente durante el último mes más o menos. Otra característica que destacan es la adherencia a las plantillas. Si le das
00:04:15algún tipo de plantilla de, digamos, una presentación, como la que ves a la izquierda, y le pides que
00:04:20cree otra presentación con el mismo estilo sobre un tema diferente, bueno, obtienes algo
00:04:25como lo que vemos a la derecha, algo que respeta el estilo de forma sobresaliente. Así que si tienes
00:04:31algún tipo de plantilla que usas una y otra vez, ya sea para presentaciones o sitios web, piénsalo como
00:04:35un sistema de diseño para prácticamente cualquier clase de resultado; GPT-6 es ideal para eso. Puedes comprobarlo de nuevo aquí con
00:04:41documentos de Excel y el diseño de documentos en general. Esta era esencialmente la imagen de referencia que se le dio.
00:04:46Esto es lo que obteníamos antes, y esto es lo que conseguimos a la derecha después de que procese esa
00:04:51imagen de referencia. Otro aspecto interesante es esta frase en la que mencionan que GPT-6 Astra
00:04:55aporta un mejor juicio visual a sitios web, juegos, aplicaciones y renderizados; dicho de otro modo, afirman
00:05:00que GPT-6 tiene mejor gusto. Y probablemente habrás escuchado una y otra vez que la IA no tiene gusto.
00:05:05Bueno, ellos sostienen que GPT-6 sí lo tiene. Seamos honestos, siempre habrá problemas cuando se trata
00:05:10de la IA y el criterio estético, porque si le das una mala orden, se producirá algún tipo de regresión
00:05:15hacia la mediocridad, pase lo que pase. Y sea cual sea ese estándar medio, la gente lo asociará
00:05:20con contenido basura generado por IA, por muy bueno que sea en realidad. Pero aquí muestran algunos ejemplos
00:05:25de una simulación en Unreal Engine que realizaron, modelado en Blender, además de algunas imágenes fijas. Algo genial
00:05:31que están incorporando con Astra son modificaciones en la forma en que realiza la compactación automática cuando se llena la ventana de contexto. Ahora,
00:05:37normalmente, al llenar la ventana de contexto, se compacta automáticamente, creando un resumen
00:05:41de todo lo que has estado hablando en esa sesión anterior, y luego inicia una nueva sesión. Bien,
00:05:46eso genera problemas y a veces omite detalles. Pero ahora, Astra conserva notas entre ventanas de contexto
00:05:52en lugar de tener solo un resumen único. Así que, en vez de un solo documento, recopila varios
00:05:57fragmentos adhesivos con información sobre lo que considera importante, pudiendo consultarlos en cualquier momento
00:06:01en lugar de limitarse a un único intento del tipo «aquí tienes un resumen, espero que sea todo lo necesario».
00:06:06De hecho, las ventanas de contexto anteriores siguen siendo accesibles mediante búsquedas. Por tanto, no es como si este fuera
00:06:12el único documento disponible en forma de resumen y, si no está aquí, estamos perdidos. Ya no ocurre eso
00:06:16en absoluto. Esta es una función experimental, por lo que tendrás que activarla en la configuración
00:06:20de codex, aunque se convertirá en la opción predeterminada en unas pocas semanas. En cuanto a la ciberseguridad,
00:06:24Astra maneja esto de forma similar a como Anthropic trata a Fable, bajo la premisa de que este modelo es tan
00:06:28potente que puede crear múltiples exploits; por consiguiente, si detecta que intentas generar algún tipo
00:06:33de exploit, simplemente no te lo permitirá. No accederá ni dará respuesta a
00:06:37tu solicitud. Otra gran mejora en GPT-6 en comparación con la serie 5 es una menor tasa
00:06:42de alucinaciones. GPT-5.6 Sol y los modelos de la serie 5.6 en general solían alucinar bastante en comparación
00:06:48con otros modelos punteros. Aun así, cara a cara, comprobamos que hemos pasado de una tasa
00:06:54de alucinación de alrededor del 9.4% a una tasa de tan solo el 2%. ¿Está disponible Astra?
00:07:01Por ahora está abierto a un conjunto limitado de organizaciones, y en los próximos días se abrirá prácticamente
00:07:06a todo el mundo. Respecto a la API, ya se encuentra disponible para desarrolladores. En cuanto al precio,
00:07:11de nuevo, coincide con el de Fable: 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida.
00:07:17Por lo tanto, basándonos en las cifras, OpenAI nos ofrece un modelo muy sólido que puede competir plenamente
00:07:22con lo mejor que tiene Anthropic. Y lo hacen a un precio inferior. Así que
00:07:26estoy súper emocionado por probarlo. Pienso que la competencia entre los grandes actores de este sector
00:07:30es, en definitiva, magnífica para nosotros, los usuarios finales.