GPT 6 Astra ya está aquí (¿Y es mejor que Fable 5.1?)

CChase AI
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00Justo después de que Anthropic lanzara Fable 5.1, OpenAI responde y lanza GPT-6 Astra.
00:00:07Comencemos analizando algunas de las pruebas de rendimiento de GPT-6 Astra. Y un saludo a
00:00:10OpenAI por darnos muchos más puntos de referencia que los que Anthropic nos mostró con Fable
00:00:145.1. Cuando se trata del uso de ordenadores, prácticamente domina la tabla. Ni siquiera tenemos muchos datos
00:00:19aquí en cuanto a Fable 5.1. Si observamos las pruebas profesionales, como BenchCAD
00:00:24y BrowseComp, de nuevo, GPT-6 lo hace increíble. El único lugar donde no gana es en el
00:00:31índice de análisis de inteligencia artificial, donde obtiene 61.2 frente al 65.7 de Fable 5.1.
00:00:38A continuación, tenemos la programación. Y de nuevo, es más o menos la misma historia. O supera a Fable 5.1 o está
00:00:43cabeza a cabeza. Si nos fijamos específicamente en TerminalBench 4.0, vemos un salto enorme desde GPT 5.6 solo
00:00:49del 37.3 al 57.7. Y si observamos DeepSuite, que probablemente sea mi prueba de programación
00:00:55favorita, se centra realmente en tareas agénticas de larga duración. Obtiene un 74.1%, lo que de nuevo,
00:01:02es mejor que cualquier otra cosa en el mercado. GPT-6 también arrasa en los tests académicos, así como en los
00:01:08de ciencia y salud. Y cuando echamos un vistazo a las pruebas de ciberseguridad, de nuevo, prestando atención
00:01:13al 5.6 solo aquí: saltos gigantescos, de 78.5 al 100%. Del 55.9 hasta el 88. Y un 5.5% en exploit
00:01:22bench que sube hasta el 39%. Así que esto supone un cambio radical respecto a los modelos de la serie cinco. Y en cuanto
00:01:27al contexto largo, GPT-6 también se sale. Puntuación del 100% en la prueba de las ocho agujas de 256 a 512k
00:01:34tokens. Es decir, esencialmente desde un cuarto hasta una ventana de contexto completamente llena. Y cuando esa ventana pasa de 512,000
00:01:41tokens a un millón, sigue obteniendo un 96.3%. Así que, si eres de los que siempre saturan de
00:01:46contexto al modelo de IA que elijas, GPT-6 funcionará realmente bien en esos escenarios. Pero las puntuaciones
00:01:51en bruto de los tests no son suficientes. Necesitamos saber cuánto cuesta realmente alcanzar estos resultados,
00:01:55porque Astra puede tener la mejor puntuación del mundo, pero si cuesta 10 veces más que lo demás, ¿qué sentido
00:01:59tiene? Por suerte para los modelos GPT, históricamente han sido muy eficientes con los tokens. Así que cuando miramos
00:02:04aquí la puntuación de Terminal Bench 4.0, vemos que eso se cumple. Vemos que GPT-6 Astra, marcado con estrellas,
00:02:11lo primero que quiero señalar es que, como muchos de estos modelos, se observa cierta caída en la eficiencia
00:02:16a medida que subimos en la cadena de nivel de esfuerzo. Así que cuando paso de bajo a medio y alto, sigo obteniendo
00:02:23mejores puntuaciones con un aumento de coste más o menos lineal. Pero al pasar de alto a extra alto, y luego a máximo,
00:02:30en realidad estoy obteniendo una peor puntuación a un mayor coste. Así que en alto, por 7.21 dólares, obtengo una
00:02:39precisión del 57.9%. Cuando comparo esto con Fable 5.1 aquí mismo, y lo pongo en alto, pues obtengo un 49.4%
00:02:49de precisión por 10.50 dólares. Así que es más caro y no rinde tan bien. Ahora bien, Fable alcanza bastante nivel
00:02:57cuando lo configuro al máximo esfuerzo con 55.8, pero me cuesta 19.50 dólares. Así que para una misma puntuación,
00:03:06de nuevo, alrededor del 55%, cuesta casi 20 dólares con Fable 5. Y con GPT-6 Astra, son 7.20 dólares. Así que es infinitamente más barato
00:03:16para prácticamente la misma precisión. Y cuando observamos Frontier Code 1.1, vemos un patrón similar,
00:03:22donde en los niveles más altos obtenemos puntuaciones parecidas. Si comparamos GPT-6 con Fable 5.1
00:03:29o Fable 5. En este caso, Fable 5 en realidad obtuvo una puntuación mayor aquí. Pero resulta mucho más caro
00:03:34ejecutar estos modelos en la nube debido a la eficiencia de tokens de GPT-6 Astra. Ahora bien, hay algunas funciones
00:03:39más allá de las pruebas que OpenAI destaca en relación con GPT-6. La primera es que lo denominan
00:03:43el mejor modelo del mundo para el uso de ordenadores. Hay varias pruebas que evalúan este tipo
00:03:48de tareas, como el examen final de los agentes. Y al igual que hemos visto en otros benchmarks, ¿qué nos muestra?
00:03:52Muestra que Astra arrasa, tanto en precisión como en los costes de API, los cuales
00:03:57nunca se pueden pasar por alto. Pero posiblemente aún más importante que la precisión sea la velocidad. Codex en realidad ofrece
00:04:01un uso de ordenadores excelente, especialmente si se usa junto con el modo de voz. Y se supone que Astra
00:04:06es 1.9 veces más rápido que GPT-5.6, lo cual es genial si eres alguien que lo ha estado usando
00:04:11intensamente durante el último mes más o menos. Otra característica que destacan es la adherencia a las plantillas. Si le das
00:04:15algún tipo de plantilla de, digamos, una presentación, como la que ves a la izquierda, y le pides que
00:04:20cree otra presentación con el mismo estilo sobre un tema diferente, bueno, obtienes algo
00:04:25como lo que vemos a la derecha, algo que respeta el estilo de forma sobresaliente. Así que si tienes
00:04:31algún tipo de plantilla que usas una y otra vez, ya sea para presentaciones o sitios web, piénsalo como
00:04:35un sistema de diseño para prácticamente cualquier clase de resultado; GPT-6 es ideal para eso. Puedes comprobarlo de nuevo aquí con
00:04:41documentos de Excel y el diseño de documentos en general. Esta era esencialmente la imagen de referencia que se le dio.
00:04:46Esto es lo que obteníamos antes, y esto es lo que conseguimos a la derecha después de que procese esa
00:04:51imagen de referencia. Otro aspecto interesante es esta frase en la que mencionan que GPT-6 Astra
00:04:55aporta un mejor juicio visual a sitios web, juegos, aplicaciones y renderizados; dicho de otro modo, afirman
00:05:00que GPT-6 tiene mejor gusto. Y probablemente habrás escuchado una y otra vez que la IA no tiene gusto.
00:05:05Bueno, ellos sostienen que GPT-6 sí lo tiene. Seamos honestos, siempre habrá problemas cuando se trata
00:05:10de la IA y el criterio estético, porque si le das una mala orden, se producirá algún tipo de regresión
00:05:15hacia la mediocridad, pase lo que pase. Y sea cual sea ese estándar medio, la gente lo asociará
00:05:20con contenido basura generado por IA, por muy bueno que sea en realidad. Pero aquí muestran algunos ejemplos
00:05:25de una simulación en Unreal Engine que realizaron, modelado en Blender, además de algunas imágenes fijas. Algo genial
00:05:31que están incorporando con Astra son modificaciones en la forma en que realiza la compactación automática cuando se llena la ventana de contexto. Ahora,
00:05:37normalmente, al llenar la ventana de contexto, se compacta automáticamente, creando un resumen
00:05:41de todo lo que has estado hablando en esa sesión anterior, y luego inicia una nueva sesión. Bien,
00:05:46eso genera problemas y a veces omite detalles. Pero ahora, Astra conserva notas entre ventanas de contexto
00:05:52en lugar de tener solo un resumen único. Así que, en vez de un solo documento, recopila varios
00:05:57fragmentos adhesivos con información sobre lo que considera importante, pudiendo consultarlos en cualquier momento
00:06:01en lugar de limitarse a un único intento del tipo «aquí tienes un resumen, espero que sea todo lo necesario».
00:06:06De hecho, las ventanas de contexto anteriores siguen siendo accesibles mediante búsquedas. Por tanto, no es como si este fuera
00:06:12el único documento disponible en forma de resumen y, si no está aquí, estamos perdidos. Ya no ocurre eso
00:06:16en absoluto. Esta es una función experimental, por lo que tendrás que activarla en la configuración
00:06:20de codex, aunque se convertirá en la opción predeterminada en unas pocas semanas. En cuanto a la ciberseguridad,
00:06:24Astra maneja esto de forma similar a como Anthropic trata a Fable, bajo la premisa de que este modelo es tan
00:06:28potente que puede crear múltiples exploits; por consiguiente, si detecta que intentas generar algún tipo
00:06:33de exploit, simplemente no te lo permitirá. No accederá ni dará respuesta a
00:06:37tu solicitud. Otra gran mejora en GPT-6 en comparación con la serie 5 es una menor tasa
00:06:42de alucinaciones. GPT-5.6 Sol y los modelos de la serie 5.6 en general solían alucinar bastante en comparación
00:06:48con otros modelos punteros. Aun así, cara a cara, comprobamos que hemos pasado de una tasa
00:06:54de alucinación de alrededor del 9.4% a una tasa de tan solo el 2%. ¿Está disponible Astra?
00:07:01Por ahora está abierto a un conjunto limitado de organizaciones, y en los próximos días se abrirá prácticamente
00:07:06a todo el mundo. Respecto a la API, ya se encuentra disponible para desarrolladores. En cuanto al precio,
00:07:11de nuevo, coincide con el de Fable: 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida.
00:07:17Por lo tanto, basándonos en las cifras, OpenAI nos ofrece un modelo muy sólido que puede competir plenamente
00:07:22con lo mejor que tiene Anthropic. Y lo hacen a un precio inferior. Así que
00:07:26estoy súper emocionado por probarlo. Pienso que la competencia entre los grandes actores de este sector
00:07:30es, en definitiva, magnífica para nosotros, los usuarios finales.

핵심 요약

GPT-6 Astra supera o iguala a Fable 5.1 en rendimiento técnico y uso de ordenadores, reduciendo drásticamente las tasas de alucinación y ofreciendo una mayor eficiencia de costes.

하이라이트

  • GPT-6 Astra alcanza una puntuación del 100% en la prueba de contexto largo de 256k a 512k tokens y un 96.3% al llegar a un millón de tokens.

  • La tasa de alucinaciones se reduce del 9.4% en los modelos de la serie 5.6 a tan solo el 2% en GPT-6 Astra.

  • El coste de ejecución en tareas de alta complejidad es de 7.20 dólares en GPT-6 Astra frente a los 19.50 dólares de Fable 5 para resultados similares.

  • TerminalBench 4.0 registra un incremento masivo en programación, pasando del 37.3% al 57.7% de precisión.

  • La velocidad de procesamiento de GPT-6 Astra es 1.9 veces mayor en comparación con GPT-5.6.

타임라인

Rendimiento en pruebas técnicas y ciberseguridad

  • GPT-6 Astra domina las pruebas de uso de ordenadores, programación y ciberseguridad.
  • DeepSuite alcanza un 74.1% de precisión en tareas agénticas de larga duración.
  • Las pruebas de ciberseguridad muestran saltos desde el 78.5% hasta el 100% en determinados benchmarks.

El rendimiento general sitúa a GPT-6 por encima de los modelos anteriores y de la competencia directa en la mayoría de benchmarks profesionales. Las capacidades en programación y el manejo de contextos largos de hasta un millón de tokens sitúan al modelo como una herramienta altamente eficiente para desarrolladores y entornos complejos.

Eficiencia de costes y uso de tokens

  • Los costes por tarea compleja son notablemente inferiores a los de alternativas como Fable.
  • El aumento de los niveles de esfuerzo lineal incrementa la precisión hasta alcanzar un límite óptimo.
  • La eficiencia de tokens reduce el coste operativo en la nube frente a versiones anteriores.

El análisis económico demuestra que GPT-6 Astra ofrece precisiones comparables o superiores a competidores directos con un ahorro considerable en la ejecución de consultas complejas. Mientras que alternativas requieren casi 20 dólares para ciertos niveles de rendimiento, Astra logra resultados similares por poco más de 7 dólares.

Nuevas funciones, diseño visual y gestión de contexto

  • La velocidad de procesamiento duplica prácticamente la de la generación anterior.
  • Astra conserva notas persistentes entre ventanas de contexto en lugar de limitarse a un único resumen.
  • La tasa de alucinaciones desciende drásticamente hasta situarse en el 2%.

Las mejoras funcionales incluyen una adherencia sobresaliente a plantillas visuales para documentos y código, además de un juicio visual más refinado en simulaciones y renderizados. La gestión de contexto experimental permite almacenar fragmentos de información clave entre sesiones, solucionando los problemas de pérdida de datos por compactación automática.

커뮤니티 글

모든 글 보기