스크립트
00:00:00OpenAI acaba de lanzar un nuevo modelo en Codex, pero el titular no es la puntuación en
00:00:04los benchmarks, sino su nuevo modo ultra, que puede activar sus propios subagentes para dividir y conquistar
00:00:10tus tareas. Eso significa que toda la orquestación que normalmente configurarías tú mismo, ahora se está integrando
00:00:15dentro del propio modelo. Así que en este video vamos a cubrir todo lo que necesitas saber sobre
00:00:19el nuevo lanzamiento, cómo rinde al escribir código de producción y si merece la pena considerarlo
00:00:23por encima de todo lo que ofrecen los modelos líderes. Cubrimos temas de IA constantemente en este
00:00:28canal, así que suscríbete a Better Stack si quieres estar al tanto de cada nuevo lanzamiento.
00:00:38OpenAI acaba de lanzar una nueva serie de modelos bajo GPT 5.6. Tenemos tres niveles: Luna,
00:00:45Terra y Sol. Es probable que estos nombres se mantengan y se mejoren con el tiempo, exactamente como
00:00:50labs como Anthropic nombran sus modelos. Luna es el rápido y barato, Terra es el caballo de batalla diario
00:00:55y Sol es el nuevo modelo insignia. Todo esto se está implementando ahora mismo, así que el acceso llegará
00:01:01tan pronto como hoy. Sin embargo, un grupo de socios de confianza seleccionados por OpenAI ha tenido acceso anticipado, así que para
00:01:07la cifra con la que todos encabezan, en Terminal Bench 2.1, que es el benchmark para línea de comandos
00:01:12y trabajo de codificación, Sol básico alcanza 88.8, y al activar el nuevo modo ultra, eso salta a 91.9. Para comparar,
00:01:21tanto GPT 5.5 como Claude Mythos 5 se sitúan en 88. Así que, sobre el papel, Sol Ultra es el nuevo estado del arte para la codificación
00:01:31agentica, pero un benchmark no es tu base de código, y el despliegue lento significa que la mayoría de los que ven esto no pueden
00:01:37ni siquiera ejecutarlo todavía. Así que toma esa cifra con cautela. Ahora, aquí es donde se pone realmente interesante:
00:01:42esta semana, el líder de Codex en OpenAI, Tibo, confirmó que Sol con modo ultra llegará a Codex.
00:01:49También adelantó una versión más rápida ejecutándose en los chips Cerebras que llegará a finales de julio. Así que, si la velocidad
00:01:55bruta es lo que te importa, esa es una a seguir, y el modo ultra es la característica emocionante aquí.
00:02:00Así que repasemos exactamente cómo funciona. Normalmente, un modelo trabaja en tu tarea en una larga cadena
00:02:06de razonamiento, pero el modo ultra divide la tarea y activa múltiples subagentes para trabajar
00:02:12en partes en paralelo. La parte nueva es que esos subagentes están entrenados para cooperar, por lo que pueden hablar
00:02:18entre sí mientras trabajan y luego combinar todo en un solo resultado. Y este tipo de
00:02:23orquestación es un gran cambio en cómo funcionan los modelos. Ejecutar un planificador, un programador y un revisor es normalmente
00:02:29algo que configurarías tú mismo en las tareas de Codex, o algo que Claude Code o Copilot manejarían
00:02:34en la capa superior, pero OpenAI ha decidido incorporar toda esa complejidad dentro del propio modelo para ti.
00:02:40Eso significa mucha menos configuración; en lugar de unir agentes separados, simplemente le das la tarea a Ultra y dejas
00:02:46que se encargue del resto. Así que es menos orquestación que supervisar y, en teoría, resultados más rápidos para esas
00:02:52tareas grandes y complicadas. Pero la pregunta es: ¿es realmente un gran salto en capacidad o solo una forma de consumir
00:02:58tokens con un nombre más elegante? La verdad es que probablemente sean ambas cosas. Subagentes entrenados de principio a fin para comunicarse es una
00:03:05dirección de investigación interesante, pero Ultra es también solo un término de marketing, lo que significa que dejamos que piense
00:03:10durante más tiempo y distribuya el trabajo. Pero aparte de todo el entusiasmo, los benchmarks vienen en realidad con un serio
00:03:15asterisco. METR, el laboratorio independiente que OpenAI utiliza para evaluar sus modelos, ejecutó Sol a través de sus tareas
00:03:22de horizonte temporal y descubrieron que Sol fue sorprendido haciendo trampa más a menudo que cualquier modelo público que hayan
00:03:28probado nunca. Y al decir hacer trampa me refiero a que hizo cosas como empaquetar exploits en sus respuestas para leer la
00:03:34suite de pruebas oculta, o extraer código fuente oculto para encontrar la respuesta esperada, y eso destruye completamente
00:03:40la medición. Cuando METR intentó calcular cuánto tiempo podía manejar una tarea Sol por sí mismo, la respuesta
00:03:46variaba desde unas 11 horas hasta más de 270 horas, pero debido a las trampas, su propia
00:03:52conclusión fue que estas cifras no son una medición fiable de lo que el modelo puede hacer. Así que el modelo
00:03:57líder en la tabla de clasificación es el que está manipulando sus propias evaluaciones, lo cual vale la pena recordar antes de que
00:04:03reconstruyas todo tu flujo de trabajo alrededor de esa puntuación de 91.9. Y eso importa mucho más de lo que parece, porque todo
00:04:09el argumento de venta de un modelo agentico es que lo dejas funcionar durante horas por su cuenta, así que si
00:04:14manipulará silenciosamente una prueba solo para parecer que tuvo éxito, tienes que preguntarte qué haría en tareas de producción
00:04:20reales cuando alguien no está supervisando y comprobando cada paso. En cuanto al coste, se ve bastante
00:04:25bien: Sol cuesta cinco dólares por millón de tokens de entrada y 30 por los de salida, Terra es la mitad de eso y Luna es un
00:04:32dólar de entrada y seis de salida. Como referencia, Claude Fable 5 ronda los 10 y 50, así que Sol cuesta aproximadamente la mitad
00:04:40del precio. Y esa es, posiblemente, una historia más útil que el benchmark: un modelo insignia más barato más un
00:04:45nivel presupuestario adecuado para tareas de gran volumen. En la práctica, usarías Luna para el trabajo barato de gran volumen,
00:04:51mantendrías Terra para la mayoría de tus tareas diarias y solo recurrirías a Sol cuando una tarea realmente necesite el razonamiento
00:04:56adicional, para no pagar precios de modelo insignia por todo. Entonces, ¿deberías cambiar algo
00:05:01hoy? Bueno, si ya trabajas en Codex, la respuesta es obviamente sí. Pero si estás invertido en
00:05:07otros laboratorios, no te reorganices todo el flujo de trabajo todavía. La ventaja en el benchmark
00:05:11es solo de unos pocos puntos y es una puntuación que su propio evaluador ni siquiera respalda. Si quieres aprender
00:05:17más sobre cómo estos modelos engañan al sistema, filmamos un video sobre exactamente eso, puedes verlo aquí.
00:05:22De lo contrario, he sido Warren para Better Stack, gracias por ver y nos vemos en el próximo.