7 reglas para usar GPT 5.6 mejor que el 90% de la gente

AAI LABS
Computing/SoftwareManagementInternet Technology

Transcript

00:00:00Acaba de salir GPT 5.6 Soul y ahora todo el mundo pregunta lo mismo.
00:00:04¿Es finalmente el modelo que supera a Claude?
00:00:06Como ya saben, somos una empresa de software,
00:00:08así que pasamos los últimos cuatro días ejecutando Soul en nuestros propios productos,
00:00:11incluyendo nuestra plataforma comunitaria hecha a medida y también en otros proyectos de clientes.
00:00:16Y lo que descubrimos no es que sea mejor o peor,
00:00:18es que Soul se comporta de manera muy diferente a Fable,
00:00:21así que usar ambos modelos de la misma forma significa que no estás aprovechando al máximo ninguno de los dos.
00:00:25Terminó parte del trabajo en una sola ejecución que normalmente le toma a Fable varias conversaciones,
00:00:29pero también siguió tomando acciones en lugares donde Fable normalmente se detendría,
00:00:32y durante las revisiones, encontró problemas en partes de nuestra aplicación que Fable se había negado a inspeccionar.
00:00:37Así que después de cuatro días de pruebas, terminamos con siete reglas para sacar lo mejor de Soul.
00:00:42Al final de este video, sabrás para qué usarlo,
00:00:44dónde supera a Fable, dónde no, y la única configuración que deberías dejar desactivada.
00:00:49Antes de entrar realmente en el video,
00:00:51pongámonos al día con el último lanzamiento de modelo de OpenAI por si te lo perdiste.
00:00:54OpenAI acaba de lanzar sus modelos más recientes bajo GPT 5.6
00:00:58y esta vez, lanzaron tres de ellos.
00:01:01Están Luna y Terra, que son los modelos más pequeños y económicos,
00:01:04y luego está Sol, que es el más capaz.
00:01:06¿Qué hay de nuevo realmente aquí?
00:01:07La propuesta principal de OpenAI esta vez es la eficiencia,
00:01:10básicamente obtener más trabajo de cada token y más rendimiento por cada dólar que gastas.
00:01:15OpenAI dice,
00:01:17que Fable en codificación y tareas de larga duración utiliza menos tokens y termina en aproximadamente la mitad del tiempo.
00:01:22En inteligencia general, sus propios números lo sitúan al mismo nivel que Fable, solo que a un menor costo,
00:01:28pero analizaremos eso más adelante.
00:01:30También han integrado la aplicación de escritorio independiente Codex en la aplicación ChatGPT,
00:01:34aunque todavía puedes usar Sol a través de la CLI de Codex, que es la versión de terminal de Codex.
00:01:38OpenAI también añadió un nuevo modo llamado Ultra, que ejecuta múltiples agentes a la vez en lugar de uno.
00:01:44Volveremos más tarde sobre si vale la pena usarlo.
00:01:46Así que ahora mismo, hay dos modelos en la cima.
00:01:48Está Fable, el que ya usas, y ahora está Sol.
00:01:51El resto de este video trata sobre cómo aprovechar al máximo Sol, incluyendo cuándo usarlo por encima de Fable.
00:01:57Empecemos primero con la parte honesta.
00:01:58Sol no es más inteligente que Fable.
00:02:00En problemas difíciles sin una solución clara, hemos visto que Fable sigue encontrando la mejor respuesta.
00:02:05La diferencia aparece una vez que la decisión ya se tomó y el modelo tiene que completar el trabajo.
00:02:09Fable es mejor para descubrir qué deberías hacer,
00:02:12mientras que Sol es mejor para continuar a través de cada paso sin necesidad de que lo traigas de vuelta a la tarea,
00:02:17y esa diferencia cambia cómo deberías usarlo.
00:02:20Empezando con la primera regla, necesitas establecer un límite antes de dejar que Sol trabaje por su cuenta.
00:02:24No tuvimos que pensar tanto en esto con Fable porque Fable normalmente se detiene o se niega cuando piensa que una acción es arriesgada.
00:02:31Sol se comporta de manera diferente.
00:02:32Sigue tomando acciones hasta que termina la tarea.
00:02:35El ejemplo más claro ocurrió mientras Sol trabajaba en una de nuestras tareas.
00:02:39Encontró archivos y procesos en ejecución en su camino,
00:02:41así que eliminó los archivos y detuvo los procesos sin preguntarnos primero.
00:02:45Fable normalmente se detendría en ese punto, pero Sol eliminó lo que lo bloqueaba y continuó con la tarea.
00:02:50Otras personas que prueban Sol vieron una versión más extrema del mismo comportamiento,
00:02:54e incluso vimos un caso en el que eliminó casi todos los archivos de la Mac de alguien.
00:02:59Así que antes de dejarlo funcionando, necesitas limitar lo que puede acceder.
00:03:02Antes de comenzar una tarea larga, pídele a Codex que cree una rama de Git separada y confirme la versión que ya funciona.
00:03:08La rama no limita lo que Sol puede tocar, pero te da un punto de control limpio para que puedas deshacer sus cambios si algo sale mal.
00:03:14Para configurar esto en la aplicación Codex, abre la configuración, establece la política de aprobación en nunca, y establece el entorno aislado en permiso de espacio de trabajo.
00:03:21Nunca significa que Sol puede seguir trabajando sin esperarte, mientras que permiso de espacio de trabajo significa que solo puede tocar archivos dentro de ese proyecto.
00:03:28Solo no selecciones acceso total porque eso le da acceso también a archivos fuera de tu aplicación.
00:03:32Ahora, una vez que hayas establecido esos límites, puedes usar ese mismo comportamiento a tu favor.
00:03:36Vimos el otro lado cuando le dimos a Sol una característica completa en AI Labs Pro.
00:03:40El mismo tipo de trabajo con Fable normalmente nos lleva varias rondas de ida y vuelta, pero Sol se mantuvo en el mismo objetivo y trabajó en toda la característica por su cuenta.
00:03:48También terminó mucho más rápido de lo que normalmente nos lleva el mismo trabajo con Fable.
00:03:52Así que usa Sol para el trabajo que normalmente tendrías que dividir en varias sesiones.
00:03:56Eso podría ser una característica completa, una revisión completa de tu aplicación, o cualquier tarea que toque varias partes del producto.
00:04:01Y un lugar donde vimos esta diferencia claramente fue durante las revisiones, lo que nos lleva a la segunda regla.
00:04:06Pero primero, tengamos una palabra de nuestro patrocinador.
00:04:08Salad Cloud
00:04:09Ejecutar modelos de OpenAI generalmente significa alquilar GPUs en la nube que cuestan una fortuna.
00:04:13Salad cambia eso.
00:04:14Desde 2018, han ejecutado una nube de GPU distribuida construida sobre las GPUs de consumo inactivas del mundo, más de 2 millones de ellas,
00:04:21así que sus precios suelen ser una fracción de los grandes proveedores, a veces más baratos por un orden de magnitud.
00:04:26Para los desarrolladores, la mejor parte es su puerta de enlace de IA.
00:04:29Es una API compatible con OpenAI, así que simplemente apuntas una herramienta como Cursor o Klein a un punto final y ejecutas modelos abiertos como Qwen 3.6.
00:04:38Sin servidores, sin arranques en frío.
00:04:39Cambié mi punto final por Qwen 3.6 de Salad en Klein, y construyó la característica de principio a fin, el mismo flujo de trabajo, a una pequeña fracción del costo.
00:04:48Y junto a los proveedores de nube habituales, la diferencia de precio es realmente difícil de creer.
00:04:53No hay bloqueo, no hay contratos, y puedes escalar en el momento en que lo necesites.
00:04:57Regístrate con mi enlace a continuación, luego envía un mensaje a su soporte para reclamar $10 en crédito gratuito y pruébalo tú mismo.
00:05:02Sol también es mejor para revisar el trabajo que Fable se niega a tocar.
00:05:06Y para ser claros, no estamos hablando del enrutamiento ocasional a Opus 4.8,
00:05:10que ocurre principalmente cuando le pides que explique su razonamiento o la tarea implica algo dañino.
00:05:15Estamos hablando de las restricciones de seguridad integradas directamente en Fable.
00:05:18Sabemos esto porque ya hemos usado Fable para este tipo de revisiones, así que sabíamos dónde se detendría normalmente.
00:05:24Cuando le dimos el mismo tipo de trabajo a Sol, no se detuvo ahí.
00:05:27Siguió revisando las partes de la aplicación que Fable siempre se había negado a inspeccionar, y encontró problemas en esas áreas.
00:05:32Pero esta es solo la primera razón por la que Sol revisa mejor.
00:05:35La otra es que puede abrir la aplicación terminada y probarla por sí mismo, lo que nos lleva a la tercera regla.
00:05:40Siempre que una tarea implique algo que puedes ver o hacer clic en la pantalla, Sol comenzará automáticamente a usar el uso de computadora.
00:05:46Dentro de la nueva aplicación ChatGPT, el uso de computadora de Sol puede funcionar en varias pestañas,
00:05:51usar sitios web en los que ya has iniciado sesión, y descargar archivos.
00:05:54Así que puede moverse a través de las mismas pantallas que tú usas en lugar de solo trabajar desde los archivos dentro de tu proyecto.
00:05:59Esto es lo que parecía en nuestra comunidad hecha a medida.
00:06:01Estábamos construyendo una nueva característica de tienda, y la aplicación no funciona de la misma manera para cada cuenta.
00:06:06Un administrador tiene un conjunto de opciones, un miembro regular tiene otro,
00:06:09y alguien en el plan de $20 debería poder hacer cosas diferentes a alguien en el plan de $100.
00:06:15Así que verificar la característica una vez no es suficiente.
00:06:17Sol pasó por el viaje completo para cada una de esas cuentas.
00:06:20Inició sesión como cada tipo de miembro, verificó lo que podían acceder, pasó por el proceso de comprar un producto,
00:06:26y luego repitió esas verificaciones en las otras partes de la aplicación que cambian según la cuenta.
00:06:31Probó la característica desde el punto de vista de cada persona que realmente la usaría.
00:06:35Así que cuando una característica se comporta de manera diferente para diferentes personas, ejecuta la revisión en una nueva conversación de Sol después de que se termine la construcción.
00:06:41Dale los diferentes tipos de cuentas y explica lo que cada uno debería poder hacer.
00:06:45Luego pídele que complete cada viaje de principio a fin y solo informe los problemas que pueda reproducir.
00:06:51Para nuestra tienda, eso significaba iniciar sesión como cada cuenta, comprar un producto, y verificar que cada persona viera la versión correcta de la característica.
00:06:57Ahora, este sitio web comunitario del que estamos hablando contiene todas las habilidades, flujos de trabajo, y otros recursos que construimos y mostramos en nuestros videos.
00:07:05Así que si encontraste valor en lo que hacemos y quieres apoyar al canal, esta es la mejor forma de hacerlo.
00:07:09El enlace está en la descripción.
00:07:10El uso de computadora cambia cómo Sol verifica el resultado final, pero también necesitas cambiar cómo le das la tarea en primer lugar.
00:07:17Lo cual nos lleva a la cuarta regla.
00:07:18La cuarta regla se centra en reestructurar las instrucciones y habilidades que ya estabas usando.
00:07:23Y esto se aplica tanto a Fable como a Sol, porque los modelos más nuevos son mejores para resolver los pasos básicos por sí mismos.
00:07:29Así que el objetivo no es hacer que cada instrucción sea lo más corta posible.
00:07:32Es eliminar instrucciones que no cambian el resultado y hacer que las instrucciones que sí importan sean más precisas.
00:07:37OpenAI explica esto en la guía de instrucciones de GPT 5.6.
00:07:41Aun así, deberías darle a Sol el resultado, los límites importantes, y lo que debe ser verdad antes de que se termine la tarea.
00:07:46Pero no necesitas mapear cada carpeta cuando las carpetas ya tienen un nombre adecuado,
00:07:50repetir la misma regla en tres lugares, o describir cada paso que el modelo debe tomar para llegar allí.
00:07:55Podemos mostrarte cómo se ve esto a través de nuestro sistema de animación.
00:07:58Lo primero que mantuvimos fue el código real que el modelo necesita replicar en el HTML.
00:08:03En lugar de describir la animación y dejar que el modelo la interprete, cada regla le da un patrón de trabajo que puede copiar.
00:08:09También mantuvimos el fondo exacto, la superficie, y los colores de acento para que el modelo no elija otros nuevos en cada ejecución.
00:08:15Pero la parte más útil fue descubrir qué podíamos eliminar.
00:08:18Una de nuestras reglas le decía al modelo que siempre guardara la animación terminada dentro de la carpeta de salida.
00:08:23Eliminamos esa línea y ejecutamos el mismo tipo de tarea de nuevo, y Sol aún la guardó allí.
00:08:27La instrucción no estaba cambiando el resultado porque el modelo ya podía determinar a dónde pertenecía el archivo terminado.
00:08:33Seguimos manteniendo esa línea por ahora porque cambiamos entre modelos,
00:08:36y un modelo más débil puede no captar el mismo patrón, pero esa es la prueba que deberías ejecutar en tus propias instrucciones y habilidades.
00:08:42Elimina una instrucción, ejecuta el mismo tipo de tarea de nuevo, y verifica si el resultado cambia.
00:08:47Si el modelo aún lo hace de manera confiable, esa instrucción probablemente no necesita estar allí.
00:08:52OpenAI informó que este tipo de limpieza mejoró sus propios resultados en un 10-15% mientras usaba entre un 41-66% menos de tokens.
00:09:00Ahora, la instrucción controla lo que Sol está tratando de hacer, pero el modo controla cuántos agentes usa para hacerlo, lo que nos lleva a la quinta regla.
00:09:07Y si te está gustando el video hasta ahora, suscríbete al canal y presiona el botón de hype.
00:09:12Este pequeño gesto de apoyo significa mucho para nosotros.
00:09:15Mantén Ultra desactivado por ahora.
00:09:17Ultra es el modo multi-agente de Sol.
00:09:19Así que en lugar de ejecutar un agente, divide la tarea y ejecuta varios de ellos al mismo tiempo.
00:09:24OpenAI lo posiciona como el modo para el trabajo más difícil, pero cada agente usa sus propios tokens,
00:09:29lo que significa que Ultra puede consumir tu uso mucho más rápido que Sol regular.
00:09:33Y cuando usamos Ultra en el mismo tipo de trabajo que ya habíamos estado ejecutando a través de Sol regular,
00:09:38no vimos una mejora significativa en el resultado terminado.
00:09:41El uso aumentó porque varios agentes estaban ejecutándose, pero la calidad se mantuvo casi igual.
00:09:46Los propios resultados de OpenAI muestran la misma pequeña diferencia, con Ultra mejorando los puntajes en aproximadamente 2 o 3 puntos dependiendo de la prueba.
00:09:54Y si Sol regular es tu valor predeterminado, la siguiente pregunta es si deberías ahorrar más uso enviando las tareas más pequeñas a Terra o Luna.
00:10:01Si estás usando Codex para construir tu aplicación, mantén Sol como predeterminado en lugar de cambiar tareas más pequeñas a Terra o Luna.
00:10:08Terra y Luna son más baratos a través de la API, lo cual importa cuando estás pagando por cada solicitud que tu propio producto envía al modelo.
00:10:15Pero cuando estás usando Codex a través de una suscripción, la decisión es diferente porque estás trabajando dentro del uso incluido en tu plan.
00:10:21Encontramos esto después de enrutar las partes más ligeras de nuestro trabajo a los modelos más pequeños.
00:10:25Completaron la tarea, pero la caída en la calidad significó que pasamos más tiempo corrigiendo el resultado de lo que normalmente hacíamos con Sol.
00:10:31Así que volvimos a Sol para la tarea completa en lugar de cambiar de modelos a mitad de ella.
00:10:36Así que eso deja la última pregunta. ¿Cuándo deberías usar Sol y cuándo deberías volver a Fable?
00:10:40Después de usar ambos modelos en nuestro flujo de trabajo diario, la forma más clara en que los posicionaríamos es esta.
00:10:45Fable es una vista previa de hacia dónde se dirigen los modelos de codificación, mientras que Sol es la versión más completa de cómo funcionan hoy.
00:10:51Y la diferencia de velocidad afecta el flujo de trabajo más que los puntajes de referencia.
00:10:55En nuestro uso diario, Fable, Opus y Sonnet tardan más en completar el mismo tipo de trabajo.
00:11:00Por otro lado, los modelos de Codex son mucho más rápidos y estamos diciendo eso sin siquiera activar el modo rápido de Codex, que usa 1.5 veces tu uso.
00:11:08Esto en nuestra opinión es uno de los mayores factores decisivos y es la razón por la que nos hemos visto recurriendo más a los modelos de Codex que a Claude.
00:11:16Así que usa Fable antes de la construcción cuando necesites ayuda para decidir cómo debería funcionar la aplicación, cómo debería estructurarse una característica o por qué sigue ocurriendo un problema difícil.
00:11:24Una vez que se hayan tomado esas decisiones, deja que Sol lo construya, ahí es donde lo usas para la característica completa, el trabajo de larga duración, la revisión y cualquier cosa que deba verificarse en la pantalla.
00:11:32Así que después de cuatro días de usar Sol, se ha convertido en nuestro predeterminado una vez que ya sabemos qué debe hacer el resultado final, mientras que Fable sigue manejando las decisiones que necesitan más juicio.
00:11:41La parte importante es establecer el límite, darle a cada modelo el trabajo correcto y revisar el resultado antes de enviarlo.
00:11:47Eso nos lleva al final de este video. Si te gustaría apoyar al canal y ayudarnos a seguir haciendo videos como este, puedes hacerlo usando el botón de súper gracias a continuación.
00:11:56Como siempre, gracias por mirar y nos vemos en el próximo.

Key Takeaway

Utiliza Fable para definir la estrategia y la arquitectura de un proyecto, y delega la ejecución, implementación de características y pruebas funcionales de larga duración a Soul para maximizar la eficiencia.

Highlights

  • GPT 5.6 Soul destaca en tareas de ejecución continua y larga duración, superando a Fable al trabajar sin pausas en procesos complejos.

  • Establecer un entorno aislado (permiso de espacio de trabajo) en la configuración de Codex evita que Soul acceda a archivos fuera del proyecto activo.

  • La limpieza de instrucciones innecesarias mejora los resultados entre un 10% y un 15% y reduce el uso de tokens entre un 41% y un 66%.

  • El modo Ultra multi-agente aumenta el consumo de recursos sin ofrecer mejoras significativas en la calidad del resultado final.

  • Soul es capaz de realizar pruebas funcionales interactuando directamente con la interfaz de usuario, incluyendo el inicio de sesión con diferentes tipos de cuenta.

  • Fable mantiene superioridad en el razonamiento inicial y la toma de decisiones estratégicas, mientras que Soul es más eficaz para materializar esos planes.

Timeline

Diferencias operativas entre Soul y Fable

  • Soul se comporta de manera distinta a Fable al no detenerse en pasos intermedios durante la ejecución de tareas.
  • Fable es más eficaz para determinar la lógica o estrategia, mientras que Soul destaca en la implementación continua.
  • La eficiencia de Soul permite realizar en una sola sesión trabajos que requerirían varias interacciones con Fable.

Las pruebas en productos de software reales demuestran que Soul y Fable tienen naturalezas operativas distintas. Mientras Fable tiende a pausar cuando enfrenta riesgos, Soul persiste en la acción hasta finalizar la tarea. Esta diferencia fundamental hace necesario adaptar el flujo de trabajo según el modelo utilizado.

Reglas para el uso seguro y eficiente de Soul

  • Es obligatorio definir límites de acceso al entorno antes de ejecutar tareas con Soul para evitar acciones no deseadas.
  • La creación de una rama de Git previa a la ejecución proporciona un punto de control para revertir cambios automáticos.
  • Soul es ideal para desarrollar características completas que requieran tocar múltiples partes del producto.

La persistencia de Soul puede llevar a la eliminación inadvertida de archivos o procesos bloqueantes. La configuración debe restringirse mediante 'permiso de espacio de trabajo' para evitar acceso total. Estas medidas permiten aprovechar su capacidad para completar características enteras sin intervención manual constante.

Pruebas funcionales e interfaz de usuario

  • Soul puede realizar inspecciones de seguridad en áreas de la aplicación que Fable evita por restricciones integradas.
  • La función de uso de computadora permite a Soul interactuar con aplicaciones mediante clics y pestañas.
  • La ejecución de flujos de trabajo con múltiples tipos de cuentas asegura una validación precisa del acceso a funciones.

Soul supera a Fable en la revisión de código y funcionalidades al poder probarlas directamente en la interfaz. Puede simular diversos usuarios (por ejemplo, administradores versus miembros) para verificar que las restricciones de acceso y las características funcionen correctamente para cada caso de uso.

Optimización de instrucciones y modos de ejecución

  • La eliminación de instrucciones redundantes optimiza el rendimiento y reduce significativamente el uso de tokens.
  • El modo Ultra multi-agente consume más recursos sin proporcionar mejoras sustanciales en la calidad final.
  • Mantener a Soul como modelo predeterminado es más eficiente que cambiar a modelos más pequeños para tareas ligeras debido a la posible pérdida de calidad.

La optimización de los prompts mediante la eliminación de pasos redundantes, que el modelo ya puede inferir, mejora el desempeño entre un 10% y un 15%. Se recomienda desactivar el modo Ultra, ya que los agentes adicionales no justifican el mayor consumo de tokens por la mínima mejora observada en los resultados.

Community Posts

View all posts