Combina Fable 5 y Sol 5.6 con esta habilidad (o te quedarás atrás)

CChase AI
Computing/SoftwareManagementInternet Technology

Transcript

00:00:00GPT 5.6, también conocido como Sol, sale mañana y la gran pregunta que todos tienen en mente es
00:00:05¿este nuevo modelo supera a Claude Fable? Bueno, creo que esa es la pregunta equivocada, porque
00:00:11en lugar de intentar averiguar cuál de estos modelos es mejor, deberíamos preguntarnos cómo podemos
00:00:16usar estos dos potentes modelos juntos. Y en el video de hoy, voy a darte una habilidad
00:00:20que hace exactamente eso. Esta habilidad incluye un modo de planificación supercargado basado en el
00:00:26grill me de Matt Pocock. Luego tenemos una sesión de planificación adversarial donde Claude y Codex se enfrentan
00:00:30hasta llegar a una conclusión. Luego, cuando estamos listos, tomamos ese plan impulsado por Fable y se lo entregamos
00:00:37a Codex, que a partir de mañana incluirá a Sol 5.6. Después de que Codex se pone a trabajar, tenemos a Fable
00:00:44revisando todo el proceso. En definitiva, no solo estamos obteniendo lo mejor de ambos modelos, sino que
00:00:49también estamos ahorrando tokens en conjunto frente a hacer que Fable lo haga todo. Así que voy a mostrarte cómo
00:00:54funciona esto, vamos a hacer una demostración rápida y luego les daré la habilidad. Entonces, ¿por qué deberíamos
00:00:58preocuparnos por crear algún tipo de habilidad donde Fable haga la mayor parte de la planificación y luego se la pasemos
00:01:02a Sol 5.6? Bueno, la primera razón es que Sol 5.6 es increíblemente potente, al menos según los puntos de referencia.
00:01:10Ahora, tómenlo con pinzas, esto viene de OpenAI, pero cuando miramos Sol 5.6 Ultra y el estándar
00:01:175.6 Sol, vemos números en Terminal Bench 2.1 que lo sitúan por delante de Claude Mythos, por no hablar de Fable 5.
00:01:24La segunda razón es la eficiencia de tokens. Hay una razón real por la que ves tanto contenido sobre
00:01:29oye, ¿cómo podemos reducir el uso de Fable? Y los tipos de cosas que ves son como el modo asesor, ya sabes,
00:01:35esencialmente hacer que Fable planifique y que Opus ejecute. Bueno, ¿por qué hacer que Opus ejecute si por el mismo precio
00:01:42podría hacer que 5.6 lo haga, o 5.5? El punto es que estamos haciendo esa misma estructura pero con un modelo mejor
00:01:49y posiblemente un modelo más barato que Opus. Cuando miramos 5.6, es más eficiente en tokens que 5.5, que
00:01:56era más eficiente en tokens que Opus 4.6, y podemos ver eso en los datos. Lo que estamos viendo justo aquí
00:02:02es GPT 5.5 en modo extra alto. Su tasa de éxito en este benchmark fue del 23% a $1.24. Cuando miro 5.6
00:02:12tiene un 25% de puntuación, así que una puntuación más alta a 56 centavos, así que mucho más barato y, por lo tanto, mucho más eficiente, y cuando
00:02:20miramos las comparaciones directas de 5.5 frente a Opus 4.8, realmente no hay competencia. Tasas de éxito más altas, menor costo.
00:02:28Así que básicamente estamos tomando esa misma idea y simplemente intensificándola con esta mejora 5.6.
00:02:33Entonces, ¿cómo funciona realmente la habilidad? Bueno, en realidad tengo un par de habilidades para ti. En el vacío, tenemos
00:02:38la habilidad de construcción de Codex. Esta es la idea de que creaste un plan con Fable y Codex simplemente va
00:02:43a proceder a construir esa característica o producto en particular. También he incluido una versión actualizada
00:02:48de Grill Me Codex. He hecho un video sobre esta habilidad antes, y lo que hemos hecho es añadir
00:02:54esta idea de que GPT 5.6 realmente sale y construye cosas para nosotros, y así, cuando observamos el
00:03:01Grill Me Codex más completo, que es la gran habilidad, ocurre en cuatro etapas. La idea es que tienes
00:03:08algún tipo de proyecto, alguna característica que quieres empezar, y lo inicias con Grill Me Codex, y
00:03:12lo primero que sucede es una entrevista. Esta entrevista es literalmente la habilidad Grill Me de
00:03:18Matt Pocock. Así que es un modo de plan con esteroides. Va mucho más profundo de lo que normalmente lo haría Claude Code
00:03:23y hacemos esto con Fable. Muy bien, así que Fable lleva el mando aquí. En segundo lugar, tenemos la planificación
00:03:30adversarial. Entonces Fable ha ideado el plan. Luego tomamos ese plan de Fable y lo enviamos a Codex.
00:03:37Ahora, en el video de hoy, eso será 5.5, pero mañana eso será 5.6, y Fable y Codex van y vienen
00:03:43por un máximo de cinco iteraciones donde Fable dice: oye, aquí está el plan. Codex dice: está bien, se ve bien,
00:03:49excepto X, Y y Z. Luego Fable dice: estoy de acuerdo, no estoy de acuerdo, y van y vienen hasta que llegan
00:03:54a un consenso. Ahora, una vez que alcanzan ese consenso, y aquí es donde ocurren las actualizaciones, ahora enviamos
00:04:01la construcción real a Codex, a 5.5 hoy y 5.6 mañana. Creo que esto es mucho mejor que pasar
00:04:09las cosas a Opus o a Sonnet o usar el modo asesor dentro de Claude Code porque estos modelos GPT son
00:04:14simplemente mejores que esos modelos más pequeños de Anthropic y son más baratos, así que realmente es un escenario donde
00:04:21a menos que simplemente seas súper anti-GPT y anti-Codex, es difícil argumentar lo contrario, especialmente si llegamos
00:04:27a un lugar donde Fable esté como fuera del mercado. Y por último, una vez que Codex termina la construcción, Fable
00:04:32va a entrar y va a revisar lo que hizo, y va a pasar por un máximo de dos
00:04:37iteraciones, digamos que Fable piensa que Codex hizo algo mal, va a decir: oye Codex, hiciste
00:04:42eso mal, arréglalo. Hará eso dos veces; si a la tercera vez no está completo, bueno, entonces Fable
00:04:47lo limpiará él mismo. Así que este es el proceso mediante el cual creo que obtenemos lo mejor de OpenAI y
00:04:54Anthropic. Ahora, antes de saltar a la demostración, una rápida palabra de nuestro patrocinador: yo. Así que acabo de lanzar mi
00:04:59Master Class de Claude Code dentro de Chase AI Plus, y es la forma número uno de pasar de cero a desarrollador de IA
00:05:04especialmente si no vienes de un entorno técnico. Actualizo esto cada semana, nos enfocamos
00:05:09en casos de uso reales y también incluye una Master Class de Codex, así que si quieres ponerte un poco
00:05:15más serio con la IA y no tienes idea de por dónde empezar, este es el lugar para ti. Habrá un
00:05:19enlace en el comentario fijado. Ahora, instalar y usar la habilidad es bastante sencillo. Pondré un enlace a
00:05:24el GitHub en la descripción. Ahora, para usar esto, simplemente vamos a escribir /grill me codex
00:05:28y simplemente le damos un aviso de lo que estamos intentando construir. Así que estamos intentando construir Trip Atlas, que
00:05:33es una aplicación web de planificación de viajes cinematográfica y estilizada, y entro un poco más en detalles sobre lo que
00:05:38quiero que sea, ¿verdad? Quiero que se vea algo genial, puedo poner los diferentes lugares a los que voy, todo eso,
00:05:42y una vez que haga esto, lo que sucederá es que iniciará la sección Grill Me
00:05:46del plan, que, si estás familiarizado con el trabajo de Matt Pocock, es esencialmente solo un modo de plan con
00:05:51esteroides. Va a hacerme unas ocho, nueve, diez preguntas diferentes. Voy mucho más profundo que tu modo de
00:05:56plan estándar, así que me está preguntando para qué es esto; vamos a decir que es para una herramienta
00:06:01personal real, no solo una demostración en video. Y para cada una de estas, también da sus recomendaciones, así que si estás
00:06:06confundido sobre qué debería elegir y por qué, todo eso está explicado para ti. Ahora está preguntando sobre geocodificación
00:06:11y continuará con esa serie de preguntas hasta que esté feliz con lo que estamos
00:06:15creando. Ahora voy a saltarme el resto de las preguntas porque te puedes imaginar
00:06:19cómo se verán las siguientes siete u ocho preguntas y pasaremos a la planificación adversarial
00:06:24etapa. Así que puedes ver aquí que ha escrito el plan y también crea un archivo markdown donde registra
00:06:28todo el ir y venir entre Codex y Claude Code. Y así, ahora mismo estamos en la ronda uno donde está
00:06:34pasándoselo a GPT, y puedes verlos ir y venir aquí en el registro, pero en este
00:06:41caso, solo tomó dos rondas antes de que fuera aprobado, así que podemos ver lo que las dos aprobaciones mejoraron,
00:06:47ya sabes, bloquear la identidad, herramienta personal real, qué tipo de stack será, y
00:06:53luego tuvo 12 hallazgos en la segunda ronda relacionados con, como, fortalecer el núcleo de datos. Ahora, una vez que
00:06:59se completa este ir y venir, tienes algunas opciones: o Codex va a construirlo, un poco como de lo que
00:07:05hemos hablado desde el principio, o tenemos la opción simplemente de hacer que Claude lo construya, así que por cualquier razón,
00:07:09como, no quiero traer a GPT, puedes quedártelo con Fable, o puedes parar aquí, pero vamos a seguir adelante
00:07:14y dejar que Codex construya esto, y de nuevo, podemos ir y venir si piensas, bueno, ¿GPT 5.6 va a ser
00:07:20mejor que Fable o 5.5 versus Opus 4.8? Al final del día, el valor real que realmente no puede ser discutido
00:07:26va a ser la eficiencia de tokens, especialmente si 5.6 está siquiera cerca de lo que los benchmarks
00:07:34están afirmando. Así que Codex ha terminado su construcción, y puedes ver ahora lo que está pasando es la etapa de revisión,
00:07:40así que ahora Fable va a revisar todo lo que Codex ha construido, y luego va a volver a Codex
00:07:44y decir: esto está mal, esto estaba bien. Recuerda, hará dos iteraciones de eso antes de decir: oye,
00:07:49quiero conducir, tomará el volante y empezará a escribir el código él mismo. Ahora, Fable ha terminado con
00:07:54su revisión, dijo que hay un par de desviaciones que sintió que eran todas razonables, revisa los
00:07:59archivos y todo esto, y ahora está preguntando, ¿quieres confirmar o quieres echarle un vistazo? Así que
00:08:02echemos un vistazo a lo que realmente construyó, y esto es lo que tenemos. Así que aquí tenemos, como,
00:08:08un mapa del mundo, y parece que creó algunos gráficos personalizados usando el generador de imágenes de GPT,
00:08:14así que puedes nombrar el viaje, puedes añadir paradas aquí a la izquierda, puedes poner adónde
00:08:20vas y luego, como, qué vas a hacer en esos diferentes lugares. También
00:08:25tiene esta reproducción cinematográfica, y voy a silenciar esto, así que veamos qué pasa aquí.
00:08:31Así que parece que, me moveré por aquí, puedes ver, como, este extraño avión saltando de punto en punto,
00:08:38que parece que creó como un SVG. Hay pequeños sellos de pasaporte y, boom, ahí lo tenemos. Así que
00:08:45sabes, hay mucho que podríamos hacer aquí para hacerlo ver, creo, mejor, pero en general construyó
00:08:52lo que dijimos que queríamos, ¿verdad? Como que todo realmente funciona aquí. Ya sabes, si borro cosas en
00:08:57aquí, elimino algunas, puedo moverlas arriba, abajo, puedo cambiar cosas. Digamos que añadimos Tokio, de repente
00:09:04realmente muestra qué tan lejos está esa parada, eso es interesante. Si añado eso a la ruta, ahí vamos,
00:09:11así que, ya sabes, realmente construí esto. Creo que no estaría mal, creo que para la primera pasada, y
00:09:17de lo que realmente se trataba esto era solo mostrar este flujo de trabajo en acción. Y también puedes ver aquí abajo
00:09:21en términos de nuestro uso, solo quemamos alrededor de 130,000 tokens en el lado de Fable para conseguir que todo
00:09:26esto se hiciera. Así que esa es la habilidad en acción. Espero que saques mucho provecho de esto una vez que Sol 5.6 salga.
00:09:31Como siempre, déjame saber qué pensaste sobre este video en los comentarios. Asegúrate de echarle un vistazo a Chase AI Plus,
00:09:37y nos vemos por ahí.

Key Takeaway

Optimizar el desarrollo de aplicaciones de IA mediante la combinación estratégica de Claude Fable para la planificación y GPT Sol 5.6 para la ejecución aumenta la eficiencia de tokens y reduce costos operativos.

Highlights

  • La integración de Claude Fable y GPT Sol 5.6 permite un ahorro significativo de tokens en comparación con el uso exclusivo de Fable.

  • El benchmark Terminal Bench 2.1 sitúa a Sol 5.6 por delante de Claude Mythos en rendimiento.

  • GPT 5.6 logra una tasa de éxito del 25% con un costo de 56 centavos, superando el 23% de éxito a 1,24 dólares de GPT 5.5.

  • El flujo de trabajo Grill Me Codex utiliza a Fable para la planificación profunda y a Codex para la construcción técnica del proyecto.

  • El proceso de desarrollo automatizado incluye una etapa de planificación adversarial con un máximo de cinco iteraciones para alcanzar consenso.

  • La etapa final del flujo implica dos iteraciones de revisión donde Fable corrige el código generado por Codex.

Timeline

Sinergia entre modelos y eficiencia

  • El uso conjunto de Fable y Sol 5.6 optimiza tanto la capacidad de planificación como la ejecución técnica.
  • Sol 5.6 presenta mayor eficiencia en el uso de tokens y menores costos unitarios que las versiones 5.5 y Opus 4.6.
  • Los datos de Terminal Bench 2.1 demuestran una mayor tasa de éxito de Sol 5.6 frente a competidores directos.

La estrategia se aleja de comparar modelos aislados para centrarse en un flujo de trabajo combinado. El análisis comparativo de costos y tasas de éxito confirma que Sol 5.6 mejora los resultados operativos respecto a sus predecesores y alternativas de Anthropic.

Estructura del proceso Grill Me Codex

  • El flujo consta de cuatro etapas: entrevista inicial, planificación adversarial, construcción técnica y revisión final.
  • La entrevista inicial basada en el método de Matt Pocock profundiza más que el modo de plan estándar.
  • La planificación adversarial permite un máximo de cinco iteraciones de intercambio entre modelos para asegurar la calidad del plan.

El flujo de trabajo automatiza el ciclo de vida de desarrollo. Fable lidera la entrevista para definir requisitos y la planificación, seguido por un debate adversarial con Codex para refinar el plan. Finalmente, Codex ejecuta la construcción y Fable realiza dos iteraciones de revisión para corregir desviaciones.

Demostración práctica de la habilidad

  • La ejecución del comando /grill me codex inicia el proceso de entrevista detallada para la construcción de software.
  • El sistema genera un archivo markdown con el registro detallado de las iteraciones entre modelos.
  • El uso de esta habilidad para la creación de una aplicación de viajes resultó en un consumo de aproximadamente 130,000 tokens.

La demostración con la aplicación Trip Atlas ilustra cómo el sistema gestiona la creación de interfaces cinematográficas y estructuras de datos personalizadas. El registro del proceso muestra la transparencia del flujo, permitiendo al usuario validar las decisiones técnicas en cada fase antes de la finalización del producto.

Community Posts

View all posts