Combina Fable 5 y Sol 5.6 con esta habilidad (o te quedarás atrás)
CChase AI
Computing/SoftwareManagementInternet Technology
Transcript
00:00:00GPT 5.6, también conocido como Sol, sale mañana y la gran pregunta que todos tienen en mente es
00:00:05¿este nuevo modelo supera a Claude Fable? Bueno, creo que esa es la pregunta equivocada, porque
00:00:11en lugar de intentar averiguar cuál de estos modelos es mejor, deberíamos preguntarnos cómo podemos
00:00:16usar estos dos potentes modelos juntos. Y en el video de hoy, voy a darte una habilidad
00:00:20que hace exactamente eso. Esta habilidad incluye un modo de planificación supercargado basado en el
00:00:26grill me de Matt Pocock. Luego tenemos una sesión de planificación adversarial donde Claude y Codex se enfrentan
00:00:30hasta llegar a una conclusión. Luego, cuando estamos listos, tomamos ese plan impulsado por Fable y se lo entregamos
00:00:37a Codex, que a partir de mañana incluirá a Sol 5.6. Después de que Codex se pone a trabajar, tenemos a Fable
00:00:44revisando todo el proceso. En definitiva, no solo estamos obteniendo lo mejor de ambos modelos, sino que
00:00:49también estamos ahorrando tokens en conjunto frente a hacer que Fable lo haga todo. Así que voy a mostrarte cómo
00:00:54funciona esto, vamos a hacer una demostración rápida y luego les daré la habilidad. Entonces, ¿por qué deberíamos
00:00:58preocuparnos por crear algún tipo de habilidad donde Fable haga la mayor parte de la planificación y luego se la pasemos
00:01:02a Sol 5.6? Bueno, la primera razón es que Sol 5.6 es increíblemente potente, al menos según los puntos de referencia.
00:01:10Ahora, tómenlo con pinzas, esto viene de OpenAI, pero cuando miramos Sol 5.6 Ultra y el estándar
00:01:175.6 Sol, vemos números en Terminal Bench 2.1 que lo sitúan por delante de Claude Mythos, por no hablar de Fable 5.
00:01:24La segunda razón es la eficiencia de tokens. Hay una razón real por la que ves tanto contenido sobre
00:01:29oye, ¿cómo podemos reducir el uso de Fable? Y los tipos de cosas que ves son como el modo asesor, ya sabes,
00:01:35esencialmente hacer que Fable planifique y que Opus ejecute. Bueno, ¿por qué hacer que Opus ejecute si por el mismo precio
00:01:42podría hacer que 5.6 lo haga, o 5.5? El punto es que estamos haciendo esa misma estructura pero con un modelo mejor
00:01:49y posiblemente un modelo más barato que Opus. Cuando miramos 5.6, es más eficiente en tokens que 5.5, que
00:01:56era más eficiente en tokens que Opus 4.6, y podemos ver eso en los datos. Lo que estamos viendo justo aquí
00:02:02es GPT 5.5 en modo extra alto. Su tasa de éxito en este benchmark fue del 23% a $1.24. Cuando miro 5.6
00:02:12tiene un 25% de puntuación, así que una puntuación más alta a 56 centavos, así que mucho más barato y, por lo tanto, mucho más eficiente, y cuando
00:02:20miramos las comparaciones directas de 5.5 frente a Opus 4.8, realmente no hay competencia. Tasas de éxito más altas, menor costo.
00:02:28Así que básicamente estamos tomando esa misma idea y simplemente intensificándola con esta mejora 5.6.
00:02:33Entonces, ¿cómo funciona realmente la habilidad? Bueno, en realidad tengo un par de habilidades para ti. En el vacío, tenemos
00:02:38la habilidad de construcción de Codex. Esta es la idea de que creaste un plan con Fable y Codex simplemente va
00:02:43a proceder a construir esa característica o producto en particular. También he incluido una versión actualizada
00:02:48de Grill Me Codex. He hecho un video sobre esta habilidad antes, y lo que hemos hecho es añadir
00:02:54esta idea de que GPT 5.6 realmente sale y construye cosas para nosotros, y así, cuando observamos el
00:03:01Grill Me Codex más completo, que es la gran habilidad, ocurre en cuatro etapas. La idea es que tienes
00:03:08algún tipo de proyecto, alguna característica que quieres empezar, y lo inicias con Grill Me Codex, y
00:03:12lo primero que sucede es una entrevista. Esta entrevista es literalmente la habilidad Grill Me de
00:03:18Matt Pocock. Así que es un modo de plan con esteroides. Va mucho más profundo de lo que normalmente lo haría Claude Code
00:03:23y hacemos esto con Fable. Muy bien, así que Fable lleva el mando aquí. En segundo lugar, tenemos la planificación
00:03:30adversarial. Entonces Fable ha ideado el plan. Luego tomamos ese plan de Fable y lo enviamos a Codex.
00:03:37Ahora, en el video de hoy, eso será 5.5, pero mañana eso será 5.6, y Fable y Codex van y vienen
00:03:43por un máximo de cinco iteraciones donde Fable dice: oye, aquí está el plan. Codex dice: está bien, se ve bien,
00:03:49excepto X, Y y Z. Luego Fable dice: estoy de acuerdo, no estoy de acuerdo, y van y vienen hasta que llegan
00:03:54a un consenso. Ahora, una vez que alcanzan ese consenso, y aquí es donde ocurren las actualizaciones, ahora enviamos
00:04:01la construcción real a Codex, a 5.5 hoy y 5.6 mañana. Creo que esto es mucho mejor que pasar
00:04:09las cosas a Opus o a Sonnet o usar el modo asesor dentro de Claude Code porque estos modelos GPT son
00:04:14simplemente mejores que esos modelos más pequeños de Anthropic y son más baratos, así que realmente es un escenario donde
00:04:21a menos que simplemente seas súper anti-GPT y anti-Codex, es difícil argumentar lo contrario, especialmente si llegamos
00:04:27a un lugar donde Fable esté como fuera del mercado. Y por último, una vez que Codex termina la construcción, Fable
00:04:32va a entrar y va a revisar lo que hizo, y va a pasar por un máximo de dos
00:04:37iteraciones, digamos que Fable piensa que Codex hizo algo mal, va a decir: oye Codex, hiciste
00:04:42eso mal, arréglalo. Hará eso dos veces; si a la tercera vez no está completo, bueno, entonces Fable
00:04:47lo limpiará él mismo. Así que este es el proceso mediante el cual creo que obtenemos lo mejor de OpenAI y
00:04:54Anthropic. Ahora, antes de saltar a la demostración, una rápida palabra de nuestro patrocinador: yo. Así que acabo de lanzar mi
00:04:59Master Class de Claude Code dentro de Chase AI Plus, y es la forma número uno de pasar de cero a desarrollador de IA
00:05:04especialmente si no vienes de un entorno técnico. Actualizo esto cada semana, nos enfocamos
00:05:09en casos de uso reales y también incluye una Master Class de Codex, así que si quieres ponerte un poco
00:05:15más serio con la IA y no tienes idea de por dónde empezar, este es el lugar para ti. Habrá un
00:05:19enlace en el comentario fijado. Ahora, instalar y usar la habilidad es bastante sencillo. Pondré un enlace a
00:05:24el GitHub en la descripción. Ahora, para usar esto, simplemente vamos a escribir /grill me codex
00:05:28y simplemente le damos un aviso de lo que estamos intentando construir. Así que estamos intentando construir Trip Atlas, que
00:05:33es una aplicación web de planificación de viajes cinematográfica y estilizada, y entro un poco más en detalles sobre lo que
00:05:38quiero que sea, ¿verdad? Quiero que se vea algo genial, puedo poner los diferentes lugares a los que voy, todo eso,
00:05:42y una vez que haga esto, lo que sucederá es que iniciará la sección Grill Me
00:05:46del plan, que, si estás familiarizado con el trabajo de Matt Pocock, es esencialmente solo un modo de plan con
00:05:51esteroides. Va a hacerme unas ocho, nueve, diez preguntas diferentes. Voy mucho más profundo que tu modo de
00:05:56plan estándar, así que me está preguntando para qué es esto; vamos a decir que es para una herramienta
00:06:01personal real, no solo una demostración en video. Y para cada una de estas, también da sus recomendaciones, así que si estás
00:06:06confundido sobre qué debería elegir y por qué, todo eso está explicado para ti. Ahora está preguntando sobre geocodificación
00:06:11y continuará con esa serie de preguntas hasta que esté feliz con lo que estamos
00:06:15creando. Ahora voy a saltarme el resto de las preguntas porque te puedes imaginar
00:06:19cómo se verán las siguientes siete u ocho preguntas y pasaremos a la planificación adversarial
00:06:24etapa. Así que puedes ver aquí que ha escrito el plan y también crea un archivo markdown donde registra
00:06:28todo el ir y venir entre Codex y Claude Code. Y así, ahora mismo estamos en la ronda uno donde está
00:06:34pasándoselo a GPT, y puedes verlos ir y venir aquí en el registro, pero en este
00:06:41caso, solo tomó dos rondas antes de que fuera aprobado, así que podemos ver lo que las dos aprobaciones mejoraron,
00:06:47ya sabes, bloquear la identidad, herramienta personal real, qué tipo de stack será, y
00:06:53luego tuvo 12 hallazgos en la segunda ronda relacionados con, como, fortalecer el núcleo de datos. Ahora, una vez que
00:06:59se completa este ir y venir, tienes algunas opciones: o Codex va a construirlo, un poco como de lo que
00:07:05hemos hablado desde el principio, o tenemos la opción simplemente de hacer que Claude lo construya, así que por cualquier razón,
00:07:09como, no quiero traer a GPT, puedes quedártelo con Fable, o puedes parar aquí, pero vamos a seguir adelante
00:07:14y dejar que Codex construya esto, y de nuevo, podemos ir y venir si piensas, bueno, ¿GPT 5.6 va a ser
00:07:20mejor que Fable o 5.5 versus Opus 4.8? Al final del día, el valor real que realmente no puede ser discutido
00:07:26va a ser la eficiencia de tokens, especialmente si 5.6 está siquiera cerca de lo que los benchmarks
00:07:34están afirmando. Así que Codex ha terminado su construcción, y puedes ver ahora lo que está pasando es la etapa de revisión,
00:07:40así que ahora Fable va a revisar todo lo que Codex ha construido, y luego va a volver a Codex
00:07:44y decir: esto está mal, esto estaba bien. Recuerda, hará dos iteraciones de eso antes de decir: oye,
00:07:49quiero conducir, tomará el volante y empezará a escribir el código él mismo. Ahora, Fable ha terminado con
00:07:54su revisión, dijo que hay un par de desviaciones que sintió que eran todas razonables, revisa los
00:07:59archivos y todo esto, y ahora está preguntando, ¿quieres confirmar o quieres echarle un vistazo? Así que
00:08:02echemos un vistazo a lo que realmente construyó, y esto es lo que tenemos. Así que aquí tenemos, como,
00:08:08un mapa del mundo, y parece que creó algunos gráficos personalizados usando el generador de imágenes de GPT,
00:08:14así que puedes nombrar el viaje, puedes añadir paradas aquí a la izquierda, puedes poner adónde
00:08:20vas y luego, como, qué vas a hacer en esos diferentes lugares. También
00:08:25tiene esta reproducción cinematográfica, y voy a silenciar esto, así que veamos qué pasa aquí.
00:08:31Así que parece que, me moveré por aquí, puedes ver, como, este extraño avión saltando de punto en punto,
00:08:38que parece que creó como un SVG. Hay pequeños sellos de pasaporte y, boom, ahí lo tenemos. Así que
00:08:45sabes, hay mucho que podríamos hacer aquí para hacerlo ver, creo, mejor, pero en general construyó
00:08:52lo que dijimos que queríamos, ¿verdad? Como que todo realmente funciona aquí. Ya sabes, si borro cosas en
00:08:57aquí, elimino algunas, puedo moverlas arriba, abajo, puedo cambiar cosas. Digamos que añadimos Tokio, de repente
00:09:04realmente muestra qué tan lejos está esa parada, eso es interesante. Si añado eso a la ruta, ahí vamos,
00:09:11así que, ya sabes, realmente construí esto. Creo que no estaría mal, creo que para la primera pasada, y
00:09:17de lo que realmente se trataba esto era solo mostrar este flujo de trabajo en acción. Y también puedes ver aquí abajo
00:09:21en términos de nuestro uso, solo quemamos alrededor de 130,000 tokens en el lado de Fable para conseguir que todo
00:09:26esto se hiciera. Así que esa es la habilidad en acción. Espero que saques mucho provecho de esto una vez que Sol 5.6 salga.
00:09:31Como siempre, déjame saber qué pensaste sobre este video en los comentarios. Asegúrate de echarle un vistazo a Chase AI Plus,
00:09:37y nos vemos por ahí.