스크립트
00:00:00Fable 5.1 y GPT-6 Astra se lanzaron con pocos días de diferencia y ambos han estado obteniendo
00:00:05puntuaciones muy altas en las pruebas de rendimiento. Astra incluso obtuvo casi un 100% en la prueba de AGI, a la que ningún modelo
00:00:11se había acercado jamás. Así que, al ver esos números, esperarías que le fuera muy bien al darle
00:00:16tu propio trabajo. Pero destacar en esas pruebas no te indica qué tan bien manejará un modelo
00:00:20el trabajo que le des, y queríamos comprobar si ambos modelos rinden igual de bien en nuestras
00:00:25propias tareas. Como somos una empresa de software, ya teníamos proyectos para probarlos, así que le dimos a ambos
00:00:30modelos trabajo de esos proyectos y revisamos lo que terminaron. Ejecutamos cada modelo en múltiples
00:00:35proyectos y puntuamos su desempeño en diferentes áreas. Utilizamos GPT-5.6 para ayudar a juzgar
00:00:41los resultados y puntuarlos. Este modelo juez no sabía qué resultados provenían de Fable y cuáles
00:00:45de Astra. Un modelo obtuvo una puntuación general de 86 sobre 100 mientras que el otro obtuvo 84. Ahora bien, esto podría parecer
00:00:52una pequeña diferencia, pero el modelo que ganó en general no se impuso en todas las partes de la prueba y
00:00:57el otro rindió sorprendentemente bien en algunas de esas áreas. Por lo tanto, vamos a repasar cómo se desempeñó cada
00:01:02modelo en nuestras pruebas y cuál ganó en cada categoría para que sepas cómo afectan esas diferencias
00:01:07al trabajo que le asignas. Antes de pasar al rendimiento de cada modelo, veamos primero
00:01:12los modelos en sí. Esta sección es solo para quienes no los conocen, así que si ya sabes
00:01:17los detalles, puedes saltarte esta sección e ir directamente a la siguiente. Anthropic lanzó
00:01:22Fable 5.1 el 1 de septiembre e incluso antes de que Anthropic pudiera disfrutar plenamente del revuelo del lanzamiento,
00:01:27OpenAI lanzó GPT-6 Astra pocos días después de Fable, y la gente ha estado creando productos muy interesantes
00:01:33con estos modelos, llevándolos al límite de sus capacidades y obteniendo resultados realmente
00:01:37sorprendentes. En cuanto a los precios, ambos modelos tienen en realidad el mismo costo de 10 dólares por
00:01:43millón de tokens de entrada y 50 dólares por millón de tokens de salida. Pero con Fable 5.1 hay una diferencia:
00:01:49Anthropic redujo el precio de las lecturas en caché en un 75%. Para quienes no sepan
00:01:54qué son las lecturas en caché, las partes de la conversación que el modelo ya ha leído se guardan
00:02:00para su reutilización. Cuando envías un nuevo mensaje, esas partes guardadas se reutilizan en lugar de que el modelo las lea
00:02:05de nuevo desde cero, y a eso se le llama lectura en caché. Estas lecturas ya abarataban la reutilización de
00:02:10la conversación, pero con la reducción de precio se vuelve aún más económico. Sin embargo, eso no significa que Fable sea un
00:02:14modelo más barato de usar en general, ya que la factura total también depende de muchos otros factores de los cuales
00:02:19hablaremos en un momento. Ahora bien, los modelos Fable han estado en Claude Code por un tiempo, pero Fable 5.1 aún no
00:02:25está incluido en el plan Claude Pro, por lo que en Pro tienes que pagarlo por separado mediante créditos de uso. En los
00:02:30planes Max, Fable 5.1 sí está incluido, pero los modelos Fable tienen un límite menor que el resto de los modelos.
00:02:36Por otro lado, OpenAI no trata a Astra como un modelo separado de esa manera, ya que Astra forma parte de
00:02:41los límites normales de Codex en ChatGPT+ y Pro, y puedes gastar todo tu uso en Astra. Ahora bien, estos
00:02:47modelos son muy capaces de trabajar en tareas largas, lo que significa que puedes pedirles que construyan una gran
00:02:52funcionalidad y dejarlos avanzar por los pasos por sí mismos. Pero cuando dejas a estos modelos trabajando
00:02:57en una tarea larga, la cantidad de contexto que pueden retener también importa. Fable te ofrece un millón de tokens en
00:03:02Claude Code, mientras que la ventana de contexto predeterminada de Astra en Codex es de solo 272,000 tokens, a pesar de que Astra tiene
00:03:09una ventana mucho mayor a través de su API, incluso superior al millón de Fable. Pero no vas a
00:03:14obtener eso en Codex por ahora, ya que Codex establece por defecto una ventana de contexto de 272,000 tokens incluso para Astra.
00:03:21Ahora bien, estos modelos han alcanzado un nivel en el que pueden realizar investigaciones avanzadas, por lo que OpenAI y
00:03:26Anthropic han añadido barreras de seguridad que restringen parte del trabajo que se les permite hacer.
00:03:31Pero esas restricciones también afectan tu trabajo de diferentes maneras, ya que cada modelo reacciona de forma distinta
00:03:36cuando su sistema de seguridad determina que tu solicitud no está permitida. Cuando Astra llega a una parte de la tarea que
00:03:41va en contra de sus reglas, rechaza directamente esa tarea y te lo informa. Por otro lado,
00:03:45Claude Code cambia de Fable a un modelo más débil cuando una solicitud infringe sus reglas. Y mucha
00:03:51gente ha descubierto que Claude Code cambió de modelo sin que ellos lo supieran. Así que si Claude Code continúa
00:03:56trabajando después de ese cambio, es posible que el resultado que obtengas ya no provenga de Fable.
00:04:01Ahora bien, la primera métrica que medimos fue la calidad, que analiza qué tan bueno es en realidad el trabajo del modelo.
00:04:06Para esta prueba, utilizamos múltiples proyectos de clientes, por lo que no podemos revelar los detalles de dichos
00:04:11proyectos, pero sí podemos explicar cómo evaluamos el trabajo y en qué se diferenciaban los modelos. En cuanto a la calidad con la que
00:04:16se escribió y organizó el código, Fable obtuvo 90 frente al 78 de Astra, porque mantuvo el código de las diferentes
00:04:22partes de la aplicación más claramente separado. Eso facilita que el modelo comprenda la aplicación al
00:04:27realizar cambios más adelante, y Fable superó a Astra en este aspecto en todos los proyectos que probamos. Y en cuanto
00:04:32a qué porcentaje del trabajo solicitado se completó, Fable obtuvo 91 frente al 84 de Astra, porque también solucionó
00:04:39problemas que no le habíamos pedido específicamente que arreglara. Pero también comprobamos si las funciones terminadas
00:04:44funcionaban correctamente sin que tuviéramos que pedir correcciones, y Astra obtuvo 87 frente al 85 de Fable en ese aspecto.
00:04:50Parte de la ventaja de Astra provino de revisar las aplicaciones de forma más exhaustiva y corregir una mayor cantidad de problemas conocidos.
00:04:55Cuando Fable probó sus aplicaciones, pasó por alto algunas situaciones en las que podían fallar, por lo que las funciones terminadas
00:05:00todavía tenían algunos problemas. En cuanto a la experiencia de usar la aplicación, Astra obtuvo 89 frente al 88 de Fable,
00:05:08porque colocó las diferentes partes de la página en ubicaciones que facilitaban su localización y uso.
00:05:13Por lo tanto, basándonos en todas las pruebas que acabamos de mencionar, la puntuación general de calidad de Fable fue 88 mientras que Astra obtuvo 84,
00:05:19porque construyó funciones más completas y su trabajo era más fácil de modificar después. Así que, en términos de calidad,
00:05:25Fable es el claro ganador. Pero antes de pasar a la siguiente prueba, escuchemos unas palabras de nuestro patrocinador,
00:05:30Zapier. Creas una aplicación con IA y funciona de maravilla, pero en el momento en que quieres que se conecte realmente a herramientas
00:05:35como Gmail, Slack y Notion, te ves programando cada integración y flujo OAuth a mano. Antes de que te des
00:05:41cuenta, estás enterrado en código de autenticación y de repente las integraciones se convierten en todo el proyecto. Ahí es donde
00:05:46entra el SDK de Zapier. Es una biblioteca de código que incorporas a tu proyecto directamente en Claude Code o Cursor,
00:05:52dándote acceso mediante programación al ecosistema de más de 9,000 aplicaciones de Zapier. Así que en lugar de construir cada integración
00:05:58a mano, simplemente llamamos a las que necesitábamos y seguimos adelante. En unas pocas líneas, nuestra aplicación enviaba correos
00:06:04y creaba páginas en Notion sin necesidad de leer documentación de API ni lidiar con la autenticación. Y cuando necesitábamos actualizar
00:06:10una propiedad personalizada en Notion que no tenía una acción preconstruida, la llamábamos directamente a través del
00:06:15SDK. Realmente se adapta al lugar donde ya trabajas. Si estás cansado de configurar integraciones a mano,
00:06:20prueba el SDK de Zapier. El enlace está en la descripción de abajo. La siguiente métrica que medimos fue qué tan bien
00:06:26manejaban los modelos las tareas de larga duración, lo que significa cuánto trabajo terminaban por su cuenta con poca
00:06:31orientación por nuestra parte mientras trabajaban. También comprobamos cómo manejaban los problemas que surgían en el camino.
00:06:36Para esto, le dimos a cada modelo una idea de aplicación para construir y redactamos la solicitud de acuerdo con su guía de
00:06:42prompts para que tuviera la mejor oportunidad de hacer bien el trabajo. No mencionamos los detalles específicos que queríamos
00:06:47y simplemente describimos lo que la aplicación necesitaba hacer. Astra trabajó durante unos 32 minutos y Fable trabajó durante
00:06:53unos 44 minutos. Astra se encontró con errores mientras construía y revisaba su aplicación, pero los resolvió
00:06:58y continuó arreglando la aplicación sin que tuviéramos que guiarlo a través de cada problema. Fable también terminó
00:07:03su aplicación sin detenerse antes de tiempo ni preguntarnos qué hacer a continuación, y ejecutó comprobaciones sobre lo que había construido.
00:07:09Así que ambos llevaron el trabajo hasta el final, pero también revisamos las aplicaciones terminadas para ver qué nos habían
00:07:13dejado. La aplicación de Astra se abría directamente en una página de inicio de sesión sin una página de presentación separada. Una vez que
00:07:18iniciábamos sesión, el diseño estaba bien organizado y la aplicación funcionaba, aunque seguía teniendo los diseños familiares que
00:07:24aparecen en muchas aplicaciones generadas por IA. Pero tuvimos un problema con el panel lateral porque no se desplazaba
00:07:30lo suficiente como para permitirnos alcanzar el botón de cerrar sesión. Tuvimos que alejar el zoom para llegar a ese botón, lo cual era
00:07:35algo que las propias revisiones de Astra no habían detectado. La aplicación de Fable también se abría directamente en una página de inicio de sesión, pero su
00:07:40diseño se sentía mucho más genérico. Las funciones funcionaban, pero todo estaba tan amontonado que
00:07:45la aplicación era difícil de usar y los degradados repetidos contribuían a ese aspecto familiar de aplicación generada por IA. Sí se adaptaba a
00:07:51pantallas más pequeñas, pero aun así carecía de un diseño usable, a pesar de que las funciones eran profundas. También
00:07:56teníamos varias otras aplicaciones y funciones enormes planeadas y construidas de esta manera con los modelos dejados
00:08:01para trabajar por su cuenta. Así que en tareas de larga duración, Astra obtuvo 93 de 100 frente a los 90 de Fable.
00:08:08Fable se enfocó más en hacer que las funciones funcionaran, a menos que hubiéramos especificado en el prompt que debía
00:08:13centrarse también en los aspectos visuales. Astra prestó atención tanto al funcionamiento de las aplicaciones como a su aspecto,
00:08:18por lo que Astra gana en tareas de larga duración. La siguiente métrica que analizamos fue el diseño y qué
00:08:23tan fáciles de usar eran las aplicaciones. Permitimos que el modelo puntuara los diseños, pero no queríamos depender de
00:08:28su gusto de diseño en solitario. Así que construimos un visor para los resultados de Fable y otro para los de Astra, lo que nos permitió
00:08:33revisar los diseños nosotros mismos y comparar cómo era utilizarlos. Le dimos a ambos modelos las mismas tareas
00:08:38de diseño, empezando por una página de inicio para un negocio que vende fuentes tipográficas. La versión de Fable se parecía mucho a
00:08:44lo que Opus suele producir, desde los colores y fuentes hasta el diseño. Incluso incluía esa franja de texto que se mueve
00:08:50por la página que hemos estado viendo últimamente en los diseños de Opus. Pero algo que Fable hizo diferente
00:08:55con respecto a Opus fue añadir muchos más elementos interactivos a lo largo del diseño, lo que hizo que la aplicación se sintiera
00:09:00La versión de Astra tenía un diseño más espacioso, con diferencias más claras en el tamaño del texto y
00:09:05colores que hacían que el texto fuera más fácil de leer. Pero había mucho menos movimiento, así que, aunque parecía más
00:09:10cómodo a la vista, no ofrecía la misma experiencia que el diseño de Fable. Por eso Fable
00:09:14obtuvo 94 puntos en interacción, frente a los 85 de Astra. A continuación, pedimos a cada modelo que diseñara la página
00:09:20de un juego de terror. El diseño de Fable usaba un faro animado para crear atmósfera.
00:09:25Creaba los gráficos como SVG, que son imágenes dibujadas con código, pero el texto no destacaba lo suficiente sobre el fondo oscuro
00:09:31debido a los tamaños y colores que Fable eligió. Y en esa misma tarea de diseño, Astra utilizó el
00:09:36modelo de generación de imágenes integrado en Codex para generar una imagen en lugar de crear los gráficos con código.
00:09:42También creó un avance del juego aunque no se lo habíamos pedido. Y donde Astra tomó ventaja
00:09:47fue en su elección de fuentes y colores, lo que hizo que el texto resaltara sobre el fondo oscuro.
00:09:52Para el sitio del festival de música, la versión de Fable repetía muchas de las opciones de diseño que vemos en los diseños hechos
00:09:57por Opus. Pero aun con esas opciones familiares, se sentía que Fable había puesto más empeño en darle al
00:10:03sitio su propio estilo. Astra usó una fotografía de concierto generada, pero el diseño general se sintió más
00:10:08genérico. La última comparación fue un juego de estacionamiento en paralelo, donde la versión de Fable estaba muy bien hecha,
00:10:13y el espejo retrovisor nos ayudaba a calcular mejor dónde mover el coche. El juego tenía dos
00:10:18vistas de cámara, pero ambas tenían problemas. Porque una mostraba el lado equivocado del espacio de estacionamiento,
00:10:23mientras que la otra solo mostraba un lado en lugar de darnos una vista completa del camino por delante. Eso hacía
00:10:27más difícil ver hacia dónde movíamos el coche, y si esos ángulos de cámara hubieran sido correctos, el juego
00:10:32habría resultado más realista. Astra nos dio tres vistas fijas y añadió consejos de manejo en el panel lateral,
00:10:38lo que facilitó jugar a su juego. Las vistas de cámara fueron mucho mejores que las de Fable. Estas eran
00:10:42pruebas generales en las que dábamos a los modelos muy pocos detalles sobre los diseños que queríamos, así que estábamos viendo
00:10:48el gusto propio del modelo aquí. Ambos repitieron opciones de diseño que habíamos visto en sus otros trabajos, pero ambos
00:10:53produjeron buenos resultados. Y con un poco más de detalle sobre cómo queríamos que se vieran y sintieran las aplicaciones,
00:10:58esperaríamos que ambos diseñaran bien. Así que, solo en cuanto a estilo, Astra ganó en visuales y usabilidad, mientras que Fable ganó en
00:11:04animaciones e interactividad. Pero antes de pasar a probar el costo y la velocidad, sería genial que
00:11:09te suscribieras al canal y le dieras al botón de me gusta. Este pequeño gesto de apoyo nos ayuda muchísimo.
00:11:15La siguiente métrica que medimos fue la eficiencia, que cubría el costo del trabajo, el tiempo que tomó,
00:11:20y cuántas veces el modelo usó sus herramientas para completarlo. Algo que hay que saber sobre los costos es que
00:11:25no usamos la API, así que estas son solo estimaciones de cuánto costaría el trabajo si usáramos la API
00:11:31según los tokens utilizados. Hicimos las pruebas en nuestra suscripción habitual. En todas las ejecuciones de prueba, el costo
00:11:37total estimado de Fable ascendió a $49.18, en comparación con los $27.69 de Astra, por lo que el total de Astra fue aproximadamente un 44% menor.
00:11:47Fable generó casi 3 veces más tokens de salida que Astra, tal como menciona la guía de prompts de Fable
00:11:52en cuanto a que tiende a escribir más que otros modelos. Ambos modelos tuvieron el mismo costo por esos
00:11:57tokens, por lo que escribir más fue lo que incrementó el costo de Fable. El uso de herramientas también aumenta el consumo de tokens,
00:12:03porque el modelo decide qué herramienta usar y luego lee los resultados antes de seguir trabajando. En todas
00:12:09las seis ejecuciones, el agente principal de Fable usó sus herramientas 443 veces frente a las 287 de Astra, lo que también aumentó el
00:12:17costo. En costo, Astra obtuvo 80 de 100 frente a los 66 de Fable. En cuanto a la velocidad, Astra también
00:12:23se adelantó con 70 frente a los 67 de Fable. Las tareas de larga duración tomaron unos 62 minutos en total para Astra,
00:12:30en comparación con los 73 minutos de Fable. Así que, sumando las puntuaciones de costo, velocidad y eficiencia de herramientas,
00:12:35Astra superó a Fable. La siguiente métrica que medimos fue el seguimiento de instrucciones,
00:12:40donde comprobamos qué tan bien los modelos seguían las instrucciones que les dimos durante la construcción,
00:12:44y si seguían haciéndolo a medida que continuaba el trabajo. Cuando ejecutamos Fable en un proyecto,
00:12:49inicialmente añadió un mensaje de coautoría diciendo que Claude ayudó a escribir el código,
00:12:53a pesar de que nuestras instrucciones le indicaban explícitamente que no lo hiciera. También ignoró una regla sobre cómo se le permitía
00:12:58crear o modificar archivos. Le dijimos que usara las propias herramientas de edición de archivos de Claude, para que esos cambios quedaran registrados
00:13:04y fueran fáciles de deshacer, pero en su lugar creó dos archivos ejecutando comandos. En cuanto al seguimiento de instrucciones,
00:13:09Astra obtuvo 96 de 100 frente a los 88 de Fable. Así que al seguir las instrucciones,
00:13:16Astra se adelantó en estas ejecuciones. La siguiente métrica que medimos fue la calidad de revisión, donde dimos a los
00:13:21modelos un proyecto con problemas y les pedimos que los encontraran. Primero dimos a ambos modelos el
00:13:27mismo código para revisar, con cuatro problemas añadidos deliberadamente, para saber qué debían encontrar. Fable
00:13:33encontró los cuatro, y también encontró cinco problemas adicionales que no habíamos añadido, los cuales fueron
00:13:37revisados y confirmados. Astra encontró dos de los cuatro problemas que habíamos añadido, pero aun así nos dijo que la revisión
00:13:42estaba completa. También incluimos tres partes que parecían sospechosas, pero que en realidad eran correctas, porque
00:13:47queríamos ver si el modelo reportaba falsos problemas. Ninguno los trató como errores, por lo que la
00:13:52diferencia aquí estuvo en la cantidad que encontraron, y Fable nos dio una revisión más exhaustiva,
00:13:57pero cuando los probamos en un proyecto más grande con nueve problemas confirmados, Astra arregló cinco, mientras que Fable
00:14:03solo encontró y arregló cuatro. Así que Astra completó más reparaciones, aunque ambos dejaron varios problemas
00:14:08sin arreglar. En cuanto a la calidad de revisión, que incluía esas reparaciones y cómo los modelos verificaban su otro trabajo,
00:14:13Fable obtuvo 84 frente a los 78 de Astra. Así que Fable se adelantó en la puntuación general de revisión,
00:14:19porque Fable nos ofreció la revisión global más sólida. Basándonos en estos resultados, Astra es clara vencedora en
00:14:25varias categorías que probamos, pero eso no significa que Fable sea un mal modelo, ya que rindió bien
00:14:30en todas las tareas y no se quedó muy atrás de Astra en varias de ellas. Así que solo tienes que elegir el modelo
00:14:35según las tareas que les vayas a encomendar. Ahora bien, para llevar estos dos modelos al límite de su capacidad, hay
00:14:40ciertas prácticas que debes seguir. Usamos muchas de ellas en nuestras pruebas, y si quieres acceder
00:14:45también a ellas, puedes encontrarlas en AI Labs Pro, que es nuestra comunidad. Si te ha aportado valor lo que
00:14:51hacemos y quieres apoyar el canal, esta es la mejor forma de hacerlo. Tienes el enlace en la descripción.
00:14:56Esto nos lleva al final de este video. Si te gustaría apoyar el canal y ayudarnos a seguir haciendo
00:15:01videos como este, puedes hacerlo usando el botón de super thanks de abajo. Como siempre,
00:15:05gracias por ver y nos vemos en el próximo.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기