Se acabó... Esto acaba de terminar el debate entre GPT 6 Astra y Fable 5.1

AAI LABS
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00Fable 5.1 y GPT-6 Astra se lanzaron con pocos días de diferencia y ambos han estado obteniendo
00:00:05puntuaciones muy altas en las pruebas de rendimiento. Astra incluso obtuvo casi un 100% en la prueba de AGI, a la que ningún modelo
00:00:11se había acercado jamás. Así que, al ver esos números, esperarías que le fuera muy bien al darle
00:00:16tu propio trabajo. Pero destacar en esas pruebas no te indica qué tan bien manejará un modelo
00:00:20el trabajo que le des, y queríamos comprobar si ambos modelos rinden igual de bien en nuestras
00:00:25propias tareas. Como somos una empresa de software, ya teníamos proyectos para probarlos, así que le dimos a ambos
00:00:30modelos trabajo de esos proyectos y revisamos lo que terminaron. Ejecutamos cada modelo en múltiples
00:00:35proyectos y puntuamos su desempeño en diferentes áreas. Utilizamos GPT-5.6 para ayudar a juzgar
00:00:41los resultados y puntuarlos. Este modelo juez no sabía qué resultados provenían de Fable y cuáles
00:00:45de Astra. Un modelo obtuvo una puntuación general de 86 sobre 100 mientras que el otro obtuvo 84. Ahora bien, esto podría parecer
00:00:52una pequeña diferencia, pero el modelo que ganó en general no se impuso en todas las partes de la prueba y
00:00:57el otro rindió sorprendentemente bien en algunas de esas áreas. Por lo tanto, vamos a repasar cómo se desempeñó cada
00:01:02modelo en nuestras pruebas y cuál ganó en cada categoría para que sepas cómo afectan esas diferencias
00:01:07al trabajo que le asignas. Antes de pasar al rendimiento de cada modelo, veamos primero
00:01:12los modelos en sí. Esta sección es solo para quienes no los conocen, así que si ya sabes
00:01:17los detalles, puedes saltarte esta sección e ir directamente a la siguiente. Anthropic lanzó
00:01:22Fable 5.1 el 1 de septiembre e incluso antes de que Anthropic pudiera disfrutar plenamente del revuelo del lanzamiento,
00:01:27OpenAI lanzó GPT-6 Astra pocos días después de Fable, y la gente ha estado creando productos muy interesantes
00:01:33con estos modelos, llevándolos al límite de sus capacidades y obteniendo resultados realmente
00:01:37sorprendentes. En cuanto a los precios, ambos modelos tienen en realidad el mismo costo de 10 dólares por
00:01:43millón de tokens de entrada y 50 dólares por millón de tokens de salida. Pero con Fable 5.1 hay una diferencia:
00:01:49Anthropic redujo el precio de las lecturas en caché en un 75%. Para quienes no sepan
00:01:54qué son las lecturas en caché, las partes de la conversación que el modelo ya ha leído se guardan
00:02:00para su reutilización. Cuando envías un nuevo mensaje, esas partes guardadas se reutilizan en lugar de que el modelo las lea
00:02:05de nuevo desde cero, y a eso se le llama lectura en caché. Estas lecturas ya abarataban la reutilización de
00:02:10la conversación, pero con la reducción de precio se vuelve aún más económico. Sin embargo, eso no significa que Fable sea un
00:02:14modelo más barato de usar en general, ya que la factura total también depende de muchos otros factores de los cuales
00:02:19hablaremos en un momento. Ahora bien, los modelos Fable han estado en Claude Code por un tiempo, pero Fable 5.1 aún no
00:02:25está incluido en el plan Claude Pro, por lo que en Pro tienes que pagarlo por separado mediante créditos de uso. En los
00:02:30planes Max, Fable 5.1 sí está incluido, pero los modelos Fable tienen un límite menor que el resto de los modelos.
00:02:36Por otro lado, OpenAI no trata a Astra como un modelo separado de esa manera, ya que Astra forma parte de
00:02:41los límites normales de Codex en ChatGPT+ y Pro, y puedes gastar todo tu uso en Astra. Ahora bien, estos
00:02:47modelos son muy capaces de trabajar en tareas largas, lo que significa que puedes pedirles que construyan una gran
00:02:52funcionalidad y dejarlos avanzar por los pasos por sí mismos. Pero cuando dejas a estos modelos trabajando
00:02:57en una tarea larga, la cantidad de contexto que pueden retener también importa. Fable te ofrece un millón de tokens en
00:03:02Claude Code, mientras que la ventana de contexto predeterminada de Astra en Codex es de solo 272,000 tokens, a pesar de que Astra tiene
00:03:09una ventana mucho mayor a través de su API, incluso superior al millón de Fable. Pero no vas a
00:03:14obtener eso en Codex por ahora, ya que Codex establece por defecto una ventana de contexto de 272,000 tokens incluso para Astra.
00:03:21Ahora bien, estos modelos han alcanzado un nivel en el que pueden realizar investigaciones avanzadas, por lo que OpenAI y
00:03:26Anthropic han añadido barreras de seguridad que restringen parte del trabajo que se les permite hacer.
00:03:31Pero esas restricciones también afectan tu trabajo de diferentes maneras, ya que cada modelo reacciona de forma distinta
00:03:36cuando su sistema de seguridad determina que tu solicitud no está permitida. Cuando Astra llega a una parte de la tarea que
00:03:41va en contra de sus reglas, rechaza directamente esa tarea y te lo informa. Por otro lado,
00:03:45Claude Code cambia de Fable a un modelo más débil cuando una solicitud infringe sus reglas. Y mucha
00:03:51gente ha descubierto que Claude Code cambió de modelo sin que ellos lo supieran. Así que si Claude Code continúa
00:03:56trabajando después de ese cambio, es posible que el resultado que obtengas ya no provenga de Fable.
00:04:01Ahora bien, la primera métrica que medimos fue la calidad, que analiza qué tan bueno es en realidad el trabajo del modelo.
00:04:06Para esta prueba, utilizamos múltiples proyectos de clientes, por lo que no podemos revelar los detalles de dichos
00:04:11proyectos, pero sí podemos explicar cómo evaluamos el trabajo y en qué se diferenciaban los modelos. En cuanto a la calidad con la que
00:04:16se escribió y organizó el código, Fable obtuvo 90 frente al 78 de Astra, porque mantuvo el código de las diferentes
00:04:22partes de la aplicación más claramente separado. Eso facilita que el modelo comprenda la aplicación al
00:04:27realizar cambios más adelante, y Fable superó a Astra en este aspecto en todos los proyectos que probamos. Y en cuanto
00:04:32a qué porcentaje del trabajo solicitado se completó, Fable obtuvo 91 frente al 84 de Astra, porque también solucionó
00:04:39problemas que no le habíamos pedido específicamente que arreglara. Pero también comprobamos si las funciones terminadas
00:04:44funcionaban correctamente sin que tuviéramos que pedir correcciones, y Astra obtuvo 87 frente al 85 de Fable en ese aspecto.
00:04:50Parte de la ventaja de Astra provino de revisar las aplicaciones de forma más exhaustiva y corregir una mayor cantidad de problemas conocidos.
00:04:55Cuando Fable probó sus aplicaciones, pasó por alto algunas situaciones en las que podían fallar, por lo que las funciones terminadas
00:05:00todavía tenían algunos problemas. En cuanto a la experiencia de usar la aplicación, Astra obtuvo 89 frente al 88 de Fable,
00:05:08porque colocó las diferentes partes de la página en ubicaciones que facilitaban su localización y uso.
00:05:13Por lo tanto, basándonos en todas las pruebas que acabamos de mencionar, la puntuación general de calidad de Fable fue 88 mientras que Astra obtuvo 84,
00:05:19porque construyó funciones más completas y su trabajo era más fácil de modificar después. Así que, en términos de calidad,
00:05:25Fable es el claro ganador. Pero antes de pasar a la siguiente prueba, escuchemos unas palabras de nuestro patrocinador,
00:05:30Zapier. Creas una aplicación con IA y funciona de maravilla, pero en el momento en que quieres que se conecte realmente a herramientas
00:05:35como Gmail, Slack y Notion, te ves programando cada integración y flujo OAuth a mano. Antes de que te des
00:05:41cuenta, estás enterrado en código de autenticación y de repente las integraciones se convierten en todo el proyecto. Ahí es donde
00:05:46entra el SDK de Zapier. Es una biblioteca de código que incorporas a tu proyecto directamente en Claude Code o Cursor,
00:05:52dándote acceso mediante programación al ecosistema de más de 9,000 aplicaciones de Zapier. Así que en lugar de construir cada integración
00:05:58a mano, simplemente llamamos a las que necesitábamos y seguimos adelante. En unas pocas líneas, nuestra aplicación enviaba correos
00:06:04y creaba páginas en Notion sin necesidad de leer documentación de API ni lidiar con la autenticación. Y cuando necesitábamos actualizar
00:06:10una propiedad personalizada en Notion que no tenía una acción preconstruida, la llamábamos directamente a través del
00:06:15SDK. Realmente se adapta al lugar donde ya trabajas. Si estás cansado de configurar integraciones a mano,
00:06:20prueba el SDK de Zapier. El enlace está en la descripción de abajo. La siguiente métrica que medimos fue qué tan bien
00:06:26manejaban los modelos las tareas de larga duración, lo que significa cuánto trabajo terminaban por su cuenta con poca
00:06:31orientación por nuestra parte mientras trabajaban. También comprobamos cómo manejaban los problemas que surgían en el camino.
00:06:36Para esto, le dimos a cada modelo una idea de aplicación para construir y redactamos la solicitud de acuerdo con su guía de
00:06:42prompts para que tuviera la mejor oportunidad de hacer bien el trabajo. No mencionamos los detalles específicos que queríamos
00:06:47y simplemente describimos lo que la aplicación necesitaba hacer. Astra trabajó durante unos 32 minutos y Fable trabajó durante
00:06:53unos 44 minutos. Astra se encontró con errores mientras construía y revisaba su aplicación, pero los resolvió
00:06:58y continuó arreglando la aplicación sin que tuviéramos que guiarlo a través de cada problema. Fable también terminó
00:07:03su aplicación sin detenerse antes de tiempo ni preguntarnos qué hacer a continuación, y ejecutó comprobaciones sobre lo que había construido.
00:07:09Así que ambos llevaron el trabajo hasta el final, pero también revisamos las aplicaciones terminadas para ver qué nos habían
00:07:13dejado. La aplicación de Astra se abría directamente en una página de inicio de sesión sin una página de presentación separada. Una vez que
00:07:18iniciábamos sesión, el diseño estaba bien organizado y la aplicación funcionaba, aunque seguía teniendo los diseños familiares que
00:07:24aparecen en muchas aplicaciones generadas por IA. Pero tuvimos un problema con el panel lateral porque no se desplazaba
00:07:30lo suficiente como para permitirnos alcanzar el botón de cerrar sesión. Tuvimos que alejar el zoom para llegar a ese botón, lo cual era
00:07:35algo que las propias revisiones de Astra no habían detectado. La aplicación de Fable también se abría directamente en una página de inicio de sesión, pero su
00:07:40diseño se sentía mucho más genérico. Las funciones funcionaban, pero todo estaba tan amontonado que
00:07:45la aplicación era difícil de usar y los degradados repetidos contribuían a ese aspecto familiar de aplicación generada por IA. Sí se adaptaba a
00:07:51pantallas más pequeñas, pero aun así carecía de un diseño usable, a pesar de que las funciones eran profundas. También
00:07:56teníamos varias otras aplicaciones y funciones enormes planeadas y construidas de esta manera con los modelos dejados
00:08:01para trabajar por su cuenta. Así que en tareas de larga duración, Astra obtuvo 93 de 100 frente a los 90 de Fable.
00:08:08Fable se enfocó más en hacer que las funciones funcionaran, a menos que hubiéramos especificado en el prompt que debía
00:08:13centrarse también en los aspectos visuales. Astra prestó atención tanto al funcionamiento de las aplicaciones como a su aspecto,
00:08:18por lo que Astra gana en tareas de larga duración. La siguiente métrica que analizamos fue el diseño y qué
00:08:23tan fáciles de usar eran las aplicaciones. Permitimos que el modelo puntuara los diseños, pero no queríamos depender de
00:08:28su gusto de diseño en solitario. Así que construimos un visor para los resultados de Fable y otro para los de Astra, lo que nos permitió
00:08:33revisar los diseños nosotros mismos y comparar cómo era utilizarlos. Le dimos a ambos modelos las mismas tareas
00:08:38de diseño, empezando por una página de inicio para un negocio que vende fuentes tipográficas. La versión de Fable se parecía mucho a
00:08:44lo que Opus suele producir, desde los colores y fuentes hasta el diseño. Incluso incluía esa franja de texto que se mueve
00:08:50por la página que hemos estado viendo últimamente en los diseños de Opus. Pero algo que Fable hizo diferente
00:08:55con respecto a Opus fue añadir muchos más elementos interactivos a lo largo del diseño, lo que hizo que la aplicación se sintiera
00:09:00La versión de Astra tenía un diseño más espacioso, con diferencias más claras en el tamaño del texto y
00:09:05colores que hacían que el texto fuera más fácil de leer. Pero había mucho menos movimiento, así que, aunque parecía más
00:09:10cómodo a la vista, no ofrecía la misma experiencia que el diseño de Fable. Por eso Fable
00:09:14obtuvo 94 puntos en interacción, frente a los 85 de Astra. A continuación, pedimos a cada modelo que diseñara la página
00:09:20de un juego de terror. El diseño de Fable usaba un faro animado para crear atmósfera.
00:09:25Creaba los gráficos como SVG, que son imágenes dibujadas con código, pero el texto no destacaba lo suficiente sobre el fondo oscuro
00:09:31debido a los tamaños y colores que Fable eligió. Y en esa misma tarea de diseño, Astra utilizó el
00:09:36modelo de generación de imágenes integrado en Codex para generar una imagen en lugar de crear los gráficos con código.
00:09:42También creó un avance del juego aunque no se lo habíamos pedido. Y donde Astra tomó ventaja
00:09:47fue en su elección de fuentes y colores, lo que hizo que el texto resaltara sobre el fondo oscuro.
00:09:52Para el sitio del festival de música, la versión de Fable repetía muchas de las opciones de diseño que vemos en los diseños hechos
00:09:57por Opus. Pero aun con esas opciones familiares, se sentía que Fable había puesto más empeño en darle al
00:10:03sitio su propio estilo. Astra usó una fotografía de concierto generada, pero el diseño general se sintió más
00:10:08genérico. La última comparación fue un juego de estacionamiento en paralelo, donde la versión de Fable estaba muy bien hecha,
00:10:13y el espejo retrovisor nos ayudaba a calcular mejor dónde mover el coche. El juego tenía dos
00:10:18vistas de cámara, pero ambas tenían problemas. Porque una mostraba el lado equivocado del espacio de estacionamiento,
00:10:23mientras que la otra solo mostraba un lado en lugar de darnos una vista completa del camino por delante. Eso hacía
00:10:27más difícil ver hacia dónde movíamos el coche, y si esos ángulos de cámara hubieran sido correctos, el juego
00:10:32habría resultado más realista. Astra nos dio tres vistas fijas y añadió consejos de manejo en el panel lateral,
00:10:38lo que facilitó jugar a su juego. Las vistas de cámara fueron mucho mejores que las de Fable. Estas eran
00:10:42pruebas generales en las que dábamos a los modelos muy pocos detalles sobre los diseños que queríamos, así que estábamos viendo
00:10:48el gusto propio del modelo aquí. Ambos repitieron opciones de diseño que habíamos visto en sus otros trabajos, pero ambos
00:10:53produjeron buenos resultados. Y con un poco más de detalle sobre cómo queríamos que se vieran y sintieran las aplicaciones,
00:10:58esperaríamos que ambos diseñaran bien. Así que, solo en cuanto a estilo, Astra ganó en visuales y usabilidad, mientras que Fable ganó en
00:11:04animaciones e interactividad. Pero antes de pasar a probar el costo y la velocidad, sería genial que
00:11:09te suscribieras al canal y le dieras al botón de me gusta. Este pequeño gesto de apoyo nos ayuda muchísimo.
00:11:15La siguiente métrica que medimos fue la eficiencia, que cubría el costo del trabajo, el tiempo que tomó,
00:11:20y cuántas veces el modelo usó sus herramientas para completarlo. Algo que hay que saber sobre los costos es que
00:11:25no usamos la API, así que estas son solo estimaciones de cuánto costaría el trabajo si usáramos la API
00:11:31según los tokens utilizados. Hicimos las pruebas en nuestra suscripción habitual. En todas las ejecuciones de prueba, el costo
00:11:37total estimado de Fable ascendió a $49.18, en comparación con los $27.69 de Astra, por lo que el total de Astra fue aproximadamente un 44% menor.
00:11:47Fable generó casi 3 veces más tokens de salida que Astra, tal como menciona la guía de prompts de Fable
00:11:52en cuanto a que tiende a escribir más que otros modelos. Ambos modelos tuvieron el mismo costo por esos
00:11:57tokens, por lo que escribir más fue lo que incrementó el costo de Fable. El uso de herramientas también aumenta el consumo de tokens,
00:12:03porque el modelo decide qué herramienta usar y luego lee los resultados antes de seguir trabajando. En todas
00:12:09las seis ejecuciones, el agente principal de Fable usó sus herramientas 443 veces frente a las 287 de Astra, lo que también aumentó el
00:12:17costo. En costo, Astra obtuvo 80 de 100 frente a los 66 de Fable. En cuanto a la velocidad, Astra también
00:12:23se adelantó con 70 frente a los 67 de Fable. Las tareas de larga duración tomaron unos 62 minutos en total para Astra,
00:12:30en comparación con los 73 minutos de Fable. Así que, sumando las puntuaciones de costo, velocidad y eficiencia de herramientas,
00:12:35Astra superó a Fable. La siguiente métrica que medimos fue el seguimiento de instrucciones,
00:12:40donde comprobamos qué tan bien los modelos seguían las instrucciones que les dimos durante la construcción,
00:12:44y si seguían haciéndolo a medida que continuaba el trabajo. Cuando ejecutamos Fable en un proyecto,
00:12:49inicialmente añadió un mensaje de coautoría diciendo que Claude ayudó a escribir el código,
00:12:53a pesar de que nuestras instrucciones le indicaban explícitamente que no lo hiciera. También ignoró una regla sobre cómo se le permitía
00:12:58crear o modificar archivos. Le dijimos que usara las propias herramientas de edición de archivos de Claude, para que esos cambios quedaran registrados
00:13:04y fueran fáciles de deshacer, pero en su lugar creó dos archivos ejecutando comandos. En cuanto al seguimiento de instrucciones,
00:13:09Astra obtuvo 96 de 100 frente a los 88 de Fable. Así que al seguir las instrucciones,
00:13:16Astra se adelantó en estas ejecuciones. La siguiente métrica que medimos fue la calidad de revisión, donde dimos a los
00:13:21modelos un proyecto con problemas y les pedimos que los encontraran. Primero dimos a ambos modelos el
00:13:27mismo código para revisar, con cuatro problemas añadidos deliberadamente, para saber qué debían encontrar. Fable
00:13:33encontró los cuatro, y también encontró cinco problemas adicionales que no habíamos añadido, los cuales fueron
00:13:37revisados y confirmados. Astra encontró dos de los cuatro problemas que habíamos añadido, pero aun así nos dijo que la revisión
00:13:42estaba completa. También incluimos tres partes que parecían sospechosas, pero que en realidad eran correctas, porque
00:13:47queríamos ver si el modelo reportaba falsos problemas. Ninguno los trató como errores, por lo que la
00:13:52diferencia aquí estuvo en la cantidad que encontraron, y Fable nos dio una revisión más exhaustiva,
00:13:57pero cuando los probamos en un proyecto más grande con nueve problemas confirmados, Astra arregló cinco, mientras que Fable
00:14:03solo encontró y arregló cuatro. Así que Astra completó más reparaciones, aunque ambos dejaron varios problemas
00:14:08sin arreglar. En cuanto a la calidad de revisión, que incluía esas reparaciones y cómo los modelos verificaban su otro trabajo,
00:14:13Fable obtuvo 84 frente a los 78 de Astra. Así que Fable se adelantó en la puntuación general de revisión,
00:14:19porque Fable nos ofreció la revisión global más sólida. Basándonos en estos resultados, Astra es clara vencedora en
00:14:25varias categorías que probamos, pero eso no significa que Fable sea un mal modelo, ya que rindió bien
00:14:30en todas las tareas y no se quedó muy atrás de Astra en varias de ellas. Así que solo tienes que elegir el modelo
00:14:35según las tareas que les vayas a encomendar. Ahora bien, para llevar estos dos modelos al límite de su capacidad, hay
00:14:40ciertas prácticas que debes seguir. Usamos muchas de ellas en nuestras pruebas, y si quieres acceder
00:14:45también a ellas, puedes encontrarlas en AI Labs Pro, que es nuestra comunidad. Si te ha aportado valor lo que
00:14:51hacemos y quieres apoyar el canal, esta es la mejor forma de hacerlo. Tienes el enlace en la descripción.
00:14:56Esto nos lleva al final de este video. Si te gustaría apoyar el canal y ayudarnos a seguir haciendo
00:15:01videos como este, puedes hacerlo usando el botón de super thanks de abajo. Como siempre,
00:15:05gracias por ver y nos vemos en el próximo.

핵심 요약

GPT-6 Astra supera a Fable 5.1 en eficiencia de costos y seguimiento de instrucciones con un 44% menos de gasto, mientras que Fable destaca en calidad de código y modularidad a pesar de generar más tokens.

하이라이트

  • GPT-6 Astra y Fable 5.1 obtuvieron puntuaciones generales muy cercanas en las pruebas de desarrollo de software, con 86 y 84 sobre 100 respectivamente.

  • Fable 5.1 alcanzó una puntuación de calidad de código de 90 frente al 78 de Astra gracias a una mejor separación de componentes.

  • El costo total estimado de las ejecuciones de Fable ascendió a $49.18, mientras que el de Astra fue de $27.69, lo que representa un ahorro del 44%.

  • Astra superó a Fable en las tareas de larga duración con 93 puntos frente a 90, gestionando de forma más equilibrada la funcionalidad y el aspecto visual.

  • En el seguimiento de instrucciones, Astra obtuvo 96 puntos frente a los 88 de Fable, al evitar modificaciones no solicitadas en archivos y comandos.

타임라인

Metodología de prueba y presentación de los modelos

  • Fable 5.1 y GPT-6 Astra se lanzaron a principios de septiembre con altas puntuaciones de rendimiento en pruebas estándar.
  • Se evaluaron ambos modelos en múltiples proyectos de software reales utilizando GPT-5.6 como juez ciego.
  • El modelo ganador global obtuvo 86 sobre 100 frente a los 84 del otro modelo.

Las pruebas de referencia habituales no reflejan con precisión el rendimiento en tareas de ingeniería de software reales. Para solucionar esto, se implementaron ambos modelos en proyectos internos de desarrollo y se juzgaron sus resultados mediante un modelo neutral que desconocía el origen de cada archivo. Aunque la diferencia numérica general fue pequeña, las variaciones en categorías específicas demostraron fortalezas y debilidades particulares.

Comparativa de costos, precios y ventanas de contexto

  • Ambos modelos cuestan 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida.
  • Fable redujo el precio de las lecturas en caché en un 75% para optimizar la reutilización de conversaciones previas.
  • Fable ofrece un millón de tokens de contexto en Claude Code, mientras que Astra se establece por defecto en 272,000 tokens en Codex.

Anthropic y OpenAI fijaron tarifas base idénticas para la entrada y salida de tokens, pero Fable introdujo un descuento del 75% en lecturas en caché para abaratar el procesamiento de historiales extensos. En cuanto a las restricciones de seguridad, Astra rechaza directamente las solicitudes prohibidas, mientras que Claude Code con Fable cambia de modelo de forma automática a una versión inferior sin previo aviso cuando se infringe una regla.

Evaluación de calidad de código y tareas de larga duración

  • Fable obtuvo 90 puntos en organización de código frente a los 78 de Astra al mantener las partes de la aplicación mejor separadas.
  • Astra alcanzó 93 puntos en tareas de larga duración frente a los 90 de Fable, equilibrando mejor la funcionalidad y el diseño visual.
  • Astra completó sus tareas en 32 minutos y Fable requirió 44 minutos de ejecución autónoma.

La calidad del código generado por Fable resultó superior en cuanto a modularidad y facilidad de mantenimiento futuro. Sin embargo, en las pruebas de autonomía de larga duración, Astra demostró una mayor atención simultánea al funcionamiento y a la interfaz de usuario, resolviendo errores de manera eficiente sin intervención humana constante.

Diseño, interactividad y eficiencia operativa

  • Fable superó a Astra en elementos interactivos y animaciones con 94 puntos frente a 85.
  • El costo total de las pruebas con Fable fue de $49.18 debido a un volumen de tokens tres veces mayor, frente a $27.69 de Astra.
  • Astra lideró las métricas de velocidad y eficiencia de uso de herramientas con 70 puntos frente a 67.

Las pruebas de diseño demostraron que Fable prioriza la interactividad y los elementos animados elaborados mediante código, aunque repite patrones visuales conocidos. Por su parte, Astra ofreció una mayor eficiencia económica y velocidad de ejecución, consumiendo muchos menos tokens de salida y utilizando sus herramientas de forma más directa.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기