C'est terminé... Ceci vient de clore le débat GPT 6 Astra contre Fable 5.1

AAI LABS
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00Fable 5.1 et GPT-6 Astra sont sortis à quelques jours d'intervalle et ont tous deux obtenu de très
00:00:05bons scores dans les benchmarks. Astra a même atteint presque 100 % au test AGI, ce qu'aucun modèle n'avait
00:00:11jamais approché. En voyant ces chiffres, on s'attend à d'excellents résultats lorsqu'on leur confie
00:00:16notre propre travail. Mais réussir ces tests ne garantit pas qu'un modèle saura gérer
00:00:20les tâches qu'on lui donne, et nous voulions voir si les deux modèles étaient aussi performants sur nos
00:00:25propres projets. Étant une entreprise de logiciels, nous avions déjà des projets pour les tester, nous avons donc
00:00:30donc confié à chacun des tâches issues de ces projets et vérifié ce qu'ils avaient accompli. Nous avons évalué chaque modèle
00:00:35sur plusieurs projets et noté ses performances dans différents domaines. Nous avons utilisé GPT-5.6 pour nous aider à juger
00:00:41et noter les résultats. Ce modèle arbitre ignorait quels résultats venaient de Fable et lesquels venaient
00:00:45d'Astra. Un modèle a obtenu un score global de 86 sur 100 tandis que l'autre a obtenu 84. Cela peut sembler
00:00:52un petit écart, mais le modèle en tête au classement général n'a pas gagné toutes les épreuves de test, et
00:00:57l'autre s'est avéré étonnamment bon dans certains domaines. Nous allons donc passer en revue les performances de chaque
00:01:02modèle lors de nos tests et voir lequel l'emporte dans chaque catégorie, afin que vous sachiez comment ces différences
00:01:07affectent le travail que vous leur confiez. Avant de voir les performances de chacun, faisons un point sur
00:01:12les modèles eux-mêmes. Cette section s'adresse uniquement à ceux qui ne les connaissent pas, donc si vous avez déjà
00:01:17les détails, vous pouvez passer cette partie et aller directement à la suivante. Anthropic a publié
00:01:22Fable 5.1 le 1er septembre, et avant même qu'Anthropic ne puisse vraiment profiter de l'engouement,
00:01:27OpenAI a lancé GPT-6 Astra quelques jours seulement après Fable. Les gens ont créé des produits vraiment
00:01:33intéressants avec ces modèles, poussant leurs limites au maximum et obtenant des résultats tout à fait
00:01:37surprenants. Côté tarifs, les deux modèles ont exactement le même prix, soit 10 dollars par
00:01:43million de jetons d'entrée et 50 dollars par million de jetons de sortie. Mais avec Fable 5.1, il y a une
00:01:49différence : Anthropic a réduit le prix des lectures en cache de 75 %. Pour ceux qui ne savent pas
00:01:54ce que sont les lectures en cache, les parties de la conversation déjà lues par le modèle sont sauvegardées pour
00:02:00être réutilisées. Lorsque vous envoyez une nouvelle invite, ces parties enregistrées sont réutilisées au lieu que le modèle ne les relise
00:02:05à nouveau depuis le début, ce que l'on appelle une lecture en cache. Ces lectures rendent déjà moins coûteuse la réutilisation de
00:02:10la conversation, et la baisse de prix rend cela encore plus économique. Mais cela ne signifie pas que Fable
00:02:14est un modèle moins cher à l'utilisation dans l'ensemble, car la facture totale dépend aussi de nombreux autres facteurs dont nous
00:02:19allons parler dans un instant. Les modèles Fable sont intégrés à Claude Code depuis un moment, mais Fable 5.1 n'est
00:02:25toujours pas inclus dans le forfait Claude Pro. Sur Pro, vous devez donc payer séparément via des crédits d'utilisation. Sur les
00:02:30forfaits Max, Fable 5.1 est inclus, mais les modèles Fable ont une limite inférieure à celle des autres modèles.
00:02:36D'un autre côté, OpenAI ne traite pas Astra comme un modèle distinct de cette manière, car Astra fait partie
00:02:41des limites normales de Codex sur ChatGPT+ et Pro, et vous pouvez dépenser toute votre utilisation sur Astra. Ces
00:02:47modèles sont vraiment capables de gérer de longues tâches, ce qui signifie que vous pouvez simplement leur demander de construire une grande
00:02:52fonctionnalité et de les laisser avancer dans les étapes par eux-mêmes. Mais lorsque vous laissez ces modèles travailler
00:02:57sur une longue tâche, la quantité de contexte qu'ils peuvent retenir a aussi son importance. Fable vous offre un million de jetons dans
00:03:02Claude Code, tandis que la fenêtre de contexte par défaut d'Astra dans Codex n'est que de 272 000 jetons, bien qu'Astra dispose
00:03:09d'une fenêtre beaucoup plus grande via son API, qui dépasse même le million de Fable. Mais vous n'aurez pas
00:03:14cela dans Codex pour l'instant, car Codex utilise par défaut une fenêtre de contexte de 272 000 jetons, même pour Astra.
00:03:21À présent, ces modèles ont atteint un niveau tel qu'ils peuvent mener des recherches avancées, de sorte qu'OpenAI et
00:03:26Anthropic ont donc tous deux ajouté des garde-fous de sécurité qui restreignent certaines des tâches qu'ils sont autorisés à faire.
00:03:31Mais ces restrictions affectent aussi votre travail de différentes manières, car chaque modèle réagit différemment
00:03:36lorsque son système de sécurité estime que votre requête n'est pas autorisée. Quand Astra atteint une partie de la tâche qui
00:03:41enfreint ses règles, elle refuse carrément la tâche et vous en informe. D'un autre côté,
00:03:45Claude Code bascule de Fable vers un modèle plus faible lorsqu'une requête va à l'encontre de ses règles. Et beaucoup
00:03:51de gens ont remarqué que Claude Code avait changé de modèle sans qu'ils le sachent. Ainsi, si Claude Code continue
00:03:56à travailler après ce changement, le résultat que vous obtenez ne provient peut-être plus de Fable.
00:04:01La première métrique que nous avons mesurée est la qualité, qui examine à quel point le travail du modèle
00:04:06est réellement bon. Pour ces tests, nous avons utilisé plusieurs projets clients, nous ne pouvons donc pas révéler les détails de ces
00:04:11projets, mais nous pouvons expliquer comment nous avons évalué le travail et en quoi les modèles différaient. Concernant la qualité d'écriture
00:04:16et d'organisation du code, Fable a obtenu 90 contre 78 pour Astra, car elle maintenait le code des différentes
00:04:22parties de l'application plus clairement séparé. Cela permet au modèle de mieux comprendre l'application lors de
00:04:27modifications ultérieures, et Fable devançait Astra sur ce point pour tous les projets testés. De plus, concernant
00:04:32la proportion de travail demandé qui a été achevée, Fable a obtenu 91 contre 84 pour Astra, car elle a également corrigé
00:04:39des problèmes que nous ne lui avions pas spécifiquement demandé de régler. Mais nous avons aussi vérifié si les fonctionnalités terminées
00:04:44fonctionnaient correctement sans que nous ayons à demander de corrections, et Astra a obtenu 87 contre 85 pour Fable sur ce plan.
00:04:50Une partie de l'avance d'Astra venait d'une vérification plus minutieuse des applications et de la correction d'un plus grand nombre de problèmes connus.
00:04:55Quand Fable testait ses applications, elle manquait certaines situations où des erreurs pouvaient survenir, de sorte que les fonctionnalités achevées
00:05:00comportaient encore quelques soucis. En ce qui concerne l'expérience d'utilisation de l'application, Astra a obtenu 89 contre 88 pour Fable,
00:05:08car elle a disposé les différentes parties de la page à des endroits qui les rendaient plus faciles à trouver et à utiliser.
00:05:13Ainsi, d'après tous les tests que nous venons de mentionner, le score de qualité global de Fable était de 88 tandis qu'Astra obtenait 84,
00:05:19car elle a construit des fonctionnalités plus complètes et son travail était plus facile à modifier par la suite. En termes de qualité,
00:05:25Fable l'emporte haut la main. Mais avant de passer au test suivant, un mot de notre sponsor,
00:05:30Zapier. Vous créez une application au feeling et elle fonctionne super bien, mais dès que vous voulez qu'elle se connecte réellement à des outils
00:05:35comme Gmail, Slack et Notion, vous devez configurer chaque intégration et flux OAuth à la main. Avant de vous en rendre compte,
00:05:41vous êtes enseveli sous le code d'authentification et les intégrations deviennent soudainement tout le projet. C'est là que
00:05:46le SDK Zapier entre en jeu. C'est une bibliothèque de code que vous intégrez dans votre projet, directement dans Claude Code ou Cursor,
00:05:52vous offrant un accès programmatique à l'écosystème de plus de 9 000 applications de Zapier. Alors au lieu de développer chaque intégration
00:05:58à la main, nous avons simplement appelé celles dont nous avions besoin et continué d'avancer. En quelques lignes, notre application envoyait des e-mails
00:06:04et créait des pages Notion sans aucune doc d'API ni aucun parcours d'authentification difficile. Et lorsque nous avions besoin de mettre à jour
00:06:10une propriété personnalisée dans Notion qui n'avait pas d'action préétablie, nous l'avons appelée directement via le
00:06:15SDK. C'est vraiment un outil qui s'intègre là où vous travaillez déjà. Si vous en avez assez de câbler des intégrations à la main,
00:06:20essayez le SDK Zapier. Le lien se trouve dans la description ci-dessous. La métrique suivante que nous avons mesurée était la façon dont
00:06:26les modèles géraient les tâches de longue durée, c'est-à-dire la quantité de travail accomplie par leurs propres moyens avec peu
00:06:31de directives de notre part au fil de l'eau. Nous avons également vérifié comment ils géraient les problèmes survenus en cours de route.
00:06:36Pour cela, nous avons confié à chaque modèle l'idée d'une application à créer et formulé la requête selon son guide de prompt
00:06:42pour lui donner un maximum de chances de bien faire son travail. Nous n'avons pas mentionné les détails spécifiques souhaités
00:06:47et nous avons simplement décrit ce que l'application devait faire. Astra a travaillé environ 32 minutes et Fable
00:06:53environ 44 minutes. Astra a rencontré des erreurs lors de la construction et de la vérification de son application, mais elle les a résolues
00:06:58et a continué à corriger l'application sans que nous ayons à la guider à travers chaque problème. Fable a également terminé
00:07:03son application sans s'arrêter prématurément ni nous demander quoi faire ensuite, et elle a exécuté des contrôles sur ce qu'elle avait construit.
00:07:09Les deux ont donc mené le travail à terme, mais nous avons également examiné les applications finies pour voir ce qu'elles
00:07:13nous avaient laissé. L'application d'Astra s'ouvrait directement sur une page de connexion sans page d'accueil séparée. Une fois connectés,
00:07:18la mise en page était bien organisée et l'application fonctionnait, bien qu'elle présentât toujours les agencements familiers
00:07:24que l'on retrouve dans de nombreuses applications générées par IA. Mais nous avons eu un problème avec le panneau latéral car il ne défilait pas
00:07:30assez loin pour nous permettre d'atteindre le bouton de déconnexion. Nous avons dû faire un zoom arrière pour l'atteindre, ce qui
00:07:35n'avait pas été détecté par les propres vérifications d'Astra. L'application de Fable s'ouvrait aussi directement sur une page de connexion, mais son
00:07:40design semblait beaucoup plus générique. Les fonctionnalités fonctionnaient, mais tout était tellement tassé que
00:07:45l'application était difficile à utiliser et les dégradés répétés renforçaient ce look familier d'application générée par IA. Elle s'adaptait bien aux
00:07:51petits écrans, mais manquait toujours d'une mise en page exploitable, même si les fonctionnalités étaient approfondies. Nous
00:07:56avions également prévu et construit plusieurs autres applications et fonctionnalités majeures de cette manière, en laissant les modèles
00:08:01travailler seuls. Ainsi, pour les tâches de longue durée, Astra a obtenu 93 sur 100 contre 90 pour Fable.
00:08:08Fable s'est davantage concentrée sur le fonctionnement des fonctionnalités, à moins que nous n'ayons spécifié dans l'invite qu'elle devait
00:08:13se concentrer également sur le visuel. Astra a prêté attention à la fois au fonctionnement des applications et à leur apparence,
00:08:18donc Astra l'emporte sur les tâches de longue durée. La métrique suivante que nous avons examinée était le design et la
00:08:23facilité d'utilisation des applications. Nous avons laissé le modèle noter les designs, mais nous ne voulions pas nous fier uniquement
00:08:28à son goût en matière de design. Nous avons donc construit un visualiseur pour les résultats de Fable et un autre pour ceux d'Astra, ce qui nous a permis
00:08:33d'examiner nous-mêmes les designs et de comparer leur ergonomie. Nous avons confié aux deux modèles les mêmes tâches de design,
00:08:38en commençant par une page d'accueil pour une entreprise vendant des polices de caractères. La version de Fable ressemblait beaucoup à
00:08:44ce qu'Opus a tendance à produire, des couleurs et des polices jusqu'à la mise en page. Elle comportait même cette bande de texte défilant
00:08:50sur la page que l'on voit souvent dans les designs d'Opus ces derniers temps. Mais une chose que Fable a faite différemment
00:08:55d'Opus, c'est d'ajouter beaucoup plus d'éléments interactifs dans tout le design, ce qui donnait une meilleure sensation d'utilisation.
00:09:00La version d'Astra proposait une mise en page plus aérée, avec des différences plus nettes dans la taille du texte et
00:09:05les couleurs, ce qui rendait la lecture plus facile. Mais il y avait beaucoup moins de mouvement, donc même si c'était plus
00:09:10agréable à regarder, cela n'offrait pas la même expérience que le design de Fable. C'est pourquoi Fable
00:09:14a obtenu 94 pour les scores d'interaction, tandis qu'Astra a obtenu 85. Ensuite, nous avons demandé à chaque modèle de concevoir une page de présentation
00:09:20de jeu d'horreur. Le design de Fable utilisait un phare animé pour créer l'ambiance. Il a généré les
00:09:25graphismes au format SVG, qui sont des images dessinées avec du code, mais le texte ne ressortait pas assez sur le fond sombre
00:09:31en raison des tailles et des couleurs choisies par Fable. Et pour la même tâche de design, Astra a utilisé le
00:09:36modèle de génération d'images intégré à Codex pour générer une image au lieu de créer les graphismes avec du code.
00:09:42Il a également créé une bande-annonce pour le jeu alors que nous ne l'avions pas demandé. Et là où Astra s'est démarqué,
00:09:47c'est dans son choix de polices et de couleurs, qui permettait au texte de se détacher sur le fond sombre.
00:09:52Pour le site du festival de musique, la version de Fable reprenait bon nombre des choix de design que l'on observe dans les conceptions réalisées
00:09:57par Opus. Mais malgré ces choix familiers, on avait l'impression que Fable avait fait davantage d'efforts pour donner au
00:10:03site son propre style. Astra a utilisé une photo de concert générée, mais le design global paraissait plus
00:10:08générique. La dernière comparaison portait sur un jeu de créneau, où la version de Fable était vraiment très bien faite,
00:10:13et le rétroviseur nous aidait à évaluer plus précisément où déplacer la voiture. Le jeu proposait deux
00:10:18angles de caméra, mais tous deux présentaient des défauts. L'un montrait le mauvais côté de la place de parking,
00:10:23tandis que l'autre ne montrait qu'un seul côté au lieu de nous offrir une vue complète de la route devant nous. Cela rendait
00:10:27plus difficile de voir où l'on déplaçait la voiture, et si ces angles de caméra avaient été corrects, le jeu aurait
00:10:32semblé plus réaliste. Astra proposait trois vues fixes et ajoutait des conseils de conduite dans le panneau latéral,
00:10:38ce qui rendait son jeu plus facile à prendre en main. Les vues de la caméra étaient toutes bien meilleures que celles de Fable. C'étaient
00:10:42des tests généraux où nous donnions très peu de détails aux modèles sur les designs souhaités, nous pouvions donc
00:10:48observer les propres goûts des modèles. Tous deux ont répété des choix de design vus dans leurs autres travaux, mais tous deux ont
00:10:53fourni de bons résultats. Et avec un peu plus de précisions sur l'apparence et l'ergonomie attendues des applications,
00:10:58nous pouvons nous attendre à ce que les deux fassent de bons designs. Ainsi, uniquement sur le plan du goût, Astra l'a emporté sur le visuel et l'ergonomie, tandis que Fable a gagné sur
00:11:04les animations et l'interactivité. Mais avant de passer aux tests de coût et de vitesse, n'hésitez pas à
00:11:09vous abonner à la chaîne et à cliquer sur le bouton j'aime. Ce petit geste de soutien représente beaucoup pour nous.
00:11:15La métrique suivante que nous avons mesurée était l'efficacité, qui englobait le coût du travail, le temps pris,
00:11:20et le nombre de fois que le modèle a utilisé ses outils pour y parvenir. Une chose à savoir concernant les coûts est que
00:11:25nous n'avons pas utilisé l'API, il s'agit donc simplement d'estimations du coût du travail si nous avions utilisé l'API
00:11:31en fonction des jetons utilisés. Nous avons effectué les tests sur notre abonnement habituel. Sur l'ensemble des tests, le coût total estimé
00:11:37de Fable s'est élevé à 49,18 $, contre 27,69 $ pour Astra, le total d'Astra étant donc inférieur d'environ 44 %.
00:11:47Fable a généré près de 3 fois plus de jetons de sortie qu'Astra, tout comme le guide de formulation de Fable
00:11:52mentionne qu'il a tendance à écrire plus que d'autres modèles. Les deux modèles avaient le même coût pour ces
00:11:57jetons, c'est donc le fait d'écrire davantage qui a fait augmenter le coût de Fable. L'utilisation d'outils contribue également à cette consommation de jetons,
00:12:03car le modèle choisit l'outil à utiliser puis lit les résultats avant de poursuivre son travail. Sur l'ensemble
00:12:09des six tests, l'agent principal de Fable a utilisé ses outils 443 fois contre 287 pour Astra, ce qui a également pesé sur
00:12:17le coût. Côté coût, Astra a obtenu 80 sur 100 contre 66 pour Fable. En matière de vitesse, Astra était également
00:12:23en tête avec 70 contre 67 pour Fable. Les tâches de longue durée ont pris environ 62 minutes au total pour Astra,
00:12:30contre 73 minutes pour Fable. Ainsi, en combinant les scores de coût, de vitesse et d'efficacité des outils,
00:12:35Astra devance Fable. La mesure suivante que nous avons évaluée est le respect des consignes,
00:12:40où nous avons vérifié dans quelle mesure les modèles suivaient les instructions fournies lors de la construction,
00:12:44et s'ils continuaient à les respecter au fil du travail. Lorsque nous avons testé Fable sur un projet,
00:12:49il a d'abord ajouté un message de coauteurs indiquant que Claude avait aidé à écrire le code,
00:12:53alors que nos instructions lui interdisaient explicitement de le faire. Il a également ignoré une règle concernant la manière
00:12:58dont il était autorisé à créer ou modifier des fichiers. Nous lui avions demandé d'utiliser les propres outils d'édition de fichiers de Claude, afin que ces modifications soient suivies
00:13:04et faciles à annuler, mais il a créé deux fichiers en exécutant des commandes à la place. En matière de respect des consignes,
00:13:09Astra a obtenu 96 sur 100 contre 88 pour Fable. Ainsi, pour ce qui est de suivre les instructions,
00:13:16Astra est arrivée en tête lors de ces tests. La mesure suivante que nous avons évaluée est la qualité de la relecture, où nous avons donné aux
00:13:21modèles un projet contenant des problèmes et leur avons demandé de les identifier. Nous avons d'abord soumis à chacun
00:13:27le même code à examiner, comportant quatre problèmes insérés délibérément, afin de savoir ce qu'ils devaient trouver. Fable
00:13:33a repéré les quatre, ainsi que cinq autres problèmes que nous n'avions pas ajoutés, lesquels ont ensuite
00:13:37été vérifiés et confirmés. Astra a trouvé deux des quatre problèmes ajoutés, tout en affirmant que la relecture
00:13:42était terminée. Nous avions également inclus trois parties qui semblaient suspectes mais qui étaient en réalité correctes, car
00:13:47nous voulions voir si le modèle signalerait de faux problèmes. Aucun des deux n'a traité cela comme un bogue, donc la
00:13:52différence réside ici dans la quantité trouvée, et Fable nous a fourni une relecture plus approfondie,
00:13:57mais lorsque nous les avons testés sur un projet plus vaste comportant neuf problèmes confirmés, Astra en a corrigé cinq, tandis que Fable
00:14:03n'en a trouvé et corrigé que quatre. Astra a donc accompli un plus grand nombre de réparations, bien que tous deux aient laissé plusieurs problèmes
00:14:08sans correction. Pour la qualité de la relecture, qui englobait ces réparations et la manière dont les modèles vérifiaient leur autre travail,
00:14:13Fable a obtenu un score de 84 contre 78 pour Astra. Fable est donc arrivé en tête sur le score global de relecture,
00:14:19car sa relecture globale s'est avérée plus solide. Ainsi, selon ces résultats, Astra s'impose clairement à travers
00:14:25plusieurs catégories testées, mais cela ne signifie pas que Fable est un mauvais modèle, car il a bien performé
00:14:30dans l'ensemble des tâches et n'était pas loin derrière Astra dans plusieurs d'entre elles. Il vous suffit donc de choisir le modèle
00:14:35en fonction des tâches que vous lui confiez. Maintenant, pour pousser ces deux modèles dans leurs derniers retranchements, il existe
00:14:40certaines pratiques à respecter. Nous en avons utilisé un grand nombre lors de nos tests, et si vous souhaitez y accéder
00:14:45vous aussi, vous pouvez les retrouver dans AI Labs Pro, qui est notre communauté. Si vous avez trouvé de la valeur dans ce que
00:14:51nous faisons et souhaitez soutenir la chaîne, c'est la meilleure façon de le faire. Le lien se trouve dans la description.
00:14:56Ceci conclut cette vidéo. Si vous souhaitez soutenir la chaîne et nous aider à continuer à créer
00:15:01des vidéos de ce type, vous pouvez le faire en utilisant le bouton Super Thanks ci-dessous. Comme toujours,
00:15:05merci d'avoir visionné et à la prochaine.

핵심 요약

Fable 5.1 domine sur la qualité du code et l'interactivité, tandis que GPT-6 Astra l'emporte sur l'efficacité globale, le coût et le respect des consignes avec un score de 86 contre 84.

하이라이트

  • Fable 5.1 et GPT-6 Astra ont été testés sur des projets logiciels réels à l'aide d'un arbitre indépendant, obtenant respectivement des scores globaux de 86 et 84 sur 100.

  • Les deux modèles affichent un tarif identique de 10 dollars par million de jetons d'entrée et 50 dollars par million de jetons de sortie, mais Fable 5.1 réduit les lectures en cache de 75 %.

  • Fable 5.1 obtient un score de qualité globale de 88 contre 84 pour Astra, en raison d'une meilleure séparation du code et d'une plus grande proportion de tâches achevées.

  • Astra surpasse Fable sur les tâches de longue durée avec un score de 93 contre 90, en travaillant de manière autonome pendant environ 32 minutes contre 44 minutes pour Fable.

  • Le coût total estimé pour Fable s'élève à 49,18 $contre 27,69$ pour Astra, cette dernière étant environ 44 % moins chère grâce à une production de jetons de sortie près de trois fois inférieure.

타임라인

Présentation et conditions des tests des modèles

  • Fable 5.1 et GPT-6 Astra obtiennent d'excellents scores aux benchmarks, Astra frôlant les 100 % au test AGI.
  • Un modèle arbitre, GPT-5.6, évalue les résultats des projets logiciels sans connaître l'origine du code.
  • Le classement général attribue un score de 86 pour un modèle et de 84 pour l'autre, révélant des performances variables selon les catégories.

Les scores élevés obtenus par les nouveaux modèles sur les benchmarks ne garantissent pas leur efficacité sur des projets réels. Une entreprise de logiciels soumet ses propres tâches aux deux modèles pour comparer concrètement leurs capacités. L'évaluation est réalisée en aveugle par un tiers neutre, permettant de départager Fable et Astra au-delà des simples chiffres théoriques.

Spécificités tarifaires et intégration des modèles

  • Anthropic lance Fable 5.1 le 1er septembre, suivi de près par le lancement de GPT-6 Astra par OpenAI.
  • Les deux modèles affichent des tarifs de base identiques, mais Fable 5.1 applique une réduction de 75 % sur les lectures en cache.
  • Fable offre une fenêtre de un million de jetons dans Claude Code, tandis qu'Astra utilise par défaut 272 000 jetons dans Codex.

Malgré un prix unitaire des jetons similaire, les structures d'utilisation diffèrent entre les plateformes. Fable 5.1 réduit le coût des lectures en cache pour économiser sur les requêtes répétées, mais reste soumis à des limites spécifiques sur les forfaits Max. En matière de sécurité, Astra refuse directement les requêtes non autorisées, alors que Claude Code bascule silencieusement vers un modèle plus faible.

Évaluation de la qualité du code et des applications

  • Fable obtient 90 contre 78 pour Astra en qualité d'écriture et d'organisation du code.
  • Astra surpasse Fable sur le fonctionnement immédiat des fonctionnalités sans corrections supplémentaires, avec un score de 87 contre 85.
  • Le score de qualité global s'établit à 88 pour Fable et 84 pour Astra.

L'analyse des projets clients démontre que Fable isole mieux le code des différentes parties de l'application, facilitant les modifications ultérieures. Fable complète également davantage de tâches en anticipant des correctifs non demandés. En revanche, Astra vérifie plus minutieusement les applications et résout un plus grand nombre d'erreurs connues lors des tests initiaux.

Exécution de tâches de longue durée et autonomie

  • Astra travaille en autonomie pendant environ 32 minutes contre 44 minutes pour Fable.
  • Astra obtient 93 sur 100 contre 90 pour Fable sur les tâches de longue durée.
  • Astra intègre simultanément l'apparence visuelle et le bon fonctionnement des applications.

L'évaluation de la gestion des tâches prolongées sans intervention humaine montre que les deux modèles parviennent au terme de la construction. Astra se distingue en prêtant attention à la fois à l'ergonomie visuelle et à la structure générale, malgré un léger défaut de défilement sur le panneau latéral de son application.

Comparaison du design et de l'interactivité

  • Fable obtient 94 pour les scores d'interaction contre 85 pour Astra.
  • Astra l'emporte sur le plan du goût visuel et de la clarté de lecture pour les pages statiques.
  • Fable intègre davantage d'éléments interactifs et d'animations dans l'ensemble de ses conceptions.

Les tests de design confrontent les modèles sur des projets variés, comme des sites de polices de caractères ou des jeux de stationnement. Fable se montre supérieure en matière d'interactivité et d'animations dynamiques, tandis qu'Astra privilégie des mises en page plus aérées et des choix de couleurs plus lisibles sur les fonds sombres.

Analyse des coûts, de la vitesse et de l'efficacité

  • Le coût total estimé atteint 49,18 $pour Fable contre 27,69$ pour Astra.
  • Fable génère près de trois fois plus de jetons de sortie et utilise ses outils 443 fois contre 287 pour Astra.
  • Astra domine l'efficacité avec un score de coût de 80 contre 66 et une vitesse de 70 contre 67.

L'analyse de l'efficacité globale met en évidence une consommation de ressources nettement supérieure pour Fable en raison de textes plus longs et d'appels d'outils plus fréquents. Astra s'avère ainsi environ 44 % moins coûteuse et plus rapide sur l'ensemble des six tests réalisés.

Respect des consignes et qualité de la relecture

  • Astra obtient 96 sur 100 contre 88 pour Fable en matière de respect des instructions.
  • Fable repère un plus grand nombre d'anomalies lors de la relecture d'un code comportant des erreurs délibérées.
  • Astra corrige un plus grand nombre de problèmes effectifs sur un projet étendu.

Le respect des consignes met en défaut Fable lorsqu'elle ajoute des messages non autorisés ou utilise des commandes directes au lieu des outils d'édition requis. En revanche, Fable se montre plus minutieuse lors de la relecture et de la détection initiale de bugs, devançant Astra sur ce critère spécifique avant de conclure la comparaison.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기