스크립트
00:00:00Fable 5.1 et GPT-6 Astra sont sortis à quelques jours d'intervalle et ont tous deux obtenu de très
00:00:05bons scores dans les benchmarks. Astra a même atteint presque 100 % au test AGI, ce qu'aucun modèle n'avait
00:00:11jamais approché. En voyant ces chiffres, on s'attend à d'excellents résultats lorsqu'on leur confie
00:00:16notre propre travail. Mais réussir ces tests ne garantit pas qu'un modèle saura gérer
00:00:20les tâches qu'on lui donne, et nous voulions voir si les deux modèles étaient aussi performants sur nos
00:00:25propres projets. Étant une entreprise de logiciels, nous avions déjà des projets pour les tester, nous avons donc
00:00:30donc confié à chacun des tâches issues de ces projets et vérifié ce qu'ils avaient accompli. Nous avons évalué chaque modèle
00:00:35sur plusieurs projets et noté ses performances dans différents domaines. Nous avons utilisé GPT-5.6 pour nous aider à juger
00:00:41et noter les résultats. Ce modèle arbitre ignorait quels résultats venaient de Fable et lesquels venaient
00:00:45d'Astra. Un modèle a obtenu un score global de 86 sur 100 tandis que l'autre a obtenu 84. Cela peut sembler
00:00:52un petit écart, mais le modèle en tête au classement général n'a pas gagné toutes les épreuves de test, et
00:00:57l'autre s'est avéré étonnamment bon dans certains domaines. Nous allons donc passer en revue les performances de chaque
00:01:02modèle lors de nos tests et voir lequel l'emporte dans chaque catégorie, afin que vous sachiez comment ces différences
00:01:07affectent le travail que vous leur confiez. Avant de voir les performances de chacun, faisons un point sur
00:01:12les modèles eux-mêmes. Cette section s'adresse uniquement à ceux qui ne les connaissent pas, donc si vous avez déjà
00:01:17les détails, vous pouvez passer cette partie et aller directement à la suivante. Anthropic a publié
00:01:22Fable 5.1 le 1er septembre, et avant même qu'Anthropic ne puisse vraiment profiter de l'engouement,
00:01:27OpenAI a lancé GPT-6 Astra quelques jours seulement après Fable. Les gens ont créé des produits vraiment
00:01:33intéressants avec ces modèles, poussant leurs limites au maximum et obtenant des résultats tout à fait
00:01:37surprenants. Côté tarifs, les deux modèles ont exactement le même prix, soit 10 dollars par
00:01:43million de jetons d'entrée et 50 dollars par million de jetons de sortie. Mais avec Fable 5.1, il y a une
00:01:49différence : Anthropic a réduit le prix des lectures en cache de 75 %. Pour ceux qui ne savent pas
00:01:54ce que sont les lectures en cache, les parties de la conversation déjà lues par le modèle sont sauvegardées pour
00:02:00être réutilisées. Lorsque vous envoyez une nouvelle invite, ces parties enregistrées sont réutilisées au lieu que le modèle ne les relise
00:02:05à nouveau depuis le début, ce que l'on appelle une lecture en cache. Ces lectures rendent déjà moins coûteuse la réutilisation de
00:02:10la conversation, et la baisse de prix rend cela encore plus économique. Mais cela ne signifie pas que Fable
00:02:14est un modèle moins cher à l'utilisation dans l'ensemble, car la facture totale dépend aussi de nombreux autres facteurs dont nous
00:02:19allons parler dans un instant. Les modèles Fable sont intégrés à Claude Code depuis un moment, mais Fable 5.1 n'est
00:02:25toujours pas inclus dans le forfait Claude Pro. Sur Pro, vous devez donc payer séparément via des crédits d'utilisation. Sur les
00:02:30forfaits Max, Fable 5.1 est inclus, mais les modèles Fable ont une limite inférieure à celle des autres modèles.
00:02:36D'un autre côté, OpenAI ne traite pas Astra comme un modèle distinct de cette manière, car Astra fait partie
00:02:41des limites normales de Codex sur ChatGPT+ et Pro, et vous pouvez dépenser toute votre utilisation sur Astra. Ces
00:02:47modèles sont vraiment capables de gérer de longues tâches, ce qui signifie que vous pouvez simplement leur demander de construire une grande
00:02:52fonctionnalité et de les laisser avancer dans les étapes par eux-mêmes. Mais lorsque vous laissez ces modèles travailler
00:02:57sur une longue tâche, la quantité de contexte qu'ils peuvent retenir a aussi son importance. Fable vous offre un million de jetons dans
00:03:02Claude Code, tandis que la fenêtre de contexte par défaut d'Astra dans Codex n'est que de 272 000 jetons, bien qu'Astra dispose
00:03:09d'une fenêtre beaucoup plus grande via son API, qui dépasse même le million de Fable. Mais vous n'aurez pas
00:03:14cela dans Codex pour l'instant, car Codex utilise par défaut une fenêtre de contexte de 272 000 jetons, même pour Astra.
00:03:21À présent, ces modèles ont atteint un niveau tel qu'ils peuvent mener des recherches avancées, de sorte qu'OpenAI et
00:03:26Anthropic ont donc tous deux ajouté des garde-fous de sécurité qui restreignent certaines des tâches qu'ils sont autorisés à faire.
00:03:31Mais ces restrictions affectent aussi votre travail de différentes manières, car chaque modèle réagit différemment
00:03:36lorsque son système de sécurité estime que votre requête n'est pas autorisée. Quand Astra atteint une partie de la tâche qui
00:03:41enfreint ses règles, elle refuse carrément la tâche et vous en informe. D'un autre côté,
00:03:45Claude Code bascule de Fable vers un modèle plus faible lorsqu'une requête va à l'encontre de ses règles. Et beaucoup
00:03:51de gens ont remarqué que Claude Code avait changé de modèle sans qu'ils le sachent. Ainsi, si Claude Code continue
00:03:56à travailler après ce changement, le résultat que vous obtenez ne provient peut-être plus de Fable.
00:04:01La première métrique que nous avons mesurée est la qualité, qui examine à quel point le travail du modèle
00:04:06est réellement bon. Pour ces tests, nous avons utilisé plusieurs projets clients, nous ne pouvons donc pas révéler les détails de ces
00:04:11projets, mais nous pouvons expliquer comment nous avons évalué le travail et en quoi les modèles différaient. Concernant la qualité d'écriture
00:04:16et d'organisation du code, Fable a obtenu 90 contre 78 pour Astra, car elle maintenait le code des différentes
00:04:22parties de l'application plus clairement séparé. Cela permet au modèle de mieux comprendre l'application lors de
00:04:27modifications ultérieures, et Fable devançait Astra sur ce point pour tous les projets testés. De plus, concernant
00:04:32la proportion de travail demandé qui a été achevée, Fable a obtenu 91 contre 84 pour Astra, car elle a également corrigé
00:04:39des problèmes que nous ne lui avions pas spécifiquement demandé de régler. Mais nous avons aussi vérifié si les fonctionnalités terminées
00:04:44fonctionnaient correctement sans que nous ayons à demander de corrections, et Astra a obtenu 87 contre 85 pour Fable sur ce plan.
00:04:50Une partie de l'avance d'Astra venait d'une vérification plus minutieuse des applications et de la correction d'un plus grand nombre de problèmes connus.
00:04:55Quand Fable testait ses applications, elle manquait certaines situations où des erreurs pouvaient survenir, de sorte que les fonctionnalités achevées
00:05:00comportaient encore quelques soucis. En ce qui concerne l'expérience d'utilisation de l'application, Astra a obtenu 89 contre 88 pour Fable,
00:05:08car elle a disposé les différentes parties de la page à des endroits qui les rendaient plus faciles à trouver et à utiliser.
00:05:13Ainsi, d'après tous les tests que nous venons de mentionner, le score de qualité global de Fable était de 88 tandis qu'Astra obtenait 84,
00:05:19car elle a construit des fonctionnalités plus complètes et son travail était plus facile à modifier par la suite. En termes de qualité,
00:05:25Fable l'emporte haut la main. Mais avant de passer au test suivant, un mot de notre sponsor,
00:05:30Zapier. Vous créez une application au feeling et elle fonctionne super bien, mais dès que vous voulez qu'elle se connecte réellement à des outils
00:05:35comme Gmail, Slack et Notion, vous devez configurer chaque intégration et flux OAuth à la main. Avant de vous en rendre compte,
00:05:41vous êtes enseveli sous le code d'authentification et les intégrations deviennent soudainement tout le projet. C'est là que
00:05:46le SDK Zapier entre en jeu. C'est une bibliothèque de code que vous intégrez dans votre projet, directement dans Claude Code ou Cursor,
00:05:52vous offrant un accès programmatique à l'écosystème de plus de 9 000 applications de Zapier. Alors au lieu de développer chaque intégration
00:05:58à la main, nous avons simplement appelé celles dont nous avions besoin et continué d'avancer. En quelques lignes, notre application envoyait des e-mails
00:06:04et créait des pages Notion sans aucune doc d'API ni aucun parcours d'authentification difficile. Et lorsque nous avions besoin de mettre à jour
00:06:10une propriété personnalisée dans Notion qui n'avait pas d'action préétablie, nous l'avons appelée directement via le
00:06:15SDK. C'est vraiment un outil qui s'intègre là où vous travaillez déjà. Si vous en avez assez de câbler des intégrations à la main,
00:06:20essayez le SDK Zapier. Le lien se trouve dans la description ci-dessous. La métrique suivante que nous avons mesurée était la façon dont
00:06:26les modèles géraient les tâches de longue durée, c'est-à-dire la quantité de travail accomplie par leurs propres moyens avec peu
00:06:31de directives de notre part au fil de l'eau. Nous avons également vérifié comment ils géraient les problèmes survenus en cours de route.
00:06:36Pour cela, nous avons confié à chaque modèle l'idée d'une application à créer et formulé la requête selon son guide de prompt
00:06:42pour lui donner un maximum de chances de bien faire son travail. Nous n'avons pas mentionné les détails spécifiques souhaités
00:06:47et nous avons simplement décrit ce que l'application devait faire. Astra a travaillé environ 32 minutes et Fable
00:06:53environ 44 minutes. Astra a rencontré des erreurs lors de la construction et de la vérification de son application, mais elle les a résolues
00:06:58et a continué à corriger l'application sans que nous ayons à la guider à travers chaque problème. Fable a également terminé
00:07:03son application sans s'arrêter prématurément ni nous demander quoi faire ensuite, et elle a exécuté des contrôles sur ce qu'elle avait construit.
00:07:09Les deux ont donc mené le travail à terme, mais nous avons également examiné les applications finies pour voir ce qu'elles
00:07:13nous avaient laissé. L'application d'Astra s'ouvrait directement sur une page de connexion sans page d'accueil séparée. Une fois connectés,
00:07:18la mise en page était bien organisée et l'application fonctionnait, bien qu'elle présentât toujours les agencements familiers
00:07:24que l'on retrouve dans de nombreuses applications générées par IA. Mais nous avons eu un problème avec le panneau latéral car il ne défilait pas
00:07:30assez loin pour nous permettre d'atteindre le bouton de déconnexion. Nous avons dû faire un zoom arrière pour l'atteindre, ce qui
00:07:35n'avait pas été détecté par les propres vérifications d'Astra. L'application de Fable s'ouvrait aussi directement sur une page de connexion, mais son
00:07:40design semblait beaucoup plus générique. Les fonctionnalités fonctionnaient, mais tout était tellement tassé que
00:07:45l'application était difficile à utiliser et les dégradés répétés renforçaient ce look familier d'application générée par IA. Elle s'adaptait bien aux
00:07:51petits écrans, mais manquait toujours d'une mise en page exploitable, même si les fonctionnalités étaient approfondies. Nous
00:07:56avions également prévu et construit plusieurs autres applications et fonctionnalités majeures de cette manière, en laissant les modèles
00:08:01travailler seuls. Ainsi, pour les tâches de longue durée, Astra a obtenu 93 sur 100 contre 90 pour Fable.
00:08:08Fable s'est davantage concentrée sur le fonctionnement des fonctionnalités, à moins que nous n'ayons spécifié dans l'invite qu'elle devait
00:08:13se concentrer également sur le visuel. Astra a prêté attention à la fois au fonctionnement des applications et à leur apparence,
00:08:18donc Astra l'emporte sur les tâches de longue durée. La métrique suivante que nous avons examinée était le design et la
00:08:23facilité d'utilisation des applications. Nous avons laissé le modèle noter les designs, mais nous ne voulions pas nous fier uniquement
00:08:28à son goût en matière de design. Nous avons donc construit un visualiseur pour les résultats de Fable et un autre pour ceux d'Astra, ce qui nous a permis
00:08:33d'examiner nous-mêmes les designs et de comparer leur ergonomie. Nous avons confié aux deux modèles les mêmes tâches de design,
00:08:38en commençant par une page d'accueil pour une entreprise vendant des polices de caractères. La version de Fable ressemblait beaucoup à
00:08:44ce qu'Opus a tendance à produire, des couleurs et des polices jusqu'à la mise en page. Elle comportait même cette bande de texte défilant
00:08:50sur la page que l'on voit souvent dans les designs d'Opus ces derniers temps. Mais une chose que Fable a faite différemment
00:08:55d'Opus, c'est d'ajouter beaucoup plus d'éléments interactifs dans tout le design, ce qui donnait une meilleure sensation d'utilisation.
00:09:00La version d'Astra proposait une mise en page plus aérée, avec des différences plus nettes dans la taille du texte et
00:09:05les couleurs, ce qui rendait la lecture plus facile. Mais il y avait beaucoup moins de mouvement, donc même si c'était plus
00:09:10agréable à regarder, cela n'offrait pas la même expérience que le design de Fable. C'est pourquoi Fable
00:09:14a obtenu 94 pour les scores d'interaction, tandis qu'Astra a obtenu 85. Ensuite, nous avons demandé à chaque modèle de concevoir une page de présentation
00:09:20de jeu d'horreur. Le design de Fable utilisait un phare animé pour créer l'ambiance. Il a généré les
00:09:25graphismes au format SVG, qui sont des images dessinées avec du code, mais le texte ne ressortait pas assez sur le fond sombre
00:09:31en raison des tailles et des couleurs choisies par Fable. Et pour la même tâche de design, Astra a utilisé le
00:09:36modèle de génération d'images intégré à Codex pour générer une image au lieu de créer les graphismes avec du code.
00:09:42Il a également créé une bande-annonce pour le jeu alors que nous ne l'avions pas demandé. Et là où Astra s'est démarqué,
00:09:47c'est dans son choix de polices et de couleurs, qui permettait au texte de se détacher sur le fond sombre.
00:09:52Pour le site du festival de musique, la version de Fable reprenait bon nombre des choix de design que l'on observe dans les conceptions réalisées
00:09:57par Opus. Mais malgré ces choix familiers, on avait l'impression que Fable avait fait davantage d'efforts pour donner au
00:10:03site son propre style. Astra a utilisé une photo de concert générée, mais le design global paraissait plus
00:10:08générique. La dernière comparaison portait sur un jeu de créneau, où la version de Fable était vraiment très bien faite,
00:10:13et le rétroviseur nous aidait à évaluer plus précisément où déplacer la voiture. Le jeu proposait deux
00:10:18angles de caméra, mais tous deux présentaient des défauts. L'un montrait le mauvais côté de la place de parking,
00:10:23tandis que l'autre ne montrait qu'un seul côté au lieu de nous offrir une vue complète de la route devant nous. Cela rendait
00:10:27plus difficile de voir où l'on déplaçait la voiture, et si ces angles de caméra avaient été corrects, le jeu aurait
00:10:32semblé plus réaliste. Astra proposait trois vues fixes et ajoutait des conseils de conduite dans le panneau latéral,
00:10:38ce qui rendait son jeu plus facile à prendre en main. Les vues de la caméra étaient toutes bien meilleures que celles de Fable. C'étaient
00:10:42des tests généraux où nous donnions très peu de détails aux modèles sur les designs souhaités, nous pouvions donc
00:10:48observer les propres goûts des modèles. Tous deux ont répété des choix de design vus dans leurs autres travaux, mais tous deux ont
00:10:53fourni de bons résultats. Et avec un peu plus de précisions sur l'apparence et l'ergonomie attendues des applications,
00:10:58nous pouvons nous attendre à ce que les deux fassent de bons designs. Ainsi, uniquement sur le plan du goût, Astra l'a emporté sur le visuel et l'ergonomie, tandis que Fable a gagné sur
00:11:04les animations et l'interactivité. Mais avant de passer aux tests de coût et de vitesse, n'hésitez pas à
00:11:09vous abonner à la chaîne et à cliquer sur le bouton j'aime. Ce petit geste de soutien représente beaucoup pour nous.
00:11:15La métrique suivante que nous avons mesurée était l'efficacité, qui englobait le coût du travail, le temps pris,
00:11:20et le nombre de fois que le modèle a utilisé ses outils pour y parvenir. Une chose à savoir concernant les coûts est que
00:11:25nous n'avons pas utilisé l'API, il s'agit donc simplement d'estimations du coût du travail si nous avions utilisé l'API
00:11:31en fonction des jetons utilisés. Nous avons effectué les tests sur notre abonnement habituel. Sur l'ensemble des tests, le coût total estimé
00:11:37de Fable s'est élevé à 49,18 $, contre 27,69 $ pour Astra, le total d'Astra étant donc inférieur d'environ 44 %.
00:11:47Fable a généré près de 3 fois plus de jetons de sortie qu'Astra, tout comme le guide de formulation de Fable
00:11:52mentionne qu'il a tendance à écrire plus que d'autres modèles. Les deux modèles avaient le même coût pour ces
00:11:57jetons, c'est donc le fait d'écrire davantage qui a fait augmenter le coût de Fable. L'utilisation d'outils contribue également à cette consommation de jetons,
00:12:03car le modèle choisit l'outil à utiliser puis lit les résultats avant de poursuivre son travail. Sur l'ensemble
00:12:09des six tests, l'agent principal de Fable a utilisé ses outils 443 fois contre 287 pour Astra, ce qui a également pesé sur
00:12:17le coût. Côté coût, Astra a obtenu 80 sur 100 contre 66 pour Fable. En matière de vitesse, Astra était également
00:12:23en tête avec 70 contre 67 pour Fable. Les tâches de longue durée ont pris environ 62 minutes au total pour Astra,
00:12:30contre 73 minutes pour Fable. Ainsi, en combinant les scores de coût, de vitesse et d'efficacité des outils,
00:12:35Astra devance Fable. La mesure suivante que nous avons évaluée est le respect des consignes,
00:12:40où nous avons vérifié dans quelle mesure les modèles suivaient les instructions fournies lors de la construction,
00:12:44et s'ils continuaient à les respecter au fil du travail. Lorsque nous avons testé Fable sur un projet,
00:12:49il a d'abord ajouté un message de coauteurs indiquant que Claude avait aidé à écrire le code,
00:12:53alors que nos instructions lui interdisaient explicitement de le faire. Il a également ignoré une règle concernant la manière
00:12:58dont il était autorisé à créer ou modifier des fichiers. Nous lui avions demandé d'utiliser les propres outils d'édition de fichiers de Claude, afin que ces modifications soient suivies
00:13:04et faciles à annuler, mais il a créé deux fichiers en exécutant des commandes à la place. En matière de respect des consignes,
00:13:09Astra a obtenu 96 sur 100 contre 88 pour Fable. Ainsi, pour ce qui est de suivre les instructions,
00:13:16Astra est arrivée en tête lors de ces tests. La mesure suivante que nous avons évaluée est la qualité de la relecture, où nous avons donné aux
00:13:21modèles un projet contenant des problèmes et leur avons demandé de les identifier. Nous avons d'abord soumis à chacun
00:13:27le même code à examiner, comportant quatre problèmes insérés délibérément, afin de savoir ce qu'ils devaient trouver. Fable
00:13:33a repéré les quatre, ainsi que cinq autres problèmes que nous n'avions pas ajoutés, lesquels ont ensuite
00:13:37été vérifiés et confirmés. Astra a trouvé deux des quatre problèmes ajoutés, tout en affirmant que la relecture
00:13:42était terminée. Nous avions également inclus trois parties qui semblaient suspectes mais qui étaient en réalité correctes, car
00:13:47nous voulions voir si le modèle signalerait de faux problèmes. Aucun des deux n'a traité cela comme un bogue, donc la
00:13:52différence réside ici dans la quantité trouvée, et Fable nous a fourni une relecture plus approfondie,
00:13:57mais lorsque nous les avons testés sur un projet plus vaste comportant neuf problèmes confirmés, Astra en a corrigé cinq, tandis que Fable
00:14:03n'en a trouvé et corrigé que quatre. Astra a donc accompli un plus grand nombre de réparations, bien que tous deux aient laissé plusieurs problèmes
00:14:08sans correction. Pour la qualité de la relecture, qui englobait ces réparations et la manière dont les modèles vérifiaient leur autre travail,
00:14:13Fable a obtenu un score de 84 contre 78 pour Astra. Fable est donc arrivé en tête sur le score global de relecture,
00:14:19car sa relecture globale s'est avérée plus solide. Ainsi, selon ces résultats, Astra s'impose clairement à travers
00:14:25plusieurs catégories testées, mais cela ne signifie pas que Fable est un mauvais modèle, car il a bien performé
00:14:30dans l'ensemble des tâches et n'était pas loin derrière Astra dans plusieurs d'entre elles. Il vous suffit donc de choisir le modèle
00:14:35en fonction des tâches que vous lui confiez. Maintenant, pour pousser ces deux modèles dans leurs derniers retranchements, il existe
00:14:40certaines pratiques à respecter. Nous en avons utilisé un grand nombre lors de nos tests, et si vous souhaitez y accéder
00:14:45vous aussi, vous pouvez les retrouver dans AI Labs Pro, qui est notre communauté. Si vous avez trouvé de la valeur dans ce que
00:14:51nous faisons et souhaitez soutenir la chaîne, c'est la meilleure façon de le faire. Le lien se trouve dans la description.
00:14:56Ceci conclut cette vidéo. Si vous souhaitez soutenir la chaîne et nous aider à continuer à créer
00:15:01des vidéos de ce type, vous pouvez le faire en utilisant le bouton Super Thanks ci-dessous. Comme toujours,
00:15:05merci d'avoir visionné et à la prochaine.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기