스크립트
00:00:00Juste après la sortie de Fable 5.1 par Anthropic, OpenAI réplique en lançant GPT-6 Astra.
00:00:07Commençons par examiner certains des benchmarks de GPT-6 Astra. Et merci à
00:00:10OpenAI de nous fournir bien plus de benchmarks à analyser que ce qu'Anthropic nous a montré avec Fable
00:00:145.1. En matière d'utilisation de l'ordinateur, il domine largement la concurrence. Nous n'avons même pas beaucoup de données
00:00:19ici concernant Fable 5.1. Si l'on regarde les benchmarks professionnels, comme BenchCAD
00:00:24et browse comp, là encore, GPT-6 réalise des performances exceptionnelles. Le seul domaine où il ne gagne pas est l'
00:00:31artificial analysis intelligence index, où il obtient un score de 61,2 contre 65,7 pour Fable 5.1.
00:00:38Ensuite, parlons de la programmation. Et là encore, c'est à peu près la même histoire. Soit il bat Fable 5.1, soit il est
00:00:43au coude-à-coude. Si l'on regarde spécifiquement TerminalBench 4.0, on constate un bond énorme par rapport au GPT 5.6 solo
00:00:49qui passe de 37,3 à 57,7. Et si l'on regarde DeepSuite, qui est probablement mon
00:00:55benchmark de codage favori, axé principalement sur les tâches agentiques de longue durée, il obtient un score de 74,1 %, ce qui, encore une fois,
00:01:02surpasse tout ce qui existe actuellement. GPT-6 écrase également les benchmarks académiques ainsi que ceux
00:01:08de la science et de la santé. Et si l'on examine les benchmarks de cybersécurité, là encore, je prête vraiment
00:01:13attention au 5.6 solo ici. Des bonds massifs, de 78,5 à 100 %. De 55,9 jusqu'à 88,5 % sur exploit
00:01:22bench et jusqu'à 39 %. Il s'agit donc d'une véritable révolution par rapport aux modèles de la série 5. Et en termes
00:01:27de contexte long, GPT-6 assure aussi brillamment. Score de 100 % au test des huit aiguilles de 256 à 512k
00:01:34jetons. Soit essentiellement du quart à une fenêtre contextuelle totalement pleine. Et lorsque cette fenêtre passe de 512 000
00:01:41jetons à un million, il obtient tout de même un score de 96,3 %. Si vous avez l'habitude d'injecter énormément de
00:01:46contexte dans votre modèle d'IA préféré, GPT-6 s'en sortira à merveille dans ces situations. Mais les scores bruts
00:01:51ne suffisent pas. Nous devons savoir combien cela coûte réellement d'atteindre ces scores,
00:01:55car Astra a beau avoir le meilleur score au monde, s'il coûte 10 fois plus cher que tout le reste, à quoi bon ?
00:01:59Heureusement, historiquement, les modèles GPT se sont montrés très efficaces en matière de jetons. En observant
00:02:04le score de terminal bench 4.0 ici, on s'aperçoit que cela se vérifie. Donc, GPT-6 Astra avec les étoiles,
00:02:11la première chose à noter est que, comme beaucoup de ces modèles, on observe une baisse d'efficacité
00:02:16à mesure que l'on monte dans la chaîne de niveau d'effort. Ainsi, en passant de faible à moyen puis élevé, j'obtiens continuellement
00:02:23de meilleurs scores pour une augmentation de coût relativement linéaire. Mais en passant d'élevé à très élevé, puis maximal,
00:02:30j'obtiens en réalité un moins bon score pour un coût supérieur. Ainsi, en niveau élevé pour 7,21 $, j'obtiens une
00:02:39précision de 57,9 %. Si je compare cela à Fable 5.1 juste ici, en mode élevé, j'obtiens une précision de 49,4 %
00:02:49pour 10,50 $. C'est donc plus cher, et les performances sont moindres. Fable obtient pourtant un score assez élevé
00:02:57lorsque je règle l'effort au maximum à 55,8, mais cela me coûte 19,50 $. Ainsi, pour un score équivalent,
00:03:06toujours d'environ 55 %, Fable 5 coûte presque 20 $, tandis que GPT-6 Astra coûte 7,20 $. C'est donc infiniment moins cher
00:03:16pour une précision pratiquement identique. Et en observant Frontier Code 1.1, on remarque un schéma similaire,
00:03:22où dans les niveaux élevés, nous obtenons des scores comparables. Lorsque l'on compare GPT-6 à Fable 5.1
00:03:29ou Fable 5, dans ce cas précis, Fable 5 a obtenu un score plus élevé ici. Mais l'exécution de ces modèles cloud s'avère bien plus coûteuse
00:03:34en raison de l'efficacité des jetons avec GPT-6 Astra. Cela dit, OpenAI met en avant quelques fonctionnalités
00:03:39au-delà des benchmarks concernant GPT-6. Premièrement, ils le présentent comme
00:03:43le meilleur modèle au monde pour l'utilisation d'ordinateurs. Il existe quelques benchmarks évaluant ce type
00:03:48de tâches, comme le dernier examen des agents. Et comme on a pu le voir avec d'autres benchmarks, que nous révèlent-ils ?
00:03:52Ils montrent qu'Astra cartonne, tant en termes de précision que de coûts d'API, lesquels ne doivent
00:03:57jamais être négligés. Mais la vitesse est sans doute encore plus importante que la précision. Codex propose une utilisation
00:04:01informatique vraiment performante, surtout combiné au mode vocal. Et Astra est censé
00:04:06être 1,9 fois plus rapide que le GPT-5.6, ce qui ravira ceux qui l'ont beaucoup utilisé
00:04:11ces derniers temps. Autre point souligné : le respect des modèles. Si vous lui fournissez
00:04:15un type de modèle, par exemple une présentation de diapositives comme celle de gauche, et que vous lui demandez
00:04:20de concevoir une autre présentation dans le même style sur un sujet différent, vous obtenez
00:04:25un résultat similaire à ce que l'on voit à droite, qui respecte extrêmement bien le style. Si vous possédez
00:04:31un modèle récurrent, que ce soit pour des présentations ou des sites web, considérez cela comme un
00:04:35système de design pour n'importe quel type de production, GPT-6 s'avère idéal pour cela. On le constate à nouveau ici avec
00:04:41les documents Excel et le style de documents en général. Voici essentiellement l'image de référence fournie.
00:04:46Voici ce que l'on obtenait auparavant, et voici le résultat à droite après prise en compte de cette
00:04:51image de référence. Autre détail intéressant : cette phrase où ils expliquent que GPT-6 Astra
00:04:55apportant un meilleur jugement visuel aux sites web, aux jeux, aux applications et au rendu, c'est-à-dire qu'ils
00:05:00GPT-6 possède un meilleur goût. Vous avez probablement entendu maintes fois que l'IA n'a aucun goût.
00:05:05Eh bien, ils affirment que GPT-6 en a un. Soyons honnêtes, il y aura toujours des problèmes
00:05:10concernant le sens esthétique de l'IA, car si on lui donne une mauvaise consigne, on observera toujours une régression
00:05:15vers la moyenne, quoi qu'il arrive. Et quelle que soit cette moyenne, les gens l'associeront à la médiocrité générée
00:05:20par l'IA, peu importe sa réelle qualité. Mais ils présentent quelques exemples d'une séquence
00:05:25réalisée sous Unreal Engine, de modélisation Blender, ainsi que quelques images fixes. Une nouveauté très intéressante
00:05:31ajoutée à Astra concerne les modifications apportées au compactage automatique lorsque la fenêtre contextuelle se remplit. Auparavant,
00:05:37quand la fenêtre de contexte était pleine, un compactage automatique s'effectuait et créait un résumé
00:05:41de tout ce qui avait été discuté lors de la session précédente, avant d'entamer une nouvelle session.
00:05:46Cela posait des problèmes, omettant parfois des détails. Désormais, Astra conserve des notes d'une fenêtre contextuelle à l'autre
00:05:52au lieu de se limiter à un simple résumé. Ainsi, au lieu d'un document unique, il dispose d'une multitude
00:05:57de notes adhésives sur ce qu'il juge important. Et il peut les consulter à tout moment,
00:06:01contrairement à une approche ponctuelle du type « voici un résumé, en espérant que cela suffise ».
00:06:06De plus, les fenêtres contextuelles antérieures restent consultables. Il ne s'agit donc pas du
00:06:12seul document résumé disponible. Si l'information n'y figure pas, tout est perdu : ce n'est plus du tout
00:06:16le cas. C'est une fonctionnalité expérimentale qu'il vous faudra activer dans la configuration
00:06:20de codex, mais elle deviendra la valeur par défaut d'ici quelques semaines. En matière de cybersécurité,
00:06:24Astra adopte une approche similaire à celle d'Anthropic avec Fable, estimant que ce modèle est tellement
00:06:28puissant qu'il peut générer de nombreuses failles. Par conséquent, s'il détecte que vous tentez de concevoir
00:06:33une faille, il refusera simplement de le faire. Il ne se pliera pas à votre demande et n'y
00:06:37répondra pas. Une autre amélioration majeure de GPT-6 par rapport à la série 5 réside dans son taux d'hallucination
00:06:42plus faible. Le GPT-5.6 Sol et les modèles 5.6 en général hallucinaient pas mal par rapport
00:06:48aux autres modèles de pointe. Pourtant, en comparant directement, on constate que nous sommes passés d'un taux
00:06:54d'hallucination de l'ordre de 9,4 % à seulement 2 %. Astra est-il disponible ?
00:07:01Il est ouvert à un nombre restreint d'organisations. Et d'ici quelques jours, il le sera pour
00:07:06pratiquement tout le monde. Quant à l'API, elle est accessible aux développeurs. Côté tarifs, on
00:07:11retrouve les prix de Fable : 10 $ par million de jetons en entrée et 50 $ par million de jetons en sortie.
00:07:17D'après ces chiffres, OpenAI nous propose un modèle très solide capable de rivaliser pleinement
00:07:22avec ce qu'Anthropic a de mieux à offrir. Et cela pour un tarif inférieur. Je suis donc
00:07:26très impatient de l'essayer. Je pense que la concurrence entre les plus grands acteurs
00:07:30profite finalement grandement à nous, les utilisateurs finaux.