GPT 6 Astra est là (Et c'est mieux que Fable 5.1 ?)

CChase AI
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00Juste après la sortie de Fable 5.1 par Anthropic, OpenAI réplique en lançant GPT-6 Astra.
00:00:07Commençons par examiner certains des benchmarks de GPT-6 Astra. Et merci à
00:00:10OpenAI de nous fournir bien plus de benchmarks à analyser que ce qu'Anthropic nous a montré avec Fable
00:00:145.1. En matière d'utilisation de l'ordinateur, il domine largement la concurrence. Nous n'avons même pas beaucoup de données
00:00:19ici concernant Fable 5.1. Si l'on regarde les benchmarks professionnels, comme BenchCAD
00:00:24et browse comp, là encore, GPT-6 réalise des performances exceptionnelles. Le seul domaine où il ne gagne pas est l'
00:00:31artificial analysis intelligence index, où il obtient un score de 61,2 contre 65,7 pour Fable 5.1.
00:00:38Ensuite, parlons de la programmation. Et là encore, c'est à peu près la même histoire. Soit il bat Fable 5.1, soit il est
00:00:43au coude-à-coude. Si l'on regarde spécifiquement TerminalBench 4.0, on constate un bond énorme par rapport au GPT 5.6 solo
00:00:49qui passe de 37,3 à 57,7. Et si l'on regarde DeepSuite, qui est probablement mon
00:00:55benchmark de codage favori, axé principalement sur les tâches agentiques de longue durée, il obtient un score de 74,1 %, ce qui, encore une fois,
00:01:02surpasse tout ce qui existe actuellement. GPT-6 écrase également les benchmarks académiques ainsi que ceux
00:01:08de la science et de la santé. Et si l'on examine les benchmarks de cybersécurité, là encore, je prête vraiment
00:01:13attention au 5.6 solo ici. Des bonds massifs, de 78,5 à 100 %. De 55,9 jusqu'à 88,5 % sur exploit
00:01:22bench et jusqu'à 39 %. Il s'agit donc d'une véritable révolution par rapport aux modèles de la série 5. Et en termes
00:01:27de contexte long, GPT-6 assure aussi brillamment. Score de 100 % au test des huit aiguilles de 256 à 512k
00:01:34jetons. Soit essentiellement du quart à une fenêtre contextuelle totalement pleine. Et lorsque cette fenêtre passe de 512 000
00:01:41jetons à un million, il obtient tout de même un score de 96,3 %. Si vous avez l'habitude d'injecter énormément de
00:01:46contexte dans votre modèle d'IA préféré, GPT-6 s'en sortira à merveille dans ces situations. Mais les scores bruts
00:01:51ne suffisent pas. Nous devons savoir combien cela coûte réellement d'atteindre ces scores,
00:01:55car Astra a beau avoir le meilleur score au monde, s'il coûte 10 fois plus cher que tout le reste, à quoi bon ?
00:01:59Heureusement, historiquement, les modèles GPT se sont montrés très efficaces en matière de jetons. En observant
00:02:04le score de terminal bench 4.0 ici, on s'aperçoit que cela se vérifie. Donc, GPT-6 Astra avec les étoiles,
00:02:11la première chose à noter est que, comme beaucoup de ces modèles, on observe une baisse d'efficacité
00:02:16à mesure que l'on monte dans la chaîne de niveau d'effort. Ainsi, en passant de faible à moyen puis élevé, j'obtiens continuellement
00:02:23de meilleurs scores pour une augmentation de coût relativement linéaire. Mais en passant d'élevé à très élevé, puis maximal,
00:02:30j'obtiens en réalité un moins bon score pour un coût supérieur. Ainsi, en niveau élevé pour 7,21 $, j'obtiens une
00:02:39précision de 57,9 %. Si je compare cela à Fable 5.1 juste ici, en mode élevé, j'obtiens une précision de 49,4 %
00:02:49pour 10,50 $. C'est donc plus cher, et les performances sont moindres. Fable obtient pourtant un score assez élevé
00:02:57lorsque je règle l'effort au maximum à 55,8, mais cela me coûte 19,50 $. Ainsi, pour un score équivalent,
00:03:06toujours d'environ 55 %, Fable 5 coûte presque 20 $, tandis que GPT-6 Astra coûte 7,20 $. C'est donc infiniment moins cher
00:03:16pour une précision pratiquement identique. Et en observant Frontier Code 1.1, on remarque un schéma similaire,
00:03:22où dans les niveaux élevés, nous obtenons des scores comparables. Lorsque l'on compare GPT-6 à Fable 5.1
00:03:29ou Fable 5, dans ce cas précis, Fable 5 a obtenu un score plus élevé ici. Mais l'exécution de ces modèles cloud s'avère bien plus coûteuse
00:03:34en raison de l'efficacité des jetons avec GPT-6 Astra. Cela dit, OpenAI met en avant quelques fonctionnalités
00:03:39au-delà des benchmarks concernant GPT-6. Premièrement, ils le présentent comme
00:03:43le meilleur modèle au monde pour l'utilisation d'ordinateurs. Il existe quelques benchmarks évaluant ce type
00:03:48de tâches, comme le dernier examen des agents. Et comme on a pu le voir avec d'autres benchmarks, que nous révèlent-ils ?
00:03:52Ils montrent qu'Astra cartonne, tant en termes de précision que de coûts d'API, lesquels ne doivent
00:03:57jamais être négligés. Mais la vitesse est sans doute encore plus importante que la précision. Codex propose une utilisation
00:04:01informatique vraiment performante, surtout combiné au mode vocal. Et Astra est censé
00:04:06être 1,9 fois plus rapide que le GPT-5.6, ce qui ravira ceux qui l'ont beaucoup utilisé
00:04:11ces derniers temps. Autre point souligné : le respect des modèles. Si vous lui fournissez
00:04:15un type de modèle, par exemple une présentation de diapositives comme celle de gauche, et que vous lui demandez
00:04:20de concevoir une autre présentation dans le même style sur un sujet différent, vous obtenez
00:04:25un résultat similaire à ce que l'on voit à droite, qui respecte extrêmement bien le style. Si vous possédez
00:04:31un modèle récurrent, que ce soit pour des présentations ou des sites web, considérez cela comme un
00:04:35système de design pour n'importe quel type de production, GPT-6 s'avère idéal pour cela. On le constate à nouveau ici avec
00:04:41les documents Excel et le style de documents en général. Voici essentiellement l'image de référence fournie.
00:04:46Voici ce que l'on obtenait auparavant, et voici le résultat à droite après prise en compte de cette
00:04:51image de référence. Autre détail intéressant : cette phrase où ils expliquent que GPT-6 Astra
00:04:55apportant un meilleur jugement visuel aux sites web, aux jeux, aux applications et au rendu, c'est-à-dire qu'ils
00:05:00GPT-6 possède un meilleur goût. Vous avez probablement entendu maintes fois que l'IA n'a aucun goût.
00:05:05Eh bien, ils affirment que GPT-6 en a un. Soyons honnêtes, il y aura toujours des problèmes
00:05:10concernant le sens esthétique de l'IA, car si on lui donne une mauvaise consigne, on observera toujours une régression
00:05:15vers la moyenne, quoi qu'il arrive. Et quelle que soit cette moyenne, les gens l'associeront à la médiocrité générée
00:05:20par l'IA, peu importe sa réelle qualité. Mais ils présentent quelques exemples d'une séquence
00:05:25réalisée sous Unreal Engine, de modélisation Blender, ainsi que quelques images fixes. Une nouveauté très intéressante
00:05:31ajoutée à Astra concerne les modifications apportées au compactage automatique lorsque la fenêtre contextuelle se remplit. Auparavant,
00:05:37quand la fenêtre de contexte était pleine, un compactage automatique s'effectuait et créait un résumé
00:05:41de tout ce qui avait été discuté lors de la session précédente, avant d'entamer une nouvelle session.
00:05:46Cela posait des problèmes, omettant parfois des détails. Désormais, Astra conserve des notes d'une fenêtre contextuelle à l'autre
00:05:52au lieu de se limiter à un simple résumé. Ainsi, au lieu d'un document unique, il dispose d'une multitude
00:05:57de notes adhésives sur ce qu'il juge important. Et il peut les consulter à tout moment,
00:06:01contrairement à une approche ponctuelle du type « voici un résumé, en espérant que cela suffise ».
00:06:06De plus, les fenêtres contextuelles antérieures restent consultables. Il ne s'agit donc pas du
00:06:12seul document résumé disponible. Si l'information n'y figure pas, tout est perdu : ce n'est plus du tout
00:06:16le cas. C'est une fonctionnalité expérimentale qu'il vous faudra activer dans la configuration
00:06:20de codex, mais elle deviendra la valeur par défaut d'ici quelques semaines. En matière de cybersécurité,
00:06:24Astra adopte une approche similaire à celle d'Anthropic avec Fable, estimant que ce modèle est tellement
00:06:28puissant qu'il peut générer de nombreuses failles. Par conséquent, s'il détecte que vous tentez de concevoir
00:06:33une faille, il refusera simplement de le faire. Il ne se pliera pas à votre demande et n'y
00:06:37répondra pas. Une autre amélioration majeure de GPT-6 par rapport à la série 5 réside dans son taux d'hallucination
00:06:42plus faible. Le GPT-5.6 Sol et les modèles 5.6 en général hallucinaient pas mal par rapport
00:06:48aux autres modèles de pointe. Pourtant, en comparant directement, on constate que nous sommes passés d'un taux
00:06:54d'hallucination de l'ordre de 9,4 % à seulement 2 %. Astra est-il disponible ?
00:07:01Il est ouvert à un nombre restreint d'organisations. Et d'ici quelques jours, il le sera pour
00:07:06pratiquement tout le monde. Quant à l'API, elle est accessible aux développeurs. Côté tarifs, on
00:07:11retrouve les prix de Fable : 10 $ par million de jetons en entrée et 50 $ par million de jetons en sortie.
00:07:17D'après ces chiffres, OpenAI nous propose un modèle très solide capable de rivaliser pleinement
00:07:22avec ce qu'Anthropic a de mieux à offrir. Et cela pour un tarif inférieur. Je suis donc
00:07:26très impatient de l'essayer. Je pense que la concurrence entre les plus grands acteurs
00:07:30profite finalement grandement à nous, les utilisateurs finaux.

핵심 요약

GPT-6 Astra surpasse Fable 5.1 et l'ensemble de la série 5 sur les benchmarks de programmation, d'utilisation de l'ordinateur et de cybersécurité, tout en réduisant le taux d'hallucination à 2 %.

하이라이트

  • GPT-6 Astra surpasse la concurrence en matière d'utilisation de l'ordinateur et affiche des performances exceptionnelles sur BenchCAD et browse comp.

  • Le score au codage atteint 74,1 % sur DeepSuite, surpassant tous les modèles existants.

  • La fenêtre contextuelle longue obtient un score de 100 % au test des huit aiguilles entre 256 et 512k jetons.

  • Le taux d'hallucination chute à 2 %, contre 9,4 % pour les modèles de la série 5.6.

  • Le modèle est 1,9 fois plus rapide que le GPT-5.6.

타임라인

Performances des benchmarks et programmation

  • GPT-6 Astra domine les benchmarks d'utilisation de l'ordinateur et de programmation.
  • TerminalBench 4.0 progresse de 37,3 à 57,7 par rapport au GPT 5.6 solo.
  • Le benchmark DeepSuite atteint un score de 74,1 %.

OpenAI lance GPT-6 Astra en réponse directe à Fable 5.1 d'Anthropic. Le modèle domine les tests professionnels comme BenchCAD et browse comp, tout en réalisant des bonds massifs en cybersécurité avec un passage de 78,5 à 100 % sur certains tests.

Gestion du contexte et coûts d'exécution

  • Le score atteint 100 % au test des huit aiguilles pour une fenêtre de 256 à 512k jetons.
  • Une fenêtre d'un million de jetons conserve un score de 96,3 %.
  • Le coût en mode élevé s'élève à 7,21 $ pour une précision de 57,9 %.

L'analyse des coûts montre que GPT-6 Astra offre une précision supérieure à Fable 5.1 pour un coût nettement inférieur. Les niveaux d'effort maximaux augmentent les coûts sans garantir de meilleurs résultats.

Fonctionnalités avancées et cybersécurité

  • La vitesse d'exécution est multipliée par 1,9 par rapport au GPT-5.6.
  • Le compactage automatique conserve des notes persistantes d'une session à l'autre.
  • Le taux d'hallucination descend à 2 %.

Astra introduit une meilleure reproduction des styles visuels pour les présentations et les interfaces. Le système de notes persistantes remplace les résumés automatiques classiques, et le taux d'hallucination est considérablement réduit par rapport aux versions précédentes.

커뮤니티 글

모든 글 보기