Opus 5 bat Fable... pour la moitié du prix ?

BBetter Stack
Computing/SoftwareBusiness NewsInternet Technology

Transcript

00:00:00Anthropic vient de publier Claude Opus 5, et il se pourrait qu'il soit meilleur que Fable tout en étant
00:00:04deux fois moins cher. Si c'est vrai, c'est mon nouveau modèle préféré, alors découvrons-le.
00:00:13Voici donc comment ils décrivent Opus 5. Opus 5 est un modèle réfléchi et proactif qui se
00:00:18rapproche de l'intelligence de pointe de Claude Fable 5 à la moitié du prix. Sur le codage et le travail de la connaissance
00:00:23les évaluations comme Frontier Bench et GDP Val, Opus 5 est le nouvel état de l'art qui reste
00:00:28derrière Mythos 5 sur les tâches de cybersécurité. Opus 5 est conçu pour être utilisé tous les jours, il fonctionne plus
00:00:33efficacement que les autres modèles, et c'est le nouveau modèle par défaut sur Claude Max et le modèle le plus puissant
00:00:38sur les plans Claude Pro. Après cela, ils montrent les benchmarks, et il gagne sur beaucoup d'entre
00:00:43eux, malgré la présence de Fable 5, et il ne gagne même pas par de petites marges. Selon
00:00:47eux, il est près de 10 % meilleur sur Frontier Bench que Fable 5, mais l'un des plus fous pour moi
00:00:52est son score sur Arc AGI. Opus 4.8 a obtenu 1,5 % ici, tandis que Sol a obtenu 7,8 %, qui était le précédent record
00:01:00, mais Opus 5 obtient 30,2 %. L'équipe derrière ce benchmark a en fait montré qu'Opus avait une nouvelle
00:01:06capacité qu'ils n'avaient jamais vue dans aucun autre modèle, où il transformerait ces tests en
00:01:10notation algébrique pour effectuer un raisonnement logique avancé. C'est vraiment impressionnant.
00:01:15Si vous vous demandez, au fait, pourquoi Fable n'est pas ici, c'est à cause de la politique de conservation des données
00:01:19de Fable. Arc AGI ne veut pas risquer de divulguer les détails de ce benchmark à Anthropic, mais la
00:01:24bonne nouvelle est qu'Opus 5 n'a pas d'exigences de conservation des données pour l'accès général. Cela va
00:01:29rendre beaucoup de gens très heureux. Passons, jetons un œil aux benchmarks tiers par
00:01:33Artificial Analysis. Sur l'index de codage, il arrive en deuxième position, perdant seulement de 0,3 point face à GPT 5.6 Sol
00:01:39Extra High, mais il bat Fable de 1,5 point, et c'est un très beau bond au-dessus d'Opus 4.8.
00:01:45Bravo à Kimi K3 ici, au fait, pour avoir bousculé les grands. J'ai fait une vidéo à ce sujet
00:01:49lors de sa sortie, donc vous devriez absolument vous abonner pour rester au courant de l'actualité de l'IA et
00:01:52des développeurs. Si nous jetons ensuite un œil à l'index agentique, Opus 5 prend en fait la tête
00:01:57ici, avec une belle petite avance sur Fable 5 et en battant le seul modèle d'OpenAI. C'est aussi la même
00:02:02histoire sur l'index d'intelligence, où Opus 5 est également en tête. Donc, du côté des performances,
00:02:06il semble qu'Opus 5 soit un modèle sérieusement bon, et honnêtement, je suis assez surpris. Je pensais en quelque sorte
00:02:11que Fable était là où ils allaient se concentrer maintenant, et qu'Opus deviendrait le nouveau modèle
00:02:15de type Sonic, mais maintenant il semble que Fable et Opus soient presque au coude à coude, jusqu'à ce que nous prenions en compte
00:02:19les prix. Si nous regardons le coût pour accomplir une tâche sur Artificial Analysis, Opus
00:02:235 revient en fait 72 centimes moins cher que Fable 5, et il est seulement un peu plus cher que
00:02:28Opus 4.8. Maintenant, je dirais que si vous recherchez le rapport qualité-prix, GPT 5.6 Sol
00:02:33restera le gagnant ici, coûtant près de la moitié du prix d'Opus 5. Vous pouvez voir
00:02:37sur ce graphique où le vert est le quadrant le plus attractif, les modèles GPT s'y trouvent à peu près,
00:02:42tout comme Kimi K3, et les modèles Anthropic ont en quelque sorte leur propre section dans la partie
00:02:46plus chère. Cursor Bench reflète également tous ces benchmarks que nous avons examinés. Sur
00:02:50ce point, Opus 5 Max a presque le même score que Fable 5, mais Fable coûte 17 $ pour cette
00:02:56tâche, et Opus coûte 8 $. Le prix lui-même, au fait, est le même qu'Opus 4.8, donc c'est
00:03:015 $ pour un million de tokens d'entrée, et 25 $ pour un million de tokens de sortie, donc si vous êtes fan de
00:03:06Opus 4.8, je ne pense pas qu'il y ait de raison de ne pas utiliser ce modèle, et en tant que fan
00:03:10de Fable 5 moi-même, je vais certainement utiliser beaucoup Opus 5 pour économiser mon abonnement
00:03:14et mes crédits pour qu'ils ne s'épuisent pas aussi souvent. Honnêtement, ma meilleure estimation sur Fable contre Opus
00:03:18est que Fable sera toujours le meilleur modèle si vous voulez des problèmes difficiles à long terme,
00:03:23mais pour 95 % du travail, Opus 5 peut désormais prendre sa place. Mais maintenant, allons-y et voyons-le
00:03:28en action avec quelques tests locaux. Le premier test que j'ai fait a été de demander aux modèles de créer
00:03:32un jeu de course de Formule 1 complet dans un seul fichier HTML en utilisant 3.js. Maintenant, je parlerai du temps que
00:03:37chaque modèle a pris ainsi que de ce que cela coûterait via l'API à la fin, mais d'abord, regardons
00:03:40juste les résultats. Voici le résultat qu'Opus 5 m'a donné, et je dois dire que je suis vraiment
00:03:45impressionné par les modèles ici. Il n'utilise aucun actif externe ou quoi que ce soit de ce genre. Tout cela est
00:03:50fait par Opus 5, et tout a l'air vraiment bien. Le tracé du circuit était un peu à l'envers là,
00:03:55mais la maniabilité est bonne. Les temps au tour fonctionnent, le positionnement fonctionne, l'ordre fonctionne,
00:03:59tout cela fonctionne bien. Oui, nous conduisons sous l'herbe ici, mais vous pouvez voir que les collisions fonctionnent,
00:04:03et il y a en fait une piste sous cette herbe, donc je peux très facilement corriger ça avec un prompt.
00:04:07Et aussi, les bacs à gravier ont l'air de très bien fonctionner. Honnêtement, je suis très impressionné par
00:04:12le résultat que nous avons obtenu d'Opus 5 ici. Ces voitures de F1 sont les plus belles de toutes, à mon avis.
00:04:16Je vous laisse décider, cependant. Voici le résultat que Fable m'a donné. Je trouve que celui-ci est aussi vraiment
00:04:20sympa avec le tracé du circuit, mais les voitures sont un peu plus basiques que ce que nous avons eu avec Opus 5.
00:04:25J'aime vraiment beaucoup le tremblement de la caméra quand on tourne, et encore une fois, toutes les
00:04:28autres fonctionnalités fonctionnent, comme la position sur la piste, le chronométrage, et tout ça. Donc Fable 5 a
00:04:33également fait du très bon travail, mais honnêtement, je pense que je préfère celui d'Opus. Voici le résultat
00:04:37que j'ai obtenu de GPT 5.6 Soul, également avec un effort maximum. Je dirais que celui-ci a fait du beau travail avec
00:04:43la modélisation et un peu le rendu de la caméra, mais vous pouvez voir là qu'il n'y a pas de piste, et qu'il y a des
00:04:47actifs qui sont à l'envers, et aussi à peu près à la moitié de ce circuit, la piste se casse. Donc il a
00:04:51fait un moins bon travail, à mon avis, que Fable et Opus. Je pense vraiment qu'Opus gagne toujours
00:04:56ici. Et le dernier modèle que j'ai testé est Kimi K3, et voici le résultat qu'ils m'ont donné,
00:05:01et honnêtement, c'est super impressionnant pour un modèle à poids ouverts. Il a fait du plutôt bon travail,
00:05:05assez similaire à GPT 5.6 Soul. Les barrières fonctionnent, la piste fonctionne, tout comme ça,
00:05:09le positionnement, tout fonctionne. Il m'a construit un jeu plutôt sympa en un seul essai. Si nous jetons un œil
00:05:14au coût et aux temps de ces essais, Opus 5 a en fait passé 46 minutes et 51 secondes
00:05:19pour terminer le jeu de F1, et cela aurait coûté environ 12,99 $ si nous avions utilisé l'API. Donc pour moi,
00:05:25Opus 5 était en fait plus cher que Fable ici, et en cherchant bien, c'était parce qu'il utilisait
00:05:30cinq fois plus de tokens. J'espère vraiment que c'est une anomalie, car les autres benchmarks ne semblent pas
00:05:35signaler la même chose. J'ajouterai que je calcule le coût de ces modèles Claude en utilisant l'outil d'utilisation de code Claude
00:05:39, il pourrait donc y avoir des problèmes de précision là-bas, car vous n'obtenez pas le prix exact lorsque
00:05:44vous utilisez l'abonnement. De plus, comme je l'ai dit plus tôt, ces modèles sont toujours premium, donc si vous descendez
00:05:49vers quelque chose comme GPT 5.6, vous allez obtenir un modèle plus rapide et moins cher, mais les résultats étaient,
00:05:54à mon avis, moins bons. Faisons un autre test cependant. Cette fois, je leur demande de créer un tableau de bord
00:05:58de gestion des finances personnelles, ce sera donc une application full stack avec un front-end et un back-end
00:06:02, et je liste également quelques fonctionnalités qu'ils peuvent ajouter ici. Voici le résultat que j'ai obtenu
00:06:06avec Opus 5, et honnêtement, je dois dire que je suis assez impressionné. J'aime vraiment cette interface, c'est juste un
00:06:11style que j'affectionne particulièrement. Dites-moi dans les commentaires si c'est votre cas aussi, et tout est
00:06:15entièrement fonctionnel. J'ai testé tout ça et ça marche, et nous avons des pages séparées pour chacune des
00:06:20fonctionnalités que j'ai demandées ici, et encore une fois, toutes les fonctionnalités marchent entre le front-end et
00:06:24le back-end, et j'aime vraiment le style d'interface qu'il a choisi. Je pense que c'est la meilleure du
00:06:28lot. Quant au code lui-même, il a utilisé React et React Router pour le front-end, dont je suis un grand
00:06:33fan, et pour le back-end, il gagne aussi des points parce qu'il a utilisé une vraie base de données. Il a utilisé
00:06:37Node SQLite ici pour la base de données, et pour le serveur lui-même il a utilisé Express. Voici le résultat
00:06:42que Fable 5 m'a donné, et je suis davantage fan de l'interface d'Opus 5, mais celle-ci n'est pas trop mal non plus,
00:06:48mais ces graphiques sont un peu inutiles, pour être honnête. Celui-ci en bas est plutôt pas mal, et encore une fois,
00:06:53toutes ces fonctionnalités fonctionnent. Je pense juste qu'Opus 5 a mis un peu plus d'énergie dans l'interface, et il est
00:06:57définitivement meilleur de ce côté-là. Dans le code, il a fait quelque chose de similaire à Opus 5, où il a utilisé
00:07:01React, mais je dirai qu'il n'a pas choisi de bibliothèque de routage. Il a en fait juste construit une petite bibliothèque
00:07:05de routage lui-même. J'aurais probablement préféré qu'il s'en tienne à quelque chose comme React Router,
00:07:09et ensuite pour la base de données, il a fait la même chose en utilisant Node SQLite ici, et celle-ci
00:07:13est aussi construite sur Express, donc un back-end assez similaire là, mais je dirais qu'Opus a en fait choisi la
00:07:18meilleure stack pour le front-end. Voici ce que GPT 5.6 Sol m'a donné, et je dois dire que celui-ci est au niveau
00:07:22pour le design de l'interface. Il égale définitivement Opus. Je pense que c'est juste un style différent, donc ça
00:07:26dépendra probablement des préférences de chacun, mais je l'aime vraiment bien. Il a fait un
00:07:31travail incroyable pour concevoir toute l'interface, et encore une fois, toutes les fonctionnalités marchent, mais celui-ci
00:07:35n'a en fait pas utilisé de pages différentes pour ces fonctionnalités individuelles. Il va juste vers une autre
00:07:38partie de la page. Il a également choisi la stack la plus unique de toutes. Il est parti sur NextJS avec
00:07:43une combinaison de Drizzle, que j'aime vraiment bien pour la base de données, et c'est une approche tout à fait valide pour
00:07:47quelque chose comme ça. Mais ensuite il a aussi utilisé Cloudflare et Vinext pour l'héberger en fait, ce qui est, je pense,
00:07:52une décision un peu étrange, car comme vous pouvez le voir, Vinext est très récent, et je ne pense pas qu'il ait été
00:07:56encore testé, et ils mettent certainement quelque chose dans le prompt pour forcer l'utilisation de Cloudflare
00:08:00et Vinext. Et je l'ai dit dans ma vidéo sur Kimi K3, c'est probablement parce que c'est ainsi que fonctionnent leurs propres sites ChatGPT
00:08:04hébergés. Enfin, le dernier modèle que j'ai testé est Kimi K3, et voici le résultat que nous
00:08:09avons obtenu, et je dirais qu'il a fait du très bon travail. Cette interface est en quelque sorte ce que j'aurais obtenu
00:08:14de GPT 5.4 ou 5.5, donc je pense qu'il est un peu en retard en matière de design d'interface, mais encore une fois, toutes les fonctionnalités
00:08:19fonctionnent, et je ne peux pas vraiment trop me plaindre de cette interface. Elle fait exactement ce que je lui ai demandé.
00:08:24Le code perd cependant quelques points pour moi. Il a choisi React pour son front-end,
00:08:28et encore une fois, il a construit sa propre bibliothèque de routage comme l'a fait Fable, mais si on regarde le serveur,
00:08:32il n'a en fait qu'un serveur express, et il n'a pas construit de base de données en utilisant Node SQLite
00:08:36ou quoi que ce soit de ce genre. Il a en fait juste construit sa propre base de données en utilisant JavaScript, donc il sauvegarde
00:08:40tout dans un fichier JSON. Ce n'est définitivement pas l'approche que j'aurais voulu qu'il prenne.
00:08:44En ce qui concerne le timing et les prix des modèles sur ce test financier, Fable était le plus cher,
00:08:48coûtant 30,79 $, et prenant également 56 minutes et 55 secondes, mais encore une fois, avec Opus, il semble être
00:08:55assez proche du prix de Fable, car il m'a coûté 29,82 $, et il a en fait pris plus de temps à 59 minutes et 15
00:09:02secondes. Les modèles GPT sont juste très bien placés en comparaison, c'est environ trois fois et demie
00:09:07moins cher, et j'espère vraiment que cette concurrence commencera à faire baisser ces prix d'Anthropic.
00:09:11Donc c'est un peu mitigé pour moi. Évidemment, je n'ai exécuté chaque test qu'une seule fois, et je n'ai fait que deux tests,
00:09:16donc j'espère que les benchmarks d'Artificial Analysis sont plus précis, où Opus est
00:09:20en fait un tiers du prix de Fable, mais je devrai certainement l'utiliser un peu plus pour vérifier
00:09:24ça. C'est peut-être juste l'outil que j'utilise pour mesurer les coûts. Un autre point pour Opus
00:09:28cependant, c'est qu'il est un peu moins strict sur le travail de cybersécurité que Fable 5. Les protections sont assez
00:09:33similaires à Opus 4.8, à l'exception de quelques garde-fous plus forts sur une gamme étroite de tâches
00:09:37cybernétiques. Apparemment, les protections permettront à Opus 5 de trouver des vulnérabilités dans le code source,
00:09:42mais il bloquera l'analyse des vulnérabilités basée sur les binaires, ainsi que les tests de pénétration et
00:09:46la génération d'exploits. Leurs tests ont révélé que leurs classificateurs interviennent environ 85 % moins souvent
00:09:51que pour Fable 5. Voilà donc, la concurrence entre les modèles est vraiment assez impressionnante
00:09:55en ce moment. Nous avons GPT 5.6 qui montre que les prix peuvent être abaissés, nous avons des modèles ouverts comme Kimi
00:10:00qui égalent les grands en matière d'intelligence, et nous avons Anthropic qui repousse constamment cette
00:10:04intelligence de plus en plus loin. Quel est votre modèle préféré, et aimez-vous ce qu'Opus annonce ?
00:10:09Dites-le-moi dans les commentaires ci-dessous, pendant que vous y êtes abonnez-vous, et comme toujours, on se voit dans la prochaine.

Key Takeaway

Claude Opus 5 égale ou surpasse Fable 5 sur la majorité des benchmarks de codage et d'intelligence tout en affichant un tarif théorique divisé par deux à 5 $ / 25 $ le million de tokens.

Highlights

  • Claude Opus 5 atteint un score de 30,2 % sur le benchmark Arc AGI, contre 1,5 % pour Opus 4.8 et 7,8 % pour le précédent record détenu par Sol.

  • Sur l'index d'intelligence d'Artificial Analysis et l'index agentique, Opus 5 dépasse Fable 5 et les modèles d'OpenAI.

  • Le modèle est proposé à 5 $ par million de tokens en entrée et 25 $ par million de tokens en sortie, égalant le tarif d'Opus 4.8.

  • L'utilisation du modèle sur Arc AGI n'impose aucune contrainte de conservation des données pour l'accès général.

  • Les classificateurs de sécurité d'Opus 5 interviennent 85 % moins souvent que ceux de Fable 5, autorisant l'identification de vulnérabilités dans le code source.

Timeline

Positionnement d'Opus 5 et résultats sur Arc AGI

  • Opus 5 devient le modèle par défaut sur Claude Max et la plus puissante option sur les plans Claude Pro.
  • Le benchmark Arc AGI enregistre un score de 30,2 % pour Opus 5, surpassant très nettement les 7,8 % de Sol.
  • Le modèle convertit les tests d'Arc AGI en notation algébrique pour effectuer un raisonnement logique.

Anthropic présente Opus 5 comme un modèle conçu pour l'usage quotidien, visant des performances proches de Fable 5 à la moitié du prix. Il surpasse Fable 5 de près de 10 % sur Frontier Bench et s'impose sur les tâches de connaissances et de codage, tout en restant derrière Mythos 5 en cybersécurité. Contrairement aux exigences de conservation de données associées à Fable, Opus 5 offre un accès général sans ces contraintes.

Performances sur les benchmarks tiers et structure tarifaire

  • Sur l'index de codage d'Artificial Analysis, Opus 5 bat Fable de 1,5 point et se classe deuxième derrière GPT 5.6 Sol Extra High.
  • Opus 5 s'impose en première place sur l'index agentique et l'index d'intelligence.
  • Le coût officiel s'établit à 5 $ par million de tokens d'entrée et 25 $ par million de tokens de sortie.

Les données d'Artificial Analysis confirment la compétitivité d'Opus 5 face aux modèles rivaux. Sur une tâche du Cursor Bench, Opus 5 Max atteint un score quasi identique à Fable 5 pour un coût de 8 $contre 17$. En revanche, sur le critère du pur rapport qualité-prix global, GPT 5.6 Sol conserve un avantage tarifaire avec un coût inférieur de moitié à celui d'Opus 5.

Génération d'un jeu de course 3D sous Three.js

  • Opus 5 génère un jeu complet de F1 en un fichier HTML sans actifs externes en 46 minutes et 51 secondes.
  • Le test d'Opus 5 affiche une consommation de tokens cinq fois supérieure à celle de Fable 5, portant la facture API estimée à 12,99 $.
  • Kimi K3 réussit à générer un jeu fonctionnel dès le premier essai en tant que modèle à poids ouverts.

La comparaison de création de code sur un jeu 3D montre un rendu visuel des véhicules supérieur chez Opus 5 par rapport à Fable 5 et GPT 5.6 Sol. Cependant, la consommation totale de tokens d'Opus 5 sur ce test spécifique rend la session plus coûteuse que celle de Fable 5. GPT 5.6 Sol et Kimi K3 offrent des vitesses d'exécution plus rapides pour des coûts plus bas, malgré quelques erreurs de génération de pistes pour le modèle d'OpenAI.

Développement d'une application financière full-stack et gestion des garde-fous

  • Opus 5 structure le front-end avec React Router et le back-end avec Node SQLite et Express.
  • Le test d'application financière facture 29,82 $avec Opus 5 en 59 minutes, contre 30,79$ avec Fable 5.
  • Les garde-fous d'Opus 5 autorisent la recherche de vulnérabilités applicatives mais bloquent la génération d'exploits.

Sur une application de gestion de finances personnelles, Opus 5 se distingue par le choix d'une architecture solide intégrant une vraie base de données SQLite, là où Kimi K3 stocke les données dans un fichier JSON local. GPT 5.6 Sol privilégie un framework NextJS avec Drizzle. En matière de sécurité informatique, les filtres d'Opus 5 s'activent 85 % moins souvent que ceux de Fable 5, laissant passer l'analyse de code source tout en refusant les tests d'intrusion et l'analyse binaire.

Community Posts

View all posts