Transcript
00:00:00Anthropic vient de publier Claude Opus 5, et il se pourrait qu'il soit meilleur que Fable tout en étant
00:00:04deux fois moins cher. Si c'est vrai, c'est mon nouveau modèle préféré, alors découvrons-le.
00:00:13Voici donc comment ils décrivent Opus 5. Opus 5 est un modèle réfléchi et proactif qui se
00:00:18rapproche de l'intelligence de pointe de Claude Fable 5 à la moitié du prix. Sur le codage et le travail de la connaissance
00:00:23les évaluations comme Frontier Bench et GDP Val, Opus 5 est le nouvel état de l'art qui reste
00:00:28derrière Mythos 5 sur les tâches de cybersécurité. Opus 5 est conçu pour être utilisé tous les jours, il fonctionne plus
00:00:33efficacement que les autres modèles, et c'est le nouveau modèle par défaut sur Claude Max et le modèle le plus puissant
00:00:38sur les plans Claude Pro. Après cela, ils montrent les benchmarks, et il gagne sur beaucoup d'entre
00:00:43eux, malgré la présence de Fable 5, et il ne gagne même pas par de petites marges. Selon
00:00:47eux, il est près de 10 % meilleur sur Frontier Bench que Fable 5, mais l'un des plus fous pour moi
00:00:52est son score sur Arc AGI. Opus 4.8 a obtenu 1,5 % ici, tandis que Sol a obtenu 7,8 %, qui était le précédent record
00:01:00, mais Opus 5 obtient 30,2 %. L'équipe derrière ce benchmark a en fait montré qu'Opus avait une nouvelle
00:01:06capacité qu'ils n'avaient jamais vue dans aucun autre modèle, où il transformerait ces tests en
00:01:10notation algébrique pour effectuer un raisonnement logique avancé. C'est vraiment impressionnant.
00:01:15Si vous vous demandez, au fait, pourquoi Fable n'est pas ici, c'est à cause de la politique de conservation des données
00:01:19de Fable. Arc AGI ne veut pas risquer de divulguer les détails de ce benchmark à Anthropic, mais la
00:01:24bonne nouvelle est qu'Opus 5 n'a pas d'exigences de conservation des données pour l'accès général. Cela va
00:01:29rendre beaucoup de gens très heureux. Passons, jetons un œil aux benchmarks tiers par
00:01:33Artificial Analysis. Sur l'index de codage, il arrive en deuxième position, perdant seulement de 0,3 point face à GPT 5.6 Sol
00:01:39Extra High, mais il bat Fable de 1,5 point, et c'est un très beau bond au-dessus d'Opus 4.8.
00:01:45Bravo à Kimi K3 ici, au fait, pour avoir bousculé les grands. J'ai fait une vidéo à ce sujet
00:01:49lors de sa sortie, donc vous devriez absolument vous abonner pour rester au courant de l'actualité de l'IA et
00:01:52des développeurs. Si nous jetons ensuite un œil à l'index agentique, Opus 5 prend en fait la tête
00:01:57ici, avec une belle petite avance sur Fable 5 et en battant le seul modèle d'OpenAI. C'est aussi la même
00:02:02histoire sur l'index d'intelligence, où Opus 5 est également en tête. Donc, du côté des performances,
00:02:06il semble qu'Opus 5 soit un modèle sérieusement bon, et honnêtement, je suis assez surpris. Je pensais en quelque sorte
00:02:11que Fable était là où ils allaient se concentrer maintenant, et qu'Opus deviendrait le nouveau modèle
00:02:15de type Sonic, mais maintenant il semble que Fable et Opus soient presque au coude à coude, jusqu'à ce que nous prenions en compte
00:02:19les prix. Si nous regardons le coût pour accomplir une tâche sur Artificial Analysis, Opus
00:02:235 revient en fait 72 centimes moins cher que Fable 5, et il est seulement un peu plus cher que
00:02:28Opus 4.8. Maintenant, je dirais que si vous recherchez le rapport qualité-prix, GPT 5.6 Sol
00:02:33restera le gagnant ici, coûtant près de la moitié du prix d'Opus 5. Vous pouvez voir
00:02:37sur ce graphique où le vert est le quadrant le plus attractif, les modèles GPT s'y trouvent à peu près,
00:02:42tout comme Kimi K3, et les modèles Anthropic ont en quelque sorte leur propre section dans la partie
00:02:46plus chère. Cursor Bench reflète également tous ces benchmarks que nous avons examinés. Sur
00:02:50ce point, Opus 5 Max a presque le même score que Fable 5, mais Fable coûte 17 $ pour cette
00:02:56tâche, et Opus coûte 8 $. Le prix lui-même, au fait, est le même qu'Opus 4.8, donc c'est
00:03:015 $ pour un million de tokens d'entrée, et 25 $ pour un million de tokens de sortie, donc si vous êtes fan de
00:03:06Opus 4.8, je ne pense pas qu'il y ait de raison de ne pas utiliser ce modèle, et en tant que fan
00:03:10de Fable 5 moi-même, je vais certainement utiliser beaucoup Opus 5 pour économiser mon abonnement
00:03:14et mes crédits pour qu'ils ne s'épuisent pas aussi souvent. Honnêtement, ma meilleure estimation sur Fable contre Opus
00:03:18est que Fable sera toujours le meilleur modèle si vous voulez des problèmes difficiles à long terme,
00:03:23mais pour 95 % du travail, Opus 5 peut désormais prendre sa place. Mais maintenant, allons-y et voyons-le
00:03:28en action avec quelques tests locaux. Le premier test que j'ai fait a été de demander aux modèles de créer
00:03:32un jeu de course de Formule 1 complet dans un seul fichier HTML en utilisant 3.js. Maintenant, je parlerai du temps que
00:03:37chaque modèle a pris ainsi que de ce que cela coûterait via l'API à la fin, mais d'abord, regardons
00:03:40juste les résultats. Voici le résultat qu'Opus 5 m'a donné, et je dois dire que je suis vraiment
00:03:45impressionné par les modèles ici. Il n'utilise aucun actif externe ou quoi que ce soit de ce genre. Tout cela est
00:03:50fait par Opus 5, et tout a l'air vraiment bien. Le tracé du circuit était un peu à l'envers là,
00:03:55mais la maniabilité est bonne. Les temps au tour fonctionnent, le positionnement fonctionne, l'ordre fonctionne,
00:03:59tout cela fonctionne bien. Oui, nous conduisons sous l'herbe ici, mais vous pouvez voir que les collisions fonctionnent,
00:04:03et il y a en fait une piste sous cette herbe, donc je peux très facilement corriger ça avec un prompt.
00:04:07Et aussi, les bacs à gravier ont l'air de très bien fonctionner. Honnêtement, je suis très impressionné par
00:04:12le résultat que nous avons obtenu d'Opus 5 ici. Ces voitures de F1 sont les plus belles de toutes, à mon avis.
00:04:16Je vous laisse décider, cependant. Voici le résultat que Fable m'a donné. Je trouve que celui-ci est aussi vraiment
00:04:20sympa avec le tracé du circuit, mais les voitures sont un peu plus basiques que ce que nous avons eu avec Opus 5.
00:04:25J'aime vraiment beaucoup le tremblement de la caméra quand on tourne, et encore une fois, toutes les
00:04:28autres fonctionnalités fonctionnent, comme la position sur la piste, le chronométrage, et tout ça. Donc Fable 5 a
00:04:33également fait du très bon travail, mais honnêtement, je pense que je préfère celui d'Opus. Voici le résultat
00:04:37que j'ai obtenu de GPT 5.6 Soul, également avec un effort maximum. Je dirais que celui-ci a fait du beau travail avec
00:04:43la modélisation et un peu le rendu de la caméra, mais vous pouvez voir là qu'il n'y a pas de piste, et qu'il y a des
00:04:47actifs qui sont à l'envers, et aussi à peu près à la moitié de ce circuit, la piste se casse. Donc il a
00:04:51fait un moins bon travail, à mon avis, que Fable et Opus. Je pense vraiment qu'Opus gagne toujours
00:04:56ici. Et le dernier modèle que j'ai testé est Kimi K3, et voici le résultat qu'ils m'ont donné,
00:05:01et honnêtement, c'est super impressionnant pour un modèle à poids ouverts. Il a fait du plutôt bon travail,
00:05:05assez similaire à GPT 5.6 Soul. Les barrières fonctionnent, la piste fonctionne, tout comme ça,
00:05:09le positionnement, tout fonctionne. Il m'a construit un jeu plutôt sympa en un seul essai. Si nous jetons un œil
00:05:14au coût et aux temps de ces essais, Opus 5 a en fait passé 46 minutes et 51 secondes
00:05:19pour terminer le jeu de F1, et cela aurait coûté environ 12,99 $ si nous avions utilisé l'API. Donc pour moi,
00:05:25Opus 5 était en fait plus cher que Fable ici, et en cherchant bien, c'était parce qu'il utilisait
00:05:30cinq fois plus de tokens. J'espère vraiment que c'est une anomalie, car les autres benchmarks ne semblent pas
00:05:35signaler la même chose. J'ajouterai que je calcule le coût de ces modèles Claude en utilisant l'outil d'utilisation de code Claude
00:05:39, il pourrait donc y avoir des problèmes de précision là-bas, car vous n'obtenez pas le prix exact lorsque
00:05:44vous utilisez l'abonnement. De plus, comme je l'ai dit plus tôt, ces modèles sont toujours premium, donc si vous descendez
00:05:49vers quelque chose comme GPT 5.6, vous allez obtenir un modèle plus rapide et moins cher, mais les résultats étaient,
00:05:54à mon avis, moins bons. Faisons un autre test cependant. Cette fois, je leur demande de créer un tableau de bord
00:05:58de gestion des finances personnelles, ce sera donc une application full stack avec un front-end et un back-end
00:06:02, et je liste également quelques fonctionnalités qu'ils peuvent ajouter ici. Voici le résultat que j'ai obtenu
00:06:06avec Opus 5, et honnêtement, je dois dire que je suis assez impressionné. J'aime vraiment cette interface, c'est juste un
00:06:11style que j'affectionne particulièrement. Dites-moi dans les commentaires si c'est votre cas aussi, et tout est
00:06:15entièrement fonctionnel. J'ai testé tout ça et ça marche, et nous avons des pages séparées pour chacune des
00:06:20fonctionnalités que j'ai demandées ici, et encore une fois, toutes les fonctionnalités marchent entre le front-end et
00:06:24le back-end, et j'aime vraiment le style d'interface qu'il a choisi. Je pense que c'est la meilleure du
00:06:28lot. Quant au code lui-même, il a utilisé React et React Router pour le front-end, dont je suis un grand
00:06:33fan, et pour le back-end, il gagne aussi des points parce qu'il a utilisé une vraie base de données. Il a utilisé
00:06:37Node SQLite ici pour la base de données, et pour le serveur lui-même il a utilisé Express. Voici le résultat
00:06:42que Fable 5 m'a donné, et je suis davantage fan de l'interface d'Opus 5, mais celle-ci n'est pas trop mal non plus,
00:06:48mais ces graphiques sont un peu inutiles, pour être honnête. Celui-ci en bas est plutôt pas mal, et encore une fois,
00:06:53toutes ces fonctionnalités fonctionnent. Je pense juste qu'Opus 5 a mis un peu plus d'énergie dans l'interface, et il est
00:06:57définitivement meilleur de ce côté-là. Dans le code, il a fait quelque chose de similaire à Opus 5, où il a utilisé
00:07:01React, mais je dirai qu'il n'a pas choisi de bibliothèque de routage. Il a en fait juste construit une petite bibliothèque
00:07:05de routage lui-même. J'aurais probablement préféré qu'il s'en tienne à quelque chose comme React Router,
00:07:09et ensuite pour la base de données, il a fait la même chose en utilisant Node SQLite ici, et celle-ci
00:07:13est aussi construite sur Express, donc un back-end assez similaire là, mais je dirais qu'Opus a en fait choisi la
00:07:18meilleure stack pour le front-end. Voici ce que GPT 5.6 Sol m'a donné, et je dois dire que celui-ci est au niveau
00:07:22pour le design de l'interface. Il égale définitivement Opus. Je pense que c'est juste un style différent, donc ça
00:07:26dépendra probablement des préférences de chacun, mais je l'aime vraiment bien. Il a fait un
00:07:31travail incroyable pour concevoir toute l'interface, et encore une fois, toutes les fonctionnalités marchent, mais celui-ci
00:07:35n'a en fait pas utilisé de pages différentes pour ces fonctionnalités individuelles. Il va juste vers une autre
00:07:38partie de la page. Il a également choisi la stack la plus unique de toutes. Il est parti sur NextJS avec
00:07:43une combinaison de Drizzle, que j'aime vraiment bien pour la base de données, et c'est une approche tout à fait valide pour
00:07:47quelque chose comme ça. Mais ensuite il a aussi utilisé Cloudflare et Vinext pour l'héberger en fait, ce qui est, je pense,
00:07:52une décision un peu étrange, car comme vous pouvez le voir, Vinext est très récent, et je ne pense pas qu'il ait été
00:07:56encore testé, et ils mettent certainement quelque chose dans le prompt pour forcer l'utilisation de Cloudflare
00:08:00et Vinext. Et je l'ai dit dans ma vidéo sur Kimi K3, c'est probablement parce que c'est ainsi que fonctionnent leurs propres sites ChatGPT
00:08:04hébergés. Enfin, le dernier modèle que j'ai testé est Kimi K3, et voici le résultat que nous
00:08:09avons obtenu, et je dirais qu'il a fait du très bon travail. Cette interface est en quelque sorte ce que j'aurais obtenu
00:08:14de GPT 5.4 ou 5.5, donc je pense qu'il est un peu en retard en matière de design d'interface, mais encore une fois, toutes les fonctionnalités
00:08:19fonctionnent, et je ne peux pas vraiment trop me plaindre de cette interface. Elle fait exactement ce que je lui ai demandé.
00:08:24Le code perd cependant quelques points pour moi. Il a choisi React pour son front-end,
00:08:28et encore une fois, il a construit sa propre bibliothèque de routage comme l'a fait Fable, mais si on regarde le serveur,
00:08:32il n'a en fait qu'un serveur express, et il n'a pas construit de base de données en utilisant Node SQLite
00:08:36ou quoi que ce soit de ce genre. Il a en fait juste construit sa propre base de données en utilisant JavaScript, donc il sauvegarde
00:08:40tout dans un fichier JSON. Ce n'est définitivement pas l'approche que j'aurais voulu qu'il prenne.
00:08:44En ce qui concerne le timing et les prix des modèles sur ce test financier, Fable était le plus cher,
00:08:48coûtant 30,79 $, et prenant également 56 minutes et 55 secondes, mais encore une fois, avec Opus, il semble être
00:08:55assez proche du prix de Fable, car il m'a coûté 29,82 $, et il a en fait pris plus de temps à 59 minutes et 15
00:09:02secondes. Les modèles GPT sont juste très bien placés en comparaison, c'est environ trois fois et demie
00:09:07moins cher, et j'espère vraiment que cette concurrence commencera à faire baisser ces prix d'Anthropic.
00:09:11Donc c'est un peu mitigé pour moi. Évidemment, je n'ai exécuté chaque test qu'une seule fois, et je n'ai fait que deux tests,
00:09:16donc j'espère que les benchmarks d'Artificial Analysis sont plus précis, où Opus est
00:09:20en fait un tiers du prix de Fable, mais je devrai certainement l'utiliser un peu plus pour vérifier
00:09:24ça. C'est peut-être juste l'outil que j'utilise pour mesurer les coûts. Un autre point pour Opus
00:09:28cependant, c'est qu'il est un peu moins strict sur le travail de cybersécurité que Fable 5. Les protections sont assez
00:09:33similaires à Opus 4.8, à l'exception de quelques garde-fous plus forts sur une gamme étroite de tâches
00:09:37cybernétiques. Apparemment, les protections permettront à Opus 5 de trouver des vulnérabilités dans le code source,
00:09:42mais il bloquera l'analyse des vulnérabilités basée sur les binaires, ainsi que les tests de pénétration et
00:09:46la génération d'exploits. Leurs tests ont révélé que leurs classificateurs interviennent environ 85 % moins souvent
00:09:51que pour Fable 5. Voilà donc, la concurrence entre les modèles est vraiment assez impressionnante
00:09:55en ce moment. Nous avons GPT 5.6 qui montre que les prix peuvent être abaissés, nous avons des modèles ouverts comme Kimi
00:10:00qui égalent les grands en matière d'intelligence, et nous avons Anthropic qui repousse constamment cette
00:10:04intelligence de plus en plus loin. Quel est votre modèle préféré, et aimez-vous ce qu'Opus annonce ?
00:10:09Dites-le-moi dans les commentaires ci-dessous, pendant que vous y êtes abonnez-vous, et comme toujours, on se voit dans la prochaine.