Opus 5 est disponible et il est MEILLEUR QUE FABLE ?!

CChase AI
Computing/SoftwareBusiness NewsInternet Technology

Transcript

00:00:00Claude Opus 5 vient de sortir, et Anthropic affirme qu'on a désormais un modèle
00:00:04proche des performances de Fable 5 pour la moitié du coût. Regardons ça de plus près.
00:00:09Examinons quelques benchmarks : les chiffres sont assez hallucinants. On voit
00:00:14qu'il bat Fable 5 et surpasse largement Opus 4.8 sur plusieurs tests, notamment
00:00:20le codage agentique en terminal, le travail intellectuel et la recherche agentique. Il surpasse aussi GPT-5.6
00:00:27dans ces catégories. Les seuls domaines où Opus 5 fait moins bien que Fable 5 sont
00:00:33le raisonnement pluridisciplinaire (et de très peu, il le bat même quand il utilise des outils), ainsi que
00:00:39le droit et la santé. Mais partout ailleurs, il dépasse leur meilleur modèle. Et si ces chiffres sont
00:00:46exacts, c'est fou. Ici, on voit sur CursorBench 3.2 à effort maximal que le modèle affiche
00:00:51un score à 0,5 % du sommet de Fable 5, mais à la moitié du coût par tâche. Dément. Et vous pouvez le voir
00:00:57juste ici. On a Opus 5 en rouge, Fable 5 en orange, et en bas en bleu, Opus 4.8.
00:01:03Alors oui, à un niveau d'effort maximal, Fable 5 prend l'avantage, mais la plupart des gens ne travaillent pas
00:01:08au maximum. Ils tournent en élevé ou très élevé. Et si l'on compare ces niveaux
00:01:13à ceux de Fable, on obtient pratiquement les mêmes résultats avec Opus 5, mais encore une fois,
00:01:17pour moitié moins cher. Et sur d'autres benchmarks, comme l'index d'agents de codage d'Artificial Analysis,
00:01:23Opus 5 surpasse purement et simplement Fable 5. Idem sur FrontierBench.
00:01:27Il surpasse carrément Fable tout en étant moins cher. Jetons maintenant un œil aux tâches
00:01:32intellectuelles et de résolution de problèmes. Là encore, ce qui est dingue, ce n'est pas seulement cette
00:01:37dynamique entre Fable 5 et Opus 5, c'est le bond entre Opus 4.8 et Opus 5. Tout cela
00:01:43représente un progrès monumental sur toute la ligne. Et si c'était comme pour Sonnet
00:01:495, où le modèle faisait mieux que le précédent tout en étant excessivement
00:01:53cher — puisque Sonnet 5 est le modèle le plus cher du marché quand on analyse
00:01:57le coût par tâche — ce n'est pas le cas ici. Opus semble extrêmement efficace en tokens par rapport à ces
00:02:03deux autres modèles. Et le fait qu'il batte Fable 5, c'est vraiment incroyable.
00:02:07Une autre amélioration intéressante concerne le rendu visuel. Voici Opus 5 travaillant sur
00:02:13une simulation en soufflerie, et ici, en train de concevoir un objet 3D interactif
00:02:19d'une cellule animale. L'un des points faibles de Claude, c'est qu'il ne produit pas directement d'images. Qu'il
00:02:24soit plus performant pour générer des graphismes SVG 3D ou HTML est donc une grande avancée.
00:02:31Autre nette amélioration : Anthropic indique qu'il est bien plus efficace pour vérifier son travail
00:02:35et itérer minutieusement jusqu'à réussir. Qu'est-ce que ça veut dire ? Que lorsqu'on utilise Opus 5
00:02:40sur des tâches agentiques à long terme, qui ne se font pas en une seule passe mais en boucles,
00:02:45comme ce concept d'ingénierie de graphes dont tout le monde parle, tout ce qui demande à
00:02:49Claude de vérifier son travail par rapport à un objectif donné et de répéter l'opération,
00:02:53Opus 5 s'en sort bien mieux qu'Opus 4.8. Un exemple très intéressant :
00:02:58Opus 5 a reçu le dessin d'une pièce mécanique avec pour consigne de la Reconstruire en 3D dans FreeCAD,
00:03:03mais sans aucun moyen de visualiser directement l'image. Il devait
00:03:09atteindre cet objectif sans instructions précises sur la marche à suivre. Il a donc lui-même
00:03:14développé un pipeline de vision par ordinateur pour extraire la géométrie des pixels et reconstituer
00:03:19l'intégralité de la pièce. Bref, pour toutes les tâches à long terme nécessitant d'atteindre un cap précis,
00:03:25Opus 5 est bien plus performant que 4.8. Côté comportements indésirables,
00:03:29il dépasse aussi nettement les versions précédentes (plus c'est bas, mieux c'est). Sa capacité à détecter
00:03:35des failles dans du code open source a fait un bond énorme depuis Opus 4.8. L'autre point fort, ce sont
00:03:40les garde-fous. Contrairement à Fable, où aborder la cybersécurité ou la biologie
00:03:45bloque immédiatement le modèle, les restrictions sont bien plus souples sur Opus 5.
00:03:50Bien qu'il reste des filtres, la probabilité qu'ils se déclenchent diminue de 85 % par rapport à Fable.
00:03:56Enfin, l'élément majeur reste le coût. Comme je le disais, c'est deux fois moins cher que Fable :
00:04:01comptez 5 $ par million de tokens en entrée et 25 $ par million en sortie. Et comme le montrent
00:04:07les benchmarks, ce modèle s'avère plutôt économe en tokens. J'ai donc très hâte de le tester,
00:04:12car si ces chiffres se confirment, on a une version améliorée de Fable pour la moitié de son prix.

Key Takeaway

Claude Opus 5 fournit des performances d'agent et de codage équivalentes ou supérieures à Fable 5 à la moitié de son coût, soit 5 $ par million de tokens en entrée et 25 $ en sortie.

Highlights

  • Claude Opus 5 affiche un coût de 5 $ par million de tokens en entrée et 25 $ par million en sortie, divisant par deux le prix de Fable 5.

  • Sur CursorBench 3.2 à effort maximal, Opus 5 atteint un score situé à 0,5 % du sommet de Fable 5 pour la moitié du coût par tâche.

  • Les déclenchements intempestifs des filtres de sécurité diminuent de 85 % sur Opus 5 par rapport à Fable 5 sur les thèmes de cybersécurité et de biologie.

  • Opus 5 surpasse Fable 5 et GPT-5.6 en codage agentique en terminal, en travail intellectuel et en recherche autonome.

  • Sans instructions directes, le modèle est capable de développer lui-même un pipeline de vision par ordinateur pour modéliser une pièce mécanique complexe dans FreeCAD.

Timeline

Performances comparatives et structure des coûts

  • Opus 5 surpasse Opus 4.8 et GPT-5.6 en codage agentique, en travail intellectuel et en recherche.
  • Le modèle s'affiche à 5 $ par million de tokens en entrée et 25 $ en sortie, divisant les coûts par deux face à Fable 5.
  • Opus 5 devance Fable 5 sur Artificial Analysis Coding Agent Index et FrontierBench.

Fable 5 ne conserve un léger avantage que sur le droit, la santé et le raisonnement pluridisciplinaire non assisté par outils. Sur CursorBench 3.2 à effort maximal, le score d'Opus 5 frôle celui de Fable 5 à 0,5 % près. Aux niveaux d'effort élevé et très élevé correspondant à un usage quotidien, Opus 5 égalise les résultats de Fable 5 pour la moitié du tarif.

Efficacité en tokens, rendus visuels et autonomie agentique

  • Opus 5 consomme moins de tokens par tâche que Sonnet 5 et Opus 4.8.
  • La génération directe de graphismes HTML et SVG 3D permet la création d'objets interactifs et de simulations.
  • L'itération autonome permet de vérifier le travail accompli au cours de boucles d'ingénierie à long terme.

Sonnet 5 demeure le modèle le plus coûteux du marché en coût par tâche, alors qu'Opus 5 optimise sa consommation de tokens. Confronté au dessin d'une pièce mécanique sans accès direct à l'image, Opus 5 a conçu son propre pipeline de vision par ordinateur pour extraire la géométrie des pixels et la reconstruire dans FreeCAD. Cette capacité de correction autonome améliore la réussite des projets complexes nécessitant un suivi d'objectifs sur plusieurs étapes.

Sécurité, détection de vulnérabilités et assouplissement des filtres

  • La capacité à détecter les failles dans le code open source augmente nettement par rapport à Opus 4.8.
  • Le taux de blocage abusif diminue de 85 % comparativement à Fable 5 sur les domaines techniques sensibles.
  • Le tarif réduit rend l'exécution de tâches complexes accessible à moindre coût.

Les blocages intempestifs fréquents sur Fable lors de requêtes en cybersécurité ou en biologie sont fortement réduits sur Opus 5, avec une baisse de 85 % des déclenchements injustifiés. Les comportements indésirables atteignent un niveau historiquement bas sur l'ensemble de la gamme Claude. L'optimisation en tokens combinée aux tarifs de 5 $ en entrée et 25 $ en sortie rend le modèle plus rentable que Fable pour des capacités équivalentes.

Community Posts

View all posts