Transcript
00:00:00Claude Opus 5 vient de sortir, et Anthropic affirme qu'on a désormais un modèle
00:00:04proche des performances de Fable 5 pour la moitié du coût. Regardons ça de plus près.
00:00:09Examinons quelques benchmarks : les chiffres sont assez hallucinants. On voit
00:00:14qu'il bat Fable 5 et surpasse largement Opus 4.8 sur plusieurs tests, notamment
00:00:20le codage agentique en terminal, le travail intellectuel et la recherche agentique. Il surpasse aussi GPT-5.6
00:00:27dans ces catégories. Les seuls domaines où Opus 5 fait moins bien que Fable 5 sont
00:00:33le raisonnement pluridisciplinaire (et de très peu, il le bat même quand il utilise des outils), ainsi que
00:00:39le droit et la santé. Mais partout ailleurs, il dépasse leur meilleur modèle. Et si ces chiffres sont
00:00:46exacts, c'est fou. Ici, on voit sur CursorBench 3.2 à effort maximal que le modèle affiche
00:00:51un score à 0,5 % du sommet de Fable 5, mais à la moitié du coût par tâche. Dément. Et vous pouvez le voir
00:00:57juste ici. On a Opus 5 en rouge, Fable 5 en orange, et en bas en bleu, Opus 4.8.
00:01:03Alors oui, à un niveau d'effort maximal, Fable 5 prend l'avantage, mais la plupart des gens ne travaillent pas
00:01:08au maximum. Ils tournent en élevé ou très élevé. Et si l'on compare ces niveaux
00:01:13à ceux de Fable, on obtient pratiquement les mêmes résultats avec Opus 5, mais encore une fois,
00:01:17pour moitié moins cher. Et sur d'autres benchmarks, comme l'index d'agents de codage d'Artificial Analysis,
00:01:23Opus 5 surpasse purement et simplement Fable 5. Idem sur FrontierBench.
00:01:27Il surpasse carrément Fable tout en étant moins cher. Jetons maintenant un œil aux tâches
00:01:32intellectuelles et de résolution de problèmes. Là encore, ce qui est dingue, ce n'est pas seulement cette
00:01:37dynamique entre Fable 5 et Opus 5, c'est le bond entre Opus 4.8 et Opus 5. Tout cela
00:01:43représente un progrès monumental sur toute la ligne. Et si c'était comme pour Sonnet
00:01:495, où le modèle faisait mieux que le précédent tout en étant excessivement
00:01:53cher — puisque Sonnet 5 est le modèle le plus cher du marché quand on analyse
00:01:57le coût par tâche — ce n'est pas le cas ici. Opus semble extrêmement efficace en tokens par rapport à ces
00:02:03deux autres modèles. Et le fait qu'il batte Fable 5, c'est vraiment incroyable.
00:02:07Une autre amélioration intéressante concerne le rendu visuel. Voici Opus 5 travaillant sur
00:02:13une simulation en soufflerie, et ici, en train de concevoir un objet 3D interactif
00:02:19d'une cellule animale. L'un des points faibles de Claude, c'est qu'il ne produit pas directement d'images. Qu'il
00:02:24soit plus performant pour générer des graphismes SVG 3D ou HTML est donc une grande avancée.
00:02:31Autre nette amélioration : Anthropic indique qu'il est bien plus efficace pour vérifier son travail
00:02:35et itérer minutieusement jusqu'à réussir. Qu'est-ce que ça veut dire ? Que lorsqu'on utilise Opus 5
00:02:40sur des tâches agentiques à long terme, qui ne se font pas en une seule passe mais en boucles,
00:02:45comme ce concept d'ingénierie de graphes dont tout le monde parle, tout ce qui demande à
00:02:49Claude de vérifier son travail par rapport à un objectif donné et de répéter l'opération,
00:02:53Opus 5 s'en sort bien mieux qu'Opus 4.8. Un exemple très intéressant :
00:02:58Opus 5 a reçu le dessin d'une pièce mécanique avec pour consigne de la Reconstruire en 3D dans FreeCAD,
00:03:03mais sans aucun moyen de visualiser directement l'image. Il devait
00:03:09atteindre cet objectif sans instructions précises sur la marche à suivre. Il a donc lui-même
00:03:14développé un pipeline de vision par ordinateur pour extraire la géométrie des pixels et reconstituer
00:03:19l'intégralité de la pièce. Bref, pour toutes les tâches à long terme nécessitant d'atteindre un cap précis,
00:03:25Opus 5 est bien plus performant que 4.8. Côté comportements indésirables,
00:03:29il dépasse aussi nettement les versions précédentes (plus c'est bas, mieux c'est). Sa capacité à détecter
00:03:35des failles dans du code open source a fait un bond énorme depuis Opus 4.8. L'autre point fort, ce sont
00:03:40les garde-fous. Contrairement à Fable, où aborder la cybersécurité ou la biologie
00:03:45bloque immédiatement le modèle, les restrictions sont bien plus souples sur Opus 5.
00:03:50Bien qu'il reste des filtres, la probabilité qu'ils se déclenchent diminue de 85 % par rapport à Fable.
00:03:56Enfin, l'élément majeur reste le coût. Comme je le disais, c'est deux fois moins cher que Fable :
00:04:01comptez 5 $ par million de tokens en entrée et 25 $ par million en sortie. Et comme le montrent
00:04:07les benchmarks, ce modèle s'avère plutôt économe en tokens. J'ai donc très hâte de le tester,
00:04:12car si ces chiffres se confirment, on a une version améliorée de Fable pour la moitié de son prix.