Sonnet 3.5 est disponible et il rivalise avec Opus
CChase AI
Computing/SoftwareSmall Business/StartupsManagement
Transcript
00:00:00Anthropic vient de sortir Sonnet 5, alors passons en revue tout ce que vous devez savoir.
00:00:04Commençons par les benchmarks. Et rappelez-vous, Sonnet 5 est un modèle
00:00:08moins puissant et moins coûteux que des modèles comme Opus et certainement Fable. Nous n'avions pas eu de mise à jour
00:00:13depuis la 4.6. Maintenant, en comparant la 5 à la 4.6, on voit un énorme bond en avant en matière de codage agentique,
00:00:21de raisonnement multidisciplinaire, d'utilisation de l'ordinateur et de travail intellectuel. Donc une amélioration
00:00:26générale. Maintenant, quand on le compare à Opus 4.8, la question n'est pas de savoir si c'est proche, mais quelle
00:00:32est l'ampleur de la baisse de performance ? Honnêtement, ce n'est pas une grosse baisse. En fait, il affiche de meilleurs chiffres
00:00:39pour le travail intellectuel, ce qui est assez fou. L'utilisation de l'ordinateur n'est qu'à 2 % derrière, et il n'est qu'à
00:00:442 % derrière en codage agentique, et seulement quelques points de pourcentage derrière sur le raisonnement
00:00:49multidisciplinaire. Le plus grand écart se situe au niveau de Sweebench Pro avec 63 % contre 69 %.
00:00:56Mais bon, Terminal Bench 2.1, 80 contre 82. Donc ce n'est pas un grand écart. Et cette discussion
00:01:03sur les performances doit se faire dans le contexte de la tarification. Rappelez-vous, Fable 5, Opus 5,
00:01:08nous parlons de 10 $pour un million de jetons d'entrée, soit le double d'Opus. Opus coûte 5$ par million de jetons d'entrée.
00:01:16Et pour la sortie, c'est 25 $. Donc 5 $et 25$. Pour Sonnet 5, nous sommes à 2 $, soit seulement 40 % du coût d'Opus
00:01:26pour les jetons d'entrée. Et pour la sortie, c'est 10 $. C'est donc nettement moins cher, moins de la moitié du coût
00:01:34d'Opus. Pourtant, quand on regarde les chiffres, c'est assez proche. C'est donc une énorme nouvelle si vous n'êtes pas
00:01:40quelqu'un qui effectue des tâches de pointe avec l'IA, mais plutôt des tâches plus routinières,
00:01:46et que vous voulez quand même de la puissance, eh bien, Sonnet 5 comble ce fossé. Regardons maintenant ces graphiques qui vont
00:01:51au-delà des simples benchmarks. Ici, nous examinons les performances de recherche agentique par niveau d'effort,
00:01:55en comparant Opus 4.8 à Sonnet 5 et Sonnet 4.6. Immédiatement, je pense que vous remarquerez ici que pour Sonnet 5, il y a un écart énorme
00:02:04dans les taux de réussite selon les niveaux d'effort. À un niveau faible, il atteint 55 %. Mais si l'on regarde
00:02:13le niveau faible sur Sonnet 4.6, il est en fait meilleur. Pourtant, en termes de coût, c'est beaucoup moins.
00:02:19Passons au niveau moyen, nous obtenons essentiellement les mêmes performances qu'avec Sonnet 4.6,
00:02:25mais avec une remise significative. Et ce n'est qu'en passant à des niveaux d'effort élevés que nous commençons à surpasser
00:02:34Sonnet 4.6. Mais à ce stade, nous obtenons de meilleures performances que Sonnet 4.6, mais à un coût
00:02:41qui aurait été celui d'un niveau d'effort faible pour Sonnet 4.6. Cette distinction de niveau d'effort,
00:02:49je pense qu'elle est très importante, car il ne s'agit pas simplement de dire que Sonnet 5 est meilleur partout, et que le niveau faible
00:02:53sur la 5 est nécessairement meilleur que sur la 4.6. Le niveau faible sur Sonnet 5 signifie vraiment que ce sera très
00:02:59bon marché. Mais pour obtenir une performance d'un niveau plus élevé, ce que nous avons vu par le passé,
00:03:03il faut probablement faire quelque chose qui se situe dans la plage élevée. Cela étant dit, quand nous sommes dans la plage
00:03:08élevée avec Sonnet 5, nous payons à peu près la même chose qu'avec Opus. Opus, aux niveaux moyen
00:03:14et élevé, coûte la même chose que Sonnet au niveau élevé, mais nous obtenons un meilleur taux de réussite. Cela apporte
00:03:21beaucoup de nuances dans cette discussion. Devons-nous utiliser Sonnet 5 ou Opus 4.8 pour des choses comme la recherche agentique ?
00:03:27Je pense que cela dépend vraiment. Si c'est un problème plus complexe, au final, Opus 4.8 peut être
00:03:33moins cher simplement parce qu'il est très efficace en termes de jetons et que Sonnet n'est pas le bon outil pour le travail.
00:03:38Cependant, lorsque nous effectuons des tâches qui ne sont pas aussi exigeantes pour ces modèles d'IA, alors peut-être
00:03:44qu'il n'est pas logique d'utiliser Opus 4.8 du tout. C'est là que nous faisons intervenir Sonnet 5. Donc, je pense que
00:03:49nous sommes dans une situation intéressante où c'est du cas par cas pour savoir quel modèle
00:03:54vous devriez utiliser. Voici un autre exemple intéressant avec l'utilisation de l'ordinateur par l'agent. Maintenant, dans l'ensemble,
00:03:58pour la plupart, Sonnet 5 bat Sonnet 4.6 et il le fait à un coût assez bas. Donc, pour la
00:04:05recherche agentique, ce n'était certainement pas le cas, mais pour l'utilisation de l'ordinateur par l'agent, tout à coup,
00:04:09nous utiliserions toujours Sonnet 5 plutôt que la 4.6. Et encore une fois, cela revient à l'idée que c'est maintenant du cas par cas
00:04:14pour savoir quel modèle utiliser. Fait intéressant, regardez Opus. Opus High fonctionne
00:04:20mieux que le Sonnet 5 max et il est moins cher. Donc, je veux dire, vous regardez cela et vous vous dites,
00:04:26wow, comme, Opus est en fait assez efficace pour ce qu'il fait. Sans parler du fait qu'il atteint ces niveaux plus élevés
00:04:30que Sonnet ne peut tout simplement pas atteindre. Donc, des choses à considérer, honnêtement, juste parce que le coût par million
00:04:36de jetons est moins cher avec Opus, il y aura beaucoup de cas où Opus sera toujours le meilleur. Maintenant, je veux
00:04:41faire une sortie de modèle anthropic sans parler du comportement mal aligné. Nous pouvons voir que c'est une amélioration
00:04:45avec Sonnet 5, mais toujours en dessous de ce que nous attendrions avec Opus 4.8 et Mythos Preview. Et en termes d'
00:04:50exploits et de toute cette question de cybersécurité qui a rendu Mythos pratiquement verrouillé, ce n'est pas un
00:04:55problème ou quelque chose dont vous devez vous soucier avec la classe Sonnet. Donc, dans l'ensemble, je ne prêterais pas trop
00:04:59attention à ces benchmarks, pour être honnête. Ces types de benchmarks, ces types de graphiques me donnent beaucoup
00:05:05plus à réfléchir, car la question, je ne pense pas, est Sonnet 5 contre 4.6. Nous allons pratiquement toujours
00:05:11utiliser Sonnet 5. C'est Sonnet 5 contre Opus 4.8. Et la question est, Opus est-il réellement moins cher ? Et
00:05:18j'adorerais voir plus de tests et plus de choses de la part d'Anthropic qui définissent en quelque sorte
00:05:24cette ligne de démarcation entre, d'accord, Sonnet 5 peut très bien faire ça et c'est moins cher qu'Opus
00:05:29versus, hé, c'est maintenant une tâche plus compliquée. Opus sera en fait plus efficace que
00:05:34Sonnet pour la compléter. Donc, des choses auxquelles réfléchir, c'est vraiment un ajout appréciable. Je pense que dans l'ensemble, pour les tâches
00:05:40de niveau inférieur, cela va être une aubaine, car pour ceux d'entre nous qui utilisent des jetons API pour, vous savez,
00:05:46nos applications ou des choses qui ne sont pas dans l'écosystème Claude Max Plan, c'est assez difficile d'utiliser
00:05:51Anthropic. C'est juste tellement cher. Et je dis aux gens depuis longtemps, genre, allez voir
00:05:55OpenAI, vous savez, regardez certains de leurs modèles miniatures parce que c'est souvent largement suffisant pour beaucoup
00:05:59des emplois des gens. Eh bien, nous avons maintenant une option de niveau intermédiaire avec Anthropic, ce qui est un ajout
00:06:05appréciable. Donc, je vais vous laisser là-dessus aujourd'hui. C'est disponible partout. Je pense que
00:06:09cela va demander beaucoup d'essais et d'erreurs pour comprendre où cela a le plus de sens. Alors, dites-moi
00:06:13ce que vous en avez pensé. Assurez-vous de consulter Chase AI Plus si vous voulez mettre la main sur ma Masterclass
00:06:17Claude Code et je vous verrai plus tard.