Sonnet 3.5 est disponible et il rivalise avec Opus

CChase AI
Computing/SoftwareSmall Business/StartupsManagement

Transcript

00:00:00Anthropic vient de sortir Sonnet 5, alors passons en revue tout ce que vous devez savoir.
00:00:04Commençons par les benchmarks. Et rappelez-vous, Sonnet 5 est un modèle
00:00:08moins puissant et moins coûteux que des modèles comme Opus et certainement Fable. Nous n'avions pas eu de mise à jour
00:00:13depuis la 4.6. Maintenant, en comparant la 5 à la 4.6, on voit un énorme bond en avant en matière de codage agentique,
00:00:21de raisonnement multidisciplinaire, d'utilisation de l'ordinateur et de travail intellectuel. Donc une amélioration
00:00:26générale. Maintenant, quand on le compare à Opus 4.8, la question n'est pas de savoir si c'est proche, mais quelle
00:00:32est l'ampleur de la baisse de performance ? Honnêtement, ce n'est pas une grosse baisse. En fait, il affiche de meilleurs chiffres
00:00:39pour le travail intellectuel, ce qui est assez fou. L'utilisation de l'ordinateur n'est qu'à 2 % derrière, et il n'est qu'à
00:00:442 % derrière en codage agentique, et seulement quelques points de pourcentage derrière sur le raisonnement
00:00:49multidisciplinaire. Le plus grand écart se situe au niveau de Sweebench Pro avec 63 % contre 69 %.
00:00:56Mais bon, Terminal Bench 2.1, 80 contre 82. Donc ce n'est pas un grand écart. Et cette discussion
00:01:03sur les performances doit se faire dans le contexte de la tarification. Rappelez-vous, Fable 5, Opus 5,
00:01:08nous parlons de 10 $pour un million de jetons d'entrée, soit le double d'Opus. Opus coûte 5$ par million de jetons d'entrée.
00:01:16Et pour la sortie, c'est 25 $. Donc 5 $et 25$. Pour Sonnet 5, nous sommes à 2 $, soit seulement 40 % du coût d'Opus
00:01:26pour les jetons d'entrée. Et pour la sortie, c'est 10 $. C'est donc nettement moins cher, moins de la moitié du coût
00:01:34d'Opus. Pourtant, quand on regarde les chiffres, c'est assez proche. C'est donc une énorme nouvelle si vous n'êtes pas
00:01:40quelqu'un qui effectue des tâches de pointe avec l'IA, mais plutôt des tâches plus routinières,
00:01:46et que vous voulez quand même de la puissance, eh bien, Sonnet 5 comble ce fossé. Regardons maintenant ces graphiques qui vont
00:01:51au-delà des simples benchmarks. Ici, nous examinons les performances de recherche agentique par niveau d'effort,
00:01:55en comparant Opus 4.8 à Sonnet 5 et Sonnet 4.6. Immédiatement, je pense que vous remarquerez ici que pour Sonnet 5, il y a un écart énorme
00:02:04dans les taux de réussite selon les niveaux d'effort. À un niveau faible, il atteint 55 %. Mais si l'on regarde
00:02:13le niveau faible sur Sonnet 4.6, il est en fait meilleur. Pourtant, en termes de coût, c'est beaucoup moins.
00:02:19Passons au niveau moyen, nous obtenons essentiellement les mêmes performances qu'avec Sonnet 4.6,
00:02:25mais avec une remise significative. Et ce n'est qu'en passant à des niveaux d'effort élevés que nous commençons à surpasser
00:02:34Sonnet 4.6. Mais à ce stade, nous obtenons de meilleures performances que Sonnet 4.6, mais à un coût
00:02:41qui aurait été celui d'un niveau d'effort faible pour Sonnet 4.6. Cette distinction de niveau d'effort,
00:02:49je pense qu'elle est très importante, car il ne s'agit pas simplement de dire que Sonnet 5 est meilleur partout, et que le niveau faible
00:02:53sur la 5 est nécessairement meilleur que sur la 4.6. Le niveau faible sur Sonnet 5 signifie vraiment que ce sera très
00:02:59bon marché. Mais pour obtenir une performance d'un niveau plus élevé, ce que nous avons vu par le passé,
00:03:03il faut probablement faire quelque chose qui se situe dans la plage élevée. Cela étant dit, quand nous sommes dans la plage
00:03:08élevée avec Sonnet 5, nous payons à peu près la même chose qu'avec Opus. Opus, aux niveaux moyen
00:03:14et élevé, coûte la même chose que Sonnet au niveau élevé, mais nous obtenons un meilleur taux de réussite. Cela apporte
00:03:21beaucoup de nuances dans cette discussion. Devons-nous utiliser Sonnet 5 ou Opus 4.8 pour des choses comme la recherche agentique ?
00:03:27Je pense que cela dépend vraiment. Si c'est un problème plus complexe, au final, Opus 4.8 peut être
00:03:33moins cher simplement parce qu'il est très efficace en termes de jetons et que Sonnet n'est pas le bon outil pour le travail.
00:03:38Cependant, lorsque nous effectuons des tâches qui ne sont pas aussi exigeantes pour ces modèles d'IA, alors peut-être
00:03:44qu'il n'est pas logique d'utiliser Opus 4.8 du tout. C'est là que nous faisons intervenir Sonnet 5. Donc, je pense que
00:03:49nous sommes dans une situation intéressante où c'est du cas par cas pour savoir quel modèle
00:03:54vous devriez utiliser. Voici un autre exemple intéressant avec l'utilisation de l'ordinateur par l'agent. Maintenant, dans l'ensemble,
00:03:58pour la plupart, Sonnet 5 bat Sonnet 4.6 et il le fait à un coût assez bas. Donc, pour la
00:04:05recherche agentique, ce n'était certainement pas le cas, mais pour l'utilisation de l'ordinateur par l'agent, tout à coup,
00:04:09nous utiliserions toujours Sonnet 5 plutôt que la 4.6. Et encore une fois, cela revient à l'idée que c'est maintenant du cas par cas
00:04:14pour savoir quel modèle utiliser. Fait intéressant, regardez Opus. Opus High fonctionne
00:04:20mieux que le Sonnet 5 max et il est moins cher. Donc, je veux dire, vous regardez cela et vous vous dites,
00:04:26wow, comme, Opus est en fait assez efficace pour ce qu'il fait. Sans parler du fait qu'il atteint ces niveaux plus élevés
00:04:30que Sonnet ne peut tout simplement pas atteindre. Donc, des choses à considérer, honnêtement, juste parce que le coût par million
00:04:36de jetons est moins cher avec Opus, il y aura beaucoup de cas où Opus sera toujours le meilleur. Maintenant, je veux
00:04:41faire une sortie de modèle anthropic sans parler du comportement mal aligné. Nous pouvons voir que c'est une amélioration
00:04:45avec Sonnet 5, mais toujours en dessous de ce que nous attendrions avec Opus 4.8 et Mythos Preview. Et en termes d'
00:04:50exploits et de toute cette question de cybersécurité qui a rendu Mythos pratiquement verrouillé, ce n'est pas un
00:04:55problème ou quelque chose dont vous devez vous soucier avec la classe Sonnet. Donc, dans l'ensemble, je ne prêterais pas trop
00:04:59attention à ces benchmarks, pour être honnête. Ces types de benchmarks, ces types de graphiques me donnent beaucoup
00:05:05plus à réfléchir, car la question, je ne pense pas, est Sonnet 5 contre 4.6. Nous allons pratiquement toujours
00:05:11utiliser Sonnet 5. C'est Sonnet 5 contre Opus 4.8. Et la question est, Opus est-il réellement moins cher ? Et
00:05:18j'adorerais voir plus de tests et plus de choses de la part d'Anthropic qui définissent en quelque sorte
00:05:24cette ligne de démarcation entre, d'accord, Sonnet 5 peut très bien faire ça et c'est moins cher qu'Opus
00:05:29versus, hé, c'est maintenant une tâche plus compliquée. Opus sera en fait plus efficace que
00:05:34Sonnet pour la compléter. Donc, des choses auxquelles réfléchir, c'est vraiment un ajout appréciable. Je pense que dans l'ensemble, pour les tâches
00:05:40de niveau inférieur, cela va être une aubaine, car pour ceux d'entre nous qui utilisent des jetons API pour, vous savez,
00:05:46nos applications ou des choses qui ne sont pas dans l'écosystème Claude Max Plan, c'est assez difficile d'utiliser
00:05:51Anthropic. C'est juste tellement cher. Et je dis aux gens depuis longtemps, genre, allez voir
00:05:55OpenAI, vous savez, regardez certains de leurs modèles miniatures parce que c'est souvent largement suffisant pour beaucoup
00:05:59des emplois des gens. Eh bien, nous avons maintenant une option de niveau intermédiaire avec Anthropic, ce qui est un ajout
00:06:05appréciable. Donc, je vais vous laisser là-dessus aujourd'hui. C'est disponible partout. Je pense que
00:06:09cela va demander beaucoup d'essais et d'erreurs pour comprendre où cela a le plus de sens. Alors, dites-moi
00:06:13ce que vous en avez pensé. Assurez-vous de consulter Chase AI Plus si vous voulez mettre la main sur ma Masterclass
00:06:17Claude Code et je vous verrai plus tard.

Key Takeaway

Sonnet 3.5 se positionne comme une solution intermédiaire puissante et économiquement avantageuse pour les tâches routinières, bien qu'Opus 4.8 demeure préférable pour les problèmes de très haute complexité malgré son coût supérieur.

Highlights

  • Sonnet 3.5 coûte 2 $par million de jetons d'entrée et 10$ par million de jetons de sortie, soit moins de la moitié du prix d'Opus 4.8.

  • Sonnet 3.5 améliore le codage agentique, le raisonnement multidisciplinaire et l'utilisation de l'ordinateur par rapport à la version 4.6.

  • Opus 4.8 reste plus performant pour la recherche agentique de haute complexité et surpasse Sonnet 3.5 en efficacité sur certaines tâches de haut niveau.

  • Le choix entre Sonnet 3.5 et Opus 4.8 dépend désormais d'une évaluation au cas par cas selon la complexité de la tâche.

  • Sonnet 3.5 offre une alternative intermédiaire compétitive face aux modèles miniatures d'OpenAI pour les tâches routinières.

Timeline

Comparaison des performances et des coûts

  • Sonnet 3.5 surpasse largement la version 4.6 dans la quasi-totalité des domaines techniques.
  • Les coûts d'utilisation de Sonnet 3.5 s'établissent à 2 $pour l'entrée et 10$ pour la sortie par million de jetons.
  • Opus 4.8 conserve un avantage marginal sur des benchmarks spécifiques comme Sweebench Pro avec 69 % contre 63 % pour Sonnet 3.5.

Cette section établit que Sonnet 3.5 comble le fossé entre les modèles d'entrée de gamme et les modèles premium comme Opus. Avec un coût représentant environ 40 % de celui d'Opus, le modèle permet une exécution plus abordable des tâches intellectuelles tout en offrant des performances très proches.

Recherche agentique et niveaux d'effort

  • L'efficacité de Sonnet 3.5 varie drastiquement selon le niveau d'effort requis pour la tâche.
  • Le passage à des niveaux d'effort élevés est nécessaire pour que Sonnet 3.5 surpasse les résultats de la version 4.6.
  • Opus 4.8 peut s'avérer plus économique sur des problèmes très complexes grâce à sa meilleure efficacité par jeton.

L'analyse des graphiques de recherche agentique révèle que le coût n'est pas le seul facteur de décision. Bien que Sonnet 3.5 soit moins coûteux, Opus 4.8 reste l'outil privilégié pour les problèmes exigeants où une performance supérieure est requise, évitant ainsi le gaspillage de jetons sur une exécution répétée.

Utilisation de l'ordinateur et positionnement global

  • Sonnet 3.5 bat systématiquement la version 4.6 pour les tâches d'utilisation d'ordinateur.
  • Opus 4.8 démontre une efficacité supérieure au niveau 'High' par rapport à Sonnet 3.5 au niveau 'Max' pour certaines manipulations spécifiques.
  • Sonnet 3.5 constitue une alternative sérieuse et moins onéreuse aux modèles d'OpenAI pour les applications via API.

Le modèle Sonnet 3.5 s'impose comme le nouveau standard pour les tâches routinières, libérant les utilisateurs de la nécessité d'utiliser systématiquement le modèle le plus coûteux. Cette mise à jour offre une flexibilité accrue pour les développeurs et les utilisateurs cherchant à optimiser leur budget sans sacrifier la qualité.

Community Posts

View all posts