Claude Sonnet 3.5 est une déception... (Mais Fable est de retour !)
BBetter Stack
컴퓨터/소프트웨어경제 뉴스AI/미래기술
스크립트
00:00:00Anthropic a lancé Claude Sonnet 5 la semaine dernière et c'était décevant, mais au moins Fable 5 est de retour,
00:00:04juste peut-être bridé, et oh, Claude Code pourrait contenir du code proche d'un logiciel espion pour détecter
00:00:09l'utilisation en Chine. Plongeons dans le vif du sujet. Je vais commencer par Sonnet 5. C'est en fait la première mise à jour de Sonnet en quatre
00:00:18mois et demi, et Anthropic affirme que c'est leur modèle Sonnet le plus agentique à ce jour,
00:00:22avec des performances proches d'Opus 4.8, mais à des prix inférieurs. La tarification est vraiment un point intéressant avec
00:00:28ce modèle, donc nous y reviendrons. D'abord, jetons un œil aux benchmarks
00:00:31fournis par Anthropic. Il bat son prédécesseur sur tous ces points, et il se rapproche d'Opus sur quelques-uns
00:00:35comme Terminal Bench et Computer Use, battant même légèrement Opus dans le travail intellectuel. Je préfère regarder
00:00:40les benchmarks tiers cependant, et ceux en qui j'ai confiance proviennent d'Artificial Analysis, et sur cet
00:00:44index de codage, il arrive quelques points derrière Opus, mais très légèrement devant GPT 5.4. Il a fait un très
00:00:50beau bond par rapport à son prédécesseur, Sonnet 4.6. C'est la même histoire sur l'Intelligence Index également, placé
00:00:56entre GPT 5.5 et GPT 5.4, mais fait intéressant, sur l'index agentique, il a en fait surpassé GPT 5.5.
00:01:03Donc, quand ils ont dit dans ce blog qu'ils avaient beaucoup travaillé sur ses capacités agentiques,
00:01:06ça semble avoir porté ses fruits ici. D'après les benchmarks, il semble être un modèle assez compétent,
00:01:10et c'est certainement une amélioration par rapport à Sonnet 4.6, mais parlons maintenant de cet élément de prix.
00:01:14Concernant la tarification de l'API, ils proposent en fait un prix réduit à 2 $ pour un million de jetons d'entrée,
00:01:18et 10 $ pour un million de jetons de sortie, cela jusqu'au 31 août. Ensuite, il reviendra au même
00:01:23prix que les autres modèles Sonnet, soit 3 $pour un million de jetons d'entrée et 15$ pour un million de jetons
00:01:28de sortie. Cela le place autour de Gemini 3.5 Flash et GPT 5.6 Terra, si jamais nous y avons accès,
00:01:34et comme ils l'ont dit, c'est moins cher qu'Opus 4.8. Le problème est cependant, en pratique, ce n'est tout simplement
00:01:39pas vrai du tout. Ce modèle est extrêmement gourmand en jetons. Il utilise environ 69 000 jetons pour exécuter une tâche dans
00:01:45l'Intelligence Index d'Artificial Analysis, ce qui le rend plus coûteux que Sonnet 4.6, Opus 4.8, Fable 5, GPT 5.4,
00:01:52et 5.5. Si vous regardez ce quadrant ici, où le vert est la place idéale, il en est aussi éloigné
00:01:57que possible parmi ces modèles. Cela a évidemment un effet d'entraînement sur le coût réel d'une tâche,
00:02:02et Artificial Analysis a constaté que Sonnet 5 s'avère plus cher qu'Opus 4.8 par tâche,
00:02:07seulement battu par Fable. De plus, si vous prenez un modèle comme GPT 5.5, qui réussit mieux sur la plupart des
00:02:12benchmarks, il est à moitié prix par rapport à Sonnet 5. Il convient de noter ici qu'Artificial Analysis
00:02:16utilise en fait le prix standard du modèle et non le prix réduit, donc je serais super
00:02:20curieux de voir si Anthropic essaie de corriger cela en prolongeant peut-être cette réduction ou simplement en laissant cela
00:02:25comme tarification permanente. Pire encore que le coût par tâche, Artificial Analysis a en fait constaté que pour
00:02:29exécuter toute leur suite de tests, Sonnet 5 a coûté plus cher que Fable 5. Genre, que s'est-il passé ici ? Même sur
00:02:34Cursor Bench, si vous regardez Sonnet 5 High, c'est à peu près le même prix qu'Opus 4.8 pour un résultat
00:02:39similaire, et à mesure que vous augmentez les niveaux d'effort, Sonnet 5 Max obtient de moins bons scores qu'Opus 4.8 extra high tout
00:02:44en coûtant plus cher. On a vraiment l'impression qu'ils ont besoin de mettre à jour ou de corriger quelque chose ici, ou alors je ne vois pas
00:02:48où ce modèle trouve sa place. Ce n'est en aucun cas un mauvais modèle en termes de capacités, juste économiquement, et j'ai
00:02:54été un grand fan des modèles Sonnet. Je pense qu'ils ont été les premiers que beaucoup d'entre nous utilisaient quotidiennement,
00:02:58mais au cours des derniers mois, j'ai toujours utilisé Opus 4.8, et rien de tout cela ne m'a fait changer d'avis.
00:03:02Surtout avec le retour de Fable, ce sera Fable pour les tâches difficiles,
00:03:05et Opus 4.8 pour un usage quotidien, et Sonnet pour rien. En parlant de Fable 5, les contrôles
00:03:11à l'exportation ont été levés, et il est maintenant de retour pour tout le monde, indépendamment de votre citoyenneté, mais malheureusement vous
00:03:15aviez une semaine pour l'utiliser dans les limites de votre forfait, ou au moins 50 % de vos limites de forfait, et après le 7 juillet
00:03:20il ne sera disponible que via des crédits d'utilisation. Il y avait des points intéressants dans ce blog sur
00:03:24l'interdiction initiale. Cela provenait en fait d'un prétendu jailbreak par un chercheur d'Amazon qui a réussi à
00:03:29l'inciter à trouver des vulnérabilités de sécurité, et dans un cas a démontré comment en exploiter une,
00:03:33mais en examinant cela, Anthropic a constaté que de nombreux modèles comme Claude Opus 4.8,
00:03:37GPT 5.5 et Kimi K 2.7 pouvaient identifier exactement la même vulnérabilité que Fable 5 dans ce rapport,
00:03:43et quand il s'agissait d'une démonstration de la façon d'exploiter la seule vulnérabilité,
00:03:47chaque modèle testé pouvait le faire, y compris Claude Haiku 4.5, Sonnet 4.6, Opus 4.6,
00:03:524.7, 4.8, GPT 5.4, 5.5, et Kimi K 2.7. Donc, il me semble que l'interdiction était assez inutile
00:03:58alors, et tout ce qu'elle a vraiment accompli, c'est qu'Anthropic a maintenant rendu ces mesures de protection encore
00:04:02plus strictes sur Fable, faisant en sorte que beaucoup plus de requêtes normales soient bloquées, et dans leur tweet d'annonce
00:04:06ils ont en fait dit que les tâches routinières comme le débogage et le codage seraient redirigées vers Opus 4.8,
00:04:11mais un employé d'Anthropic a plus tard corrigé cela en disant que cela ne devrait concerner qu'un petit nombre d'entre elles.
00:04:14Mais cela a apparemment affecté certains benchmarks plus que d'autres, avec des affirmations selon lesquelles Fable a maintenant été
00:04:18bridé. En gros, il se rabat juste davantage sur Opus 4.8, donc il fonctionne beaucoup moins bien sur ces
00:04:23benchmarks. Sur un sujet similaire aux contrôles à l'exportation et aux interdictions, certaines personnes ont remarqué que Claude
00:04:27code tente désormais d'effectuer une prise d'empreinte de manière très furtive, en modifiant la chaîne de date
00:04:32du système. C'est un excellent article de blog qui détaille tout cela, et je laisserai le lien
00:04:35ci-dessous, mais le résumé est qu'il y a une fonction dans Claude code qui vérifie si votre fuseau horaire est en
00:04:40Chine. Si c'est le cas, votre chaîne de date passera de l'utilisation de tirets à celle de barres obliques. Ensuite, il vérifiera également
00:04:44si votre URL basée sur l'API correspond à cette liste, ou si le nom d'hôte contient des mots-clés de laboratoires d'IA
00:04:49comme DeepSeek, Minimax, ou ZAI, et si c'est le cas, il changera l'apostrophe dans “today's” par un caractère Unicode
00:04:55différent qui ressemble essentiellement au même. C'est une technique très intelligente appelée stéganographie,
00:05:00et la plupart d'entre vous ne seront pas impactés par cela. C'est essentiellement destiné à essayer de détecter ces revendeurs
00:05:03d'API, les passerelles non autorisées vers Claude code, et les attaques par distillation de modèle. Je n'ai pas vraiment de
00:05:08problème avec le fait qu'ils essaient de le faire, je préférerais juste qu'ils soient un peu plus honnêtes sur les choses qui
00:05:12sont dans Claude code, et qu'ils n'essaient pas de le cacher de cette manière. Pensez-vous que ce soit un problème, et que
00:05:16pensez-vous de Sonnet 5 et du retour de Fable ? Faites-le-moi savoir dans les commentaires ci-dessous, ou abonnez-vous,
00:05:20et comme toujours, à la prochaine.