Claude Sonnet 3.5 est une déception... (Mais Fable est de retour !)

BBetter Stack
컴퓨터/소프트웨어경제 뉴스AI/미래기술

스크립트

00:00:00Anthropic a lancé Claude Sonnet 5 la semaine dernière et c'était décevant, mais au moins Fable 5 est de retour,
00:00:04juste peut-être bridé, et oh, Claude Code pourrait contenir du code proche d'un logiciel espion pour détecter
00:00:09l'utilisation en Chine. Plongeons dans le vif du sujet. Je vais commencer par Sonnet 5. C'est en fait la première mise à jour de Sonnet en quatre
00:00:18mois et demi, et Anthropic affirme que c'est leur modèle Sonnet le plus agentique à ce jour,
00:00:22avec des performances proches d'Opus 4.8, mais à des prix inférieurs. La tarification est vraiment un point intéressant avec
00:00:28ce modèle, donc nous y reviendrons. D'abord, jetons un œil aux benchmarks
00:00:31fournis par Anthropic. Il bat son prédécesseur sur tous ces points, et il se rapproche d'Opus sur quelques-uns
00:00:35comme Terminal Bench et Computer Use, battant même légèrement Opus dans le travail intellectuel. Je préfère regarder
00:00:40les benchmarks tiers cependant, et ceux en qui j'ai confiance proviennent d'Artificial Analysis, et sur cet
00:00:44index de codage, il arrive quelques points derrière Opus, mais très légèrement devant GPT 5.4. Il a fait un très
00:00:50beau bond par rapport à son prédécesseur, Sonnet 4.6. C'est la même histoire sur l'Intelligence Index également, placé
00:00:56entre GPT 5.5 et GPT 5.4, mais fait intéressant, sur l'index agentique, il a en fait surpassé GPT 5.5.
00:01:03Donc, quand ils ont dit dans ce blog qu'ils avaient beaucoup travaillé sur ses capacités agentiques,
00:01:06ça semble avoir porté ses fruits ici. D'après les benchmarks, il semble être un modèle assez compétent,
00:01:10et c'est certainement une amélioration par rapport à Sonnet 4.6, mais parlons maintenant de cet élément de prix.
00:01:14Concernant la tarification de l'API, ils proposent en fait un prix réduit à 2 $ pour un million de jetons d'entrée,
00:01:18et 10 $ pour un million de jetons de sortie, cela jusqu'au 31 août. Ensuite, il reviendra au même
00:01:23prix que les autres modèles Sonnet, soit 3 $pour un million de jetons d'entrée et 15$ pour un million de jetons
00:01:28de sortie. Cela le place autour de Gemini 3.5 Flash et GPT 5.6 Terra, si jamais nous y avons accès,
00:01:34et comme ils l'ont dit, c'est moins cher qu'Opus 4.8. Le problème est cependant, en pratique, ce n'est tout simplement
00:01:39pas vrai du tout. Ce modèle est extrêmement gourmand en jetons. Il utilise environ 69 000 jetons pour exécuter une tâche dans
00:01:45l'Intelligence Index d'Artificial Analysis, ce qui le rend plus coûteux que Sonnet 4.6, Opus 4.8, Fable 5, GPT 5.4,
00:01:52et 5.5. Si vous regardez ce quadrant ici, où le vert est la place idéale, il en est aussi éloigné
00:01:57que possible parmi ces modèles. Cela a évidemment un effet d'entraînement sur le coût réel d'une tâche,
00:02:02et Artificial Analysis a constaté que Sonnet 5 s'avère plus cher qu'Opus 4.8 par tâche,
00:02:07seulement battu par Fable. De plus, si vous prenez un modèle comme GPT 5.5, qui réussit mieux sur la plupart des
00:02:12benchmarks, il est à moitié prix par rapport à Sonnet 5. Il convient de noter ici qu'Artificial Analysis
00:02:16utilise en fait le prix standard du modèle et non le prix réduit, donc je serais super
00:02:20curieux de voir si Anthropic essaie de corriger cela en prolongeant peut-être cette réduction ou simplement en laissant cela
00:02:25comme tarification permanente. Pire encore que le coût par tâche, Artificial Analysis a en fait constaté que pour
00:02:29exécuter toute leur suite de tests, Sonnet 5 a coûté plus cher que Fable 5. Genre, que s'est-il passé ici ? Même sur
00:02:34Cursor Bench, si vous regardez Sonnet 5 High, c'est à peu près le même prix qu'Opus 4.8 pour un résultat
00:02:39similaire, et à mesure que vous augmentez les niveaux d'effort, Sonnet 5 Max obtient de moins bons scores qu'Opus 4.8 extra high tout
00:02:44en coûtant plus cher. On a vraiment l'impression qu'ils ont besoin de mettre à jour ou de corriger quelque chose ici, ou alors je ne vois pas
00:02:48où ce modèle trouve sa place. Ce n'est en aucun cas un mauvais modèle en termes de capacités, juste économiquement, et j'ai
00:02:54été un grand fan des modèles Sonnet. Je pense qu'ils ont été les premiers que beaucoup d'entre nous utilisaient quotidiennement,
00:02:58mais au cours des derniers mois, j'ai toujours utilisé Opus 4.8, et rien de tout cela ne m'a fait changer d'avis.
00:03:02Surtout avec le retour de Fable, ce sera Fable pour les tâches difficiles,
00:03:05et Opus 4.8 pour un usage quotidien, et Sonnet pour rien. En parlant de Fable 5, les contrôles
00:03:11à l'exportation ont été levés, et il est maintenant de retour pour tout le monde, indépendamment de votre citoyenneté, mais malheureusement vous
00:03:15aviez une semaine pour l'utiliser dans les limites de votre forfait, ou au moins 50 % de vos limites de forfait, et après le 7 juillet
00:03:20il ne sera disponible que via des crédits d'utilisation. Il y avait des points intéressants dans ce blog sur
00:03:24l'interdiction initiale. Cela provenait en fait d'un prétendu jailbreak par un chercheur d'Amazon qui a réussi à
00:03:29l'inciter à trouver des vulnérabilités de sécurité, et dans un cas a démontré comment en exploiter une,
00:03:33mais en examinant cela, Anthropic a constaté que de nombreux modèles comme Claude Opus 4.8,
00:03:37GPT 5.5 et Kimi K 2.7 pouvaient identifier exactement la même vulnérabilité que Fable 5 dans ce rapport,
00:03:43et quand il s'agissait d'une démonstration de la façon d'exploiter la seule vulnérabilité,
00:03:47chaque modèle testé pouvait le faire, y compris Claude Haiku 4.5, Sonnet 4.6, Opus 4.6,
00:03:524.7, 4.8, GPT 5.4, 5.5, et Kimi K 2.7. Donc, il me semble que l'interdiction était assez inutile
00:03:58alors, et tout ce qu'elle a vraiment accompli, c'est qu'Anthropic a maintenant rendu ces mesures de protection encore
00:04:02plus strictes sur Fable, faisant en sorte que beaucoup plus de requêtes normales soient bloquées, et dans leur tweet d'annonce
00:04:06ils ont en fait dit que les tâches routinières comme le débogage et le codage seraient redirigées vers Opus 4.8,
00:04:11mais un employé d'Anthropic a plus tard corrigé cela en disant que cela ne devrait concerner qu'un petit nombre d'entre elles.
00:04:14Mais cela a apparemment affecté certains benchmarks plus que d'autres, avec des affirmations selon lesquelles Fable a maintenant été
00:04:18bridé. En gros, il se rabat juste davantage sur Opus 4.8, donc il fonctionne beaucoup moins bien sur ces
00:04:23benchmarks. Sur un sujet similaire aux contrôles à l'exportation et aux interdictions, certaines personnes ont remarqué que Claude
00:04:27code tente désormais d'effectuer une prise d'empreinte de manière très furtive, en modifiant la chaîne de date
00:04:32du système. C'est un excellent article de blog qui détaille tout cela, et je laisserai le lien
00:04:35ci-dessous, mais le résumé est qu'il y a une fonction dans Claude code qui vérifie si votre fuseau horaire est en
00:04:40Chine. Si c'est le cas, votre chaîne de date passera de l'utilisation de tirets à celle de barres obliques. Ensuite, il vérifiera également
00:04:44si votre URL basée sur l'API correspond à cette liste, ou si le nom d'hôte contient des mots-clés de laboratoires d'IA
00:04:49comme DeepSeek, Minimax, ou ZAI, et si c'est le cas, il changera l'apostrophe dans “today's” par un caractère Unicode
00:04:55différent qui ressemble essentiellement au même. C'est une technique très intelligente appelée stéganographie,
00:05:00et la plupart d'entre vous ne seront pas impactés par cela. C'est essentiellement destiné à essayer de détecter ces revendeurs
00:05:03d'API, les passerelles non autorisées vers Claude code, et les attaques par distillation de modèle. Je n'ai pas vraiment de
00:05:08problème avec le fait qu'ils essaient de le faire, je préférerais juste qu'ils soient un peu plus honnêtes sur les choses qui
00:05:12sont dans Claude code, et qu'ils n'essaient pas de le cacher de cette manière. Pensez-vous que ce soit un problème, et que
00:05:16pensez-vous de Sonnet 5 et du retour de Fable ? Faites-le-moi savoir dans les commentaires ci-dessous, ou abonnez-vous,
00:05:20et comme toujours, à la prochaine.

핵심 요약

Claude Sonnet 5 déçoit par son manque de rentabilité économique par rapport à Opus 4.8, tandis que le retour de Fable 5 s'accompagne de restrictions de sécurité renforcées et d'une tarification basée sur des crédits.

하이라이트

  • Claude Sonnet 5 est plus coûteux que Claude Opus 4.8 par tâche en raison d'une consommation élevée de 69 000 jetons par opération.

  • Le modèle GPT 5.5 surpasse Claude Sonnet 5 sur la majorité des benchmarks tout en coûtant deux fois moins cher.

  • Le modèle Fable 5, bien que de retour pour tous les utilisateurs, est désormais soumis à des mesures de protection plus strictes et à un système de crédits d'utilisation après le 7 juillet.

  • Claude Code intègre une technique de stéganographie utilisant des caractères Unicode pour détecter les revendeurs d'API et les passerelles non autorisées en Chine.

  • Les contrôles à l'exportation appliqués à Fable 5 étaient initialement basés sur une vulnérabilité que tous les autres modèles majeurs, y compris GPT 5.5, pouvaient également identifier.

타임라인

Analyse de performance et tarification de Claude Sonnet 5

  • Claude Sonnet 5 surpasse les versions précédentes sur les benchmarks d'agentivité.
  • Le coût opérationnel réel est nettement plus élevé que prévu en raison d'une consommation excessive de jetons.
  • Opus 4.8 reste plus compétitif que Sonnet 5 pour les tâches quotidiennes et complexes en termes de rapport coût-performance.

Bien que les benchmarks officiels montrent des progrès, les données d'Artificial Analysis révèlent que Sonnet 5 consomme environ 69 000 jetons pour une seule tâche. Ce volume de consommation rend le modèle moins économique qu'Opus 4.8 ou GPT 5.5. Le prix réduit de l'API est temporaire jusqu'au 31 août, après quoi les tarifs augmentent, accentuant le manque d'attrait économique du modèle.

Retour et bridage de Fable 5

  • Fable 5 est de nouveau accessible à tous sans distinction de citoyenneté.
  • L'accès est limité par des crédits après le 7 juillet.
  • Les mesures de protection renforcées réduisent les performances du modèle sur les tâches de codage routinier.

L'interdiction initiale de Fable 5, justifiée par la détection de vulnérabilités, s'est révélée peu pertinente puisque tous les modèles concurrents comme GPT 5.5 et Claude Opus 4.8 pouvaient reproduire les mêmes exploits. Désormais, le modèle est plus restrictif, redirigeant fréquemment les requêtes de codage vers Opus 4.8, ce qui dégrade ses résultats sur les tests de performance.

Mécanismes de détection furtive dans Claude Code

  • Claude Code utilise la stéganographie pour vérifier la localisation géographique de l'utilisateur.
  • La modification de caractères Unicode vise à identifier les revendeurs d'API non autorisés.
  • L'absence de transparence sur ces fonctions de détection soulève des interrogations sur les pratiques de développement.

Une analyse du code révèle des fonctions furtives qui modifient la mise en forme des dates et utilisent des caractères Unicode spécifiques pour détecter si l'API est utilisée depuis des zones géographiques restreintes ou par des laboratoires d'IA concurrents. Ces méthodes visent à contrer les attaques par distillation et les passerelles non autorisées, bien que la dissimulation de ces mécanismes manque de transparence.

커뮤니티 글

모든 글 보기