Claude Sonnet 5 ist eine Enttäuschung... (Fable ist aber zurück!)

BBetter Stack
컴퓨터/소프트웨어경제 뉴스AI/미래기술

스크립트

00:00:00Anthropic hat letzte Woche Claude Sonnet 5 veröffentlicht, was enttäuschend war, aber immerhin ist Fable 5 zurück,
00:00:04nur vielleicht abgeschwächt, und oh, Claude Code könnte Spyware-ähnlichen Code enthalten, um chinesische
00:00:09Nutzung zu erkennen. Fangen wir an. Ich beginne mit Sonnet 5. Dies ist tatsächlich das erste Sonnet-Update seit vier
00:00:18einhalb Monaten, und Anthropic sagt, es sei ihr bisher agilste Sonnet-Modell,
00:00:22mit einer Leistung nahe an Opus 4.8, aber zu niedrigeren Preisen. Die Preisgestaltung ist bei
00:00:28diesem Modell sehr interessant, daher kommen wir später noch darauf zurück. Zuerst schauen wir uns die Benchmarks an,
00:00:31die Anthropic bereitstellt. Es schlägt seinen Vorgänger in allen, und es nähert sich Opus in einigen
00:00:35wie Terminal Bench und Computer Use, und schlägt Opus sogar leicht bei Wissensarbeit. Ich ziehe es jedoch vor,
00:00:40mir Benchmarks von Drittanbietern anzusehen, und denen von Artificial Analysis vertraue ich,
00:00:44und auf deren Coding-Index liegt es ein paar Punkte hinter Opus, aber sehr knapp vor GPT 5.4. Es hat einen sehr
00:00:50schönen Sprung von seinem Vorgänger, Sonnet 4.6, gemacht. Das Gleiche gilt auch für den Intelligence Index, es liegt
00:00:56zwischen GPT 5.5 und GPT 5.4, aber interessanterweise übertraf es auf dem Agentic Index tatsächlich GPT 5.5.
00:01:03Als sie also in dem Blog sagten, sie hätten viel Arbeit in die agentischen Fähigkeiten gesteckt,
00:01:06scheint sich das hier ausgezahlt zu haben. Von den Benchmarks her sieht es also nach einem ziemlich kompetenten Modell aus,
00:01:10und es ist definitiv ein Fortschritt gegenüber Sonnet 4.6, aber nun sprechen wir über das Preiselement.
00:01:14Bei der API-Preisgestaltung bieten sie tatsächlich einen Rabattpreis von 2 Dollar pro Million Input-Token,
00:01:18und 10 Dollar pro Million Output-Token an, das gilt bis zum 31. August. Danach kehrt es zum gleichen
00:01:23Preis wie bei den anderen Sonnet-Modellen zurück, was 3 Dollar pro Million Input-Token und 15 Dollar pro Million Output-
00:01:28Token waren. Damit liegt es in der Nähe von Gemini 3.5 Flash und GPT 5.6 Terra, falls wir jemals Zugriff darauf erhalten,
00:01:34und wie gesagt, es ist günstiger als Opus 4.8. Das Problem ist jedoch, dass dies in der Praxis
00:01:39überhaupt nicht stimmt. Dieses Modell ist extrem tokenhungrig. Es verbraucht etwa 69.000 Token, um eine Aufgabe im
00:01:45Artificial Analysis Intelligence Index auszuführen, was mehr ist als bei Sonnet 4.6, Opus 4.8, Fable 5, GPT 5.4
00:01:52und 5.5. Wenn man sich das auf diesem Quadranten hier ansieht, wo Grün der Zielbereich ist, ist es so weit
00:01:57wie nur möglich von diesen Modellen entfernt. Das hat natürlich einen Dominoeffekt auf die tatsächlichen Kosten einer Aufgabe,
00:02:02und Artificial Analysis stellte fest, dass Sonnet 5 pro Aufgabe teurer war als Opus 4.8,
00:02:07und nur von Fable übertroffen wurde. Plus, wenn man ein Modell wie GPT 5.5 nimmt, das bei den meisten
00:02:12Benchmarks tatsächlich besser abschneidet, ist es halb so teuer wie Sonnet 5. Es ist erwähnenswert, dass Artificial Analysis
00:02:16tatsächlich den Standardpreis des Modells und nicht den rabattierten Preis verwendet, daher wäre ich super
00:02:20gespannt zu sehen, ob Anthropic versucht, dies zu beheben, indem sie vielleicht den Rabatt verlängern oder ihn einfach
00:02:25als dauerhafte Preisgestaltung beibehalten. Noch schlimmer als die Kosten pro Aufgabe ist, dass Artificial Analysis tatsächlich herausfand, dass
00:02:29die Ausführung ihrer gesamten Testsuite mit Sonnet 5 mehr kostete als mit Fable 5. Also, was ist hier passiert? Selbst bei
00:02:34Cursor Bench, wenn man Sonnet 5 High betrachtet, kostet es in etwa so viel wie Opus 4.8 für ein ähnliches
00:02:39Ergebnis, und wenn man die Anstrengungsstufen erhöht, schneidet Sonnet 5 Max schlechter ab als Opus 4.8 Extra High, während
00:02:44es mehr kostet. Es fühlt sich einfach so an, als müssten sie hier etwas aktualisieren oder reparieren, sonst sehe ich
00:02:48nicht, wo dieses Modell hinpasst. Es ist keineswegs ein schlechtes Modell im Hinblick auf die Fähigkeiten, nur wirtschaftlich, und ich bin
00:02:54ein großer Fan der Sonnet-Modelle. Ich denke, sie waren die ersten, die viele von uns täglich genutzt haben,
00:02:58aber in den letzten Monaten habe ich immer Opus 4.8 verwendet, und nichts davon hat mich dazu gebracht, meine Meinung zu ändern.
00:03:02Besonders da Fable zurück ist, wird es bei schwierigen Aufgaben Fable sein,
00:03:05und für die tägliche Nutzung Opus 4.8, und Sonnet für gar nichts. Apropos Fable 5, die Exportkontrollen
00:03:11wurden aufgehoben, und es ist jetzt wieder für alle verfügbar, unabhängig von der Staatsbürgerschaft, aber leider
00:03:15hatten Sie eine Woche Zeit, dies innerhalb Ihrer Tariflimits zu nutzen, oder zumindest zu 50% Ihrer Tariflimits, und nach dem 7. Juli
00:03:20wird es nur noch über Nutzungsguthaben verfügbar sein. Es gab einige interessante Punkte in diesem Blog über
00:03:24das ursprüngliche Verbot. Es kam tatsächlich von einem angeblichen Jailbreak eines Amazon-Forschers, der es schaffte,
00:03:29es dazu zu bringen, Sicherheitslücken zu finden, und in einem Fall demonstrierte, wie man eine ausnutzt,
00:03:33aber bei der Untersuchung stellte Anthropic fest, dass viele Modelle wie Claude Opus 4.8,
00:03:37GPT 5.5 und Kimi K 2.7 genau dieselbe Sicherheitslücke identifizieren konnten wie Fable 5 in diesem Bericht,
00:03:43und als es darum ging, zu demonstrieren, wie man diese einzelne Sicherheitslücke ausnutzt,
00:03:47konnte jedes einzelne getestete Modell dies tun, einschließlich Claude Haiku 4.5, Sonnet 4.6, Opus 4.6,
00:03:524.7, 4.8, GPT 5.4, 5.5 und Kimi K 2.7. Es scheint mir also, dass das Verbot ziemlich sinnlos war,
00:03:58und alles, was wirklich erreicht wurde, ist, dass Anthropic diese Schutzmaßnahmen jetzt noch
00:04:02strenger bei Fable gemacht hat, was dazu führt, dass viel mehr normale Anfragen blockiert werden, und in ihrer Ankündigung
00:04:06sagten sie sogar, dass Routineaufgaben wie Debugging und Coding auf Opus 4.8 zurückgreifen würden,
00:04:11aber ein Anthropic-Mitarbeiter korrigierte dies später mit der Aussage, dass dies nur eine kleine Anzahl sein sollte.
00:04:14Aber es hat anscheinend einige Benchmarks mehr beeinflusst als andere, mit Behauptungen, dass Fable jetzt
00:04:18abgeschwächt wurde. Im Grunde greift es jetzt öfter auf Opus 4.8 zurück, also schneidet es bei diesen
00:04:23Benchmarks viel schlechter ab. Zu einem ähnlichen Thema wie die Exportkontrollen und die Verbote: Manche Leute bemerkten, dass Claude
00:04:27Code jetzt einige Versuche des Fingerprintings auf sehr hinterhältige Weise unternimmt, indem es seinen System-Datumsstring
00:04:32modifiziert. Dies ist ein großartiger Blogbeitrag, der auf alle Details eingeht, und ich werde ihn
00:04:35unten verlinken, aber der TLDR ist, dass es eine Funktion in Claude Code gibt, die prüft, ob Ihre Zeitzone in
00:04:40China liegt. Wenn das der Fall ist, ändert sich Ihr Datumsstring von Bindestrichen zu Schrägstrichen. Dann prüft es auch,
00:04:44ob Ihre API-basierte URL mit dieser Liste übereinstimmt oder ob der Hostname bestimmte KI-Labor-Schlüsselwörter
00:04:49wie DeepSeq, Minimax oder ZAI enthält, und wenn das der Fall ist, wird das Apostroph in “today's” in ein anderes
00:04:55Unicode-Zeichen geändert, das im Grunde exakt gleich aussieht. Es ist eine sehr clevere Technik namens Steganografie,
00:05:00und die meisten von euch werden davon nicht betroffen sein. Es soll im Grunde versuchen, diese API-Reseller,
00:05:03unautorisierte Claude-Code-Gateways und Model-Distillation-Angriffe zu erkennen. Ich habe kein wirkliches
00:05:08Problem damit, dass sie versuchen, das zu tun, ich würde mir nur wünschen, sie wären etwas ehrlicher über die Dinge,
00:05:12die in Claude Code enthalten sind, und würden nicht versuchen, es auf diese Weise zu verbergen. Denkt ihr, das ist ein Problem, und was
00:05:16haltet ihr von Sonnet 5 und der Rückkehr von Fable? Lasst es mich in den Kommentaren unten wissen, oder seid ihr dort abonniert,
00:05:20und wie immer, wir sehen uns im nächsten.

핵심 요약

Claude Sonnet 5 enttäuscht durch ineffizientes Token-Management und hohe Kosten pro Aufgabe, während Fable 5 zwar global zurückkehrt, aber durch strengere Filter an Nutzbarkeit einbüßt.

하이라이트

  • Das neue Modell Claude Sonnet 5 zeigt eine im Vergleich zum Vorgänger höhere Kostenintensität durch einen extrem hohen Token-Verbrauch bei Standardaufgaben.

  • Bei der Ausführung von Testreihen wie dem Artificial Analysis Intelligence Index verbraucht Sonnet 5 etwa 69.000 Token, was den Verbrauch von Opus 4.8, Fable 5 und GPT 5.5 deutlich übersteigt.

  • Trotz angekündigter Rabatte bis zum 31. August ist Sonnet 5 in der Praxis bei vielen Aufgaben teurer als das leistungsfähigere Opus 4.8.

  • Fable 5 steht nach der Aufhebung der Exportkontrollen wieder global zur Verfügung, jedoch mit strengeren Schutzmaßnahmen, die häufiger zu Fehlern bei Routineaufgaben führen.

  • Claude Code nutzt Steganografie, um die Nutzung durch API-Reseller und unautorisierte Gateways zu erkennen, indem Datums- und Textformate subtil manipuliert werden.

타임라인

Bewertung von Claude Sonnet 5

  • Sonnet 5 zeigt trotz verbesserter agentischer Fähigkeiten eine mangelhafte wirtschaftliche Effizienz.
  • Das Modell verbraucht pro Aufgabe deutlich mehr Token als die Konkurrenzmodelle GPT 5.5 oder Opus 4.8.
  • Die API-Preisgestaltung wird durch den hohen Token-Bedarf faktisch entwertet.

Obwohl Sonnet 5 auf Benchmarks für Wissensarbeit und agentische Fähigkeiten Fortschritte erzielt, ist die Praxisleistung ernüchternd. Der extrem hohe Token-Verbrauch macht das Modell pro Aufgabe teurer als Opus 4.8, obwohl es als günstigere Alternative vermarktet wird. Selbst reduzierte Preise bis Ende August können die ineffiziente Token-Nutzung nicht kompensieren, was den Einsatzbereich des Modells stark einschränkt.

Rückkehr von Fable 5

  • Fable 5 ist nach der Aufhebung der Exportbeschränkungen wieder für alle Nutzer weltweit verfügbar.
  • Strengere Sicherheitsfilter bei Fable 5 führen dazu, dass vermehrt Routineanfragen im Coding und Debugging blockiert werden.
  • Das ursprüngliche Verbot basierte auf einer Sicherheitslücke, die jedoch bei nahezu allen gängigen KI-Modellen identisch auftrat.

Die Rückkehr von Fable 5 wird durch eine deutlich restriktivere Konfiguration überschattet. Anthropic hat die Schutzmaßnahmen nach dem Vorfall mit dem Amazon-Forscher so weit verschärft, dass das Modell bei alltäglichen Aufgaben häufiger aussetzt und auf Opus 4.8 zurückgreifen muss. Die Analyse zeigt, dass das Sicherheitsrisiko, das zum Verbot führte, kein exklusives Problem von Fable 5 war, sondern eine allgemeine Herausforderung aktueller Sprachmodelle darstellt.

Steganografie in Claude Code

  • Claude Code erkennt unautorisierte Zugriffe durch versteckte Manipulationen im Text und bei Datumsformaten.
  • Chinesische Nutzer werden durch die Änderung von Datums-Trennzeichen identifiziert.
  • Die Verwendung spezieller Unicode-Zeichen dient als Fingerabdruck gegen API-Reseller.

Die Software implementiert eine steganografische Überprüfung, um unerlaubte API-Gateways zu identifizieren. Durch die gezielte Änderung von Satzzeichen – etwa eines Apostrophs in ein visuell identisches Unicode-Äquivalent – oder die Modifikation von Datumsstrings werden bestimmte Nutzergruppen markiert. Diese Methoden dienen primär dazu, unautorisierte Reseller und Distillation-Angriffe aufzuspüren, wobei die Intransparenz der Implementierung kritisch betrachtet wird.

커뮤니티 글

모든 글 보기