스크립트
00:00:00Anthropic hat letzte Woche Claude Sonnet 5 veröffentlicht, was enttäuschend war, aber immerhin ist Fable 5 zurück,
00:00:04nur vielleicht abgeschwächt, und oh, Claude Code könnte Spyware-ähnlichen Code enthalten, um chinesische
00:00:09Nutzung zu erkennen. Fangen wir an. Ich beginne mit Sonnet 5. Dies ist tatsächlich das erste Sonnet-Update seit vier
00:00:18einhalb Monaten, und Anthropic sagt, es sei ihr bisher agilste Sonnet-Modell,
00:00:22mit einer Leistung nahe an Opus 4.8, aber zu niedrigeren Preisen. Die Preisgestaltung ist bei
00:00:28diesem Modell sehr interessant, daher kommen wir später noch darauf zurück. Zuerst schauen wir uns die Benchmarks an,
00:00:31die Anthropic bereitstellt. Es schlägt seinen Vorgänger in allen, und es nähert sich Opus in einigen
00:00:35wie Terminal Bench und Computer Use, und schlägt Opus sogar leicht bei Wissensarbeit. Ich ziehe es jedoch vor,
00:00:40mir Benchmarks von Drittanbietern anzusehen, und denen von Artificial Analysis vertraue ich,
00:00:44und auf deren Coding-Index liegt es ein paar Punkte hinter Opus, aber sehr knapp vor GPT 5.4. Es hat einen sehr
00:00:50schönen Sprung von seinem Vorgänger, Sonnet 4.6, gemacht. Das Gleiche gilt auch für den Intelligence Index, es liegt
00:00:56zwischen GPT 5.5 und GPT 5.4, aber interessanterweise übertraf es auf dem Agentic Index tatsächlich GPT 5.5.
00:01:03Als sie also in dem Blog sagten, sie hätten viel Arbeit in die agentischen Fähigkeiten gesteckt,
00:01:06scheint sich das hier ausgezahlt zu haben. Von den Benchmarks her sieht es also nach einem ziemlich kompetenten Modell aus,
00:01:10und es ist definitiv ein Fortschritt gegenüber Sonnet 4.6, aber nun sprechen wir über das Preiselement.
00:01:14Bei der API-Preisgestaltung bieten sie tatsächlich einen Rabattpreis von 2 Dollar pro Million Input-Token,
00:01:18und 10 Dollar pro Million Output-Token an, das gilt bis zum 31. August. Danach kehrt es zum gleichen
00:01:23Preis wie bei den anderen Sonnet-Modellen zurück, was 3 Dollar pro Million Input-Token und 15 Dollar pro Million Output-
00:01:28Token waren. Damit liegt es in der Nähe von Gemini 3.5 Flash und GPT 5.6 Terra, falls wir jemals Zugriff darauf erhalten,
00:01:34und wie gesagt, es ist günstiger als Opus 4.8. Das Problem ist jedoch, dass dies in der Praxis
00:01:39überhaupt nicht stimmt. Dieses Modell ist extrem tokenhungrig. Es verbraucht etwa 69.000 Token, um eine Aufgabe im
00:01:45Artificial Analysis Intelligence Index auszuführen, was mehr ist als bei Sonnet 4.6, Opus 4.8, Fable 5, GPT 5.4
00:01:52und 5.5. Wenn man sich das auf diesem Quadranten hier ansieht, wo Grün der Zielbereich ist, ist es so weit
00:01:57wie nur möglich von diesen Modellen entfernt. Das hat natürlich einen Dominoeffekt auf die tatsächlichen Kosten einer Aufgabe,
00:02:02und Artificial Analysis stellte fest, dass Sonnet 5 pro Aufgabe teurer war als Opus 4.8,
00:02:07und nur von Fable übertroffen wurde. Plus, wenn man ein Modell wie GPT 5.5 nimmt, das bei den meisten
00:02:12Benchmarks tatsächlich besser abschneidet, ist es halb so teuer wie Sonnet 5. Es ist erwähnenswert, dass Artificial Analysis
00:02:16tatsächlich den Standardpreis des Modells und nicht den rabattierten Preis verwendet, daher wäre ich super
00:02:20gespannt zu sehen, ob Anthropic versucht, dies zu beheben, indem sie vielleicht den Rabatt verlängern oder ihn einfach
00:02:25als dauerhafte Preisgestaltung beibehalten. Noch schlimmer als die Kosten pro Aufgabe ist, dass Artificial Analysis tatsächlich herausfand, dass
00:02:29die Ausführung ihrer gesamten Testsuite mit Sonnet 5 mehr kostete als mit Fable 5. Also, was ist hier passiert? Selbst bei
00:02:34Cursor Bench, wenn man Sonnet 5 High betrachtet, kostet es in etwa so viel wie Opus 4.8 für ein ähnliches
00:02:39Ergebnis, und wenn man die Anstrengungsstufen erhöht, schneidet Sonnet 5 Max schlechter ab als Opus 4.8 Extra High, während
00:02:44es mehr kostet. Es fühlt sich einfach so an, als müssten sie hier etwas aktualisieren oder reparieren, sonst sehe ich
00:02:48nicht, wo dieses Modell hinpasst. Es ist keineswegs ein schlechtes Modell im Hinblick auf die Fähigkeiten, nur wirtschaftlich, und ich bin
00:02:54ein großer Fan der Sonnet-Modelle. Ich denke, sie waren die ersten, die viele von uns täglich genutzt haben,
00:02:58aber in den letzten Monaten habe ich immer Opus 4.8 verwendet, und nichts davon hat mich dazu gebracht, meine Meinung zu ändern.
00:03:02Besonders da Fable zurück ist, wird es bei schwierigen Aufgaben Fable sein,
00:03:05und für die tägliche Nutzung Opus 4.8, und Sonnet für gar nichts. Apropos Fable 5, die Exportkontrollen
00:03:11wurden aufgehoben, und es ist jetzt wieder für alle verfügbar, unabhängig von der Staatsbürgerschaft, aber leider
00:03:15hatten Sie eine Woche Zeit, dies innerhalb Ihrer Tariflimits zu nutzen, oder zumindest zu 50% Ihrer Tariflimits, und nach dem 7. Juli
00:03:20wird es nur noch über Nutzungsguthaben verfügbar sein. Es gab einige interessante Punkte in diesem Blog über
00:03:24das ursprüngliche Verbot. Es kam tatsächlich von einem angeblichen Jailbreak eines Amazon-Forschers, der es schaffte,
00:03:29es dazu zu bringen, Sicherheitslücken zu finden, und in einem Fall demonstrierte, wie man eine ausnutzt,
00:03:33aber bei der Untersuchung stellte Anthropic fest, dass viele Modelle wie Claude Opus 4.8,
00:03:37GPT 5.5 und Kimi K 2.7 genau dieselbe Sicherheitslücke identifizieren konnten wie Fable 5 in diesem Bericht,
00:03:43und als es darum ging, zu demonstrieren, wie man diese einzelne Sicherheitslücke ausnutzt,
00:03:47konnte jedes einzelne getestete Modell dies tun, einschließlich Claude Haiku 4.5, Sonnet 4.6, Opus 4.6,
00:03:524.7, 4.8, GPT 5.4, 5.5 und Kimi K 2.7. Es scheint mir also, dass das Verbot ziemlich sinnlos war,
00:03:58und alles, was wirklich erreicht wurde, ist, dass Anthropic diese Schutzmaßnahmen jetzt noch
00:04:02strenger bei Fable gemacht hat, was dazu führt, dass viel mehr normale Anfragen blockiert werden, und in ihrer Ankündigung
00:04:06sagten sie sogar, dass Routineaufgaben wie Debugging und Coding auf Opus 4.8 zurückgreifen würden,
00:04:11aber ein Anthropic-Mitarbeiter korrigierte dies später mit der Aussage, dass dies nur eine kleine Anzahl sein sollte.
00:04:14Aber es hat anscheinend einige Benchmarks mehr beeinflusst als andere, mit Behauptungen, dass Fable jetzt
00:04:18abgeschwächt wurde. Im Grunde greift es jetzt öfter auf Opus 4.8 zurück, also schneidet es bei diesen
00:04:23Benchmarks viel schlechter ab. Zu einem ähnlichen Thema wie die Exportkontrollen und die Verbote: Manche Leute bemerkten, dass Claude
00:04:27Code jetzt einige Versuche des Fingerprintings auf sehr hinterhältige Weise unternimmt, indem es seinen System-Datumsstring
00:04:32modifiziert. Dies ist ein großartiger Blogbeitrag, der auf alle Details eingeht, und ich werde ihn
00:04:35unten verlinken, aber der TLDR ist, dass es eine Funktion in Claude Code gibt, die prüft, ob Ihre Zeitzone in
00:04:40China liegt. Wenn das der Fall ist, ändert sich Ihr Datumsstring von Bindestrichen zu Schrägstrichen. Dann prüft es auch,
00:04:44ob Ihre API-basierte URL mit dieser Liste übereinstimmt oder ob der Hostname bestimmte KI-Labor-Schlüsselwörter
00:04:49wie DeepSeq, Minimax oder ZAI enthält, und wenn das der Fall ist, wird das Apostroph in “today's” in ein anderes
00:04:55Unicode-Zeichen geändert, das im Grunde exakt gleich aussieht. Es ist eine sehr clevere Technik namens Steganografie,
00:05:00und die meisten von euch werden davon nicht betroffen sein. Es soll im Grunde versuchen, diese API-Reseller,
00:05:03unautorisierte Claude-Code-Gateways und Model-Distillation-Angriffe zu erkennen. Ich habe kein wirkliches
00:05:08Problem damit, dass sie versuchen, das zu tun, ich würde mir nur wünschen, sie wären etwas ehrlicher über die Dinge,
00:05:12die in Claude Code enthalten sind, und würden nicht versuchen, es auf diese Weise zu verbergen. Denkt ihr, das ist ein Problem, und was
00:05:16haltet ihr von Sonnet 5 und der Rückkehr von Fable? Lasst es mich in den Kommentaren unten wissen, oder seid ihr dort abonniert,
00:05:20und wie immer, wir sehen uns im nächsten.