스크립트
00:00:00Anthropic hat gerade Sonnet 5 veröffentlicht, also gehen wir alles durch, was Sie darüber wissen müssen.
00:00:04Beginnen wir also mit den Benchmarks. Und denken Sie daran, Sonnet 5 ist ein weniger leistungsfähiges,
00:00:08weniger teures Modell als etwa Opus und definitiv Fable. Wir hatten hier kein Upgrade
00:00:13seit 4.6. Wenn wir 5 mit 4.6 vergleichen, sehen wir einen riesigen Sprung nach vorne beim agentischen Programmieren,
00:00:21multidisziplinärem Schlussfolgern, Computernutzung und Wissensarbeit. Also ein echtes Upgrade auf der
00:00:26ganzen Linie. Wenn wir es nun mit Opus 4.8 vergleichen, ist nicht die Frage: Ist es nah dran? Sondern wie groß ist
00:00:32der Leistungsabfall? Und ehrlich gesagt ist der Abfall gar nicht so groß. Tatsächlich liefert es sogar bessere Zahlen
00:00:39bei der Wissensarbeit, was ziemlich verrückt ist. Die Computernutzung liegt nur 2 % dahinter, und es ist nur
00:00:442 % hinter dem agentischen Programmieren und nur einige wenige Prozentpunkte hinter multidisziplinärem
00:00:49Schlussfolgern. Die größte Lücke besteht hier beim Sweebench Pro mit 63 gegenüber 69 %.
00:00:56Aber hey, Terminal Bench 2.1 liegt bei 80 gegenüber 82. Das ist also keine große Lücke. Und diese Diskussion
00:01:03über die Leistung muss im Kontext der Preisgestaltung betrachtet werden. Denken Sie daran, Fable 5, Mythos 5,
00:01:08da liegen wir bei 10 $pro Input-Token, was das Doppelte von Opus ist. Opus kostet 5$ pro Million Input-Token.
00:01:16Und für den Output sind es 25 $. Also 5 $und 25$. Bei Sonnet 5 liegen wir bei 2 $. Das sind also nur 40 % der Kosten von
00:01:26Opus bei den Input-Token. Und für den Output sind es 10 $. Also deutlich günstiger, weniger als die Hälfte der Kosten von
00:01:34Opus. Und doch, wenn wir uns die Zahlen ansehen, ist es ziemlich nah dran. Das sind also großartige Neuigkeiten, wenn Sie jemand sind,
00:01:40der keine hochspezialisierten KI-Aufgaben erledigt, sondern Routineaufgaben, und Sie
00:01:46dennoch Leistung benötigen – nun, Sonnet 5 schließt diese Lücke jetzt. Schauen wir uns nun diese Diagramme an, die über
00:01:51die Benchmarks hinausgehen. Hier betrachten wir die agentische Suchleistung nach Aufwand, im Vergleich
00:01:55von Opus 4.8 mit Sonnet 5 und Sonnet 4.6. Sofort werden Sie hier bemerken, bei Sonnet 5 gibt es eine riesige
00:02:04Lücke bei den Erfolgsquoten, wenn wir zwischen den Aufwandsstufen wechseln. Bei „Niedrig“ erreicht es 55 %. Wenn wir uns aber
00:02:13„Niedrig“ bei Sonnet 4.6 ansehen, schneidet Sonnet 4.6 sogar besser ab. Dennoch sind die Kosten viel niedriger.
00:02:19Gehen wir zu „Mittel“ über, erhalten wir im Wesentlichen die gleiche Leistung wie bei Sonnet 4.6,
00:02:25aber zu einem deutlichen Rabatt. Und erst wenn wir auf hohe Aufwandsstufen gehen, beginnen wir, Sonnet 4.6
00:02:34zu übertreffen. Aber zu diesem Zeitpunkt erhalten wir eine bessere Leistung als bei Sonnet 4.6, aber zu Kosten, die
00:02:41bei Sonnet 4.6 der niedrigen Aufwandsstufe entsprochen hätten. Diese Art der Unterscheidung nach Aufwand,
00:02:49halte ich für sehr wichtig, denn es heißt nicht einfach: Hey, Sonnet 5 ist durch die Bank besser, wo „Niedrig“
00:02:53bei 5 zwangsläufig besser ist als bei 4.6. „Niedrig“ bei Sonnet 5 bedeutet eigentlich nur, dass es extrem
00:02:59günstig ist. Aber im Hinblick auf eine höhere Leistung, was wir in der Vergangenheit gesehen haben,
00:03:03muss man wahrscheinlich etwas im hohen Bereich tun. Wenn wir uns jedoch im hohen
00:03:08Bereich mit Sonnet 5 befinden, zahlen wir im Grunde das Gleiche wie mit Opus. Opus kostet bei „Mittel“
00:03:14und „Hoch“ genauso viel wie Sonnet bei „Hoch“, aber wir erhalten eine bessere Erfolgsquote. Das bringt also
00:03:21viel Nuance in diese Diskussion. Müssen wir Sonnet 5 gegenüber Opus 4.5 und Dingen wie
00:03:27agentischer Suche verwenden? Ich denke, es kommt wirklich darauf an. Bei komplexeren Problemen könnte Opus 4.8 am Ende
00:03:33günstiger sein, einfach weil es so token-effizient ist und Sonnet für die Aufgabe einfach nicht geeignet ist.
00:03:38Wenn wir jedoch Aufgaben erledigen, die für diese KI-Modelle nicht so herausfordernd sind, dann ergibt es vielleicht
00:03:44überhaupt keinen Sinn, Opus 4.8 zu verwenden. Dann kommt Sonnet 5 ins Spiel. Ich denke also, das ist
00:03:49eine interessante Situation, in der wir uns jetzt befinden, wo es von Fall zu Fall entschieden werden muss,
00:03:54welches Modell man verwenden sollte. Hier ist noch ein interessanter Punkt, wenn wir uns die agentische Computernutzung ansehen. Nun, im Großen und Ganzen
00:03:58schlägt Sonnet 5 meistens Sonnet 4.6 und tut dies zu recht niedrigen Kosten. Also,
00:04:05agentische Suche, das war definitiv nicht der Fall, aber agentische Computernutzung, plötzlich
00:04:09würden wir immer Sonnet 5 gegenüber 4.6 bevorzugen. Und wieder führt das zu der Idee, dass es jetzt eine Sache
00:04:14von Fall zu Fall ist, welches Modell Sie verwenden sollten. Interessanterweise aber, schauen Sie sich Opus an. Opus „Hoch“ leistet
00:04:20besser als das maximale Sonnet 5 und ist günstiger. Also, ich meine, man schaut sich das an und denkt sich:
00:04:26Wow, Opus ist eigentlich ziemlich effizient für das, was es tut. Ganz zu schweigen davon, dass es diese höheren
00:04:30Ebenen erreicht, die Sonnet einfach nicht erreichen kann. Dinge, über die man nachdenken sollte; ehrlich gesagt, nur weil die Kosten pro Million
00:04:36Token bei Opus günstiger sind, wird es viele Fälle geben, in denen Opus immer noch das Beste ist. Nun, ich möchte
00:04:41keine Anthropic-Modellveröffentlichung abschließen, ohne über falsch ausgerichtetes Verhalten zu sprechen. Wir können sehen, dass es eine Verbesserung
00:04:45bei Sonnet 5 ist, aber immer noch hinter dem, was wir von Opus 4.8 und Mythos Preview erwarten würden. Und in Bezug auf
00:04:50Exploits und diese ganze Cybersicherheitsfrage, die Mythos so ziemlich lahmgelegt hat, das ist kein
00:04:55Problem oder etwas, worüber Sie sich bei der Sonnet-Klasse Sorgen machen müssen. Insgesamt würde ich diesen Benchmarks ehrlich gesagt nicht zu viel
00:04:59Aufmerksamkeit schenken. Diese Art von Benchmarks, diese Art von Diagrammen lassen mich viel
00:05:05eher innehalten, denn die Frage ist meiner Meinung nach nicht Sonnet 5 gegenüber 4.6. Wir werden so ziemlich immer
00:05:11Sonnet 5 verwenden. Es ist Sonnet 5 gegenüber Opus 4.8. Und die Frage ist: Ist Opus eigentlich günstiger? Und
00:05:18ich würde gerne mehr Tests und mehr Material von Anthropic sehen, das irgendwie darlegt, hier ist so
00:05:24eine Art Demarkationslinie zwischen, okay, Sonnet 5 kann das ganz gut und ist günstiger als
00:05:29Opus gegenüber, hey, das ist jetzt eine kompliziertere Aufgabe. Opus wird bei der Erledigung effizienter sein als
00:05:34Sonnet. Also Dinge, über die man nachdenken sollte, definitiv ein „Nice-to-have“. Ich denke insgesamt,
00:05:40Aufgaben auf niedrigerer Ebene werden ein Segen sein, denn für diejenigen unter uns, die API-Token für, wissen Sie,
00:05:46unsere Anwendungen oder Dinge, die nicht im Claude-Max-Plan-Ökosystem sind, verwenden, ist es ziemlich schwer, Anthropic zu nutzen.
00:05:51Es ist einfach so verdammt teuer. Und ich sage den Leuten schon lange: Schaut einfach mal
00:05:55bei OpenAI vorbei, seht euch einige ihrer Mini-Modelle an, denn das ist oft mehr als genug für die Arbeit vieler Leute.
00:05:59Nun, wir haben jetzt so etwas wie eine Mittelklasse-Option bei Anthropic, was eine nette
00:06:05Sache ist. Also, das ist der Punkt, an dem ich euch heute zurücklasse. Das ist überall verfügbar. Ich denke,
00:06:09es wird viel Ausprobieren erfordern, um herauszufinden, wo das am meisten Sinn ergibt. Also lasst mich wissen,
00:06:13was ihr darüber denkt. Schaut euch unbedingt „Chase AI Plus“ an, wenn ihr Zugang zu meiner Claude
00:06:17Code Masterclass haben wollt, und wir sehen uns.