Sonnet 3.5 ist live und konkurriert mit Opus

CChase AI
컴퓨터/소프트웨어창업/스타트업경영/리더십

스크립트

00:00:00Anthropic hat gerade Sonnet 5 veröffentlicht, also gehen wir alles durch, was Sie darüber wissen müssen.
00:00:04Beginnen wir also mit den Benchmarks. Und denken Sie daran, Sonnet 5 ist ein weniger leistungsfähiges,
00:00:08weniger teures Modell als etwa Opus und definitiv Fable. Wir hatten hier kein Upgrade
00:00:13seit 4.6. Wenn wir 5 mit 4.6 vergleichen, sehen wir einen riesigen Sprung nach vorne beim agentischen Programmieren,
00:00:21multidisziplinärem Schlussfolgern, Computernutzung und Wissensarbeit. Also ein echtes Upgrade auf der
00:00:26ganzen Linie. Wenn wir es nun mit Opus 4.8 vergleichen, ist nicht die Frage: Ist es nah dran? Sondern wie groß ist
00:00:32der Leistungsabfall? Und ehrlich gesagt ist der Abfall gar nicht so groß. Tatsächlich liefert es sogar bessere Zahlen
00:00:39bei der Wissensarbeit, was ziemlich verrückt ist. Die Computernutzung liegt nur 2 % dahinter, und es ist nur
00:00:442 % hinter dem agentischen Programmieren und nur einige wenige Prozentpunkte hinter multidisziplinärem
00:00:49Schlussfolgern. Die größte Lücke besteht hier beim Sweebench Pro mit 63 gegenüber 69 %.
00:00:56Aber hey, Terminal Bench 2.1 liegt bei 80 gegenüber 82. Das ist also keine große Lücke. Und diese Diskussion
00:01:03über die Leistung muss im Kontext der Preisgestaltung betrachtet werden. Denken Sie daran, Fable 5, Mythos 5,
00:01:08da liegen wir bei 10 $pro Input-Token, was das Doppelte von Opus ist. Opus kostet 5$ pro Million Input-Token.
00:01:16Und für den Output sind es 25 $. Also 5 $und 25$. Bei Sonnet 5 liegen wir bei 2 $. Das sind also nur 40 % der Kosten von
00:01:26Opus bei den Input-Token. Und für den Output sind es 10 $. Also deutlich günstiger, weniger als die Hälfte der Kosten von
00:01:34Opus. Und doch, wenn wir uns die Zahlen ansehen, ist es ziemlich nah dran. Das sind also großartige Neuigkeiten, wenn Sie jemand sind,
00:01:40der keine hochspezialisierten KI-Aufgaben erledigt, sondern Routineaufgaben, und Sie
00:01:46dennoch Leistung benötigen – nun, Sonnet 5 schließt diese Lücke jetzt. Schauen wir uns nun diese Diagramme an, die über
00:01:51die Benchmarks hinausgehen. Hier betrachten wir die agentische Suchleistung nach Aufwand, im Vergleich
00:01:55von Opus 4.8 mit Sonnet 5 und Sonnet 4.6. Sofort werden Sie hier bemerken, bei Sonnet 5 gibt es eine riesige
00:02:04Lücke bei den Erfolgsquoten, wenn wir zwischen den Aufwandsstufen wechseln. Bei „Niedrig“ erreicht es 55 %. Wenn wir uns aber
00:02:13„Niedrig“ bei Sonnet 4.6 ansehen, schneidet Sonnet 4.6 sogar besser ab. Dennoch sind die Kosten viel niedriger.
00:02:19Gehen wir zu „Mittel“ über, erhalten wir im Wesentlichen die gleiche Leistung wie bei Sonnet 4.6,
00:02:25aber zu einem deutlichen Rabatt. Und erst wenn wir auf hohe Aufwandsstufen gehen, beginnen wir, Sonnet 4.6
00:02:34zu übertreffen. Aber zu diesem Zeitpunkt erhalten wir eine bessere Leistung als bei Sonnet 4.6, aber zu Kosten, die
00:02:41bei Sonnet 4.6 der niedrigen Aufwandsstufe entsprochen hätten. Diese Art der Unterscheidung nach Aufwand,
00:02:49halte ich für sehr wichtig, denn es heißt nicht einfach: Hey, Sonnet 5 ist durch die Bank besser, wo „Niedrig“
00:02:53bei 5 zwangsläufig besser ist als bei 4.6. „Niedrig“ bei Sonnet 5 bedeutet eigentlich nur, dass es extrem
00:02:59günstig ist. Aber im Hinblick auf eine höhere Leistung, was wir in der Vergangenheit gesehen haben,
00:03:03muss man wahrscheinlich etwas im hohen Bereich tun. Wenn wir uns jedoch im hohen
00:03:08Bereich mit Sonnet 5 befinden, zahlen wir im Grunde das Gleiche wie mit Opus. Opus kostet bei „Mittel“
00:03:14und „Hoch“ genauso viel wie Sonnet bei „Hoch“, aber wir erhalten eine bessere Erfolgsquote. Das bringt also
00:03:21viel Nuance in diese Diskussion. Müssen wir Sonnet 5 gegenüber Opus 4.5 und Dingen wie
00:03:27agentischer Suche verwenden? Ich denke, es kommt wirklich darauf an. Bei komplexeren Problemen könnte Opus 4.8 am Ende
00:03:33günstiger sein, einfach weil es so token-effizient ist und Sonnet für die Aufgabe einfach nicht geeignet ist.
00:03:38Wenn wir jedoch Aufgaben erledigen, die für diese KI-Modelle nicht so herausfordernd sind, dann ergibt es vielleicht
00:03:44überhaupt keinen Sinn, Opus 4.8 zu verwenden. Dann kommt Sonnet 5 ins Spiel. Ich denke also, das ist
00:03:49eine interessante Situation, in der wir uns jetzt befinden, wo es von Fall zu Fall entschieden werden muss,
00:03:54welches Modell man verwenden sollte. Hier ist noch ein interessanter Punkt, wenn wir uns die agentische Computernutzung ansehen. Nun, im Großen und Ganzen
00:03:58schlägt Sonnet 5 meistens Sonnet 4.6 und tut dies zu recht niedrigen Kosten. Also,
00:04:05agentische Suche, das war definitiv nicht der Fall, aber agentische Computernutzung, plötzlich
00:04:09würden wir immer Sonnet 5 gegenüber 4.6 bevorzugen. Und wieder führt das zu der Idee, dass es jetzt eine Sache
00:04:14von Fall zu Fall ist, welches Modell Sie verwenden sollten. Interessanterweise aber, schauen Sie sich Opus an. Opus „Hoch“ leistet
00:04:20besser als das maximale Sonnet 5 und ist günstiger. Also, ich meine, man schaut sich das an und denkt sich:
00:04:26Wow, Opus ist eigentlich ziemlich effizient für das, was es tut. Ganz zu schweigen davon, dass es diese höheren
00:04:30Ebenen erreicht, die Sonnet einfach nicht erreichen kann. Dinge, über die man nachdenken sollte; ehrlich gesagt, nur weil die Kosten pro Million
00:04:36Token bei Opus günstiger sind, wird es viele Fälle geben, in denen Opus immer noch das Beste ist. Nun, ich möchte
00:04:41keine Anthropic-Modellveröffentlichung abschließen, ohne über falsch ausgerichtetes Verhalten zu sprechen. Wir können sehen, dass es eine Verbesserung
00:04:45bei Sonnet 5 ist, aber immer noch hinter dem, was wir von Opus 4.8 und Mythos Preview erwarten würden. Und in Bezug auf
00:04:50Exploits und diese ganze Cybersicherheitsfrage, die Mythos so ziemlich lahmgelegt hat, das ist kein
00:04:55Problem oder etwas, worüber Sie sich bei der Sonnet-Klasse Sorgen machen müssen. Insgesamt würde ich diesen Benchmarks ehrlich gesagt nicht zu viel
00:04:59Aufmerksamkeit schenken. Diese Art von Benchmarks, diese Art von Diagrammen lassen mich viel
00:05:05eher innehalten, denn die Frage ist meiner Meinung nach nicht Sonnet 5 gegenüber 4.6. Wir werden so ziemlich immer
00:05:11Sonnet 5 verwenden. Es ist Sonnet 5 gegenüber Opus 4.8. Und die Frage ist: Ist Opus eigentlich günstiger? Und
00:05:18ich würde gerne mehr Tests und mehr Material von Anthropic sehen, das irgendwie darlegt, hier ist so
00:05:24eine Art Demarkationslinie zwischen, okay, Sonnet 5 kann das ganz gut und ist günstiger als
00:05:29Opus gegenüber, hey, das ist jetzt eine kompliziertere Aufgabe. Opus wird bei der Erledigung effizienter sein als
00:05:34Sonnet. Also Dinge, über die man nachdenken sollte, definitiv ein „Nice-to-have“. Ich denke insgesamt,
00:05:40Aufgaben auf niedrigerer Ebene werden ein Segen sein, denn für diejenigen unter uns, die API-Token für, wissen Sie,
00:05:46unsere Anwendungen oder Dinge, die nicht im Claude-Max-Plan-Ökosystem sind, verwenden, ist es ziemlich schwer, Anthropic zu nutzen.
00:05:51Es ist einfach so verdammt teuer. Und ich sage den Leuten schon lange: Schaut einfach mal
00:05:55bei OpenAI vorbei, seht euch einige ihrer Mini-Modelle an, denn das ist oft mehr als genug für die Arbeit vieler Leute.
00:05:59Nun, wir haben jetzt so etwas wie eine Mittelklasse-Option bei Anthropic, was eine nette
00:06:05Sache ist. Also, das ist der Punkt, an dem ich euch heute zurücklasse. Das ist überall verfügbar. Ich denke,
00:06:09es wird viel Ausprobieren erfordern, um herauszufinden, wo das am meisten Sinn ergibt. Also lasst mich wissen,
00:06:13was ihr darüber denkt. Schaut euch unbedingt „Chase AI Plus“ an, wenn ihr Zugang zu meiner Claude
00:06:17Code Masterclass haben wollt, und wir sehen uns.

핵심 요약

Mit Sonnet 3.5 führt Anthropic ein leistungsfähiges Mittelklasse-Modell ein, das durch 60 % geringere Input-Kosten bei vergleichbarer Leistung zu Opus 4.8 eine neue Kosten-Nutzen-Abwägung für API-Anwender erzwingt.

하이라이트

  • Sonnet 3.5 übertrifft Sonnet 4.6 in den Bereichen agentisches Programmieren, multidisziplinäres Schlussfolgern und Computernutzung deutlich.

  • Die Input-Kosten für Sonnet 3.5 liegen bei 2 $ pro Million Token, was 40 % der Kosten von Opus 4.8 entspricht.

  • Sonnet 3.5 erreicht beim Sweebench Pro einen Wert von 63 % gegenüber 69 % bei Opus 4.8.

  • Im Bereich der agentischen Computernutzung übertrifft Sonnet 3.5 das Vorgängermodell 4.6 durchgehend bei niedrigeren Kosten.

  • Für komplexe Aufgaben ist Opus 4.8 trotz höherer Token-Preise oft effizienter, da es weniger für die Problemlösung benötigt.

  • Sicherheitsbedenken und Exploits, die bei anderen Modellen auftraten, stellen für die Sonnet-Klasse kein Problem dar.

타임라인

Leistungsvergleich und Benchmarks

  • Sonnet 3.5 bietet signifikante Verbesserungen gegenüber der Version 4.6.
  • Der Leistungsabstand zu Opus 4.8 ist bei der Wissensarbeit minimal, bei der Computernutzung liegt er bei lediglich 2 %.
  • Die Kostenstruktur für Sonnet 3.5 beträgt 2 $ für Input und 10 $ für Output pro Million Token.

Die Einführung von Sonnet 3.5 markiert einen deutlichen Fortschritt in der Modellklasse. Trotz der Positionierung als kostengünstigeres Modell sind die Leistungswerte nah an Opus 4.8 angesiedelt. Die signifikant niedrigeren Preise machen es zu einer attraktiven Option für Routineaufgaben, bei denen hochspezialisierte KI-Fähigkeiten nicht zwingend erforderlich sind.

Agentische Leistung nach Aufwand

  • Sonnet 3.5 zeigt bei niedrigen Aufwandsstufen eine enorme Kosteneffizienz.
  • Die Erfolgsquote von Sonnet 3.5 steigt erst bei hohen Aufwandsstufen über das Niveau von Sonnet 4.6.
  • Opus 4.8 bietet bei 'Mittel'- und 'Hoch'-Einstellungen eine bessere Erfolgsquote bei vergleichbaren Kosten wie Sonnet 3.5.

Die Leistung ist stark von der gewählten Aufwandsklasse abhängig. Während Sonnet 3.5 bei niedrigen Anforderungen extrem günstig arbeitet, nähert sich die Kosten-Nutzen-Relation bei komplexen Aufgaben an Opus 4.8 an. Anwender müssen je nach Anwendungsfall entscheiden, ob das günstigere Modell ausreicht oder die höhere Effizienz von Opus trotz höherer Token-Preise die bessere Wahl ist.

Computernutzung und Sicherheitsaspekte

  • Bei der agentischen Computernutzung ist Sonnet 3.5 dem Vorgänger 4.6 vorzuziehen.
  • Opus 4.8 bleibt bei maximaler Auslastung effizienter als Sonnet 3.5.
  • Sicherheitsrisiken durch Exploits sind in der Sonnet-Klasse vernachlässigbar.

Die Analyse zeigt, dass Sonnet 3.5 bei Computernutzungs-Aufgaben ein klares Upgrade darstellt. Dennoch bleibt Opus 4.8 die Referenz für komplexe, leistungshungrige Prozesse. Die verbesserte Ausrichtung und Sicherheitsstabilität runden das Release ab und bieten API-Nutzern eine notwendige Mittelklasse-Alternative zu den hochpreisigen Modellen.

커뮤니티 글

모든 글 보기