Fable 5.1 ist das großartigste Modell aller Zeiten (und günstiger als Fable 5)

CChase AI
컴퓨터/소프트웨어

스크립트

00:00:00Fable 5.1 ist da und es ist besser, günstiger
00:00:02und heute werde ich dir
00:00:04alles erzählen, was du darüber wissen musst.
00:00:05Fangen wir zuerst beim Preis an.
00:00:07Fable 5.1 wird voraussichtlich etwa 25% weniger kosten als Fable 5
00:00:11und das liegt daran, dass sie die Preise
00:00:13für Cache Reads senken.
00:00:14Das ist enorm, wenn du viele lang laufende agentische Aufgaben erledigst,
00:00:19und sie heben das explizit hervor,
00:00:21und deine Kostenreduktion könnte bis zu 45%
00:00:23betragen in jenen Fällen, in denen du
00:00:24Arbeit mit Tausenden und Abertausenden von Token machst
00:00:27und du in Kontextfensterlängen
00:00:28von 50, 60, 70% arbeitest.
00:00:30Sie aktualisieren ihre Datenaufbewahrungsrichtlinie,
00:00:32führen das für ihre Unternehmenskunden ein,
00:00:34und was die Sicherheitsvorkehrungen angeht,
00:00:35reduzieren sie die False Positives,
00:00:37was ein ziemlicher Schmerz im Hintern war
00:00:38beim originalen Fable 5,
00:00:40weil wenn man ihm Fragen stellte,
00:00:41die sich auf Dinge wie Cybersicherheit bezogen,
00:00:43wurde man ständig blockiert,
00:00:44und in diesem Fall gibt es jetzt eine um 60% geringere Wahrscheinlichkeit
00:00:47für ein False Positive.
00:00:49Schauen wir uns nun die Benchmarks an.
00:00:50Durch die Bank schlägt es Fable 5, Opus 5
00:00:53und GPT 5.6 bei buchstäblich allem.
00:00:56Nun, einige der Sprünge sind ziemlich signifikant.
00:00:58Wenn wir uns agentische wissenschaftliche Forschung ansehen,
00:01:00ist sie doppelt so hoch wie bei Fable 5.
00:01:03Auch das agentische Programmieren macht einen riesigen Sprung.
00:01:05Wir gehen von 42% mit Fable 5 auf 55,8 mit Fable 5.1.
00:01:09Ich erinnere mich, als wir uns die Benchmarks für Opus 5 ansahen,
00:01:11waren wir ziemlich überwältigt von dem, was Opus 5 uns liefern konnte
00:01:14an reinen Zahlen.
00:01:16In der Realität denke ich, dass die meisten Leute Fable 5 immer noch Opus 5 vorziehen,
00:01:19aber ich habe das Gefühl, dass der Vergleich von Fable 5 zu 5.1
00:01:23wahrscheinlich ein bisschen genauer ist
00:01:24im Hinblick darauf, wie es sich anfühlen wird,
00:01:26wenn man es tatsächlich benutzt.
00:01:28Darüber hinaus sind die meisten Benchmark-Steigerungen
00:01:29relativ schrittweise.
00:01:31Wir reden hier und da über ein paar Prozentpunkte,
00:01:32wobei Geschäftsworkflows unter Verwendung
00:01:34des Automatisierungs-Benchmarks die Ausnahme bilden.
00:01:37Nun, wichtig ist nicht nur der Benchmark an sich,
00:01:39sondern wie viel wir für diese Art von Werten bezahlen
00:01:41und welche Art von Veränderungen wir sehen,
00:01:43wenn wir am Aufwandslevel herumschrauben?
00:01:44Denn das ist immer sehr interessant zu betrachten,
00:01:46weil wir oft, wenn wir uns extra hohe
00:01:48oder maximale Aufwandslevel ansehen,
00:01:49wirklich nicht so viel Gegenwert für unser Geld bekommen
00:01:51verglichen mit hoch oder sogar mittel.
00:01:53Was wir hier also haben, ist der Terminal Bench 4.0.
00:01:56Wir haben Mythos 5.1 hier oben,
00:01:59Fable 5.1 in der Mitte
00:02:00und dann Mythos 5 hier unten,
00:02:02und man kann sich vorstellen, dass Fable 5 etwas unter Mythos liegt.
00:02:05Fable 5.1 und Mythos 5.1 also,
00:02:07offensichtlich ein großer Sprung im Vergleich zu Mythos 5,
00:02:10und es ist günstiger.
00:02:12Und was wirklich cool ist, wenn wir uns etwas
00:02:13wie hoch ansehen, zum Beispiel,
00:02:15was meiner Meinung nach die Einstellung der meisten Leute ist,
00:02:16oftmals verwende ich mittel,
00:02:17wenn es um meine Fable-Anwendungsfälle geht,
00:02:20entsprichst du im Wesentlichen,
00:02:20wenn wir uns mittel ansehen,
00:02:21der maximalen Ausgabe von Mythos 5,
00:02:25aber anstatt 26 $ zu kosten,
00:02:27sind es dann 7,80 $.
00:02:30Und wenn wir zu hoch gehen
00:02:32und hoch mit sage ich mal max vergleichen,
00:02:34schaut man sich nur an,
00:02:35was, eine Änderung von 6% bei der Ausgabe,
00:02:38aber 19,50 $ gegenüber 10,50 $.
00:02:42Das wirklich Coole an diesen neuen Modellen ist also,
00:02:43dass man extrem hohe Leistung erhalten kann
00:02:45auf diesen mittleren Aufwandsstufen
00:02:47und wirklich bei den Kosten sparen kann.
00:02:50Und wir sehen dasselbe Muster
00:02:52in diesen anderen Benchmarks, oder?
00:02:53Das ist Humanity's Last Exam.
00:02:55Wieder sehen wir keinen riesigen Anstieg,
00:02:57wenn wir von hoch direkt zu max springen,
00:02:59obwohl wir wirklich gute Leistung haben
00:03:00zu recht vernünftigen Kosten
00:03:02bei diesen Einstellungen im mittleren Bereich.
00:03:04Die einzige Ausnahme ist, wenn wir uns
00:03:05agentisches Programmieren auf Cursor Bench ansehen:
00:03:07Bei Fable 5.1
00:03:08sehen wir einen ziemlich hohen Sprung von hoch zu extra hoch,
00:03:11aber nochmals, zwischen extra hoch und max
00:03:13nicht so viel.
00:03:14Aber weißt du, wenn ich auf hoch bin
00:03:15bei Fable 5.1,
00:03:17ist es dasselbe wie auf extra hoch
00:03:18mit Fable 5,
00:03:20kostet aber weniger als die Hälfte.
00:03:22Hier gibt es also riesige Preisersparnisse,
00:03:24selbst wenn du nicht jemand bist,
00:03:25der unbedingt wild komplexe Arbeit verrichtet.
00:03:27Wenn du einfach in Anführungszeichen
00:03:29dein durchschnittlicher Solo-Entwickler bist,
00:03:30sind deine Probleme nicht so kompliziert,
00:03:32aber du nutzt gerne diese Frontier-Modelle,
00:03:33hast du jetzt die Möglichkeit
00:03:34das Aufwandslevel einfach herunterzuschrauben
00:03:36und machst im Grunde
00:03:37genau das, was du vorher tatest,
00:03:38wiederum zu halben Kosten,
00:03:40was man gar nicht hoch genug einschätzen kann.
00:03:41Nun, wissenschaftliche Forschung
00:03:42war schon immer ein ziemlich großes Verkaufsargument,
00:03:44wenn es um die Fable- und Mythos-Modelle geht.
00:03:46Und bei der 5.1-Version gibt es da
00:03:48keine Änderungen.
00:03:49Sie sprechen viel über molekulares Design,
00:03:51rechnerische Analyse und Modellierung
00:03:53sowie Computerbiologie.
00:03:55Auch dies sind eher Nischenprobleme,
00:03:57die manche Leute lösen,
00:03:58aber es ist immer irgendwie interessant zu sehen,
00:04:00was in diesen Bereichen vor sich geht,
00:04:01verglichen mit deinem Standard,
00:04:03was macht das hier
00:04:03auf diesem Benchmark für agentisches Programmieren.
00:04:05Und wie ich in der Einleitung angedeutet habe,
00:04:07gab es einige Änderungen
00:04:08in Bezug auf Sicherheit,
00:04:09geschützt sein
00:04:09und Ausrichtung.
00:04:11Großes Bild:
00:04:12weniger False Positives.
00:04:13Du kannst ihm mehr Fragen stellen
00:04:14zu Themen wie Cybersicherheit
00:04:15und es ist klug genug,
00:04:16nicht einfach auszuflippen
00:04:18und dich zu Opus zu schicken,
00:04:19egal was ist.
00:04:20Wenn du wirklich tief gehen willst,
00:04:21tiefgehend hierzu,
00:04:21haben sie ihre Systemkarte,
00:04:23die man sich jederzeit ansehen kann.
00:04:24Das sind, weißt du,
00:04:25mehrere hundert Seiten Zeug,
00:04:27212 um genau zu sein,
00:04:28aber sie geben uns hier eine gute Zusammenfassung.
00:04:30Aber alles, worum du dich kümmern musst,
00:04:31ist, dass diese Leitplanken
00:04:32präziser sind,
00:04:33sodass sie weniger wahrscheinlich
00:04:34gutartige Inhalte markieren
00:04:35und dich einfach
00:04:36auf ein niedrigeres Modell verweisen.
00:04:37Speziell für Cybersicherheitsfragen
00:04:40können Cloud Code-Benutzer
00:04:40im Durchschnitt
00:04:4160% weniger Interventionen
00:04:43pro Sitzung
00:04:44durch diese Sicherheitsvorkehrungen erwarten,
00:04:46was großartig ist,
00:04:46wenn du an
00:04:47irgendeiner Art von Anwendung arbeitest,
00:04:48bei der du Fragen stellen musst
00:04:49über bewährte Praktiken der Cybersicherheit
00:04:51für Ihren konkreten Anwendungsfall.
00:04:53Sie haben
00:04:53hier tatsächlich einen interessanten Absatz,
00:04:54der über
00:04:55Anti-Destillations-Mechanismen spricht,
00:04:57was eine Methode ist,
00:04:58im Wesentlichen zu extrahieren,
00:04:59das Beste aus Fable 5 herauszuholen
00:05:01und Fable 5.1,
00:05:02um sie in anderen Modellen zu nutzen.
00:05:03Das ist ein wirklich großes
00:05:04Thema
00:05:05in Verbindung mit
00:05:06Open-Source-Modellen.
00:05:07Du hast wahrscheinlich schon
00:05:08jede Menge darüber gehört,
00:05:08dass all diese guten
00:05:09Open-Source-Modelle herauskommen,
00:05:10und sie werden zweifellos
00:05:11weiterhin auf den Markt kommen,
00:05:13während sie aus diesen
00:05:14Frontier-Modellen destillieren.
00:05:15Das ist also genau die Art von
00:05:17Diskussion,
00:05:17die man im Auge
00:05:18behalten sollte.
00:05:18Es betrifft dich nicht wirklich,
00:05:20den Endnutzer,
00:05:21aber es ist eben
00:05:22so eine Art Metadiskussion,
00:05:23wo wir all diese
00:05:24Open-Source-Modelle haben,
00:05:25die aus China kommen,
00:05:26während viele der führenden
00:05:26Unternehmen in den USA sitzen,
00:05:27und es gibt immer
00:05:28diese Reden darüber,
00:05:29dass all diese Open-Source-Modelle
00:05:31in Wahrheit nur Daten
00:05:32von Modellen
00:05:32wie Opus und Fable
00:05:33abgreifen.
00:05:35Sie nennen ein Beispiel dafür,
00:05:36wie das funktioniert,
00:05:37nämlich dass neue API-Konten
00:05:38Claudes vorherigen Kontext
00:05:39nicht bearbeiten können,
00:05:40um im Wesentlichen zu extrahieren,
00:05:42wie Claude denkt
00:05:43und zu seinen
00:05:44Antworten
00:05:44und herauszufinden,
00:05:45wie es zu seinen Antworten kommt.
00:05:46das betrifft
00:05:46speziell neue Konten,
00:05:47also wenn du bereits eines hast,
00:05:48wird dich das,
00:05:48wie gesagt,
00:05:49nicht wirklich betreffen.
00:05:50Kommen wir nun zu Kosten
00:05:51und Verfügbarkeit:
00:05:52Verfügbarkeit,
00:05:52es ist im Moment
00:05:53überall verfügbar.
00:05:54Kosten.
00:05:55Pro Token,
00:05:56wenn man es sich ansieht,
00:05:56ist es genau dasselbe
00:05:58wie bei Fable 5.
00:05:58Wir sprechen von 10 Dollar
00:05:59pro Million Input-Tokens
00:06:00und 50 Dollar pro Million
00:06:02Output-Tokens.
00:06:03Aber in der Realität,
00:06:04wenn man das tatsächlich nutzt,
00:06:05nach dem Motto:
00:06:06hey, ich lasse es
00:06:07ausführen,
00:06:08wird es weniger kosten,
00:06:09und zwar deshalb weniger kosten,
00:06:10weil es Cache-Lesevorgänge gibt.
00:06:12Wenn du keine Ahnung hast,
00:06:12was Prompt Caching ist,
00:06:14kannst du dir ein Video
00:06:14von letzter Woche ansehen,
00:06:16in dem ich darüber spreche.
00:06:18Im Grunde genommen
00:06:18ist das riesig,
00:06:19wenn du jemand bist,
00:06:20der lang laufende,
00:06:20agentenbasierte Aufgaben ausführt.
00:06:23Du hast also quasi
00:06:23sehr große Sitzungen,
00:06:25Mengen an Kontext
00:06:26und nutzt es
00:06:27fast durchgehend.
00:06:28Du lässt es nicht
00:06:29etwas erledigen
00:06:29und kommst am nächsten Tag wieder.
00:06:30Du redest und redest
00:06:31und redest einfach
00:06:32damit.
00:06:32Diese Cache-Lesevorgänge
00:06:33kosten 75% weniger,
00:06:35was eine massive Änderung ist
00:06:37und zu diesen
00:06:39geringeren Kosten führt.
00:06:40Und dieses Diagramm
00:06:41verdeutlicht das.
00:06:42Das können grob
00:06:4225% weniger Kosten
00:06:44bei normalen Aufgaben sein,
00:06:45aber wie gesagt,
00:06:46bei stark agentenbasierten
00:06:47Arbeitslasten bis zu 45% weniger.
00:06:49Es ist also wirklich aufregend,
00:06:49ein Upgrade
00:06:50für das Fable-Modell zu erhalten.
00:06:51Ich fand Fable 5 toll,
00:06:53war aber etwas unschlüssig
00:06:53was Opus 5 angeht,
00:06:54aber für diejenigen unter euch,
00:06:55die praktisch gearbeitet
00:06:56haben mit Fable,
00:06:57stimmt ihr mir sicher zu,
00:06:58dass es einen
00:06:59signifikanten Unterschied gibt
00:07:01in dem, was uns dieses Modell bringt,
00:07:02verglichen mit allem anderen,
00:07:03was wir bisher
00:07:03von Anthropic bekommen haben.
00:07:04Etwas zu haben,
00:07:05das besser
00:07:06und billiger ist
00:07:07und bei dem wir uns weniger Sorgen
00:07:09wegen der Leitplanken machen müssen,
00:07:10ist denke ich eine tolle Sache.
00:07:11Probiert es also unbedingt aus.
00:07:12Lasst mich wissen,
00:07:13was ihr denkt.

핵심 요약

Fable 5.1 übertrifft frühere Modelle in Benchmarks bei gleichzeitig um bis zu 45% gesenkten Kosten für agentische Arbeitslasten und einer um 60% geringeren False-Positive-Rate.

하이라이트

  • Fable 5.1 kostet voraussichtlich etwa 25% weniger als Fable 5 durch gesenkte Preise für Cache Reads.

  • Die Wahrscheinlichkeit für False Positives sinkt bei Fable 5.1 um 60% im Vergleich zum Originalmodell.

  • Das agentische Programmieren steigt in den Benchmarks von 42% bei Fable 5 auf 55,8% bei Fable 5.1.

  • Ein mittleres Aufwandslevel bei Fable 5.1 entspricht der maximalen Ausgabe von Mythos 5, kostet jedoch nur 7,80 US-Dollar statt 26 US-Dollar.

  • Cache-Lesevorgänge kosten bei Fable 5.1 75% weniger, was bei lang laufenden agentischen Aufgaben zu Gesamtkostenreduktionen von bis zu 45% führt.

타임라인

Preisstruktur und Cache Reads

  • Fable 5.1 kostet rund 25% weniger als Fable 5.
  • Die Kostenreduktion resultiert aus gesenkten Preisen für Cache Reads.
  • Die Wahrscheinlichkeit für False Positives bei Cybersicherheitsfragen sinkt um 60%.

Die Preissenkung wirkt sich besonders bei lang laufenden agentischen Aufgaben aus. Bei der Arbeit mit großen Kontextfenstern und tausenden Token beträgt die Kostenreduktion bis zu 45%. Zudem wurden die Datenaufbewahrungsrichtlinien für Unternehmenskunden aktualisiert und die Sicherheitsvorkehrungen angepasst, sodass Fragen zu sensiblen Themen wie Cybersicherheit seltener fälschlicherweise blockiert werden.

Benchmark-Ergebnisse und Aufwandsstufen

  • Fable 5.1 schlägt Fable 5, Opus 5 und GPT 5.6 in sämtlichen Benchmarks.
  • Das agentische Programmieren verbessert sich von 42% auf 55,8%.
  • Ein mittleres Aufwandslevel erreicht die Leistung der maximalen Ausgabe von Mythos 5 bei deutlich geringeren Kosten.

Die Leistungssteigerungen fallen bei wissenschaftlicher Forschung und Programmierung signifikant aus. Ein genauer Blick auf die Aufwandslevel zeigt, dass maximale Einstellungen oft nur minimal bessere Ergebnisse liefern als hohe oder mittlere Stufen, jedoch unverhältnismäßig teurer sind. Die mittlere Stufe von Fable 5.1 liefert die maximale Leistung von Mythos 5 zu einem Bruchteil der Kosten.

Sicherheitsleitplanken und Destillationsschutz

  • Cloud Code-Benutzer verzeichnen durchschnittlich 60% weniger Sicherheitsinterventionen.
  • Präzisere Leitplanken markieren gutartige Inhalte seltener als problematisch.
  • Anti-Destillations-Mechanismen verhindern das unautorisierte Extrahieren von Modellwissen für Open-Source-Projekte.

Die veränderten Leitplanken erlauben tiefgehende Anfragen zu Best Practices in der Cybersicherheit ohne ständige Blockaden. Parallel dazu integrieren die Entwickler Mechanismen gegen die Destillation, um zu verhindern, dass neue API-Konten den internen Kontext und die Denkprozesse von Claude abgreifen und für konkurrierende Open-Source-Modelle verwenden.

Kosten und Verfügbarkeit

  • Fable 5.1 ist ab sofort flächendeckend verfügbar.
  • Die reinen Token-Preise liegen bei 10 US-Dollar pro Million Input-Tokens und 50 US-Dollar pro Million Output-Tokens.
  • Prompt Caching senkt die Kosten für lang laufende Sitzungen durch 75% günstigere Cache-Lesevorgänge erheblich.

Obwohl die Standardpreise pro Token denen des Vorgängers entsprechen, senkt die effizientere Nutzung von Cache-Lesevorgängen die tatsächlichen Betriebskosten. Anwender, die kontinuierlich in großen Kontextfenstern arbeiten, profitieren von Einsparungen zwischen 25% und 45%, was Fable 5.1 zu einem leistungsstarken und wirtschaftlichen Werkzeug für Entwickler macht.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기