스크립트
00:00:00Fable 5.1 ist da und es ist besser, günstiger
00:00:02und heute werde ich dir
00:00:04alles erzählen, was du darüber wissen musst.
00:00:05Fangen wir zuerst beim Preis an.
00:00:07Fable 5.1 wird voraussichtlich etwa 25% weniger kosten als Fable 5
00:00:11und das liegt daran, dass sie die Preise
00:00:13für Cache Reads senken.
00:00:14Das ist enorm, wenn du viele lang laufende agentische Aufgaben erledigst,
00:00:19und sie heben das explizit hervor,
00:00:21und deine Kostenreduktion könnte bis zu 45%
00:00:23betragen in jenen Fällen, in denen du
00:00:24Arbeit mit Tausenden und Abertausenden von Token machst
00:00:27und du in Kontextfensterlängen
00:00:28von 50, 60, 70% arbeitest.
00:00:30Sie aktualisieren ihre Datenaufbewahrungsrichtlinie,
00:00:32führen das für ihre Unternehmenskunden ein,
00:00:34und was die Sicherheitsvorkehrungen angeht,
00:00:35reduzieren sie die False Positives,
00:00:37was ein ziemlicher Schmerz im Hintern war
00:00:38beim originalen Fable 5,
00:00:40weil wenn man ihm Fragen stellte,
00:00:41die sich auf Dinge wie Cybersicherheit bezogen,
00:00:43wurde man ständig blockiert,
00:00:44und in diesem Fall gibt es jetzt eine um 60% geringere Wahrscheinlichkeit
00:00:47für ein False Positive.
00:00:49Schauen wir uns nun die Benchmarks an.
00:00:50Durch die Bank schlägt es Fable 5, Opus 5
00:00:53und GPT 5.6 bei buchstäblich allem.
00:00:56Nun, einige der Sprünge sind ziemlich signifikant.
00:00:58Wenn wir uns agentische wissenschaftliche Forschung ansehen,
00:01:00ist sie doppelt so hoch wie bei Fable 5.
00:01:03Auch das agentische Programmieren macht einen riesigen Sprung.
00:01:05Wir gehen von 42% mit Fable 5 auf 55,8 mit Fable 5.1.
00:01:09Ich erinnere mich, als wir uns die Benchmarks für Opus 5 ansahen,
00:01:11waren wir ziemlich überwältigt von dem, was Opus 5 uns liefern konnte
00:01:14an reinen Zahlen.
00:01:16In der Realität denke ich, dass die meisten Leute Fable 5 immer noch Opus 5 vorziehen,
00:01:19aber ich habe das Gefühl, dass der Vergleich von Fable 5 zu 5.1
00:01:23wahrscheinlich ein bisschen genauer ist
00:01:24im Hinblick darauf, wie es sich anfühlen wird,
00:01:26wenn man es tatsächlich benutzt.
00:01:28Darüber hinaus sind die meisten Benchmark-Steigerungen
00:01:29relativ schrittweise.
00:01:31Wir reden hier und da über ein paar Prozentpunkte,
00:01:32wobei Geschäftsworkflows unter Verwendung
00:01:34des Automatisierungs-Benchmarks die Ausnahme bilden.
00:01:37Nun, wichtig ist nicht nur der Benchmark an sich,
00:01:39sondern wie viel wir für diese Art von Werten bezahlen
00:01:41und welche Art von Veränderungen wir sehen,
00:01:43wenn wir am Aufwandslevel herumschrauben?
00:01:44Denn das ist immer sehr interessant zu betrachten,
00:01:46weil wir oft, wenn wir uns extra hohe
00:01:48oder maximale Aufwandslevel ansehen,
00:01:49wirklich nicht so viel Gegenwert für unser Geld bekommen
00:01:51verglichen mit hoch oder sogar mittel.
00:01:53Was wir hier also haben, ist der Terminal Bench 4.0.
00:01:56Wir haben Mythos 5.1 hier oben,
00:01:59Fable 5.1 in der Mitte
00:02:00und dann Mythos 5 hier unten,
00:02:02und man kann sich vorstellen, dass Fable 5 etwas unter Mythos liegt.
00:02:05Fable 5.1 und Mythos 5.1 also,
00:02:07offensichtlich ein großer Sprung im Vergleich zu Mythos 5,
00:02:10und es ist günstiger.
00:02:12Und was wirklich cool ist, wenn wir uns etwas
00:02:13wie hoch ansehen, zum Beispiel,
00:02:15was meiner Meinung nach die Einstellung der meisten Leute ist,
00:02:16oftmals verwende ich mittel,
00:02:17wenn es um meine Fable-Anwendungsfälle geht,
00:02:20entsprichst du im Wesentlichen,
00:02:20wenn wir uns mittel ansehen,
00:02:21der maximalen Ausgabe von Mythos 5,
00:02:25aber anstatt 26 $ zu kosten,
00:02:27sind es dann 7,80 $.
00:02:30Und wenn wir zu hoch gehen
00:02:32und hoch mit sage ich mal max vergleichen,
00:02:34schaut man sich nur an,
00:02:35was, eine Änderung von 6% bei der Ausgabe,
00:02:38aber 19,50 $ gegenüber 10,50 $.
00:02:42Das wirklich Coole an diesen neuen Modellen ist also,
00:02:43dass man extrem hohe Leistung erhalten kann
00:02:45auf diesen mittleren Aufwandsstufen
00:02:47und wirklich bei den Kosten sparen kann.
00:02:50Und wir sehen dasselbe Muster
00:02:52in diesen anderen Benchmarks, oder?
00:02:53Das ist Humanity's Last Exam.
00:02:55Wieder sehen wir keinen riesigen Anstieg,
00:02:57wenn wir von hoch direkt zu max springen,
00:02:59obwohl wir wirklich gute Leistung haben
00:03:00zu recht vernünftigen Kosten
00:03:02bei diesen Einstellungen im mittleren Bereich.
00:03:04Die einzige Ausnahme ist, wenn wir uns
00:03:05agentisches Programmieren auf Cursor Bench ansehen:
00:03:07Bei Fable 5.1
00:03:08sehen wir einen ziemlich hohen Sprung von hoch zu extra hoch,
00:03:11aber nochmals, zwischen extra hoch und max
00:03:13nicht so viel.
00:03:14Aber weißt du, wenn ich auf hoch bin
00:03:15bei Fable 5.1,
00:03:17ist es dasselbe wie auf extra hoch
00:03:18mit Fable 5,
00:03:20kostet aber weniger als die Hälfte.
00:03:22Hier gibt es also riesige Preisersparnisse,
00:03:24selbst wenn du nicht jemand bist,
00:03:25der unbedingt wild komplexe Arbeit verrichtet.
00:03:27Wenn du einfach in Anführungszeichen
00:03:29dein durchschnittlicher Solo-Entwickler bist,
00:03:30sind deine Probleme nicht so kompliziert,
00:03:32aber du nutzt gerne diese Frontier-Modelle,
00:03:33hast du jetzt die Möglichkeit
00:03:34das Aufwandslevel einfach herunterzuschrauben
00:03:36und machst im Grunde
00:03:37genau das, was du vorher tatest,
00:03:38wiederum zu halben Kosten,
00:03:40was man gar nicht hoch genug einschätzen kann.
00:03:41Nun, wissenschaftliche Forschung
00:03:42war schon immer ein ziemlich großes Verkaufsargument,
00:03:44wenn es um die Fable- und Mythos-Modelle geht.
00:03:46Und bei der 5.1-Version gibt es da
00:03:48keine Änderungen.
00:03:49Sie sprechen viel über molekulares Design,
00:03:51rechnerische Analyse und Modellierung
00:03:53sowie Computerbiologie.
00:03:55Auch dies sind eher Nischenprobleme,
00:03:57die manche Leute lösen,
00:03:58aber es ist immer irgendwie interessant zu sehen,
00:04:00was in diesen Bereichen vor sich geht,
00:04:01verglichen mit deinem Standard,
00:04:03was macht das hier
00:04:03auf diesem Benchmark für agentisches Programmieren.
00:04:05Und wie ich in der Einleitung angedeutet habe,
00:04:07gab es einige Änderungen
00:04:08in Bezug auf Sicherheit,
00:04:09geschützt sein
00:04:09und Ausrichtung.
00:04:11Großes Bild:
00:04:12weniger False Positives.
00:04:13Du kannst ihm mehr Fragen stellen
00:04:14zu Themen wie Cybersicherheit
00:04:15und es ist klug genug,
00:04:16nicht einfach auszuflippen
00:04:18und dich zu Opus zu schicken,
00:04:19egal was ist.
00:04:20Wenn du wirklich tief gehen willst,
00:04:21tiefgehend hierzu,
00:04:21haben sie ihre Systemkarte,
00:04:23die man sich jederzeit ansehen kann.
00:04:24Das sind, weißt du,
00:04:25mehrere hundert Seiten Zeug,
00:04:27212 um genau zu sein,
00:04:28aber sie geben uns hier eine gute Zusammenfassung.
00:04:30Aber alles, worum du dich kümmern musst,
00:04:31ist, dass diese Leitplanken
00:04:32präziser sind,
00:04:33sodass sie weniger wahrscheinlich
00:04:34gutartige Inhalte markieren
00:04:35und dich einfach
00:04:36auf ein niedrigeres Modell verweisen.
00:04:37Speziell für Cybersicherheitsfragen
00:04:40können Cloud Code-Benutzer
00:04:40im Durchschnitt
00:04:4160% weniger Interventionen
00:04:43pro Sitzung
00:04:44durch diese Sicherheitsvorkehrungen erwarten,
00:04:46was großartig ist,
00:04:46wenn du an
00:04:47irgendeiner Art von Anwendung arbeitest,
00:04:48bei der du Fragen stellen musst
00:04:49über bewährte Praktiken der Cybersicherheit
00:04:51für Ihren konkreten Anwendungsfall.
00:04:53Sie haben
00:04:53hier tatsächlich einen interessanten Absatz,
00:04:54der über
00:04:55Anti-Destillations-Mechanismen spricht,
00:04:57was eine Methode ist,
00:04:58im Wesentlichen zu extrahieren,
00:04:59das Beste aus Fable 5 herauszuholen
00:05:01und Fable 5.1,
00:05:02um sie in anderen Modellen zu nutzen.
00:05:03Das ist ein wirklich großes
00:05:04Thema
00:05:05in Verbindung mit
00:05:06Open-Source-Modellen.
00:05:07Du hast wahrscheinlich schon
00:05:08jede Menge darüber gehört,
00:05:08dass all diese guten
00:05:09Open-Source-Modelle herauskommen,
00:05:10und sie werden zweifellos
00:05:11weiterhin auf den Markt kommen,
00:05:13während sie aus diesen
00:05:14Frontier-Modellen destillieren.
00:05:15Das ist also genau die Art von
00:05:17Diskussion,
00:05:17die man im Auge
00:05:18behalten sollte.
00:05:18Es betrifft dich nicht wirklich,
00:05:20den Endnutzer,
00:05:21aber es ist eben
00:05:22so eine Art Metadiskussion,
00:05:23wo wir all diese
00:05:24Open-Source-Modelle haben,
00:05:25die aus China kommen,
00:05:26während viele der führenden
00:05:26Unternehmen in den USA sitzen,
00:05:27und es gibt immer
00:05:28diese Reden darüber,
00:05:29dass all diese Open-Source-Modelle
00:05:31in Wahrheit nur Daten
00:05:32von Modellen
00:05:32wie Opus und Fable
00:05:33abgreifen.
00:05:35Sie nennen ein Beispiel dafür,
00:05:36wie das funktioniert,
00:05:37nämlich dass neue API-Konten
00:05:38Claudes vorherigen Kontext
00:05:39nicht bearbeiten können,
00:05:40um im Wesentlichen zu extrahieren,
00:05:42wie Claude denkt
00:05:43und zu seinen
00:05:44Antworten
00:05:44und herauszufinden,
00:05:45wie es zu seinen Antworten kommt.
00:05:46das betrifft
00:05:46speziell neue Konten,
00:05:47also wenn du bereits eines hast,
00:05:48wird dich das,
00:05:48wie gesagt,
00:05:49nicht wirklich betreffen.
00:05:50Kommen wir nun zu Kosten
00:05:51und Verfügbarkeit:
00:05:52Verfügbarkeit,
00:05:52es ist im Moment
00:05:53überall verfügbar.
00:05:54Kosten.
00:05:55Pro Token,
00:05:56wenn man es sich ansieht,
00:05:56ist es genau dasselbe
00:05:58wie bei Fable 5.
00:05:58Wir sprechen von 10 Dollar
00:05:59pro Million Input-Tokens
00:06:00und 50 Dollar pro Million
00:06:02Output-Tokens.
00:06:03Aber in der Realität,
00:06:04wenn man das tatsächlich nutzt,
00:06:05nach dem Motto:
00:06:06hey, ich lasse es
00:06:07ausführen,
00:06:08wird es weniger kosten,
00:06:09und zwar deshalb weniger kosten,
00:06:10weil es Cache-Lesevorgänge gibt.
00:06:12Wenn du keine Ahnung hast,
00:06:12was Prompt Caching ist,
00:06:14kannst du dir ein Video
00:06:14von letzter Woche ansehen,
00:06:16in dem ich darüber spreche.
00:06:18Im Grunde genommen
00:06:18ist das riesig,
00:06:19wenn du jemand bist,
00:06:20der lang laufende,
00:06:20agentenbasierte Aufgaben ausführt.
00:06:23Du hast also quasi
00:06:23sehr große Sitzungen,
00:06:25Mengen an Kontext
00:06:26und nutzt es
00:06:27fast durchgehend.
00:06:28Du lässt es nicht
00:06:29etwas erledigen
00:06:29und kommst am nächsten Tag wieder.
00:06:30Du redest und redest
00:06:31und redest einfach
00:06:32damit.
00:06:32Diese Cache-Lesevorgänge
00:06:33kosten 75% weniger,
00:06:35was eine massive Änderung ist
00:06:37und zu diesen
00:06:39geringeren Kosten führt.
00:06:40Und dieses Diagramm
00:06:41verdeutlicht das.
00:06:42Das können grob
00:06:4225% weniger Kosten
00:06:44bei normalen Aufgaben sein,
00:06:45aber wie gesagt,
00:06:46bei stark agentenbasierten
00:06:47Arbeitslasten bis zu 45% weniger.
00:06:49Es ist also wirklich aufregend,
00:06:49ein Upgrade
00:06:50für das Fable-Modell zu erhalten.
00:06:51Ich fand Fable 5 toll,
00:06:53war aber etwas unschlüssig
00:06:53was Opus 5 angeht,
00:06:54aber für diejenigen unter euch,
00:06:55die praktisch gearbeitet
00:06:56haben mit Fable,
00:06:57stimmt ihr mir sicher zu,
00:06:58dass es einen
00:06:59signifikanten Unterschied gibt
00:07:01in dem, was uns dieses Modell bringt,
00:07:02verglichen mit allem anderen,
00:07:03was wir bisher
00:07:03von Anthropic bekommen haben.
00:07:04Etwas zu haben,
00:07:05das besser
00:07:06und billiger ist
00:07:07und bei dem wir uns weniger Sorgen
00:07:09wegen der Leitplanken machen müssen,
00:07:10ist denke ich eine tolle Sache.
00:07:11Probiert es also unbedingt aus.
00:07:12Lasst mich wissen,
00:07:13was ihr denkt.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기