Wie lang können Ihre Skills sein, bevor Ihr Agent vergisst, was Sie ihm gesagt haben? — Laurie Voss, Arize AI

AAI Engineer
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00-
00:00:12- Hallo zusammen.
00:00:15Vielen Dank, dass Sie zu diesem wunderbar nerdigen Vortrag gekommen sind.
00:00:20Dieser Vortrag hat einen wirklich langen Titel,
00:00:22also gebe ich Ihnen gleich zu Beginn die Kurzfassung.
00:00:23Man schreibt Skill-Dateien und stopft sie voller Anweisungen.
00:00:27Irgendwann hört das Modell auf, den Überblick über all das zu behalten.
00:00:31Die Frage ist: Wo liegt dieser Punkt?
00:00:33Ab welchem Punkt hat man zu viele Anweisungen
00:00:35in seine Skill-Dateien gesteckt?
00:00:36Und die Antwort hat sich im letzten Jahr stark verändert.
00:00:40Ich bin Laurie, Leiterin für Developer Relations bei Arise AI.
00:00:44In einem früheren Leben habe ich NPM Inc. mitbegründet.
00:00:46Einige von Ihnen kennen mich also vielleicht noch aus den JavaScript-Tagen.
00:00:48Heutzutage beschäftige ich mich viel mit KI
00:00:50und wie man sie testet.
00:00:53Vor ein paar Monaten war ich auf einer KI-Konferenz in Miami,
00:00:55was eine gute Konferenz war.
00:00:57Und ich sah mir einen Vortrag von Dexter Horthy an.
00:00:59Es war ein guter Vortrag.
00:01:00Er ging überhaupt nicht um dieses Thema.
00:01:02Aber während dieses Vortrags
00:01:04erwähnte er beiläufig,
00:01:06dass ein Agent bis zu etwa 200 Anweisungen befolgen kann,
00:01:10bevor er beginnt, diese Anweisungen zu vergessen.
00:01:13Und dann fuhr er in seinem Vortrag fort,
00:01:15und es war eine reine Randnotiz.
00:01:17Er erwähnte, dass diese Zahl aus dem Jahr 2025 stammt,
00:01:20sodass es mittlerweile vielleicht besser aussieht.
00:01:22Und ich hörte für eine Sekunde auf zuzuhören,
00:01:25weil ich dachte: 200 Anweisungen
00:01:27sind wirklich nicht besonders viele Anweisungen, oder?
00:01:31Eine anständige Skill-Datei knackt die 200 Anweisungen
00:01:33fast sofort.
00:01:35Wenn der Nutzer sagt X, mach Y,
00:01:37füge immer einen Abschnitt zu Z ein,
00:01:39benutze niemals die Phrase W,
00:01:40jede einzelne davon ist eine separate Anweisung.
00:01:42Und wenn das Modell nach 200 stillschweigend aufhört, sie zu verfolgen,
00:01:45ist das eine wirklich harte Obergrenze
00:01:47für die Komplexität dessen, was man bauen kann.
00:01:49Also wollte ich erstens wissen, woher er diese Zahl hatte,
00:01:52und zweitens, ob sie stimmte.
00:01:55Sie kennen dieses Gefühl sicher auch.
00:01:57Man schreibt diese große, schöne Skill-Datei,
00:01:58seitenweise Regeln, Edge Cases, Tonfall, Formatierung.
00:02:00Man gibt sie dem Agenten.
00:02:01Er erledigt die Aufgabe.
00:02:03Und man schaut sich das Ergebnis an und denkt sich:
00:02:05Hat er eigentlich aufgepasst?
00:02:07Hat er tatsächlich all diese Regeln befolgt?
00:02:09Oder hat er einfach getan, wonach ihm war,
00:02:11und mir sozusagen ein vages Simulakrum
00:02:14dessen geliefert, was ich erwartet hatte?
00:02:16Das kann man nicht wirklich sagen – oder etwa doch?
00:02:18Dazu später mehr.
00:02:20Man lebt also mit dieser ständigen, leisen Angst,
00:02:23jedes Mal, wenn man auf Ausführen klickt.
00:02:24Und genau um dieses Gefühl geht es bei dieser Forschung
00:02:27und darum herauszufinden, ob wir es vermeiden können.
00:02:30Hier ist also mein Versprechen für die nächsten 18 Minuten.
00:02:33Ich werde Ihnen zeigen, woher diese Zahl 200 stammt,
00:02:36ob sie immer noch stimmt
00:02:37und wie die tatsächliche Zahl heute aussieht,
00:02:39denn sie hat sich um eine Größenordnung verschoben.
00:02:41Und dann werden wir darüber sprechen, was das
00:02:44für Ihre eigene Arbeit bedeutet.
00:02:46Wie lang Ihre Skills und Prompts tatsächlich sein können
00:02:49und welche Änderungen Sie infolgedessen
00:02:51an Ihrem Workflow vornehmen sollten.
00:02:54Die Zahl 200 ist also keine Folklore.
00:02:57Sie stammt aus einem echten Benchmark namens IfScale,
00:02:59aus einem Papier von diesem Typen, dessen Namen ich falsch aussprechen werde,
00:03:03Jaroslawicz, und Co-Autoren aus dem letzten Jahr.
00:03:06Und der Test ist wunderbar einfach.
00:03:10So funktioniert IfScale.
00:03:12Man bittet das Modell, einen Geschäftsbericht zu schreiben,
00:03:14und gibt ihm eine Liste spezifischer Wörter,
00:03:16die es genau in den Bericht einbauen muss.
00:03:19Man schließt das genaue Wort Kunde ein,
00:03:20schließt das genaue Wort Umsatz ein
00:03:22und so weiter, für so viele Wörter, wie man möchte.
00:03:24Jedes davon ist eine Anweisung, die es befolgen muss.
00:03:27Und dann zählt man, wie viele dieser genauen Wörter aufgetaucht sind.
00:03:32Da der Test also so einfach ist,
00:03:34muss man sich nur zwei Zahlen merken.
00:03:36Die erste ist die Dichte, die wir n nennen.
00:03:38Das ist die Anzahl der Regeln, über die wir gleichzeitig sprechen.
00:03:41Und die zweite ist die Genauigkeit,
00:03:42also der Prozentsatz dieser Regeln,
00:03:43die es tatsächlich befolgen konnte.
00:03:46Nun könnte man sagen, dass das Einbinden zufälliger Wörter in einen Bericht
00:03:50nicht dasselbe ist wie das Befolgen echter Anweisungen,
00:03:52was ein fairer Punkt ist, über den wir sprechen werden.
00:03:55Aber die Schlüsselwörter dienen als Proxy.
00:03:57Zu sagen „Füge das Wort Umsatz ein“ hat dieselbe Struktur
00:04:01wie „Füge einen Abschnitt zur Preisgestaltung ein“, oder?
00:04:02Oder „Benutze diese Phrase niemals“.
00:04:04Es ist eine diskrete, benannte Einschränkung,
00:04:06die man dem Agenten vorgegeben hat.
00:04:09Wenn ein Modell nicht einmal 200 Wörter in einem Prompt verfolgen kann,
00:04:11wird es definitiv Schwierigkeiten
00:04:13mit 200 komplizierteren Anweisungen haben.
00:04:16Wenn überhaupt, wird es also noch schlechter abschneiden.
00:04:20Diese Zahl ist also eine Obergrenze.
00:04:22Diese Zahl markiert das absolute Maximum.
00:04:23Gibt man ihm kompliziertere Anweisungen,
00:04:25wird die Zahl wahrscheinlich noch niedriger sein.
00:04:27Und 200 ist eine wirklich niedrige Obergrenze.
00:04:30Bevor man also neuen Modellen hinterherjagt,
00:04:32muss man saubere Wissenschaft betreiben,
00:04:33was bedeutet, dass man das alte Ergebnis reproduzieren
00:04:36und sicherstellen muss, dass die 200er-Obergrenze real ist.
00:04:39Also habe ich den ursprünglichen Benchmark noch einmal ausgeführt.
00:04:42Das Originalpapier hat eine ganze Reihe von Modellen getestet,
00:04:45und Modelle kommen und gehen extrem schnell.
00:04:47Als ich also dazu kam, diese Tests durchzuführen,
00:04:50waren von den ursprünglich 10 verwendeten Modellen
00:04:52nur noch drei über irgendeine Art
00:04:54von API verfügbar.
00:04:57Das waren GPT 4.1, Claude Sonnet 4
00:04:59und Gemini 2.5 Pro.
00:05:01Das waren Modelle, die vor 12 Monaten verfügbar waren
00:05:03und es jetzt immer noch sind.
00:05:05Und deshalb haben wir diese drei getestet,
00:05:07weil eben nicht mehr übrig war.
00:05:08Und seit ich diese Forschung vor ein paar Wochen
00:05:11zum ersten Mal veröffentlicht habe,
00:05:12wurde eines dieser drei Modelle bereits eingestellt.
00:05:14Dies war also der allerletzte Zeitpunkt,
00:05:16zu dem ich diesen Test hätte durchführen können.
00:05:17Von dieser Auswahl sind also nur noch zwei übrig.
00:05:20Man sollte sich also besser nicht an bestimmte Modelle binden.
00:05:22Hier sind die Ergebnisse, die wir bei der Replikation
00:05:25der ursprünglichen IfScale-Ergebnisse erhalten haben.
00:05:27Das ist die Genauigkeit auf der vertikalen Achse.
00:05:29Sie beginnt bei 100 % und fängt an abzufallen.
00:05:32Und unten sehen Sie die Anzahl der Regeln
00:05:35auf einer logarithmischen Skala.
00:05:36Jedes Mal, wenn man sich um die Hälfte nach rechts bewegt,
00:05:37hat sich die Anzahl der Regeln verdoppelt, die verarbeitet werden müssen.
00:05:42Bei 500 Regeln verliert man also bereits 30, 40, 50 % von ihnen.
00:05:46Unsere Kurven stimmten mit den Ergebnissen der Originalarbeit
00:05:49innerhalb der Rauschtoleranz überein, der Befund war also echt.
00:05:52Vor einem Jahr fingen die Spitzenmodelle
00:05:55bei irgendwo zwischen 200 und 300 Regeln an zu schwächeln.
00:05:57Das ist eine wirklich niedrige Obergrenze.
00:06:00Das ist also unsere Baseline, und jetzt kommt der spaßige Teil,
00:06:03in dem wir genau denselben Test
00:06:05auf den aktuellen Stand der Technik angewendet haben,
00:06:07oder vielmehr auf das, was der aktuelle Stand war,
00:06:09als ich diesen Test durchführte.
00:06:10Ich habe also GPT 5.5, Claude Opus 4.7 getestet,
00:06:13denn 4.8 kam eine Woche nach meinem Test heraus,
00:06:17dazu Gemini 3.1 Pro und DeepSeek V4 Pro.
00:06:20Ich gab ihnen denselben Prompt, dieselben Wörter,
00:06:22einfach alles gleich, und stieß sofort auf ein Problem:
00:06:25Sie haben den Test mit Bravour bestanden.
00:06:27Sie haben bei diesem Test alle sofort 100% erreicht,
00:06:30absolut fehlerfrei.
00:06:34Wir hatten also einen Test entwickelt, um die Obergrenze zu finden,
00:06:36und die Modelle sind einfach durch die Obergrenze marschiert,
00:06:37ohne überhaupt zu merken, dass sie da war.
00:06:40Das war ein Problem, denn der Benchmark
00:06:42war auf maximal 500 Wörter ausgelegt,
00:06:43also musste ich den Benchmark anpassen,
00:06:45um die neue Obergrenze überhaupt finden zu können.
00:06:47Ich habe also die Zielvorgaben verschoben und ihnen mehr Wörter gegeben.
00:06:50Ich habe sie von 500 auf 1.000 verdoppelt,
00:06:52dann noch einmal von 1.000 auf 2.000,
00:06:55und das so lange fortgeführt, bis ich bei einem Wortschatz
00:06:56von 10.000 Wörtern ankam – erst da stieß ich auf die Grenzen
00:07:00dessen, was Modelle heutzutage leisten können.
00:07:03Ich zeige Ihnen jetzt die wichtigste Folie, das sind die Ergebnisse.
00:07:06Denken Sie an die logarithmische Skala
00:07:07auf der x-Achse dort.
00:07:12Es geht also von 500 zu 1.000, 5.000 und 10.000.
00:07:16Es sieht so aus, als würde die Kurve steil abfallen,
00:07:18aber das passiert tatsächlich erst über einen Bereich von 1.000 Wörtern.
00:07:20Aber schauen Sie, wie weit nach rechts diese neuen Kurven wandern,
00:07:25bevor sie abknicken.
00:07:26Vor einem Jahr brachen sie bei 200 bis 300 Anweisungen ein,
00:07:29und heute liegt die Grenze je nach Modell eher bei 2.000
00:07:32und bei den besten sogar bei bis zu 5.000 Anweisungen,
00:07:36bevor sie drastisch abfallen.
00:07:38In etwa 12 Monaten sind Spitzenmodelle also fast zehnmal
00:07:41besser darin geworden, Anweisungen gleichzeitig zu befolgen.
00:07:44Das ist das Hauptergebnis, und es gibt eine Menge Nuancen,
00:07:47auf die wir eingehen müssen.
00:07:49Die Fähigkeit, 2.000 benannte Einschränkungen in einem einzigen Prompt zu verfolgen,
00:07:53ist nun da.
00:07:55Und das ist wirklich interessant, denn ich finde –
00:07:57ich weiß nicht, ob es allen anderen auch so geht –,
00:07:59aber für mich fühlte sich der Sprung von, wissen Sie,
00:08:04GPT 5.1 zu GPT 5.5 irgendwie inkrementell an, oder?
00:08:07Es fühlte sich nicht so an, als wären wir zehnmal besser geworden,
00:08:09aber das ist ein Test, der für eine sehr praktische Frage extrem wichtig ist:
00:08:14Wie lang darf meine Skill-Datei sein?
00:08:17Und im Laufe eines Jahres wurden wir zehnmal besser.
00:08:21Und das Faszinierende ist, dass dieser Benchmark
00:08:23kaum ein Jahr alt ist.
00:08:25Ein Jahr später ist 500 ein Rundungsfehler,
00:08:27und die Messlatte verschiebt sich unterm Fuß weiter.
00:08:29Ich habe 4.7 getestet, Opus 4.8 ist sogar noch besser.
00:08:35Dieses Diagramm ist also bereits ein wenig veraltet,
00:08:36was im Grunde der Hauptpunkt ist.
00:08:37Wenn Sie Ihre technischen Annahmen
00:08:39über die Funktionsweise von Skill-Dateien
00:08:41und die maximale Länge Ihrer Prompts
00:08:44vor mehr als sechs Monaten getroffen haben,
00:08:46liegen Sie jetzt falsch
00:08:48und sollten Ihre Vorgehensweise wahrscheinlich überarbeiten.
00:08:52Aber die Geschichte hat noch eine Fortsetzung,
00:08:54denn die Art und Weise, wie die Modelle versagten,
00:08:59hat sich drastisch verändert
00:09:00und diese Fehlerweise ist von großer Bedeutung.
00:09:02Dieser Aspekt war ein völlig unerwarteter Fund
00:09:06als ich mit dem Experiment begann.
00:09:07Zuerst hat er meinen Test völlig durcheinandergebracht,
00:09:10denn der alte Fehlermodus war langweilig.
00:09:13Sie haben einfach Anweisungen vergessen
00:09:14und ich konnte messen, wie viele Anweisungen
00:09:16sie behalten oder vergessen hatten.
00:09:17Aber die neuen Modelle scheitern auf ihre ganz eigene,
00:09:20extrem typische Art und Weise.
00:09:22Lassen Sie mich Ihnen also zeigen, wie diese vier Modelle versagen.
00:09:26DeepSeek 4 ist ein traditionelles Modell.
00:09:29Es vergisst einfach Dinge.
00:09:30Da gibt es kein Drama.
00:09:31Es fängt bei etwa 750 Regeln an, Anweisungen zu vergessen,
00:09:35und bei 2.000 lässt es fast die Hälfte davon fallen.
00:09:38Es vergisst also einfach, was ehrlich gesagt der Fehlermodus ist,
00:09:41dem ich am meisten vertraue, weil er vorhersehbar ist.
00:09:43Er ist sehr leicht zu messen.
00:09:44Und die anderen Modelle waren da bei Weitem nicht so kooperativ.
00:09:48Opus 4.7 entschied wiederholt,
00:09:52dass der Test gefährlich sei.
00:09:54Und das führte dazu, dass es sich
00:09:57auf API-Ebene weigerte, den Test zu beenden.
00:09:59Ich wusste gar nicht, dass man von Claude eine API-Antwort
00:10:01bekommen kann, die besagt:
00:10:03Nein, ich könnte das tun, aber ich werde es nicht machen.
00:10:06Aber das ist absolut eine Antwort auf API-Ebene,
00:10:09die Claude unterstützt, weil ihnen Sicherheit
00:10:10so wichtig ist, und ich fing an, das ständig zu bekommen.
00:10:13Und der Grund dafür war,
00:10:15dass Claude einen sehr empfindlichen Sicherheitsklassifikator hat.
00:10:19Und wenn man bestimmte Wortkombinationen eingibt,
00:10:22wie zum Beispiel Milzbrand und Zyanid,
00:10:24entscheidet es, dass die gesamte Anfrage gefährlich ist,
00:10:26und bricht ab.
00:10:27Und wenn Sie sich erinnern, was mein Test macht:
00:10:29Mein Test wirft fünf- bis zehntausend zufällige Wörter
00:10:33in eine Anweisungsdatei.
00:10:35Und so enthielten meine zufällig ausgewählten Wörter
00:10:38allerhand Dinge, die in Kombination
00:10:39für den Sicherheitsfilter gefährlich aussahen.
00:10:41Deshalb brach er immer wieder ab und behauptete, ich würde ihn
00:10:43bitten, eine Bombe oder so zu bauen.
00:10:47Um Claude zur Kooperation zu bewegen, musste ich also all meine Wörter
00:10:54durch den Sicherheitsfilter von OpenAI jagen
00:10:56und alle verdächtig aussehenden Wörter herausfiltern,
00:10:58damit es überhaupt weiterging.
00:10:59Sobald ich ihm das gegeben hatte, hat Claude sich wirklich gut geschlagen.
00:11:03Aber der Fehlermodus besteht darin, dass Claude viel eher dazu neigt,
00:11:05recht früh zu entscheiden, dass Ihr Vorhaben gefährlich ist –
00:11:08wissen Sie, schon bei 200 oder 300 Anweisungen –,
00:11:11wenn das, was Sie tun, beispielsweise
00:11:13irgendetwas mit medizinischer Beratung zu tun hat,
00:11:15da medizinische Themen oft einen doppelten Zweck erfüllen.
00:11:17Sie können gefährlich oder sicher sein.
00:11:20Der dritte Fehlermodus betraf also Gemini 3.1 Pro.
00:11:24Gemini ist absolut grundsolide bis hin zu 5.000 Anweisungen.
00:11:28Es schlägt sich extrem gut.
00:11:30Ganz klar eines der besten im Diagramm.
00:11:32Und darüber hinaus wird es seltsam.
00:11:35Es vergisst die Anweisungen nicht.
00:11:37Es wird von den Anweisungen überwältigt.
00:11:39Es versucht sicherzustellen, dass es alle Anweisungen gleichzeitig befolgt,
00:11:44und nutzt dafür sogenannte
00:11:45„Thinking Tokens“ (Denk-Token).
00:11:46Und wenn die Anzahl der Anweisungen wirklich hoch wird,
00:11:48verbraucht es all seine Denktokens.
00:11:50Es verwendet sein gesamtes Token-Budget zum Nachdenken
00:11:53und liefert dann überhaupt keine Ausgabe mehr.
00:11:55Es kommt sozusagen auf neun, wissen Sie,
00:11:57wenn man ihm 10.000 Tokens gegeben hat,
00:11:59verbraucht es 9.500 Tokens für den Denkprozess
00:12:02und gibt Ihnen dann eine Antwort mit 500 Wörtern,
00:12:04die keines der eigentlichen Tokens enthält.
00:12:07Es denkt sich also selbst in die Enge
00:12:09und hat keinen Platz mehr für die eigentliche Antwort,
00:12:10was sehr teuer und absolut nutzlos ist,
00:12:13was irgendwie zu seiner Marke passt, nicht wahr?
00:12:19Was ich so natürlich niemals laut aussprechen würde.
00:12:23Und schließlich kommt der Gewinner: GPT 5.5.
00:12:26GPT 5.5 ist der beste von allen mit 99 % Genauigkeit,
00:12:29und das über volle 5.000 Regeln hinweg.
00:12:32Aber wenn man es zu weit treibt,
00:12:33ist es mit Abstand der seltsamste Haufen.
00:12:35Denn es verweigert sich nicht einfach kategorisch,
00:12:37es vergisst auch nicht stillschweigend.
00:12:38Stattdessen wird es einfach frustriert
00:12:41und teilt Ihnen mit, dass der Test idiotisch ist.
00:12:45Es fängt an, den Bericht zu schreiben, schafft ein paar...
00:12:47Das ist ja das Lustige:
00:12:48Es fängt nicht einfach an und sagt sofort nein.
00:12:50Es beginnt mit dem Bericht,
00:12:51es fängt an, den Bericht zu verfassen,
00:12:52und so nach 500 Wörtern in dem Bericht
00:12:54heißt es plötzlich: Nein, das ist dumm.
00:12:55Das mache ich nicht weiter.
00:12:56Und dann teilt es Ihnen höflich mit, dass das dumm ist.
00:12:58Ich mache das jetzt nicht mehr.
00:13:00Das ist die genaue Antwort, die es mir gegeben hat.
00:13:02Aber das war nach etwa 5.000 Wörtern in diesem Geschäftsbericht,
00:13:05den ich ihm zu erstellen aufgetragen hatte.
00:13:08Es hat also nicht ganz Unrecht, oder?
00:13:10Ich hatte um einen zusammenhängenden Geschäftsbericht gebeten,
00:13:12zu keinem bestimmten Thema,
00:13:14der 5.000 zufällige Wörter enthält.
00:13:17Du hast ja recht, GPT.
00:13:19Das ist eine ziemlich bescheuerte Aufgabe.
00:13:23Was eine extrem unvernünftige Anfrage war,
00:13:25und GPT hat das vollkommen zu Recht kritisiert.
00:13:27Aber im Test zählt es trotzdem als Fehler.
00:13:29Denn der halb fertige Bericht, den es ausgibt,
00:13:31enthält die meisten Schlüsselwörter nicht mehr,
00:13:32und es ist zudem der am schwersten zu erkennende Fehler.
00:13:35Denn Claude steigt sofort aus.
00:13:36Claude sagt nein,
00:13:37das mache ich nicht.
00:13:39DeepSeek gibt sein Bestes.
00:13:41Aber GPT liefert scheinbar gute Arbeit ab,
00:13:44es sei denn, man liest den Bericht bis zum Ende,
00:13:46wo es heißt: Nein, eigentlich
00:13:47höre ich jetzt auf, weil das total idiotisch ist.
00:13:51Wenn man also einen Schritt zurücktritt und alle vier vergleicht:
00:13:53DeepSeek vergisst es einfach.
00:13:54Claude kriegt Angst und verweigert den Dienst.
00:13:56Gemini denkt sich so lange tot, bis nichts mehr kommt.
00:13:58Und GPT 5.5 erledigt die Hälfte der Arbeit
00:14:00und teilt Ihnen mit, dass der Rest unter seiner Würde ist.
00:14:04Dabei geht es nicht darum, welches davon am lustigsten ist.
00:14:07Auch wenn es wirklich ein bisschen amüsant ist.
00:14:09Der Punkt ist: Die Frage, ob es meine Anweisungen befolgt hat,
00:14:12hat nicht mehr nur ein einziges Fehlerbild.
00:14:14Es gibt vier verschiedene Arten, wie es fehlschlagen kann.
00:14:16Und Sie können diesen Fehler nicht erkennen, es sei denn, Sie wissen,
00:14:19mit welchem Modell Sie es zu tun haben und wie dessen Fehlerquote aussehen wird.
00:14:23Die Modelle sind also zehnmal besser geworden.
00:14:27Sie versagen auf amüsante Weise.
00:14:29Warum sollte Sie das kümmern, wenn Sie wieder an Ihrem Schreibtisch sitzen?
00:14:31Weil sich drei Dinge in Ihrem Workflow verändert haben.
00:14:34Das erste ist: Vor einem Jahr war es klug, jede Skill-Datei sehr, sehr kurz zu halten.
00:14:39Unter 200 Anweisungen, und dann auf Sub-Skills sowie ein ganzes byzantinisches Labyrinth aus zusätzlichen Skill-Dateien und Unterdateien zu verweisen.
00:14:50Man musste seine Anweisungen komprimieren, um in den sehr begrenzten Speicherplatz zu passen, und das muss man jetzt nicht mehr tun.
00:14:57Ihre Skill-Dateien können sehr lang sein.
00:14:59Zweitens: Wenn Ihr Anwendungsfall hundert spezifische Regeln oder 300 erfordert, können Sie diese einfach alle in den Prompt packen.
00:15:06Sie müssen nicht mehr wach liegen und sich fragen, welche davon das Modell stillschweigend ignoriert hat.
00:15:12Und wenn Sie an Ihre eigene Erfahrung im Umgang mit Modellen denken, kommt Ihnen das wahrscheinlich bekannt vor.
00:15:21Sie haben festgestellt, dass Sie sich weniger Sorgen darüber machen, wie lang Ihr Prompt wird, weil die Modelle beim Befolgen von Prompts wirklich zehnmal besser geworden sind.
00:15:322.000 benannte Einschränkungen sind ein kompletter Styleguide, richtig?
00:15:35Das ist jede Markenregel, jeder rechtliche Haftungsausschluss.
00:15:38Vor einem Jahr hätte man das auf ein Dutzend spezialisierte Agenten aufteilen und hoffen müssen, dass diese sich die Arbeit sauber übergeben.
00:15:46Aber das können Sie jetzt ignorieren.
00:15:48Aber der dritte Punkt ist der wirklich wichtige.
00:15:50Die Frage war früher: Kann das Modell das überhaupt tun?
00:15:53Und die Antwort lautet inzwischen ganz klar: Ja.
00:15:55Nun, einigermaßen klar.
00:15:58Die neue Frage lautet: Ist es den Preis wert?
00:16:01Denn Sie können zwar 10.000 Wörter – äh, 10.000 verschiedene Anweisungen in Ihren Prompt aufnehmen, aber das wird ein enormer Prompt.
00:16:07Das wird ein sehr teurer Prompt.
00:16:09Das wird ein sehr langsamer Prompt.
00:16:10Was früher eine harte Mauer war, gegen die man gelaufen ist, hat sich nun in einen weichen Kompromiss verwandelt: Lohnt es sich, all diese extra Anweisungen hinzuzufügen, wenn es mehr Kosten und mehr Latenz verursacht?
00:16:19Und nun ein paar Einschränkungen, um den Fragen und Antworten zuvorzukommen.
00:16:25Erstens und am wichtigsten: Ich habe es vorhin erwähnt, dies ist eine Stellvertreteraufgabe; zufällige Wörter in einen gefälschten Geschäftsbericht einzubauen, ist ein Indiz dafür, dass lange Skill-Dateien funktionieren.
00:16:38Es ist nicht dasselbe wie der Beweis, dass eine lange Skill-Datei funktioniert.
00:16:41Außerdem stoßen die Modelle an völlig unterschiedlichen Punkten an ihre Grenzen, irgendwo zwischen 750 und über 9.000, man muss sein Modell also sehr sorgfältig auswählen.
00:16:49Was unser Test nicht tut, ist zu messen, ob das Modell über einen riesigen Prompt hinweg klar schlussfolgert.
00:16:57Die gute Nachricht ist also, seit ich vor einigen Wochen meine Recherchen angestellt habe, haben sich etliche Leute darauf gestürzt, und jetzt gibt es gute Forschung dazu.
00:17:05Echte Wissenschaftler haben sich eingeschaltet und – Chroma hat Context-Rot-Arbeiten über 18 Modelle hinweg durchgeführt, die zeigen, dass die Genauigkeit bei langen Eingaben um 30 bis 50 Prozent sinken kann, lange bevor man das Limit des Kontextfensters erreicht.
00:17:21Und das Merkwürdige an ihrer Entdeckung war, dass kohäquenter, gut strukturierter Text eher zu diesem Fehlerbild führt, als wenn man die Anweisungen einfach in eine zufällige Reihenfolge bringt und durchmischt.
00:17:33Warum das so ist, weiß ich nicht, dafür müsste ich ihren Bericht lesen.
00:17:37Das Modell kann also 2.000, 5.000, möglicherweise 10.000 Anweisungen nachverfolgen, aber es schlussfolgert nicht unbedingt klar über sie.
00:17:46Es wird nicht unbedingt – wenn diese Anweisungen im Widerspruch stehen, wenn Spannungen zwischen ihnen herrschen – das Ganze unbedingt richtig hinbekommen.
00:17:53Und dann ist da noch der andere Punkt, den ich kurz erwähnte.
00:17:56Claudes Weigerungen sind zwar nervig, aber sie sind unübersehbar.
00:18:00Man erhält einen Fehler und weiß, dass es fehlgeschlagen ist.
00:18:02GPTs höflicher, halb fertiger Bericht ist viel gefährlicher, weil er wie eine echte Antwort aussieht.
00:18:07Man muss das gesamte Dokument lesen, um zu bemerken, dass es auf halbem Weg heimlich aufgegeben hat, was bedeutet, dass man der Ausgabe nicht trauen kann.
00:18:13Das bedeutet, dass Sie die Ausgabe jedes verdammte Mal lesen müssen, um sicherzustellen, ob sie funktioniert oder nicht.
00:18:17Das Modell akzeptiert also Ihre 2.000 Regeln und gibt Ihnen etwas zurück, das zumindest anfangs zuversichtlich und ausgefeilt wirkt, aber auf halbem Weg abgebrochen sein könnte.
00:18:30Ganz nebenbei: Die Leute fragen mich immer, wie viel mich das alles gekostet hat.
00:18:34Es hat mich 209 US-Dollar gekostet, all diese Abfragen durchzuführen.
00:18:372.300 Aufrufe über sieben Modelle hinweg beliefen sich auf 209 Dollar.
00:18:43Es zeigt sich: Neue Grundlagenforschung kostet gar nicht so viel.
00:18:46Und das ist der Teil des Vortrags, in dem ich sagte, dass man diesen Kram in der Produktion überprüfen muss, weil man sich nicht darauf verlassen kann, dass das Modell nicht stillschweigend versagt.
00:18:55Sie wussten also, dass ich irgendwann Evals erwähnen würde, weil ich bei Arise arbeite und das genau mein Job ist.
00:19:01Aber es gibt genug Eigenwerbung für Arise.
00:19:03Ich sage daher nur eine wahre Sache: Wenn Sie eine echte KI-Anwendung entwickeln und ihr wirklich knifflige Aufgaben stellen,
00:19:10werden Sie bei einem Frontier-Modell über einen oder mehrere dieser Fehler stoßen.
00:19:14Und außer Claude, das Ihnen auf API-Ebene einfach die kalte Schulter zeigt, ist die einzige Möglichkeit zu erkennen, dass etwas schiefgelaufen ist, die Überwachung Ihrer Ausgaben mit einem anderen LLM.
00:19:23Das ist ein Eval, genau das macht Arise, und dabei belasse ich es.
00:19:27Ich erwähnte bereits, dass es seit unseren eigenen Tests neue Forschungen gibt.
00:19:30Hier ist noch ein wichtiger Punkt.
00:19:31Es erschien ein Paper, das 46 Modelle testete, mit dem Titel Revisiting the Reliability of Language Models in Instruction Following,
00:19:37was meine Ohren nach meinen eigenen Recherchen natürlich sofort spitz werden ließ.
00:19:41Und sie fanden etwas Unangenehmes heraus: Ein Modell kann einen Benchmark wie unseren mit Bestnoten bestehen und dennoch extrem unzuverlässig sein.
00:19:47Denn wenn man dieselbe Anweisung auf etwas andere Weise formuliert, kann das einen radikalen Unterschied darin machen, wie gut es diese Anweisungen befolgt.
00:19:56Das Modell kann also 2.000 Anweisungen befolgen und das wirklich gut machen.
00:20:00Aber wenn man dieselben Anweisungen, dieselben 2.000 Anweisungen in eine andere Reihenfolge bringt, kann das das Modell plötzlich deutlich schlechter darin machen, sie zu befolgen.
00:20:08Und wie genau man das macht, was die richtige Reihenfolge der Anweisungen für Ihr Modell ist, damit es ihnen perfekt folgt anstatt verwirrt zu werden, ist nach wie vor Gegenstand laufender Forschung.
00:20:19Die Kapazität ist also gestiegen, aber die Zuverlässigkeit bleibt ein Problem.
00:20:24Und das ist jetzt nur ein kleiner Hauch von Stolz, weil ich mich darüber gefreut habe: Ich bin kein Wissenschaftler, ich habe ein bisschen recherchiert.
00:20:31Und dann hat sich eine ganze Reihe echter Wissenschaftler darauf gestürzt und echte Wissenschaft zu derselben Frage betrieben.
00:20:36Inzwischen gibt es eine ganze Reihe von Benchmarks zur Messung genau dieser Frage.
00:20:40Firebench, CCRbench, Guidebench versuchen alle dasselbe zu messen.
00:20:44Wie gut Modelle viele reale, unübersichtliche Einschränkungen gleichzeitig befolgen.
00:20:49Und jetzt schaut das ganze Feld darauf; wenn Sie also bessere Wissenschaft wollen als meine, wissen Sie, 10.000 zufälligen Wörter, existiert die echte Wissenschaft jetzt.
00:20:58Das bringt mich zu dem Punkt, an dem ich Sie entlasse.
00:21:00Vor einem Jahr bestand der schwierige Teil beim Schreiben eines Skills darin, alles unterzubringen, ohne dass das Modell den Faden verliert.
00:21:05Das war ein Kompressionsproblem, und dieses Kompressionsproblem ist gelöst.
00:21:08Das Modell hält Ihre 2.000 Anweisungen problemlos im Kopf.
00:21:11Der neue schwierige Teil besteht darin zu wissen, ob es tatsächlich getan hat, was Sie gesagt haben, und das ist ein Verifizierungsproblem.
00:21:16Ein Verifizierungsproblem löst man nicht, indem man einen besseren Prompt schreibt.
00:21:20Man löst es, indem man die Ausgabe jedes Mal überprüft, genauso wie man jeden anderen Code testen würde – sprich: durch ein Eval.
00:21:26Die Leistungsgrenze hat sich in einem Jahr verzehnfacht.
00:21:29Gehen Sie also zurück und überprüfen Sie die Annahmen, die Sie vor sechs Monaten darüber getroffen haben, wie groß Ihre Prompts sein sollten und wie umfangreich Ihre Anweisungen werden dürfen, denn sie könnten bereits falsch sein.
00:21:41Das war der Vortrag.
00:21:42Wenn Sie all den Code und sämtliche Daten haben möchten, finden Sie diese unter dieser GitHub-URL.
00:21:48Und dieser andere QR-Code ist etwas, das das Marketing unbedingt einfügen musste.
00:21:51Wir veranstalten heute Abend um 17:00 Uhr eine Weltmeisterschafts-Watchparty.
00:21:55Sie können zu unserer Party kommen.
00:21:56Dieser Link führt zu dem Luma-Event, mit dem Sie zur Party rein kommen.
00:22:01Ich hoffe, dieser Vortrag hat Ihnen ein paar neue Erkenntnisse oder zumindest ein paar Lacher gebracht, und vielen Dank für Ihre Zeit und Ihre Aufmerksamkeit.
00:22:07Vielen Dank.
00:22:08Vielen Dank.

설명

Laurie Voss reran a year old benchmark and the models walked straight through its ceiling without noticing it was there. IFScale asks a model to write a business report containing a list of exact words, then counts how many actually appear. A year ago frontier models started dropping instructions somewhere around 200 to 300, which is a hard limit on how much you can put in a skills file. Voss, head of developer relations at Arize AI and a cofounder of npm, first replicated that result on the three models from the original paper still reachable by API, then pointed the same test at the current frontier. They scored 100 percent immediately. He had to raise the benchmark from 500 words to 10,000 before anything broke at all. The boundary now sits near 2,000 instructions, and for the best model closer to 5,000, roughly a tenfold gain in twelve months. The stranger finding is that the models no longer fail the same way. One simply forgets, shedding nearly half its rules by 2,000. One refuses at the API level, because a pile of random words trips its safety classifier. One spends its whole thinking budget verifying instructions and leaves no room to answer. The last writes five thousand words of the report, decides the request is stupid, says so politely, and stops, which reads like a finished answer unless you get to the end. Voss argues this moves the work: fitting rules into a small budget was a compression problem and it is gone, while knowing whether the model obeyed is a verification problem that only checking outputs solves. The whole study cost 29 dollars. Speaker info: - https://x.com/seldo - https://www.linkedin.com/in/seldo/ - https://seldo.com Timestamps: 0:00 - The 200 instruction ceiling and where it came from 1:49 - Not knowing whether it followed your rules 2:58 - How the IFScale benchmark works 4:19 - Replicating last year's result 6:12 - Pointing the same test at current models 7:07 - The headline, a tenfold jump in a year 9:01 - Four models, four different ways to fail 14:27 - What this changes in your workflow 16:29 - Caveats, and what the test does not prove 19:32 - Capacity went up, reliability did not 21:06 - Compression solved, verification remains

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기