Mausestärke: Agenten, die man nicht messen kann, kann man nicht führen. — Maximillian Piras, Yutori
AAI Engineer
컴퓨터/소프트웨어경제 뉴스경영/리더십
스크립트
00:00:00Vielen Dank für Ihre Zeit, ich schätze es sehr, dass Sie da sind, und es ist mir immer eine große Ehre,
00:00:18auf der World's Fair zu sprechen. Ich werde also mein Bestes tun, um Ihnen ein paar wertvolle Einblicke zu geben, und ja,
00:00:24hoffentlich Ihre Zeit lohnenswert zu machen. Mein Name ist Maximilian Puros, und heute spreche ich über
00:00:29Mausstärke. Dies ist ein Vortrag über das Messen von Agenten anhand von mentalen Modellen. Bevor ich jedoch
00:00:36darüber spreche, wie man Agenten misst, werde ich ein wenig darüber erzählen, wie ich sie täglich nutze,
00:00:41und das kommt Ihnen vielleicht bekannt vor, aber um alle auf den gleichen Stand zu bringen, gehen wir es einfach durch. Ich lasse sie meistens im Hintergrund
00:00:46laufen, so wie viele von Ihnen vermutlich auch. Während sich meine aktive Aufmerksamkeit auf eine Sache konzentriert,
00:00:52etwa diesen Vortrag vor Ihnen zu halten, möchte ich dennoch bei Nebensachen Fortschritte erzielen.
00:00:57Ich konzentriere mich also voll auf diesen Vortrag, während meine Agenten mir helfen, im Hintergrund einige
00:01:04Entwürfe zu erkunden. Da meine Folien meiner Meinung nach noch etwas Arbeit brauchen, habe ich mein Designsystem
00:01:09bereits eingerichtet und meinen Agenten einige Anweisungen gegeben. Also starte ich einen Agenten, der einfach versucht,
00:01:15verschiedene Richtungen bei der Typografie und dem Layout zu erkunden und so viele Entwürfe wie möglich
00:01:21zu erstellen. Aber natürlich ist ein Agent nie genug, deshalb starte ich gerne eine ganze Reihe davon parallel. Wissen Sie, ich habe
00:01:28viele Folien durchzugehen, also brauche ich all meine Agenten, um das in verschiedene Richtungen zu erforschen, und hoffentlich
00:01:34erhalte ich ein paar interessante Ergebnisse, um meine Folien etwas besser zu machen. Und hoffentlich werden sie bald fertig, denn wir
00:01:40haben hier offensichtlich einen engen Zeitplan, eine knappe Deadline. So arbeite ich im Allgemeinen, und das kommt
00:01:49vielen von Ihnen wahrscheinlich bekannt vor, wo wir einfach versuchen, so viele Agenten wie möglich parallel zu starten, weil es
00:01:54sich immer so anfühlt, als gäbe es noch viel mehr Recherchen zu tun – wir wollen es so gründlich wie möglich –, es gibt noch viel mehr Design-
00:02:00Entwürfe zu machen. Wenn sich unser Hauptfokus also auf eine Sache richtet, warum nicht eine Reihe von Agenten parallel starten
00:02:06und einfach versuchen, seine Zeit zu maximieren? Und das macht natürlich viel Spaß, bis man die Rechnung bekommt, und dann
00:02:13fängt man an sich zu fragen, ob es das alles wert war, nicht wahr? Haben Sie zu intensiv Vibe-Coding betrieben, haben Sie zu stark auf Token-Maximierung gesetzt,
00:02:21hätten Sie bei der Sequenzierung Ihrer Agenten effizienter vorgehen können? Und genau darauf werde ich heute
00:02:29zu sprechen kommen: Wie bewerten wir die Token-Kosten und insbesondere, wie helfen wir unseren Kunden,
00:02:34sie zu bewerten? Seit anderthalb Jahren habe ich das Vergnügen, als Gründungsgdesigner bei einem
00:02:40Unternehmen namens Utori zu arbeiten, und wir konzentrieren uns auf Computernutzungsmodelle – das sind Modelle, die lernen, einen Computer
00:02:45wie ein Mensch zu bedienen. Der Anwendungsfall dafür ist: Wenn man keine Informationen von einer API oder einem MCP abrufen kann,
00:02:52warum nicht einfach einen Agenten aussenden, der einen Computer wie ein Mensch bedient? Dann können wir alle Arten von Daten extrahieren
00:02:58und sie so manipulieren, dass wir an all die Dinge gelangen, die zuvor nicht zugänglich waren. Das ist natürlich weniger
00:03:04effizient als APIs und MCPs, aber als letztes Mittel schickt man einfach einen Agenten los, der den Computer bedient und versucht, die
00:03:11Informationen zu beschaffen. Hier ist der Utori-Agent, der die Utori-Website nutzt und seinen eigenen Benchmark überprüft – also quasi
00:03:19sich selbst bewundert. Ja, das wird ein bisschen skurril, und ein Großteil dessen, was ich als
00:03:25Gründungsdesigner dort tue, ist, mit Kunden zu sprechen und zu verstehen, wie wir Agenten so intuitiv wie
00:03:29möglich machen können. Wie ermitteln wir die mentalen Modelle, die sie nutzen, um den Wert der Anwendungsfälle einzuschätzen,
00:03:34für die sie Agenten losschicken wollen? Und viele von ihnen scheinen bisher ziemlich verwirrt zu sein; viele Leute sind begeistert von
00:03:41Agenten, aber der Satz, der recht häufig fällt, ist, dass sie das Gefühl haben, sie würden gerade erst an der
00:03:46Oberfläche kratzen. Es scheint noch nicht ganz intuitiv zu sein, wie wir sie am besten nutzen können, und daher
00:03:52läuft es in vielen meiner Kundengespräche immer auf die Frage hinaus: Was ist der beste Weg, um
00:03:57Agenten einzusetzen, was sind die besten Anwendungsfälle für sie und wie betrachte ich die Kompromisse
00:04:01hinsichtlich der Token-Kosten im Verhältnis zum Nutzen? Ich denke also, wir bauen diesen Muskel heute
00:04:06immer noch auf, und das führt mich zur These des Vortrags: Ich glaube, dass Agenten ein
00:04:11Messproblem haben. Als Beispiel sehen Sie hier mich bei der Arbeit, wie ich versuche, einige
00:04:16Agenten zu messen, und einer meiner Kollegen hat dieses Foto gemacht und zu mir gesagt, es sähe aus, als würde ich versuchen,
00:04:21das Geheimnis um Pepe Silva zu lösen. Wie Sie sehen, ist es keine einfache Aufgabe, Agenten zu messen, aber ich bin sicher,
00:04:30einige von Ihnen sagen jetzt: Moment mal, worüber redet dieser Typ? Ich habe eine Flotte von Agenten,
00:04:35die gerade für mich arbeiten, wir bauen während wir sprechen unsere nächste Millionen-Dollar-App, und ich habe
00:04:40überhaupt kein Problem damit, meine Agenten zu messen. Dem würde ich zustimmen, aber dann möchte ich Sie auf
00:04:46das unverzichtbare Zitat von Upton Sinclair verweisen, um uns alle daran zu erinnern, dass jeder in diesem Raum sehr voreingenommen ist und
00:04:52wir Early Adopters sind und uns sehr darauf freuen, diese neue Technologie zu erkunden. Das bedeutet jedoch nicht, dass wir
00:04:57die Menschen repräsentieren, denen wir letztendlich helfen wollen, diese Technologie anzunehmen. Daher,
00:05:03wissen Sie, halte ich es für wichtig, uns daran zu erinnern, dass wir auf die eine oder andere Weise wahrscheinlich
00:05:08Token verkaufen, sei es indirekt oder direkt. Spiegelt unsere eigene Token-Nutzung also wirklich
00:05:13all die Menschen da draußen wider, die noch nie einen Agenten berührt haben? Manche Leute kopieren und fügen immer noch
00:05:18in ChatGPT ein – ich bin womöglich mit so einer Person verheiratet, und trotz all meiner Versuche, sie dazu zu bringen,
00:05:23sie noch nicht von mir hat einrichten lassen, und zur Erinnerung: Wenn wir daran denken,
00:05:30Menschen bei der Nutzung von Agenten zu helfen – all die Menschen weltweit, von denen wir glauben,
00:05:35dass sie genauso begeistert und wertvoll sein könnten wie wir, wenn wir parallele Agenten laufen lassen –, rufen wir uns dieses Zitat ins Gedächtnis.
00:05:43Das läuft also auf das alte Problem einer neuen Technologie hinaus, und natürlich gibt es haufenweise Geschichte, die wir studieren können, um zu sehen, wie die Leute das früher sahen.
00:05:52Wir haben dieses extrem spannende neue Ding, aber wir haben noch nicht ganz herausgefunden, wie wir es richtig kommunizieren sollen.
00:05:58Deshalb gehe ich für diesen Vortrag zurück ins 18. Jahrhundert und wir können uns ein paar Notizen machen, als James Watt versuchte, Dampfmaschinen zu verkaufen.
00:06:05Damals beschloss er, dass ein großartiger Anwendungsfall für seine Dampfmaschinen darin bestand, ein Pferdebetriebswerk zu ersetzen.
00:06:12Das war damals die Energiequelle einer Mühle. Wenn man also zum Beispiel eine Brauerei hat
00:06:18und eine Energiequelle braucht, um seine Gerste zu mahlen oder was auch immer – ich bin kein großer Brauerei-Typ, daher weiß ich nicht genau, wie das gemacht wird –,
00:06:25aber man braucht eine Energiequelle, und die damals übliche Energiequelle bestand darin, ein Pferd an einen Dreharm zu spannen,
00:06:31und das Pferd lief im Kreis, und so hat man seine Energie erzeugt. Heutzutage mag das verrückt erscheinen,
00:06:36aber damals war es gang und gäbe. Watt dachte sich, wisst ihr, im Vergleich zu einem Pferd ist das eine sehr effiziente Maschine,
00:06:42obwohl er richtigerweise anmerkte, dass eines der Haupthindernisse bei der Einführung diese kognitive Dissonanz sein würde, Leuten, die gewissermaßen in Pferden denken,
00:06:52zu erklären, wie man sich an diese alte Maschine anpasst, die irgendwie einschüchternd und angsteinflößend wirkt, und vielleicht sagt jemand, dass sie alle eure Probleme lösen wird,
00:07:01aber man kann die Vision noch nicht vor sich sehen. Vielleicht kommt das einigen von uns, die heute mit Agenten arbeiten, bekannt vor.
00:07:07Watts Lösung bestand darin, dass er das mentale Modell dieser Leute verstehen musste
00:07:12und insbesondere eine Metrik entwickeln musste, die ihm einen Anhaltspunkt für die relative Effizienzsteigerung liefert.
00:07:18Also untersuchte er buchstäblich Pferdebetriebswerke und versuchte, so etwas wie theoretische Messungen anzustellen, wie –
00:07:28wie die Mechanik und die durchschnittliche Leistung davon sind, und kam schließlich zu einer Metrik namens Pferdestärke,
00:07:35was vielleicht bekannt klingt. Er nutzte diesen Wert, um die allgemeine Leistung zu quantifizieren, die die Pferde damals erzeugten,
00:07:44und konnte dies dann als Grundlage nutzen, um den Effizienzmultiplikator aufzuzeigen, den eine Dampfmaschine bieten konnte.
00:07:49Diese Metrik war damals nicht sehr wissenschaftlich.
00:07:52Man könnte sagen, sie war nicht einmal unbedingt genau, aber das Wichtigste, was sie tat, war, eine Wertsteigerung zu kommunizieren,
00:08:00und das erlaubte den Pferdeliebhabern gewissermaßen zu kalibrieren, welche Effizienzgewinne sie durch den Versuch, eine Dampfmaschine einzusetzen, erzielen könnten.
00:08:12Es ging also nicht einmal unbedingt darum, was man bei der Nutzung bekommt, sondern darum, was einen überhaupt erst dazu bringt, es auszuprobieren.
00:08:19Und wisst ihr, das ist eine ziemlich große Leistung, denn obwohl er in Bezug auf diese Metrik die Effizienz auf seiner Seite hatte,
00:08:27Wisst ihr, seien wir ehrlich, ganz egal wie effizient das war, Pferde haben einfach tolle Vibes,
00:08:34es ist also schwer, diese Vibes zu übertreffen, und das wusste er.
00:08:37Er musste sozusagen die Emotionen überwinden und etwas liefern, das eine ROI-Berechnung ermöglichte.
00:08:45Und, oh, Entschuldigung, ich habe was übersprungen.
00:08:48Die Lehre daraus ist also: Wenn wir unseren Kunden keinen greifbaren ROI bieten können,
00:08:55dann fällt es uns sehr schwer, den Wert zu vermitteln.
00:08:58Und ich denke, wir müssen nur in unsere eigene Branche blicken, um all die Beispiele zu sehen, in denen andere im Tech-Sektor ebenfalls daran scheitern, den ROI zu berechnen.
00:09:07Wir mögen hier im Raum vielleicht denken, das sei ein gelöstes Problem, aber wenn man sich andere Ingenieure weltweit anschaut, die vielleicht nicht so KI-fixiert sind,
00:09:16sind sie theoretisch sehr klug und sollten herausfinden können, wie man das berechnet,
00:09:21doch dann gibt es Szenarien, in denen Leute ihr gesamtes Token-Budget für ein Jahr
00:09:27innerhalb eines Quartals verbrauchen oder sich mit Token-Bestenlisten herumschlagen.
00:09:32Die Anreize passen also noch nicht ganz zusammen, und wir haben im Technologiesektor vielleicht noch nicht das richtige Wertmaß gefunden.
00:09:39Wie skalieren wir also darüber hinaus und sprechen mit Leuten, die keine Ahnung haben, wovon wir reden,
00:09:45versuchen aber dennoch, ihnen ein Maß an gesteigerter Effizienz durch Agents zu bieten?
00:09:51Im Moment stecken wir in diesem Teufelskreis fest, in dem wir zu viel ausgeben und zu wenig nutzen.
00:09:57Das ist ein Begriff, den ich von RAMP geliehen habe, die dazu einen tollen Blogbeitrag haben.
00:10:00Es ist also ein Kreislauf, in dem wir uns durch Token-Maximalismus quasi in die Sparsamkeit treiben
00:10:05und dann aussteigen, bis uns wieder die FOMO erfasst und wir es erneut versuchen.
00:10:11Ich denke, wir müssen diesen Kreislauf durchbrechen, und das schaffen wir, indem wir bessere Messwerte finden, die den Wert vermitteln.
00:10:18Einige sind offensichtlich auf dem richtigen Weg.
00:10:21Neulich kursierte auf X ein Diagramm, das der Coinbase-CEO gepostet hatte: Sie hatten intern begonnen, die Standardeinstellungen für ihre Modelle zu ändern
00:10:31und versuchten, die Spitzenmodelle nur für die schwersten Aufgaben aufzuheben.
00:10:34Das führte dazu, dass sich die KI-Ausgaben von der Token-Nutzung abzukoppeln begannen.
00:10:40Das ist ein guter Anfang – RAMP hat dazu, wie gesagt, auch einen tollen Blogbeitrag.
00:10:44Aber das Problem ist meiner Meinung nach immer noch, dass der Fokus zu stark auf Token liegt.
00:10:48Token sind natürlich als Messgröße für ein internes System nützlich, aber letztlich sind sie nur ein Output.
00:10:56Deshalb müssen die Token sehr klar mit einem Ergebnis verknüpft werden.
00:11:01Wie viele Bugs haben die Token – Entschuldigung, wie viele Bugs haben die Token, die wir gekauft haben, beseitigt – entschuldigen Sie, total verheddert.
00:11:12Wie viele Bugs wurden durch unsere Token-Ausgaben beseitigt?
00:11:15Wie viele Support-Anfragen wurden geschlossen und so weiter?
00:11:18Klare Ergebnisse also und diese dann sauber mit den Fortschritten bei unseren Zielen verknüpfen.
00:11:23Und ohne eine sehr genaue Messung des ROI wird das extrem schwierig.
00:11:28Und ich gehe noch einen Schritt weiter und sage, dass es nicht einmal nur die breitere Technologiebranche sein muss,
00:11:35die auf dieses Problem stößt, sondern dass es vielen von uns in diesem Raum vielleicht auch so geht.
00:11:40Und obwohl wir es wahrscheinlich alle genießen, mit verschiedenen Agenten zu coden und das Gefühl haben –
00:11:46es fühlt sich durchaus so an, als gäbe es da etwas bezüglich der gesteigerten Fähigkeiten und Effizienz,
00:11:51besteht das Problem natürlich darin, dass wir alle an Tausenden von Pull Requests zugrunde gehen.
00:11:54Und selbst Anthropic, wo einige Teammitglieder behauptet haben, das Coden gelöst zu haben,
00:12:01haben auch zugegeben, dass sie das Code-Review nicht gelöst haben.
00:12:04Und infolgedessen hat sich der Flaschenhals nun auf das menschliche Review verlagert, wo die Effizienzgewinne durch Coding-Agenten
00:12:11noch nicht ganz sichtbar sind, weil wir die meiste Zeit mit dem Reviewen des Codes verbringen
00:12:14und noch nicht herausgefunden haben, wie wir das parallel zur Generierung des Codes selbst skalieren können.
00:12:20Und so verlagert sich der Flaschenhals schließlich auf die Verifizierungsseite, wodurch uns die Möglichkeit fehlt, den Wert in großem Maßstab zu messen
00:12:28und die Qualität mit derselben Geschwindigkeit zu beurteilen.
00:12:30Und um nochmals auf die ROI-Berechnungen zurückzukommen: Wir generieren all diesen Code, aber woher wissen wir –
00:12:35wir wissen nicht, ob genug davon gut ist, um die Ausgaben zu rechtfertigen.
00:12:39Und natürlich war das Code-Review vielleicht schon immer fehlerhaft, aber Agenten entlarven es jetzt als das –
00:12:46legen das eigentliche Problem offen.
00:12:48Und ich mag dieses Zitat von Noah Hine aus einem Beitrag darüber, wie man Code-Reviews löst,
00:12:53in dem er ausdrücklich erwähnt, dass die Annahmen hinter dem Code-Review jetzt –
00:12:57das sind, was neu überdacht werden muss.
00:12:59Wir müssen also unsere Vorannahmen überprüfen, um eine neue Grundlage dafür zu finden, wie wir im Zeitalter von Agenten Code-Reviews durchführen können.
00:13:06Und ich werde nicht darauf eingehen, wie man Code-Reviews löst.
00:13:09Ich denke, das ist definitiv ein Vortrag, den jemand anderes besser halten sollte und ein völlig anderes Thema.
00:13:15Aber was für diesen Vortrag wichtig ist, ist die Frage: Warum fühlt sich das Code-Review so an, als sei es lösbar?
00:13:19Und ich denke, Noah berührt hier etwas Wichtiges, nämlich dass das Code-Review als Kultur
00:13:24eine sehr gute Konvergenz bezüglich gemeinsamer Annahmen aufweist.
00:13:28Und das erlaubt es Ihnen – das erlaubt es Ihnen, Dinge im großen Maßstab zu messen, wenn wir uns alle auf die Messung einigen können
00:13:35und dies zu einer einigermaßen klaren Richtlinie wird.
00:13:39Die anstehende Aufgabe besteht also darin, dass wir diese Annahmen für das Zeitalter der Agenten annehmen – anpassen müssen, entschuldigung.
00:13:49Und wenn wir das schaffen, können wir von der Ausführung
00:13:54mit der Geschwindigkeit von Rechenleistung zu Messungen mit der Geschwindigkeit von Rechenleistung übergehen.
00:13:57Und natürlich müssen die Messungen zu den mentalen Modellen der Kunden passen, die sie nutzen.
00:14:01Und die Lehre hierbei ist, dass man bei der Überlegung, wie man einen Agenten für etwas baut,
00:14:09auch darüber nachdenken muss, wie man den Kunden hilft, eine Methode aufzubauen oder zumindest zu schaffen, um zu verifizieren, dass das Ergebnis gut ist.
00:14:16Es reicht also nicht aus, ihn nur zu bauen.
00:14:18Wir müssen ihnen auch helfen – wir müssen ihnen auch dabei helfen, zu klaren ROI-Berechnungen zu gelangen, um ihre Ausgaben zu rechtfertigen.
00:14:25Und das bringt mich zu der Idee der „Mouse Power“ (Mausstärke), die das Äquivalent zur Pferdestärke für das Zeitalter der Agenten sein könnte.
00:14:33Genau wie James Watt in der Lage war, ein Maß für die Effizienz im Vergleich zu den Pferden in den Göpeln –
00:14:39in den Pferdegöpeln, die damals die Energiequelle waren – zu zeigen,
00:14:42können wir vielleicht auch herausfinden, wie wir eine Effizienzbasis für die Art und Weise schaffen, wie wir Computer heute nutzen,
00:14:48und dann demonstrieren, wie viel besser oder vielleicht leistungsstärker bei bestimmten Vektoren ein Agent bei dieser Aufgabe sein könnte.
00:14:55Und das ist natürlich vielleicht keine so einfache Aufgabe wie damals für ihn, als er einfach den Pferdegöpel untersuchen konnte,
00:15:02weil wir nicht einfach irgendeine Methode entwickeln können, um unsere Cursorbewegungen zu messen
00:15:07und quasi die Delta herauszufinden, wie viel effizienter ein Agent sie bewegen könnte,
00:15:11und wir somit sagen können: Ja, Agenten sind bei diesen Aufgaben um so viel leistungsstärker als Menschen.
00:15:15Glauben Sie mir, ich habe es versucht.
00:15:17Ich ließ mir von Claude dieses Messgerät per Vibe-Coding erstellen,
00:15:20und ich dachte, wenn ich vielleicht die Bewegung herausfinden könnte,
00:15:23wie die potenzielle Bewegung über den Bildschirm und messen, wie schnell sie war,
00:15:27könnte ich ein sauberes Maß für Mauseffizienz erhalten.
00:15:29Aber das ist natürlich nur als Scherz gemeint.
00:15:31Das ist natürlich ein sinnloses Unterfangen, weil der Informationsraum einfach viel zu hochdimensional ist,
00:15:37und deshalb wird die Mauseffizienz natürlich nie eine Metrik sein,
00:15:41sondern es ist eher eine Idee, nämlich die Idee: Wenn man jemandem einen Agenten verkauft,
00:15:45muss man ihm auch das Bewertungssystem an die Hand geben, wie wir eigentlich verifizieren, dass dieser Agent gute Arbeit leistet,
00:15:51und somit ein gutes Maß dafür haben, dass diese Token es wert sind.
00:15:57Wie man das macht, liegt natürlich ganz bei Ihnen,
00:15:59und ich werde Ihnen nicht sagen können, wie Sie –
00:16:01ich habe keine guten Frameworks dafür, wie man die richtigen Messungen herausfindet,
00:16:05um sie allen bereitzustellen, für die Sie einen Agenten bauen,
00:16:08aber was ich tun kann, ist eine Idee vorzustellen, die mir im Kopf herumgeistert,
00:16:12die in der Informationstheorie verwurzelt ist.
00:16:15Um also auf Claude Shannons Ideen zur Messung der Entropie in Informationen zurückzukommen:
00:16:20Entropie als die Unsicherheit einer Wahrscheinlichkeitsverteilung
00:16:24und natürlich sehr stark die Grundlage dafür, wie wir Agenten heute trainieren,
00:16:28wobei Dinge wie Kreuzentropie und ähnliches ein großer Faktor bei der Bestimmung der Leistungsfähigkeit eines Agenten sind.
00:16:33Ich denke, dass Entropie eine interessante Idee ist, über die man nicht nur im Hinblick auf die Leistung eines Agenten nachdenken sollte,
00:16:38sondern auch im Hinblick auf die Aufgaben, zu deren Erledigung wir sie ausschleusen.
00:16:42Und so habe ich diese Matrix zusammengestellt, die auf der x-Achse abbildet:
00:16:48die Unsicherheit bei den Schritten, die zur Ausführung einer Aufgabe erforderlich sind.
00:16:51Wenn wir also über den Bau eines Agenten nachdenken,
00:16:53reicht es meiner Ansicht nach nicht aus, nur zu überlegen, was eine wertvolle Aufgabe für den Agenten wäre,
00:16:57sondern auch zu bedenken, wie viel Unsicherheit in den Schritten zur Durchführung dieser Aufgabe selbst steckt.
00:17:03Ein Beispiel wäre: Einen Flug zu buchen hat viel weniger Unsicherheit als etwa ein Meisterwerk zu malen, oder?
00:17:10Denn man weiß, dass es bestimmte Informationen geben muss, die beim Flugkauf passieren müssen.
00:17:15Es muss einen Abflugort und ein Ankunftsziel geben.
00:17:18Es wird ein Sitzplatz ausgewählt.
00:17:19Das geschieht vielleicht durch die Person.
00:17:21Es ist vielleicht einfach zufällig.
00:17:22Aber diese Dinge müssen passieren, damit diese Aufgabe abgeschlossen wird.
00:17:25Und auf der anderen Seite steht die Aufgabe, ein Meisterwerk zu malen, nicht wahr?
00:17:29Und wer weiß schon, wie die Schritte dazu aussehen?
00:17:31Und vielleicht bringt man einen Agenten dazu, es zu tun.
00:17:33Aber es wäre sehr schwierig herauszufinden, wie wir tatsächlich einen relativ vorhersehbaren Weg dorthin schaffen können.
00:17:40Auf der anderen Achse liegt jedoch die Unsicherheit in den Akzeptanzkriterien selbst.
00:17:45Also nicht nur, ob der Agent die Aufgabe ausführen kann, sondern können wir jemandem tatsächlich helfen –
00:17:50oder gibt es tatsächlich eine klare Richtlinie dafür, wie sie bewertet wird?
00:17:54Wenn man also über Ideen auf diesen beiden Achsen und deren Schnittpunkt nachdenkt, bietet uns das vielleicht einen besseren Leitfaden
00:18:00dafür, wie man Agenten baut.
00:18:01Und wir können ein paar Beispiele durchgehen.
00:18:03Wenn wir also auf die – auf die linke Seite schauen, Ihre rechte Seite – ja.
00:18:09Nein, Ihre linke auch.
00:18:11Also ja, ich weiß, der letzte Redner war davon auch verwirrt.
00:18:15Also ja, auf der linken Seite, wenn die Unsicherheit bei den Aufgabenschritten gering ist, dann ist es ein sehr – ein sehr vorhersehbares Ergebnis,
00:18:24oder es ist ein sehr vorhersehbarer Weg, um dieses Ziel zu erreichen.
00:18:27Und warum sollte man dann Token verschwenden?
00:18:30Schreiben Sie einfach ein Skript.
00:18:31Auf der anderen Seite, wenn die Schritte zur Ausführung der Aufgabe eine sehr hohe Unsicherheit aufweisen, haben Sie sehr unvorhersehbare Informationen.
00:18:40Und daher läuft es wahrscheinlich Gefahr, außerhalb der Verteilung beim Vortraining zu liegen, und hat wahrscheinlich sehr spärliche Belohnungen für das Reinforcement Learning.
00:18:47Und vielleicht ist es deshalb keine gute Aufgabe für einen Agenten, weil es einfach viel schwieriger ist herauszufinden, wie man diese Daten tatsächlich modelliert.
00:18:54Und in der Mitte ist offensichtlich – ich glaube, meine Zeit ist um, aber ich werde noch nicht hinausgeworfen.
00:19:01Deshalb bringe ich das jetzt schnell zu Ende.
00:19:04Also ja, in der Mitte liegt wahrscheinlich der Sweet Spot.
00:19:06Aber auf der anderen Achse: Wie groß ist die Unsicherheit bei der Verifizierung, dass dies tatsächlich wertvoll ist?
00:19:10Wenn Sie also eine hohe Unsicherheit bei den Akzeptanzkriterien haben, befinden Sie sich im Grunde an einem Punkt, an dem die Verifizierung von der Ausführung kaum zu unterscheiden ist.
00:19:17Warum sollten Sie also einen Agenten für etwas bauen, bei dem eine Person fast die Arbeit noch einmal machen muss, um zu verifizieren, dass es nützlich war?
00:19:24Also offensichtlich eine Token-Verschwendung.
00:19:26Und dann bleibt dieser mittlere Bereich, in dem Sie diesen interessanten Schnittpunkt von Aufgaben haben, die – sie sind nicht zu ungewiss, als dass sie – oder sie haben einen Grad an Unsicherheit, bei dem sie nicht nur ein Skript oder außerhalb der Verteilung für das Training sind, aber sie haben genügend Unsicherheit, um interessant zu sein.
00:19:47Gleichzeitig haben sie aber auch die Eigenschaft, dass es relativ einfach ist, den Wert von ihnen zu validieren bzw. zu überprüfen.
00:19:56Und so landen sie an einem Ort, wo sie quasi die Form eines NP-artigen Problems annehmen, was bedeutet, dass sie einfacher zu verifizieren als auszuführen sind.
00:20:02Und der Grund, warum ich das sage, ist, dass man, wenn man ein ziemlich wiederholbares Muster für die Verifizierung ihrer Arbeit herausfinden kann, tatsächlich auch Agenten auf dieses Problem loslassen kann.
00:20:10Und so baut man natürlich nicht nur den Agenten, sondern baut vielleicht den Agenten, der die Arbeit des Agenten verifiziert.
00:20:18Und ja, das ist vielleicht – das ist hauptsächlich ein Denkanstoß, der sich noch in der Entwicklung befindet, daher freue ich mich über alle Gedanken dazu.
00:20:27Aber wenn Sie diesen Leitfaden befolgen, hoffe ich, dass Sie beim Bau Ihres nächsten Agenten auch herausfinden können, wie Sie dessen Mauseffizienz („Mouse Power“) aufbauen.
00:20:34Und vielen Dank.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기