Von VLMs/VLAs zu verkörperten Agenten — Armen Aghajanyan, Perceptron AI
AAI Engineer
Computing/Software
Transcript
00:00:00Ja, ich denke, wir fangen einfach an. Ich bin Armin, Mitgründer und CEO von Perceptron.
00:00:20Wir werden noch kurz darauf eingehen, was wir tun, aber worüber ich heute primär sprechen möchte, ist
00:00:25unsere Forschungshaltung, dass wir uns von Unterscheidungen zwischen VLMs, VLAs,
00:00:32Weltmodellen oder wie auch immer man es nennen mag, hin zu sogenannten verkörperten Basismodellen bewegen wollen.
00:00:42Was wir bei Perceptron also konkret tun, unser wichtigstes Ziel sozusagen, ist, dass wir
00:00:48physikalische KI-Grundlagen schaffen wollen, die uns die Fähigkeit geben, die physische Welt in Echtzeit zu wahrzunehmen, zu verstehen und mit ihr zu interagieren.
00:00:53Die übergeordnete Mission ist also wirklich die Überbrückung der
00:00:58physischen und digitalen Welt. Was im Grunde bedeutet, dass unser Ziel darin besteht, überall dort, wo es ein Gerät,
00:01:07ein Instrument, einen Roboter, eine Kamera oder einen Sensor gibt, Intelligenz bereitzustellen.
00:01:14Und wenn wir speziell über dieses Paradigma des Wahrnehmens, Schlussfolgerns
00:01:19und Handelns sprechen, sehen wir das als eine Art Vereinheitlichung der traditionellen multimodalen Modellierung.
00:01:25Ich komme von FAIR. Ich war sechs Jahre lang dort, und mein Ziel war es herauszufinden, wie man
00:01:31Rezepte für multimodale Modelle hochskaliert. Eines der ersten Dinge, an denen wir gearbeitet haben –
00:01:37und wir haben viel in diesem Bereich veröffentlicht –, war die frühe Fusion. Also das Konzept, alle diese
00:01:41Modalitäten so früh wie möglich zusammenzuführen. Die eigentliche Komplexität besteht darin, herauszufinden, was der
00:01:47richtige Weg ist, all die verschiedenen Modalitäten sowohl bei der Eingabe als auch bei
00:01:52der Ausgabe ganzheitlich abzubilden. Und so sind VLMs gewissermaßen der Standard geworden –
00:01:58wenn ich von multimodalen Modellen spreche, denken Sie wahrscheinlich an VLMs. Es geht also um die Fähigkeit,
00:02:03Bilder, Videos und Text einzulesen und im Wesentlichen Text auszugeben. Und davon gibt es Variationen.
00:02:09Es gibt Modelle wie ER-Modelle, also Modelle für verkörpertes Schlussfolgern, die zum Beispiel
00:02:15Verankerungspunkte ausgeben können und räumliches Verständnis oder Schlussfolgern etwas besser beherrschen.
00:02:20Dann haben wir Dinge wie VLAs, die den Ausgabebereich neben Text nun auch auf
00:02:25Aktionen erweitern. Diese bauen traditionell natürlich weiterhin auf Standard-VLM-Backbones auf,
00:02:30obwohl es einige Bemühungen gab, sich weg von...
00:02:35...VLMs hin zu Dingen wie Weltmodellen oder Welt-Aktions-Modellen zu bewegen, obwohl noch nichts davon super
00:02:39erfolgreich war. Und dann kommen wir zu interessanteren und komplexeren Varianten multimodaler
00:02:46Modelle, wie etwa Weltmodelle, bei denen man im Grunde aus bestimmten Eingaben Videos generiert. Bei den Eingaben
00:02:51kann es sich um Bilder oder Videos oder ehrlich gesagt um Bilder, Videos und Aktionen handeln. Der letzte Punkt, den ich
00:02:57ansprechen möchte, ist etwas Neueres, was wir semantische Weltmodelle nennen. Dabei gibt man eigentlich nichts aus,
00:03:02sondern lernt eine Art Repräsentation, die man für die Zukunft als nützlich erachtet. Was wir unter
00:03:08einem verkörperten Basismodell verstehen, ist eigentlich ein Rahmen, der sowohl die Standard-Wahrnehmung,
00:03:13das verkörperte Schlussfolgern als auch das übergeordnete Ziel der Steuerung in einem einzigen Modell ermöglicht.
00:03:20Es geht also darum, über verschiedene Sensormodalitäten bei der Eingabe hinweg logisch zu schlussfolgern und
00:03:25das meiste von dem, was ich für die Ausgabe erwähnt habe, in einem einzigen, vereinheitlichten Modell umzusetzen.
00:03:31Ich werde kurz zwei Herausforderungen ansprechen. Es handelt sich um grundlegende
00:03:35Forschungsfragen, vor denen wir stehen. Ich werde erklären, wie unser Unternehmen das angegangen ist
00:03:40und was andere Akteure in diesem Bereich tun.
00:03:43Der erste Punkt ist: Stellen Sie sich vor, Sie versuchen rein hypothetisch, etwas wie ein Video zu modellieren,
00:03:48etwa eine Stunde Video. Je nach Repräsentation verarbeiten Sie
00:03:52möglicherweise etwa eine Million visueller Tokens als Eingabe. Die Wahrheit ist, dass es gar keine echte Referenz
00:03:57gibt, die Sie effektiv nutzen können, richtig? Man kann zwar Dinge tun – und das wurde natürlich auch gemacht –,
00:04:02wie Transkripte zu extrahieren, sie aus dem Video vorherzusagen oder vielleicht synthetisch
00:04:08einige Frames zu beschriften oder Fragen dazu zu stellen. Es stellt sich heraus, dass das eine riesige Verschwendung ist,
00:04:13richtig? Wenn Sie bedenken, was in Ihr Modell einfließt: Es gehen eine Million Tokens ein,
00:04:16und Sie berechnen den Loss im Grunde nur für etwa 0,2 Prozent aller Tokens,
00:04:22die hineingehen. Das ist im Kern sehr problematisch. Und die Wahrheit ist: Egal wie Sie versuchen,
00:04:27das zu beheben, Sie speisen im Grunde ein falsches Trainingssignal ein.
00:04:31Entweder ist das Signal zu dünn gesät, zu synthetisch oder zu undifferenziert. Ansätze
00:04:37jenseits einer rein synthetischen Anreicherung bestanden darin, jedes einzelne Pixel vorherzusagen. Das ist zwar
00:04:42ein sehr dichtes Signal, aber es weist die Aufmerksamkeitswerte sehr schlecht zu. Wissen Sie,
00:04:47man vergleicht und behandelt ein Hintergrundpixel mit dem gleichen Wichtigkeitsgrad wie
00:04:51eine Greifer-Spitze, die Kontaktpunkte, spezifische Fehler oder die Physik.
00:04:56Was wir bei Perceptron also tun – und das ist ein Teil unseres zentralen Know-hows –,
00:05:01ist die Überlegung: Wie sieht ein natürliches Wahrnehmungsziel aus? Konkret: Wie kann ich
00:05:06die Wahrnehmungsobjekte, von denen wir glauben, dass sie in Zukunft wichtig sein werden, ganz automatisch vorhersagen? Als
00:05:11Beispiel könnte man fest programmieren: Wenn man einen Roboterarm hat, ist die Spitze des Greifers
00:05:16ein sehr nützliches Wahrnehmungsobjekt, das man für die Zukunft vorhersagen kann. Damit haben einige bereits
00:05:20angefangen. Das Team von MOMO Act von AI2 hat das gemacht. Es gibt auch andere VLAs, die das
00:05:26gemacht haben. Aber das ist immer noch ein fest codiertes Wahrnehmungsobjekt. Die Frage ist also: Kann man einen automatischen
00:05:30Weg finden, wie das Modell dieses sehr einzigartige Ziel semantisch lernen kann? Und die Wahrheit ist: Wir haben
00:05:37einen Weg gefunden. Wir werden hier nicht verraten, wie wir das machen, aber das deutet an,
00:05:41wie wir das Problem der Datenknappheit angehen. Das zweite Kernproblem, auf das wir viel Zeit verwenden,
00:05:49ist die Kontextüberlastung. Wenn Sie Kameras haben, die ständig laufen, oder Roboter, die nicht unbedingt
00:05:54warten oder anhalten, müssen Sie im Grunde über eine sehr, sehr große Menge an Tokens schlussfolgern. Und während
00:06:01Text relativ dicht ist, ist Video vergleichsweise dünn gesät. Die Frage lautet also: Gibt es architektonische
00:06:08Durchbrüche, um mit diesem Problem nativ umzugehen, anstatt
00:06:13nur auf synthetischer Ebene zu versuchen, dieses Ungleichgewicht zu beheben?
00:06:20Es gibt einige Dinge, die man tun kann. Ein Grundprinzip besteht darin,
00:06:25verschiedene Modalitäten als völlig unterschiedlich zu behandeln. Man darf Text-Tokens nicht genauso
00:06:31behandeln wie Bild-Tokens oder Audio- und Video-Tokens. Man kann also zum Beispiel
00:06:36damit beginnen, sich auf räumliche Kompression oder Token-Kompression zu konzentrieren. Manche machen sehr primitive
00:06:41Dinge – und wir haben anfangs auch damit angefangen, und es funktioniert tatsächlich. Man kann damit beginnen,
00:06:44blockweise Repräsentationen über ein Video oder ein Bild zu mitteln. Damit lassen sich bereits
00:06:51interessante Kompressionsraten erzielen, etwa bis zu 10-fach. Dennoch ist das eher ein Provisorium, und es gibt
00:06:57keine wirklich etablierten architektonischen Methoden, um das zu lösen. Was wir in den
00:07:04letzten Monaten getan haben, ist die Veröffentlichung unseres Ansatzes für den Umgang mit unterschiedlichen Graden von
00:07:10Datenknappheit: Man lässt das Modell einfach selbst entscheiden, welche Tokens es beachten sollte und welche
00:07:14nicht. Dafür haben wir unser Paper zu datensparsamen Mixture-of-Experts veröffentlicht, was
00:07:19genau das ermöglicht. Es erlaubt dem Modell – nun, es gibt einen Router im Modell –, tatsächlich
00:07:24vorherzusagen, welches Token einfließen und welches übersprungen werden soll. Und das gelingt uns
00:07:30gewissermaßen ohne Zusatzkosten über all die verschiedenen Schichten hinweg. Und es zeigt sich: Wenn man das Modell einfach lernen lässt,
00:07:36ohne starre architektonische Vorgaben einzucodieren, lernt das Modell tatsächlich.
00:07:43Wenn man die datensparsame Rechenleistung visualisiert, die unsere Modelle nutzen, sieht man,
00:07:49dass sie von Natur aus lernen, sich auf Informationen mit hoher Dichte oder auf aufgabenrelevante Informationen zu konzentrieren.
00:07:56Oben rechts sieht man zum Beispiel, dass sich das Modell auf das Diagramm konzentriert,
00:08:00worauf man auch als Mensch heranzoomen würde, weil das wahrscheinlich der interessante Teil innerhalb
00:08:05der Abbildung ist. Es zeigt sich, dass sogar eine aufgabenabhängige Ressourcenverteilung
00:08:13stattfindet. Wenn Sie unten links schauen und eine sehr, sehr allgemeine Frage stellen,
00:08:18sehen Sie ein Aufmerksamkeitsmuster über das gesamte Bild hinweg. Das Modell weiß einfach
00:08:22nicht, wie es die Rechenleistung richtig zuweisen soll. Bitten Sie es jedoch,
00:08:27beispielsweise all das Obst zu segmentieren, sieht man, dass es mehr Tokens den Bereichen zuweist,
00:08:31die es für Obst-Tokens hält. Das ist ein sehr schöner und cleverer Kniff, den wir nutzen und veröffentlicht haben,
00:08:36und den auch andere übernehmen: Es geht darum, Vorwissen so in die Architektur einzubetten, dass es hilft,
00:08:43das Dichteungleichgewicht der Modalitäten auszugleichen, ohne dabei so einschränkend zu sein, dass die Modelle nicht
00:08:49mehr eigenständig lernen können. Wir haben all das zusammengeführt – und Sie haben die
00:08:57Veröffentlichung vielleicht gesehen – und vor einigen Wochen unser Modell herausgebracht, das wir als das erste verkörperte
00:09:03Basismodell betrachten. Dieses Modell liegt auf Augenhöhe mit Gemini
00:09:093.1 Pro. Es ist tatsächlich besser als Gemini Embodied Reasoning und etwa 15-mal günstiger.
00:09:15Es wurde im Wesentlichen auf einem ein Petabyte großen Datensatz trainiert, den wir aus absolut allen
00:09:20Möglichen Quellen gesammelt haben – von Internet-Crawls bis hin zu eigenen Mid-Training-Rezepten oder synthetischen Daten-Pipelines.
00:09:28Wir verfügen über dieses eine Petabyte an Daten aus Text, Bildern, Videos und Bewegungspfaden. Und diese Pfade
00:09:34können sehr allgemeiner Natur sein: Es können Abläufe am Desktop oder etwa Flugbahnen in Videospielen sein.
00:09:41Sobald man beginnt, diese Dinge zu tun, entstehen sehr interessante Eigenschaften.
00:09:46Die bemerkenswerteste Eigenschaft, die wir beobachtet haben – und die im Nachhinein auf der Hand liegt –,
00:09:50ist, dass man klassische CV-Aufgaben als agentische Aufgaben betrachten kann. Und
00:09:57in diesem Fall haben wir die Erkennung als agentische Aufgabe neu definiert. Unser Modell kann,
00:10:02wissen Sie, Code schreiben. Es kann heranzoomen, den Kontrast ändern. Und Sie
00:10:09können hier sehen, das ist ein sehr schweres Problem. Es gibt ein ganzes Subreddit für solche
00:10:14Probleme, bei denen man sehr schwer erkennbare Objekte in Bildern finden muss. Unsere Modelle machen das
00:10:19sehr gut. Aber sie tun dies in einem agentischen Sinne. Das ist also kein klassisches “Erkenne diesen
00:10:24Kasten”. Hier entscheidet das Modell selbst, dass es Kacheln bilden und den
00:10:28Kontrast anpassen muss. Es schlägt eine Box vor, erhöht den Kontrast und findet den Vogel.
00:10:36Selbst für Menschen, die sehr gut in visueller Wahrnehmung sind,
00:10:42ist das eine relativ schwere Aufgabe. Das verdanken wir
00:10:46nativ verkörperten Modellen, die verstehen, wie man mit verschiedenen Modalitäten umgeht.
00:10:51Wie bezieht sich das nun auf den allgemeinen Ansatz der physischen KI in der Robotik?
00:10:57Ich habe diese Folie von den GDM-Kollegen gestohlen. Was wir bei robotischen
00:11:04agentischen Systemen beobachten, ist diese Trennung zwischen verkörperten Reasoning-Modellen
00:11:11oder Orchestratoren und taktilen Richtlinienmodellen. Stellen Sie sich vor:
00:11:17Wenn ich Kaffee koche und das drei Minuten dauert, kann ich entweder versuchen,
00:11:21mein gesamtes VLA dazu zu zwingen, diese Aufgabe zu lösen. Oder ich nutze
00:11:26ein Orchestrator-Modell, das die Aufgaben in Teilaufgaben zerlegt, und eine taktile
00:11:31Steuerungsrichtlinie, die darüber läuft. Es gibt ein ganzes Spektrum von reinen VLA-Modellen
00:11:36bis hin zu solchen agentischen Systemen. Hauptsächlich möchte ich betonen,
00:11:41dass verkörpertes Reasoning ein sehr komplexes, bisher ungelöstes Problem ist.
00:11:46Dennoch gehören unsere Modelle beim verkörperten Reasoning weiterhin zur Spitze.
00:11:50Und dadurch sehen wir wirklich coole Dinge, die es vorher nicht gab.
00:11:55Hier ist ein konkretes Beispiel für sehr komplexe Datenannotation
00:11:59in der Robotik. Sie können sehen, wie das Modell hin- und herzulaufen scheint,
00:12:04verschiedene Teile des Videos analysiert, es zuschneidet, prüft,
00:12:09ob die Beschreibungen stimmen, und sich selbst überprüft. Das geht, weil AR-Modelle schnell sind.
00:12:15Sie sind deutlich günstiger als alles andere auf dem Markt. Mit Gemini würde
00:12:20dieses Video ein paar Dollar kosten, bei uns sind es nur wenige Cent.
00:12:24All das entsteht durch diese fortschrittlichen verkörperten Reasoning-Fähigkeiten,
00:12:29die wir bei anderen Modellen bisher nicht gesehen haben.
00:12:37Ich teile nun unseren wohl größten Forschungsdurchbruch. Mehr dazu
00:12:41folgt in den kommenden Wochen vermutlich auf Twitter. Wir haben nämlich
00:12:48neue Skalierungsgesetze für verkörperte Basismodelle entdeckt. Das sind Modelle,
00:12:53mit denen man gleichzeitig steuerungsbasiertes Training, Trajektorientraining, Wahrnehmungstraining
00:12:59und verkörpertes Reasoning-Training durchführen kann. Wenn man den richtigen Mix
00:13:03und die richtigen Ziele findet, erkennt man plötzlich sehr interessante Stellschrauben,
00:13:08die man vorher vielleicht nicht gesehen hat.
00:13:11Die konkrete Stellschraube ist die Möglichkeit, allgemeine Video-Vortrainingsdaten
00:13:19gegen Teleoperationsdaten einzutauschen. Teleoperationsdaten sind sehr teuer,
00:13:25etwa 100 Dollar pro Stunde. Für 100 Dollar kann ich wesentlich mehr Videodaten sammeln.
00:13:32Diese Grafik zeigt: Wenn man reine VLAs trainiert, bewegt man sich in diesem
00:13:39Bereich. Es gibt zwar Skalierungseffekte und Vorteile durch mehr
00:13:43Teleoperationsdaten, diese sind aber nicht so erheblich wie beim Training
00:13:48dieser vereinheitlichten verkörperten Basismodelle. Das zeigt die untere Hälfte des Diagramms.
00:13:55Der Vorteil ist: Man kann mit 10-mal mehr Video-Vortrainingsdaten
00:14:03auf 10-mal so viele Teleoperationsdaten verzichten. Für unsere Rechenkapazität
00:14:09hat sich das bislang bestätigt. Wir werden die Grenzen verkörperter Basismodelle
00:14:16weiter austesten. Hier sind Videos einer Richtlinie; wir hoffen, eines
00:14:28der kleineren Modelle in wenigen Wochen als Open Source zu veröffentlichen. Das läuft nativ
00:14:33in einem einzigen Modell, das verkörpertes Reasoning nutzt, um die Aufgabe zu verstehen.
00:14:38Es gibt Steuerungstokens aus. Es ruckelt noch etwas, aber das bekommen wir hin.
00:14:43hoffentlich bei Skalierung lösen lässt. Und man sieht sehr komplexe Aufgaben,
00:14:48die für reine VLAs wohl sehr schwer wären. Im rechten Video
00:14:54muss das Modell den Buchtitel lesen, wissen, um was für ein Buch
00:14:58es sich handelt, und es dann im richtigen Behälter ablegen.
00:15:04Das ist eine mehrstufige Aufgabe aus Wahrnehmung und Steuerung, die extrem schwer ist,
00:15:09wenn man ein reines End-to-End-Steuerungsmodell hat, das die nötigen Wahrnehmungsaufgaben nicht kennt.
00:15:23Ja. Ziemlich cool. Es funktioniert out-of-the-box auch Zero-Shot relativ gut.
00:15:28Wir freuen uns, das in ein paar Wochen, irgendwann im Juli, bereitzustellen.
00:15:33Ich lasse noch ein paar Minuten für Fragen, aber bei Interesse vernetzen wir uns gerne.
00:15:41Eine coole Sache bei uns ist, dass wir ausgewählten Partnern Zugriff auf unsere Mark-1-Gewichte geben.
00:15:47Wir gewähren Zugriff auf die Gewichte unserer größeren Embodied-Foundation-Modelle. Schreibt mir per Mail oder Twitter.
00:15:58Und dann öffne ich für Fragen, wir haben noch ein paar Minuten.
00:16:02Vielen Dank.
00:16:03Vielen Dank.
00:16:05Vielen Dank.
00:16:05Vielen Dank.
00:16:09Vielen Dank.
00:16:11Vielen Dank.
00:16:13Vielen Dank.
00:16:24Ja, die Frage ist: Wie schaffen wir es, das zeitliche Verständnis so gut hinzubekommen?
00:16:31Gute Frage. Ehrlich gesagt ist es noch nicht perfekt. Es braucht noch Arbeit, um es verlässlich einzusetzen.
00:16:37Der Kernpunkt ist das Kontextmanagement. Man hat einen begrenzten Kontext. Die Modelle hier haben 1 Million Kontexte, was bei High-FPS-Video schnell voll ist.
00:17:06Man muss überlegen, welche Kniffe möglich sind. Ein Beispiel: Was ist mit Keyframes gegenüber Delta-Frames?
00:17:19Wie steuere ich den Kontext durch Abwägen beider? Und wie kann ich beim Pre-Training Dinge einbinden, die für Robotik nützlich sind?
00:17:32Ein ganz simples Beispiel, bei dem früher selbst Gemini-Modelle Probleme hatten: Kardinalitäten zu erkennen.
00:17:40Links und Rechts ist bei Internet-Data-Crawls schwer, weil niemand Daten damit beschriftet, dass Objekt A links oder unter Objekt B liegt.
00:17:51Frühe Gedanken zur Datenverteilung helfen hier enorm. Embodied Reasoning war ein klarer Fokus, weshalb wir Gemini ER mit weniger Compute übertroffen haben.
00:18:07Die wohl coolste Robustheit zeigt sich bei VLA-Modellen: Nutzt man ein chinesisches Modell
00:18:35und feintunt es für eine bestimmte Policy, scheitert diese schon, wenn man nur den Tischhintergrund ändert.
00:18:47Interessanterweise ist diese kombinierte Wahrnehmungs- und Steuerungsmodellierung viel robuster gegen solche Fehler oder Lichtveränderungen.
00:18:56Wir sehen das primär als Hintergrund-Robustheit, die herkömmliche Modelle so nicht haben.
00:19:03Ich will nicht zu viel versprechen – es ist immer noch relativ schwierig.
00:19:07Wenn ich mit einer Taschenlampe auf einen der Arme leuchte, klappt es wahrscheinlich nicht.
00:19:12Aber die gemeinsame Modellierung hilft enorm.
00:19:16Wir machen auch viel Online-Augmentierung, simulieren also z. B. den Ausfall einer Armkamera,
00:19:27oder täuschen Sonnenlicht aus einer bestimmten Richtung vor.
00:19:31Solche Dinge tun wir beim Training, um die Robustheit zu steigern.
00:19:35Der große Gewinn entsteht aber durch dieses Early-Fusion-Paradigma im Robotikbereich.
00:19:43Cool.
00:19:44.
00:19:50Oh, Wissensdatenbanken?
00:19:52Nützlich, um Bilder oder Videos zu beschriften – das klappt recht gut.
00:19:57Wir arbeiten mit Robotik-Partnern für sehr komplexe, egozentrische Annotationen dieser Art.
00:20:02Es geht also nicht unbedingt ums Bauen einer Ontologie, sondern um sehr tiefe, strukturierte Extraktion,
00:20:07darin sind unsere Modelle sehr gut.
00:20:10Ja.
00:20:11Übrigens ist alles, was ich gezeigt habe, über öffentliche APIs verfügbar zum Ausprobieren.
00:20:15Die Benchmarks sind öffentlich.
00:20:17Ich glaube, meine Zeit ist um.
00:20:19Man würgt mich ab, ich kann draußen weiter sprechen.
00:20:22Aber vielen Dank euch allen.
00:20:27Vielen Dank.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video