Von VLMs/VLAs zu verkörperten Agenten — Armen Aghajanyan, Perceptron AI

AAI Engineer
컴퓨터/소프트웨어

스크립트

00:00:00Ja, ich denke, wir fangen einfach an. Ich bin Armin, Mitgründer und CEO von Perceptron.
00:00:20Wir werden noch kurz darauf eingehen, was wir tun, aber worüber ich heute primär sprechen möchte, ist
00:00:25unsere Forschungshaltung, dass wir uns von Unterscheidungen zwischen VLMs, VLAs,
00:00:32Weltmodellen oder wie auch immer man es nennen mag, hin zu sogenannten verkörperten Basismodellen bewegen wollen.
00:00:42Was wir bei Perceptron also konkret tun, unser wichtigstes Ziel sozusagen, ist, dass wir
00:00:48physikalische KI-Grundlagen schaffen wollen, die uns die Fähigkeit geben, die physische Welt in Echtzeit zu wahrzunehmen, zu verstehen und mit ihr zu interagieren.
00:00:53Die übergeordnete Mission ist also wirklich die Überbrückung der
00:00:58physischen und digitalen Welt. Was im Grunde bedeutet, dass unser Ziel darin besteht, überall dort, wo es ein Gerät,
00:01:07ein Instrument, einen Roboter, eine Kamera oder einen Sensor gibt, Intelligenz bereitzustellen.
00:01:14Und wenn wir speziell über dieses Paradigma des Wahrnehmens, Schlussfolgerns
00:01:19und Handelns sprechen, sehen wir das als eine Art Vereinheitlichung der traditionellen multimodalen Modellierung.
00:01:25Ich komme von FAIR. Ich war sechs Jahre lang dort, und mein Ziel war es herauszufinden, wie man
00:01:31Rezepte für multimodale Modelle hochskaliert. Eines der ersten Dinge, an denen wir gearbeitet haben –
00:01:37und wir haben viel in diesem Bereich veröffentlicht –, war die frühe Fusion. Also das Konzept, alle diese
00:01:41Modalitäten so früh wie möglich zusammenzuführen. Die eigentliche Komplexität besteht darin, herauszufinden, was der
00:01:47richtige Weg ist, all die verschiedenen Modalitäten sowohl bei der Eingabe als auch bei
00:01:52der Ausgabe ganzheitlich abzubilden. Und so sind VLMs gewissermaßen der Standard geworden –
00:01:58wenn ich von multimodalen Modellen spreche, denken Sie wahrscheinlich an VLMs. Es geht also um die Fähigkeit,
00:02:03Bilder, Videos und Text einzulesen und im Wesentlichen Text auszugeben. Und davon gibt es Variationen.
00:02:09Es gibt Modelle wie ER-Modelle, also Modelle für verkörpertes Schlussfolgern, die zum Beispiel
00:02:15Verankerungspunkte ausgeben können und räumliches Verständnis oder Schlussfolgern etwas besser beherrschen.
00:02:20Dann haben wir Dinge wie VLAs, die den Ausgabebereich neben Text nun auch auf
00:02:25Aktionen erweitern. Diese bauen traditionell natürlich weiterhin auf Standard-VLM-Backbones auf,
00:02:30obwohl es einige Bemühungen gab, sich weg von...
00:02:35...VLMs hin zu Dingen wie Weltmodellen oder Welt-Aktions-Modellen zu bewegen, obwohl noch nichts davon super
00:02:39erfolgreich war. Und dann kommen wir zu interessanteren und komplexeren Varianten multimodaler
00:02:46Modelle, wie etwa Weltmodelle, bei denen man im Grunde aus bestimmten Eingaben Videos generiert. Bei den Eingaben
00:02:51kann es sich um Bilder oder Videos oder ehrlich gesagt um Bilder, Videos und Aktionen handeln. Der letzte Punkt, den ich
00:02:57ansprechen möchte, ist etwas Neueres, was wir semantische Weltmodelle nennen. Dabei gibt man eigentlich nichts aus,
00:03:02sondern lernt eine Art Repräsentation, die man für die Zukunft als nützlich erachtet. Was wir unter
00:03:08einem verkörperten Basismodell verstehen, ist eigentlich ein Rahmen, der sowohl die Standard-Wahrnehmung,
00:03:13das verkörperte Schlussfolgern als auch das übergeordnete Ziel der Steuerung in einem einzigen Modell ermöglicht.
00:03:20Es geht also darum, über verschiedene Sensormodalitäten bei der Eingabe hinweg logisch zu schlussfolgern und
00:03:25das meiste von dem, was ich für die Ausgabe erwähnt habe, in einem einzigen, vereinheitlichten Modell umzusetzen.
00:03:31Ich werde kurz zwei Herausforderungen ansprechen. Es handelt sich um grundlegende
00:03:35Forschungsfragen, vor denen wir stehen. Ich werde erklären, wie unser Unternehmen das angegangen ist
00:03:40und was andere Akteure in diesem Bereich tun.
00:03:43Der erste Punkt ist: Stellen Sie sich vor, Sie versuchen rein hypothetisch, etwas wie ein Video zu modellieren,
00:03:48etwa eine Stunde Video. Je nach Repräsentation verarbeiten Sie
00:03:52möglicherweise etwa eine Million visueller Tokens als Eingabe. Die Wahrheit ist, dass es gar keine echte Referenz
00:03:57gibt, die Sie effektiv nutzen können, richtig? Man kann zwar Dinge tun – und das wurde natürlich auch gemacht –,
00:04:02wie Transkripte zu extrahieren, sie aus dem Video vorherzusagen oder vielleicht synthetisch
00:04:08einige Frames zu beschriften oder Fragen dazu zu stellen. Es stellt sich heraus, dass das eine riesige Verschwendung ist,
00:04:13richtig? Wenn Sie bedenken, was in Ihr Modell einfließt: Es gehen eine Million Tokens ein,
00:04:16und Sie berechnen den Loss im Grunde nur für etwa 0,2 Prozent aller Tokens,
00:04:22die hineingehen. Das ist im Kern sehr problematisch. Und die Wahrheit ist: Egal wie Sie versuchen,
00:04:27das zu beheben, Sie speisen im Grunde ein falsches Trainingssignal ein.
00:04:31Entweder ist das Signal zu dünn gesät, zu synthetisch oder zu undifferenziert. Ansätze
00:04:37jenseits einer rein synthetischen Anreicherung bestanden darin, jedes einzelne Pixel vorherzusagen. Das ist zwar
00:04:42ein sehr dichtes Signal, aber es weist die Aufmerksamkeitswerte sehr schlecht zu. Wissen Sie,
00:04:47man vergleicht und behandelt ein Hintergrundpixel mit dem gleichen Wichtigkeitsgrad wie
00:04:51eine Greifer-Spitze, die Kontaktpunkte, spezifische Fehler oder die Physik.
00:04:56Was wir bei Perceptron also tun – und das ist ein Teil unseres zentralen Know-hows –,
00:05:01ist die Überlegung: Wie sieht ein natürliches Wahrnehmungsziel aus? Konkret: Wie kann ich
00:05:06die Wahrnehmungsobjekte, von denen wir glauben, dass sie in Zukunft wichtig sein werden, ganz automatisch vorhersagen? Als
00:05:11Beispiel könnte man fest programmieren: Wenn man einen Roboterarm hat, ist die Spitze des Greifers
00:05:16ein sehr nützliches Wahrnehmungsobjekt, das man für die Zukunft vorhersagen kann. Damit haben einige bereits
00:05:20angefangen. Das Team von MOMO Act von AI2 hat das gemacht. Es gibt auch andere VLAs, die das
00:05:26gemacht haben. Aber das ist immer noch ein fest codiertes Wahrnehmungsobjekt. Die Frage ist also: Kann man einen automatischen
00:05:30Weg finden, wie das Modell dieses sehr einzigartige Ziel semantisch lernen kann? Und die Wahrheit ist: Wir haben
00:05:37einen Weg gefunden. Wir werden hier nicht verraten, wie wir das machen, aber das deutet an,
00:05:41wie wir das Problem der Datenknappheit angehen. Das zweite Kernproblem, auf das wir viel Zeit verwenden,
00:05:49ist die Kontextüberlastung. Wenn Sie Kameras haben, die ständig laufen, oder Roboter, die nicht unbedingt
00:05:54warten oder anhalten, müssen Sie im Grunde über eine sehr, sehr große Menge an Tokens schlussfolgern. Und während
00:06:01Text relativ dicht ist, ist Video vergleichsweise dünn gesät. Die Frage lautet also: Gibt es architektonische
00:06:08Durchbrüche, um mit diesem Problem nativ umzugehen, anstatt
00:06:13nur auf synthetischer Ebene zu versuchen, dieses Ungleichgewicht zu beheben?
00:06:20Es gibt einige Dinge, die man tun kann. Ein Grundprinzip besteht darin,
00:06:25verschiedene Modalitäten als völlig unterschiedlich zu behandeln. Man darf Text-Tokens nicht genauso
00:06:31behandeln wie Bild-Tokens oder Audio- und Video-Tokens. Man kann also zum Beispiel
00:06:36damit beginnen, sich auf räumliche Kompression oder Token-Kompression zu konzentrieren. Manche machen sehr primitive
00:06:41Dinge – und wir haben anfangs auch damit angefangen, und es funktioniert tatsächlich. Man kann damit beginnen,
00:06:44blockweise Repräsentationen über ein Video oder ein Bild zu mitteln. Damit lassen sich bereits
00:06:51interessante Kompressionsraten erzielen, etwa bis zu 10-fach. Dennoch ist das eher ein Provisorium, und es gibt
00:06:57keine wirklich etablierten architektonischen Methoden, um das zu lösen. Was wir in den
00:07:04letzten Monaten getan haben, ist die Veröffentlichung unseres Ansatzes für den Umgang mit unterschiedlichen Graden von
00:07:10Datenknappheit: Man lässt das Modell einfach selbst entscheiden, welche Tokens es beachten sollte und welche
00:07:14nicht. Dafür haben wir unser Paper zu datensparsamen Mixture-of-Experts veröffentlicht, was
00:07:19genau das ermöglicht. Es erlaubt dem Modell – nun, es gibt einen Router im Modell –, tatsächlich
00:07:24vorherzusagen, welches Token einfließen und welches übersprungen werden soll. Und das gelingt uns
00:07:30gewissermaßen ohne Zusatzkosten über all die verschiedenen Schichten hinweg. Und es zeigt sich: Wenn man das Modell einfach lernen lässt,
00:07:36ohne starre architektonische Vorgaben einzucodieren, lernt das Modell tatsächlich.
00:07:43Wenn man die datensparsame Rechenleistung visualisiert, die unsere Modelle nutzen, sieht man,
00:07:49dass sie von Natur aus lernen, sich auf Informationen mit hoher Dichte oder auf aufgabenrelevante Informationen zu konzentrieren.
00:07:56Oben rechts sieht man zum Beispiel, dass sich das Modell auf das Diagramm konzentriert,
00:08:00worauf man auch als Mensch heranzoomen würde, weil das wahrscheinlich der interessante Teil innerhalb
00:08:05der Abbildung ist. Es zeigt sich, dass sogar eine aufgabenabhängige Ressourcenverteilung
00:08:13stattfindet. Wenn Sie unten links schauen und eine sehr, sehr allgemeine Frage stellen,
00:08:18sehen Sie ein Aufmerksamkeitsmuster über das gesamte Bild hinweg. Das Modell weiß einfach
00:08:22nicht, wie es die Rechenleistung richtig zuweisen soll. Bitten Sie es jedoch,
00:08:27beispielsweise all das Obst zu segmentieren, sieht man, dass es mehr Tokens den Bereichen zuweist,
00:08:31die es für Obst-Tokens hält. Das ist ein sehr schöner und cleverer Kniff, den wir nutzen und veröffentlicht haben,
00:08:36und den auch andere übernehmen: Es geht darum, Vorwissen so in die Architektur einzubetten, dass es hilft,
00:08:43das Dichteungleichgewicht der Modalitäten auszugleichen, ohne dabei so einschränkend zu sein, dass die Modelle nicht
00:08:49mehr eigenständig lernen können. Wir haben all das zusammengeführt – und Sie haben die
00:08:57Veröffentlichung vielleicht gesehen – und vor einigen Wochen unser Modell herausgebracht, das wir als das erste verkörperte
00:09:03Basismodell betrachten. Dieses Modell liegt auf Augenhöhe mit Gemini
00:09:093.1 Pro. Es ist tatsächlich besser als Gemini Embodied Reasoning und etwa 15-mal günstiger.
00:09:15Es wurde im Wesentlichen auf einem ein Petabyte großen Datensatz trainiert, den wir aus absolut allen
00:09:20Möglichen Quellen gesammelt haben – von Internet-Crawls bis hin zu eigenen Mid-Training-Rezepten oder synthetischen Daten-Pipelines.
00:09:28Wir verfügen über dieses eine Petabyte an Daten aus Text, Bildern, Videos und Bewegungspfaden. Und diese Pfade
00:09:34können sehr allgemeiner Natur sein: Es können Abläufe am Desktop oder etwa Flugbahnen in Videospielen sein.
00:09:41Sobald man beginnt, diese Dinge zu tun, entstehen sehr interessante Eigenschaften.
00:09:46Die bemerkenswerteste Eigenschaft, die wir beobachtet haben – und die im Nachhinein auf der Hand liegt –,
00:09:50ist, dass man klassische CV-Aufgaben als agentische Aufgaben betrachten kann. Und
00:09:57in diesem Fall haben wir die Erkennung als agentische Aufgabe neu definiert. Unser Modell kann,
00:10:02wissen Sie, Code schreiben. Es kann heranzoomen, den Kontrast ändern. Und Sie
00:10:09können hier sehen, das ist ein sehr schweres Problem. Es gibt ein ganzes Subreddit für solche
00:10:14Probleme, bei denen man sehr schwer erkennbare Objekte in Bildern finden muss. Unsere Modelle machen das
00:10:19sehr gut. Aber sie tun dies in einem agentischen Sinne. Das ist also kein klassisches “Erkenne diesen
00:10:24Kasten”. Hier entscheidet das Modell selbst, dass es Kacheln bilden und den
00:10:28Kontrast anpassen muss. Es schlägt eine Box vor, erhöht den Kontrast und findet den Vogel.
00:10:36Selbst für Menschen, die sehr gut in visueller Wahrnehmung sind,
00:10:42ist das eine relativ schwere Aufgabe. Das verdanken wir
00:10:46nativ verkörperten Modellen, die verstehen, wie man mit verschiedenen Modalitäten umgeht.
00:10:51Wie bezieht sich das nun auf den allgemeinen Ansatz der physischen KI in der Robotik?
00:10:57Ich habe diese Folie von den GDM-Kollegen gestohlen. Was wir bei robotischen
00:11:04agentischen Systemen beobachten, ist diese Trennung zwischen verkörperten Reasoning-Modellen
00:11:11oder Orchestratoren und taktilen Richtlinienmodellen. Stellen Sie sich vor:
00:11:17Wenn ich Kaffee koche und das drei Minuten dauert, kann ich entweder versuchen,
00:11:21mein gesamtes VLA dazu zu zwingen, diese Aufgabe zu lösen. Oder ich nutze
00:11:26ein Orchestrator-Modell, das die Aufgaben in Teilaufgaben zerlegt, und eine taktile
00:11:31Steuerungsrichtlinie, die darüber läuft. Es gibt ein ganzes Spektrum von reinen VLA-Modellen
00:11:36bis hin zu solchen agentischen Systemen. Hauptsächlich möchte ich betonen,
00:11:41dass verkörpertes Reasoning ein sehr komplexes, bisher ungelöstes Problem ist.
00:11:46Dennoch gehören unsere Modelle beim verkörperten Reasoning weiterhin zur Spitze.
00:11:50Und dadurch sehen wir wirklich coole Dinge, die es vorher nicht gab.
00:11:55Hier ist ein konkretes Beispiel für sehr komplexe Datenannotation
00:11:59in der Robotik. Sie können sehen, wie das Modell hin- und herzulaufen scheint,
00:12:04verschiedene Teile des Videos analysiert, es zuschneidet, prüft,
00:12:09ob die Beschreibungen stimmen, und sich selbst überprüft. Das geht, weil AR-Modelle schnell sind.
00:12:15Sie sind deutlich günstiger als alles andere auf dem Markt. Mit Gemini würde
00:12:20dieses Video ein paar Dollar kosten, bei uns sind es nur wenige Cent.
00:12:24All das entsteht durch diese fortschrittlichen verkörperten Reasoning-Fähigkeiten,
00:12:29die wir bei anderen Modellen bisher nicht gesehen haben.
00:12:37Ich teile nun unseren wohl größten Forschungsdurchbruch. Mehr dazu
00:12:41folgt in den kommenden Wochen vermutlich auf Twitter. Wir haben nämlich
00:12:48neue Skalierungsgesetze für verkörperte Basismodelle entdeckt. Das sind Modelle,
00:12:53mit denen man gleichzeitig steuerungsbasiertes Training, Trajektorientraining, Wahrnehmungstraining
00:12:59und verkörpertes Reasoning-Training durchführen kann. Wenn man den richtigen Mix
00:13:03und die richtigen Ziele findet, erkennt man plötzlich sehr interessante Stellschrauben,
00:13:08die man vorher vielleicht nicht gesehen hat.
00:13:11Die konkrete Stellschraube ist die Möglichkeit, allgemeine Video-Vortrainingsdaten
00:13:19gegen Teleoperationsdaten einzutauschen. Teleoperationsdaten sind sehr teuer,
00:13:25etwa 100 Dollar pro Stunde. Für 100 Dollar kann ich wesentlich mehr Videodaten sammeln.
00:13:32Diese Grafik zeigt: Wenn man reine VLAs trainiert, bewegt man sich in diesem
00:13:39Bereich. Es gibt zwar Skalierungseffekte und Vorteile durch mehr
00:13:43Teleoperationsdaten, diese sind aber nicht so erheblich wie beim Training
00:13:48dieser vereinheitlichten verkörperten Basismodelle. Das zeigt die untere Hälfte des Diagramms.
00:13:55Der Vorteil ist: Man kann mit 10-mal mehr Video-Vortrainingsdaten
00:14:03auf 10-mal so viele Teleoperationsdaten verzichten. Für unsere Rechenkapazität
00:14:09hat sich das bislang bestätigt. Wir werden die Grenzen verkörperter Basismodelle
00:14:16weiter austesten. Hier sind Videos einer Richtlinie; wir hoffen, eines
00:14:28der kleineren Modelle in wenigen Wochen als Open Source zu veröffentlichen. Das läuft nativ
00:14:33in einem einzigen Modell, das verkörpertes Reasoning nutzt, um die Aufgabe zu verstehen.
00:14:38Es gibt Steuerungstokens aus. Es ruckelt noch etwas, aber das bekommen wir hin.
00:14:43hoffentlich bei Skalierung lösen lässt. Und man sieht sehr komplexe Aufgaben,
00:14:48die für reine VLAs wohl sehr schwer wären. Im rechten Video
00:14:54muss das Modell den Buchtitel lesen, wissen, um was für ein Buch
00:14:58es sich handelt, und es dann im richtigen Behälter ablegen.
00:15:04Das ist eine mehrstufige Aufgabe aus Wahrnehmung und Steuerung, die extrem schwer ist,
00:15:09wenn man ein reines End-to-End-Steuerungsmodell hat, das die nötigen Wahrnehmungsaufgaben nicht kennt.
00:15:23Ja. Ziemlich cool. Es funktioniert out-of-the-box auch Zero-Shot relativ gut.
00:15:28Wir freuen uns, das in ein paar Wochen, irgendwann im Juli, bereitzustellen.
00:15:33Ich lasse noch ein paar Minuten für Fragen, aber bei Interesse vernetzen wir uns gerne.
00:15:41Eine coole Sache bei uns ist, dass wir ausgewählten Partnern Zugriff auf unsere Mark-1-Gewichte geben.
00:15:47Wir gewähren Zugriff auf die Gewichte unserer größeren Embodied-Foundation-Modelle. Schreibt mir per Mail oder Twitter.
00:15:58Und dann öffne ich für Fragen, wir haben noch ein paar Minuten.
00:16:02Vielen Dank.
00:16:03Vielen Dank.
00:16:05Vielen Dank.
00:16:05Vielen Dank.
00:16:09Vielen Dank.
00:16:11Vielen Dank.
00:16:13Vielen Dank.
00:16:24Ja, die Frage ist: Wie schaffen wir es, das zeitliche Verständnis so gut hinzubekommen?
00:16:31Gute Frage. Ehrlich gesagt ist es noch nicht perfekt. Es braucht noch Arbeit, um es verlässlich einzusetzen.
00:16:37Der Kernpunkt ist das Kontextmanagement. Man hat einen begrenzten Kontext. Die Modelle hier haben 1 Million Kontexte, was bei High-FPS-Video schnell voll ist.
00:17:06Man muss überlegen, welche Kniffe möglich sind. Ein Beispiel: Was ist mit Keyframes gegenüber Delta-Frames?
00:17:19Wie steuere ich den Kontext durch Abwägen beider? Und wie kann ich beim Pre-Training Dinge einbinden, die für Robotik nützlich sind?
00:17:32Ein ganz simples Beispiel, bei dem früher selbst Gemini-Modelle Probleme hatten: Kardinalitäten zu erkennen.
00:17:40Links und Rechts ist bei Internet-Data-Crawls schwer, weil niemand Daten damit beschriftet, dass Objekt A links oder unter Objekt B liegt.
00:17:51Frühe Gedanken zur Datenverteilung helfen hier enorm. Embodied Reasoning war ein klarer Fokus, weshalb wir Gemini ER mit weniger Compute übertroffen haben.
00:18:07Die wohl coolste Robustheit zeigt sich bei VLA-Modellen: Nutzt man ein chinesisches Modell
00:18:35und feintunt es für eine bestimmte Policy, scheitert diese schon, wenn man nur den Tischhintergrund ändert.
00:18:47Interessanterweise ist diese kombinierte Wahrnehmungs- und Steuerungsmodellierung viel robuster gegen solche Fehler oder Lichtveränderungen.
00:18:56Wir sehen das primär als Hintergrund-Robustheit, die herkömmliche Modelle so nicht haben.
00:19:03Ich will nicht zu viel versprechen – es ist immer noch relativ schwierig.
00:19:07Wenn ich mit einer Taschenlampe auf einen der Arme leuchte, klappt es wahrscheinlich nicht.
00:19:12Aber die gemeinsame Modellierung hilft enorm.
00:19:16Wir machen auch viel Online-Augmentierung, simulieren also z. B. den Ausfall einer Armkamera,
00:19:27oder täuschen Sonnenlicht aus einer bestimmten Richtung vor.
00:19:31Solche Dinge tun wir beim Training, um die Robustheit zu steigern.
00:19:35Der große Gewinn entsteht aber durch dieses Early-Fusion-Paradigma im Robotikbereich.
00:19:43Cool.
00:19:44.
00:19:50Oh, Wissensdatenbanken?
00:19:52Nützlich, um Bilder oder Videos zu beschriften – das klappt recht gut.
00:19:57Wir arbeiten mit Robotik-Partnern für sehr komplexe, egozentrische Annotationen dieser Art.
00:20:02Es geht also nicht unbedingt ums Bauen einer Ontologie, sondern um sehr tiefe, strukturierte Extraktion,
00:20:07darin sind unsere Modelle sehr gut.
00:20:10Ja.
00:20:11Übrigens ist alles, was ich gezeigt habe, über öffentliche APIs verfügbar zum Ausprobieren.
00:20:15Die Benchmarks sind öffentlich.
00:20:17Ich glaube, meine Zeit ist um.
00:20:19Man würgt mich ab, ich kann draußen weiter sprechen.
00:20:22Aber vielen Dank euch allen.
00:20:27Vielen Dank.

핵심 요약

Ein vereinheitlichtes verkörpertes Basismodell für Wahrnehmung, Schlussfolgerung und Steuerung ersetzt spezialisierte Einzelmodelle und senkt den Bedarf an teuren Teleoperationsdaten durch den Einsatz allgemeiner Videodaten um das Zehnfache.

하이라이트

  • Das verkörperte Basismodell von Perceptron erreicht die Leistung von Gemini 3.1 Pro, übertrifft Gemini Embodied Reasoning und ist dabei etwa 15-mal günstiger.

  • Der Einsatz eines datensparsamen Mixture-of-Experts-Routers reduziert die Rechenkosten, indem das Modell dynamisch entscheidet, welche visuellen Tokens verarbeitet oder übersprungen werden.

  • Durch die gemeinsame Modellierung von Wahrnehmung, Schlussfolgerung und Steuerung lassen sich teure Teleoperationsdaten im Verhältnis 1:10 durch bis zu 10-mal mehr allgemeine Videodaten ersetzen.

  • Das Modell redefiniert klassische Computer-Vision-Aufgaben als agentische Prozesse und führt eigenständig Code-Aktionen wie Bildkachelung und Kontrastanpassung aus.

  • Für das Pre-Training steht ein ein Petabyte großer Datensatz zur Verfügung, der Text, Bilder, Videos und Bewegungspfade aus Desktop-Abläufen und Videospielen kombiniert.

타임라인

Vereinheitlichung von VLM, VLA und Weltmodellen

  • Die Entwicklung verlagert sich von getrennten Systemen wie VLMs und VLAs hin zu vereinheitlichten verkörperten Basismodellen.
  • Frühe Fusion führt unterschiedliche Eingabemodalitäten auf unterster Ebene zusammen.
  • Ein einziges Architektur-Framework deckt Wahrnehmung, räumliches Schlussfolgern und direkte Robotersteuerung ab.

Herkömmliche Architekturen trennen visuelle Sprachmodelle für Textausgaben von VLA-Modellen für Aktionsausgaben. Ein verkörpertes Basismodell vereint diese Funktionen in einem System. Es verarbeitet Eingaben aus verschiedenen Sensoren und generiert sowohl Text als auch räumliche Verankerungspunkte und direkte Steuerungsbefehle.

Lösungsansätze für Verlustverdünnung und Kontextüberlastung

  • Bei der Verarbeitung langer Video-Streams wird der Verlustwert auf weniger als 0,2 Prozent aller Eingabe-Tokens berechnet.
  • Das Auslesen von Hintergründen mit gleicher Priorität wie Greiferspitzen verschlechtert die Aufmerksamkeitssteuerung.
  • Ein datensparsamer Mixture-of-Experts-Router wählt aufgabenrelevante Tokens automatisch aus und überspringt redundante Informationen.

Eine Stunde Video erzeugt rund eine Million visuelle Tokens, was ohne gezielte Auswahl zu dünnen Trainingssignalen führt. Statt Pixel-für-Pixel vorherzusagen oder auf synthetische Datensätze zurückzugreifen, lernt die Architektur eigenständig das Zuweisen von Rechenkapazität. Bei Bildsegmentierungsaufgaben oder der Analyse relevanter Objektdetails konzentrieren sich die Tokens automatisch auf die hochdichten Informationsbereiche.

Agentische Wahrnehmung und Roboter-Orchestrierung

  • Visuelle Erkennungsaufgaben lassen sich als agentische Handlungsabläufe strukturieren.
  • Das Modell passt Kontraste eigenständig an und teilt Bilder in Kacheln ein, um schwer erkennbare Objekte zu finden.
  • Die Trennung in Orchestrator-Modelle und taktile Steuerungsrichtlinien strukturiert mehrstufige Aufgaben effizient.

Klassische Computer-Vision-Aufgaben werden nicht mehr starr verarbeitet, sondern dynamisch gelöst. Das System nutzt eigenen Code, um Bildbereiche zur genauen Objekterkennung anzupassen. In der Robotik zerlegt ein übergeordnetes Reasoning-Modell komplexe Abläufe in Teilaufgaben, die anschließend von taktilen Kontrollmodellen ausgeführt werden.

Skalierungsgesetze und Robotersteuerung in der Praxis

  • Neue Skalierungsgesetze belegen die Ersetzbarkeit teurer Teleoperationsdaten durch allgemeines Videomaterial.
  • Teleoperationsdaten verursachen Kosten von etwa 100 Dollar pro Stunde.
  • Die kombinierte Modellierung von Wahrnehmung und Steuerung erhöht die Robustheit gegenüber wechselnden Hintergrund- und Lichtverhältnissen.

Ein zehnfach höheres Volumen an Videodaten kompensiert einen Großteil der benötigten Teleoperationsdaten beim Modelltraining. In Testaufbauten führt das System mehrstufige Befehle aus, wie das Lesen von Buchtiteln und das anschließende Einsortieren in den passenden Behälter. Das Pre-Training auf gemischten Daten reduziert zudem die Störanfälligkeit bei veränderten Tischhintergründen oder schwankenden Lichtbedingungen.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기