Robotertechnik steckt seit 70 Jahren fest — Deepak Pathak, Skild AI

스크립트

00:00:00Ich glaube, Ihnen allen hier ist bewusst, wie viel Fortschritt die KI
00:00:15in den letzten fünf Jahren gemacht hat.
00:00:17Es fühlt sich nach mehr an als in den gesamten letzten 100 Jahren.
00:00:22Und was derzeit passiert, besonders in der KI,
00:00:24ist: KI kam zuerst für Sprache, dann für Sprachausgabe, Audio, Video.
00:00:28Und alle sind begeistert, dass als Nächstes die Robotik kommt.
00:00:32Diese Begeisterung erreicht dieses Jahr aus irgendeinem Grund ihren Höhepunkt,
00:00:37was mir nach wie vor unbegreiflich ist.
00:00:40Man sieht auch Branchengrößen wie Jensen,
00:00:43die von physischer KI als der nächsten Grenze der Robotik sprechen.
00:00:46Wenn man Twitter oder LinkedIn öffnet,
00:00:49wirkt es fast so, als wäre die Robotik bereits da.
00:00:51Und dass wir irgendwann bis Dezember Haushaltsroboter bei uns zu Hause haben,
00:00:56wie es von vielen Leuten behauptet wird.
00:00:58Aber ich bin hier, um zu betonen, dass die Robotik schon seit fast 70 Jahren
00:01:03„fast da“ ist.
00:01:06Diejenigen unter Ihnen, die in den letzten vier, fünf Jahren zur Robotik kamen:
00:01:10Machen Sie mal irgendeinen Robotik-Kurs.
00:01:14Und wenn Sie Videos aus der Robotik von vor 30 Jahren
00:01:17von denen von heute unterscheiden können, lade ich Sie zum Essen ein.
00:01:23Um Ihnen ein Beispiel zu geben, schauen wir uns diesen Roboter an.
00:01:26Hier ist ein Bild.
00:01:27Das Ziel dieses Roboters ist es, sich dieses Bild mit Bauklötzen anzusehen
00:01:31und diese Klötze vor sich so anzuordnen,
00:01:34dass sie demselben Muster wie auf dem Bild entsprechen.
00:01:37Okay?
00:01:38Das ist eine extrem einfache Aufgabe.
00:01:40Aber wenn man darüber nachdenkt, ist es ein 3D-Block.
00:01:42Man muss 3D von jeder Seite verstehen.
00:01:44Und der Roboter kann das ziemlich präzise.
00:01:47Irgendwelche Vermutungen, wie alt dieses Ergebnis ist?
00:01:51Jemand?
00:01:51Einfach schätzen.
00:01:52Schätzen Sie einfach mal.
00:01:53Wie bitte?
00:01:5440 Jahre.
00:01:55Okay.
00:01:55Bietet jemand mehr?
00:01:59Das stammt aus den 1960er Jahren.
00:02:01Das war lange bevor es Computer gab.
00:02:03Okay?
00:02:04Das nennt sich MIT Copy Demo.
00:02:06Das war der Beginn von...
00:02:09das war noch vor der KI, wie Sie sie heute kennen.
00:02:12Schauen Sie sich das hier an.
00:02:17Ein Exponat auf dem Atomkongress in Philadelphia
00:02:19hat das perfekte Erfolgsrezept für Beliebtheit.
00:02:21Was hier passiert: Der Mann hinter den Kulissen
00:02:24steuert diese Roboter über ein Leader-Follower-System.
00:02:27Und wenn man sich große Labore ansieht, große Unternehmen,
00:02:31große akademische Labore – wie sie Daten sammeln,
00:02:33nutzen sie Teleoperationssysteme, die
00:02:35exakt denselben Prinzipien folgen.
00:02:38Irgendwelche Tipps für das Jahr bei diesem Video?
00:02:40Der erfahrene Bediener des elektronischen Geräts...
00:02:42Jetzt schätzen bestimmt alle das Jahr viel zu hoch.
00:02:45Aber das ist von 1957, vor 68 Jahren.
00:02:49Okay?
00:02:51Fragen Sie jemanden in Ihrer Familie, der älter ist als...
00:02:53eigentlich leben die vielleicht gar nicht mehr.
00:02:55Denn das ist...
00:02:57man müsste jemanden fragen, der 80 Jahre alt ist:
00:02:59Wie war der Stand der Technik damals?
00:03:02Für ein paar Kilobyte Arbeitsspeicher brauchte man einen ganzen Raum,
00:03:06so eine riesige Anlage.
00:03:07Und schon damals hat man so etwas zum Laufen gebracht.
00:03:11Und nicht nur das: Wenn man jedes Jahrzehnt durchgeht,
00:03:14sehen die Videos genauso cool aus.
00:03:15Hier ist zum Beispiel ein humanoider Roboter beim Jonglieren
00:03:18oder beim Tischfußball gegen einen Menschen.
00:03:21Und das stammt auch alles aus der Zeit vor Deep Learning.
00:03:25Das hier ist von vor acht Jahren.
00:03:26Dieser Roboter ist ein Ergebnis aus Berkeley,
00:03:29kann den ganzen Tisch abräumen, Dinge in einer Kiste einsortieren.
00:03:33Das hat ein einziger Doktorand mit einem Rechner mit einer GPU geschafft.
00:03:36Mehr brauchte es nicht.
00:03:37Okay?
00:03:38Wenn ich all diese Videos aus der Vergangenheit koloriere
00:03:41und einen KI-Filter für eine moderne Stimme darüberlege,
00:03:45kann man nicht erkennen, ob dieses Video von 1957
00:03:49oder von heute ist.
00:03:50Und das sind nicht einmal die ältesten Ergebnisse.
00:03:52Die ältesten gehen auf die 1940er Jahre zurück.
00:03:54Okay?
00:03:55Woran liegt es also, dass in den letzten 70 Jahren
00:04:00jede andere Technologie, absolut jede andere Technologie
00:04:02sich enorm weiterentwickelt hat –
00:04:04Sprachverständnis, Computer Vision, Mobiltelefone, Mikrochips.
00:04:08Warum steckt die Robotik seit so langer Zeit in diesem Urzeitalter fest?
00:04:11Der Grund dafür ist ein allgemeines Gehirn.
00:04:14Robotik wurde von Grund auf immer als ein
00:04:17Hardware-Problem angegangen.
00:04:18Das ist der Grund, warum sich alles rund um die Robotik
00:04:21weiterentwickelt hat, aber die Robotik selbst seit 70 Jahren
00:04:24auf der Stelle tritt.
00:04:25Es gibt ein sehr bekanntes Paradoxon namens Moravec-Paradoxon.
00:04:27Ich weiß nicht, ob Sie von Moravec gehört haben.
00:04:29Er war auch CMU-Professor, genau wie ich.
00:04:32Ich muss ihn also auf jeden Fall zitieren.
00:04:34Er war einer der Gründerväter der KI.
00:04:36Nach 30 Jahren Arbeit in der Robotik
00:04:39kam er zu einer sehr einfachen Erkenntnis:
00:04:41Schwer ist einfach.
00:04:42Einfach ist schwer.
00:04:43Okay?
00:04:44Was auch immer der Mensch für schwer hielt,
00:04:45ist für Computer extrem einfach und umgekehrt.
00:04:49Und Sie können das direkt vor Ihren Augen beobachten.
00:04:51Man würde sagen, Mathematik ist schwer.
00:04:53Eine Goldmedaille bei der Mathe-Olympiade ist wirklich extrem schwer.
00:04:56Eine Treppe steigen?
00:04:57War supereinfach.
00:04:59Schauen Sie sich jetzt in der Technologie um:
00:05:01Wo stehen wir in Bezug auf das, was gelöst wurde
00:05:02und was noch ungelöst ist.
00:05:04Das ist also die Robotik, okay?
00:05:05Sie ist nicht einfach nur eine weitere Anwendung von KI.
00:05:09Sie ist das, wofür KI ganz zu Beginn überhaupt gegründet wurde
00:05:12und worin sie kaum Fortschritte gemacht hat.
00:05:14Das ist nicht einfach ein weiteres Feld,
00:05:15in das Deep-Learning-Netzwerke so einfach einsteigen können.
00:05:18Man muss das von Grund auf nach grundlegenden Prinzipien
00:05:22völlig neu durchdenken.
00:05:23Ein sehr bekanntes Beispiel ist,
00:05:25dass ein Computer Garri Kasparow in den 90ern im Schach schlagen konnte,
00:05:29aber wir noch immer keinen Roboter haben,
00:05:34der die Schachfiguren greifen und auf dem Schachbrett
00:05:36platzieren kann.
00:05:37Wie gehen wir also vor, um das zu lösen?
00:05:43Positiv betrachtet haben wir eine Geheimformel
00:05:47für den Erfolg der KI, richtig?
00:05:49Man besorgt sich große Datensätze.
00:05:51Man trainiert große Modelle.
00:05:52Und wie durch Magie funktioniert es, okay?
00:05:54Wir wissen, dass dieses Muster in vielen Bereichen
00:05:57sehr gut funktioniert, richtig?
00:05:59Können wir dasselbe Rezept nun auf die Robotik anwenden?
00:06:02Nun, es lässt sich nicht direkt übertragen, weil wir keine Daten haben.
00:06:06Es gibt kein Internet für Robotikdaten.
00:06:09Und wie schon erwähnt, kann man Daten manuell
00:06:12über Teleoperation am Roboter sammeln.
00:06:14Aber wie Sie merken, ist Teleoperation keine Errungenschaft der letzten fünf Jahre.
00:06:18Das ist etwas, das 68 oder 70 Jahre alt ist.
00:06:21Das Komische ist: Wenn man zurückblickt
00:06:24und sich die Entwicklung der Modelle GPT-3 und GPT-4 ansieht,
00:06:28zurück zu GPT-3 vor drei Jahren –
00:06:31das wirkt wie eine Ewigkeit her –,
00:06:33GPT-3 funktionierte erst und erregte Aufmerksamkeit,
00:06:36als man diese Modelle mit Trillionen von Tokens trainieren konnte.
00:06:40GPT-3 basierte bereits auf über 30 Billionen Tokens.
00:06:42Und heute sind es Hunderte Billionen Tokens.
00:06:44Wenn man Daten manuell per Teleoperation sammelt,
00:06:47braucht man etwa eine Minute für ein einziges Beispiel.
00:06:49Sie können das selbst nachrechnen.
00:06:50Selbst mit der gesamten US-Bevölkerung
00:06:53würde es über ein Jahrhundert dauern, dieselbe Skalierung
00:06:55wie bei GPT-3 zu erreichen, was etwa--
00:06:59und niemand nutzt heute mehr GPT-3.
00:07:00Verstanden?
00:07:01Das ist also sehr langsam und teuer.
00:07:02Ich würde behaupten, in der Robotik hat
00:07:05noch niemand wirklich skaliert.
00:07:07Und wir sind weit davon entfernt, über Skalierung zu sprechen,
00:07:10wie man sie aus anderen Bereichen kennt.
00:07:14Oder?
00:07:14Darauf haben wir uns also konzentriert.
00:07:17Skalierung beschäftigt uns seit etwa drei Jahren.
00:07:19Aber ich arbeite seit mehr als einem Jahrzehnt an dem Problem.
00:07:22Mehr habe ich in meiner Karriere nicht gemacht.
00:07:24Sonst nichts.
00:07:26Unsere These bei der Skalierung lautet,
00:07:27eine sogenannte körperübergreifende Intelligenz zu entwickeln.
00:07:32Jeder Roboter, jede Aufgabe, ein Gehirn.
00:07:35Verstanden?
00:07:36Jeder Roboter – ein Humanoide,
00:07:37ein Vierbeiner,
00:07:38ein Roboterarm am Fließband oder eine geschickte Hand.
00:07:41Das spielt absolut keine Rolle.
00:07:42Und selbst diese Hypothese ist viel
00:07:45allgemeiner als die Steuerung beim Menschen,
00:07:48da wir nur unseren eigenen Körper steuern.
00:07:50Warum müssen wir so universell denken?
00:07:51Nun, das Argument ist: In der Robotik
00:07:54gibt es ohnehin keine Daten.
00:07:56Ich kann mir also nicht aussuchen, von welcher Hardware ich Daten nutze.
00:07:59Wir sollten Daten von jeder Art von Hardware nutzen können,
00:08:02jeder Art von Aufgabe, jedem Szenario.
00:08:04Das ist der einzige Weg, um die Skalierung
00:08:06von Sprachmodellen vor drei Jahren wirklich zu erreichen.
00:08:10Das Ziel ist dieses Konzept von: jeder Roboter,
00:08:13jede Aufgabe, ein Gehirn.
00:08:15In diesem Vortrag werde ich hoffentlich
00:08:16zeigen, warum das der richtige Weg für die Robotik ist.
00:08:20Gut?
00:08:20Das war die grobe Einleitung.
00:08:23Bevor ich näher ins Detail gehe,
00:08:24möchte ich Ihnen ein erstes Beispiel zeigen.
00:08:28In diesem Ergebnis stammt jeder einzelne Roboter
00:08:31von einer anderen Firma, mit anderer Hardware.
00:08:34Und alle werden von einem skalierten Gehirn gesteuert,
00:08:37ob Humanoiden beim Treppensteigen
00:08:39oder in allen möglichen Szenarien.
00:08:42Das sind keine neuen Ergebnisse.
00:08:43Das sind Ergebnisse, die schon ein paar Jahre alt sind.
00:08:47Robust gegenüber Störungen.
00:08:51Man kann sie direkt in neuen Szenarien einsetzen.
00:09:03Die Idee hierbei: Jeder einzelne Roboter in diesem Video führt
00:09:08Aktionen irgendwo auf der Welt aus.
00:09:11Das Gehirn dahinter verbessert sich,
00:09:13weil es ein universelles Gehirn ist.
00:09:15Ja, das ist wirklich schwer, oder?
00:09:16Weil Eier in Ordnung sind.
00:09:17Das ist also eine Vorschau auf unsere Arbeit.
00:09:33Ich möchte diesen Vortrag wissenschaftlicher und informativer gestalten
00:09:38als eine Firmenwerbung.
00:09:39Ich werde darüber sprechen, wie wir Daten in der Robotik skalieren.
00:09:42Blicken wir zurück, wie das bisher angegangen wurde.
00:09:45Ich blicke dabei auf meine eigene Karriere zurück.
00:09:48Meine Hypothese zu Daten hat sich über die Jahre verändert.
00:09:51Als ich anfing, Dinge zu skalieren,
00:09:55war die Idee: Man kann Daten für Roboter manuell erfassen,
00:09:59aber das ist zu langsam.
00:10:00Roboter sollten Daten selbstständig sammeln dürfen.
00:10:03Wir hatten also dieses Konzept der neugiergetriebenen Erkundung,
00:10:06bei dem Roboter die Umgebung neugierig erkunden.
00:10:10Das hat viele Vorteile, wie: Kein Mensch erforderlich.
00:10:13Roboter können spielerisch weitermachen und Daten sammeln.
00:10:15Wir nannten es damals “Spieldaten”.
00:10:17Sie sind sehr reichhaltig, da sie Kräfte, Sensoren und Gelenkwinkel enthalten.
00:10:21Die Schwierigkeit ist jedoch: Es findet nur in der physischen Welt statt.
00:10:24Es ist also sehr schwer zu skalieren.
00:10:27Google hat damals daran gearbeitet mit hunderten von Robotern.
00:10:31Selbst für Google ist das zu teuer und zu langsam zum Skalieren.
00:10:34Die andere Idee ist wieder die Teleoperation.
00:10:36Wie gesagt, eine alte Idee.
00:10:38Aber wieder dieselben Probleme.
00:10:39Unmöglich zu skalieren, denn jetzt braucht man nicht nur Roboter,
00:10:42sondern auch Menschen.
00:10:43Es ist also noch teurer.
00:10:45Und die Vielfalt ist sehr begrenzt.
00:10:46Denn selbst wenn man einen Roboter mit einem Menschen aufstellt,
00:10:50erhält man vielleicht 1.000 Beispiele,
00:10:51aber alle im selben Aufbau.
00:10:53Ideal wäre es, den Roboter jeden Tag in ein neues Zuhause zu bringen,
00:10:57in ein neues Szenario.
00:10:58Und das ist extrem schwer zu skalieren.
00:11:01Dann hatten wir einen großen Durchbruch beim Lernen
00:11:03aus Simulationen.
00:11:04Dies war eines der ersten Ergebnisse, bei denen gezeigt werden konnte,
00:11:08dass tiefes bestärkendes Lernen in der Simulation trainiert
00:11:12und auf einen echten Roboter übertragen werden kann.
00:11:13Das war damals ein preisgekröntes Paper.
00:11:16Heute nutzen es alle Humanoiden und Unternehmen da draußen.
00:11:20Das stammte aus einem Labor in Berkeley und der CMU.
00:11:23Aber auch hier gibt es Vor- und Nachteile.
00:11:25Es lässt sich sehr leicht skalieren.
00:11:27Aber Vielfalt ist schwer zu erreichen, da man jede Szene
00:11:29in der Simulation manuell erstellen muss.
00:11:31Wenn Sie hier zuhören, gibt es
00:11:34keine einzelne Antwort, auf die ich hinauswill.
00:11:35Es gibt nicht die eine Lösung.
00:11:39Das ist eine weitere Arbeit von uns aus früherer Zeit.
00:11:41Das war alles vor der Skalierung.
00:11:43Lernen aus Videos von Menschen.
00:11:44Man schaut dem Menschen zu und der Roboter kopiert es.
00:11:47Auch hier: hohe Vielfalt.
00:11:48Man kann Videos von YouTube usw. nutzen.
00:11:50Sehr gut skalierbar.
00:11:51Aber es ist eine sehr schwache Datenform,
00:11:54weil sie weit von der Robotik entfernt ist.
00:11:57Was ist also die Lösung hier?
00:11:59Die Antwort ist: Es gibt keinen Königsweg.
00:12:01Man muss Daten im Kontext
00:12:05verschiedener Eigenschaften betrachten.
00:12:06Meiner Meinung nach gibt es nur drei Eigenschaften,
00:12:09die in der Robotik zählen--
00:12:12Skalierbarkeit, Vielfalt und die Nähe
00:12:15zu den Gelenkwinkeln des Roboters.
00:12:18Skalierbarkeit bedeutet: Kann ich es schnell über Szenarien hinweg skalieren?
00:12:22Vielfalt bedeutet: Kann ich vielfältige Daten erhalten?
00:12:25Denn 100 Billionen Token nützen
00:12:27überhaupt nichts, wenn sie sich alle
00:12:29in derselben Umgebung und denselben Szenarien befinden.
00:12:32Und Nähe zum Roboter bedeutet: Wie weit ist man
00:12:35von den tatsächlichen Gelenkwinkeln des Roboters entfernt?
00:12:38Betrachtet man Simulationen: sehr skalierbar, geringe Vielfalt,
00:12:42aber relativ nah am Roboter.
00:12:44Menschliche Videos sind sehr skalierbar und vielfältig,
00:12:46aber sehr weit von Roboterdaten entfernt.
00:12:47Man muss lernen, den Menschen auf den Roboter zu übertragen.
00:12:49Diese anderen beiden, Teleoperation und Manipulationsschnittstellen,
00:12:52liegen irgendwo dazwischen.
00:12:54Und man sieht jetzt weltweit bei verschiedenen
00:12:57Unternehmen,
00:12:58dass sie sich alle auf einen dieser Ansätze konzentrieren.
00:13:01Die meisten auf Teleoperation oder Yumi-Setups.
00:13:05Sehr wenige auf alles andere.
00:13:07Aber es gibt nicht die eine perfekte Lösung.
00:13:09Jeder Ansatz hat seine Nachteile.
00:13:11Das Gute daran ist jedoch, dass sie sich alle gegenseitig
00:13:15ergänzen.
00:13:16Ihre Nachteile überschneiden sich nicht
00:13:19eins zu eins.
00:13:20Deshalb besteht die Rezeptur, zu der wir über die Jahre gelangt sind,
00:13:24darin, das Training in zwei Teile zu unterteilen:
00:13:27Pre-Training und Post-Training.
00:13:29Das ist überraschend, oder?
00:13:30Aber wie führt man das Pre-Training durch?
00:13:31Man möchte mit Daten vortrainieren, die
00:13:32sehr skalierbar und vielfältig sind, aber vielleicht von geringer Qualität.
00:13:35Also Simulationen, Videos von Menschen und so weiter.
00:13:37So führt man also das Vortraining durch.
00:13:39Und für das Nachtraining nutzt man Daten aus der Teleoperation.
00:13:42Was sind nun Teleoperationsdaten?
00:13:43Sie haben eine sehr hohe Qualität, aber eine geringe Menge, okay?
00:13:47Hohe Qualität, geringe Menge.
00:13:48Das erinnert uns genau an das Rezept bei Sprachmodellen.
00:13:51Man trainiert Daten aus dem Internet vor.
00:13:53Dann trainiert man für das Programmieren, für die eigene Firma usw. nach.
00:13:59Aber in der Robotik gibt es noch eine weitere Kategorie,
00:14:00nämlich Einsatzdaten.
00:14:02Und Einsatzdaten sind extrem skalierbar,
00:14:05sobald der Einsatz skaliert ist.
00:14:07Mit der Zeit werden diese Daten also alles andere überlagern.
00:14:11Und was wir zu bauen versuchen, ist das,
00:14:14was wir ein Daten-Schwungrad nennen, welches
00:14:16diese Daten aus der Phase des Nachtrainings nimmt
00:14:18und sie wieder ins Vortraining einspeist.
00:14:20Jetzt versteht man, warum dieses Konzept eines omnikörperlichen Gehirns
00:14:23extrem wichtig ist, denn es
00:14:25ist sehr unwahrscheinlich, dass man nur einen Roboter und nur eine Version
00:14:28für immer bei jeder Aufgabe auf der ganzen Welt im Einsatz hat.
00:14:32Das passiert in keinem Bereich der Hardware, außer bei Chips,
00:14:36weil sie sehr schwer herzustellen sind.
00:14:38Und selbst bei den Chips sieht man,
00:14:40dass heutzutage von vielen Unternehmen
00:14:42Inferenz-Chips am laufenden Band kommen.
00:14:43In der Hardware ist das also nie der Fall.
00:14:45Man hat nie nur eine Roboterversion oder eine Bauform,
00:14:48weshalb omnikörperliche Intelligenz
00:14:50der Wegbereiter für ein solches Einsatzdaten-Schwungrad ist.
00:14:56Schauen wir uns nun ganz schnell ein paar Ergebnisse an.
00:14:58Dieses Gehirn ist extrem allgemein gehalten,
00:15:00sodass wir eine Vielzahl von Aufgaben sehr schnell erledigen können.
00:15:03Sie haben vielleicht viele Aufgaben wie das Falten von Wäsche gesehen,
00:15:06und so weiter.
00:15:07Aus irgendeinem Grund ist das eine sehr beliebte Aufgabe im Silicon Valley.
00:15:10Und das Argument hier lautet: Wann haben Sie
00:15:14beim Falten eines T-Shirts je gedacht,
00:15:18dass das gefaltete T-Shirt ein Chaos wird, wenn man um einen Zentimeter danebengreift?
00:15:22So denkt man gar nicht.
00:15:23Die Leute denken beim Falten gar nicht nach.
00:15:25Sie greifen einfach irgendwohin.
00:15:26Man macht es einfach irgendwie.
00:15:27Die Fehlertoleranz ist also extrem, extrem hoch.
00:15:31Warum ist diese Aufgabe dann schwer?
00:15:35Warum lassen sich die Leute
00:15:38vormachen, diese Aufgabe sei schwer?
00:15:39Lassen Sie es mich so ausdrücken.
00:15:42Der Stoff, richtig?
00:15:43Warum ist Stoff schwer?
00:15:46Simulation, aber nutzt ohnehin niemand Simulationen dafür.
00:15:48Das stammt alles aus Teleoperation.
00:15:49Warum ist das schwer?
00:15:51Wissen Sie, warum das schwer ist?
00:15:52Weil es für die klassische Art der Robotik schwer ist.
00:15:56Klassischerweise würde man in der Robotik die gesamte Physik modellieren,
00:15:59Modelle von Hand erstellen und es dann so machen.
00:16:01Dafür ist es sehr schwer.
00:16:02Aber für Robotik auf Basis von Deep Learning
00:16:04ist das die einfachste denkbare Aufgabe,
00:16:06weil sie eine hohe Fehlertoleranz hat.
00:16:08Es ist also völlig--
00:16:09mittlerweile konzentrieren sich so viele Firmen auf diese Aufgabe.
00:16:12Schwer ist meiner Meinung nach
00:16:13eher eine Aufgabe wie diese hier.
00:16:17Wenn ich Sie vor diesem Video gefragt hätte,
00:16:19ob diese Aufgabe ohne Hände machbar ist,
00:16:22hätte sehr wahrscheinlich die Hälfte Nein gesagt,
00:16:24weil man dafür einstecken muss--
00:16:25wie viele von Ihnen haben schon mal AirPods verloren?
00:16:29In unserer Firma gibt es einen Kanal
00:16:30namens “rechter AirPod”, weil die Leute ständig
00:16:32ihren rechten AirPod verlieren.
00:16:34In diesem Fall hat der Roboter keine Hand.
00:16:36Er hat einen Greifer.
00:16:37Hier ist die Aufgabe für den Greifer also sehr schwer.
00:16:41Es erfordert daher ein höheres Maß an Intelligenz,
00:16:43weil der Arm sich so ausrichten muss,
00:16:46dass er den AirPod genau richtig aufnimmt,
00:16:49damit er eingesetzt werden kann, da die Greifer sich nur
00:16:52so schließen lassen.
00:16:54Sie sind parallel zueinander.
00:16:55Man kann den AirPod also nicht ganz am Ende noch drehen.
00:16:59Was Sie hier sehen, sind keine echten AirPods.
00:17:02Das sind Fälschungen von Temu für etwa 5 bis 10 Dollar das Stück.
00:17:05Sie haben also keinen Magneten im Inneren.
00:17:07Der Roboter muss sich also richtig anstrengen, um das ordentlich einzusetzen,
00:17:11weil kein Magnet da ist, der es leicht reinzieht.
00:17:13Das sind also alles Fälschungen.
00:17:15Das ist noch schwerer, als es im Video aussieht.
00:17:17Sobald man das allgemeine Gehirn im Hintergrund aufgebaut hat,
00:17:23kann man es auch aus verschiedenen reinen Menschen-Videos lernen,
00:17:26ohne beim Teleoperations-Training
00:17:28überhaupt Feintuning-Daten zu haben.
00:17:29In diesem Szenario haben wir folgendes gemacht:
00:17:31Wir haben mit Menschen-Videos wie diesem trainiert, also Ego-Perspektiven-Videos.
00:17:34Wir versuchen nun, das auf Videos aus der Dritter-Person-Perspektive zu übertragen.
00:17:38Und wenn die Dritte-Person-Perspektive klappt, kann man von YouTube lernen,
00:17:40von jeder Art von Open-Source-Daten.
00:17:43In diesem Fall sehen wir also das Video
00:17:45und fügen dann weniger als eine Stunde Roboterdaten hinzu.
00:17:47Eine sehr schnelle Transformation also.
00:17:50Und dann lässt es sich auf Humanoide übertragen.
00:17:53Diese hier haben Hände.
00:17:54Ob Hände oder keine Hände, ist eine große Debatte.
00:17:57Oft nutzen Leute Hände als Ausrede dafür, warum Robotik noch nicht
00:18:00so weit ist, aber dem ist nicht so.
00:18:02Es liegt immer an der Intelligenz dahinter.
00:18:07Wir setzen derzeit keine Hände ein, weil es keine
00:18:09gibt, die in Fabriken eingesetzt werden können.
00:18:12Sie gehen alle innerhalb von 100 Stunden kaputt.
00:18:14Egal welche Sie nehmen.
00:18:17Wenn Sie eine bessere Hand haben, würde ich
00:18:19sofort 10 Stück zum Testen kaufen.
00:18:22Es geht also um robuste Szenarien.
00:18:25Die Idee ist, dass man viele Aufgaben durch Beobachten von Menschen lernen kann.
00:18:28Und der Grund, warum wir mit sehr wenig Daten auskommen,
00:18:31nämlich unter einer Stunde Roboterdaten,
00:18:33ist, dass der Roboter sich Dinge in seinem Kopf vorstellt
00:18:36und versucht, das Gelernte für viele Szenarien zu vervielfachen.
00:18:39Was Sie hier sehen, ist ein völlig simuliertes Video.
00:18:42Man könnte es den Traum des Roboters nennen.
00:18:43Es findet also im eigenen Modell des Roboters statt,
00:18:45wo er sich Szenarien vorstellen kann.
00:18:48Das sind also keine echten Daten.
00:18:49Das ist alles vom eigenen Modell des Roboters generiert.
00:18:52Man kann das auf komplexere Aufgaben übertragen
00:18:56und sogar auf günstigere Hardware.
00:18:57Hier sieht man das Zubereiten von Eiern, also Omelett kochen.
00:19:02Dieser gesamte Aufbau kostet etwa 4.000 Dollar.
00:19:06Das sind also extrem günstige Arme im Vergleich zu dem, was sonst auf dem Markt ist.
00:19:11Und wie Sie sehen, ist dieser Aufbau viel zu günstig,
00:19:15um überhaupt Sensoren zu haben.
00:19:16Der einzige Sensor hier ist eine Kamera, keine Kraftsensoren, sonst nichts.
00:19:20Und der Roboter kann rein über das Sehen Aufgaben erledigen, die Krafteinwirkung erfordern.
00:19:25Ich behaupte nicht, dass das die Zukunft ist,
00:19:26nach dem Motto, man sollte das so machen.
00:19:27Die Sensoren werden sich sicher verbessern.
00:19:29Aber mit den bestehenden Sensoren
00:19:33sind wir rein aus Sicht der Intelligenz noch weit hinter dem zurück,
00:19:36wo wir sein könnten.
00:19:38Das lässt sich also beliebig fortsetzen.
00:19:39Das ist mein Betreuer aus Berkeley.
00:19:41Er hat nicht geglaubt, dass Roboter das können.
00:19:43Er stand einfach etwa eine Stunde lang da,
00:19:45während der Roboter ein Omelett nach dem anderen machte.
00:19:48Und das Interessante daran ist:
00:19:49Das ist ein vollkommenes End-to-End-System.
00:19:51Es gibt keine Zustandsmaschine, gar nichts.
00:19:53Der Grund, warum der Roboter ein Ei zubereitet,
00:19:55ist, dass da ein leerer Teller vor ihm steht.
00:19:56Ich weiß nicht, warum es flackert.
00:19:58Das Video wurde nicht geschnitten,
00:20:00das versichere ich Ihnen.
00:20:01Es ist ein HDMI-Problem.
00:20:02Sobald man also den Teller entfernt...
00:20:06Entschuldigung, ich weiß nicht, warum das passiert ist.
00:20:08Ja, es gibt also keine Zustandsmaschine.
00:20:10Wann der Roboter startet, wann er aufhört,
00:20:11ist alles automatisiert.
00:20:12Und es ist sehr robust, selbst gegen Störungen.
00:20:14Man kann Objekte umstellen.
00:20:16Man kann... das sind alles ungesehene Objekte.
00:20:20Nur die Pfanne und der Gasherd sind gleich.
00:20:22Alles andere ist anders.
00:20:23Und der Roboter kann einfach weitermachen.
00:20:25Man erhält also eine grundlegende Robustheit.
00:20:27Das alles wurde mit weniger als 10 Stunden Daten trainiert.
00:20:30Es braucht also sehr wenige Daten, um diese Robustheit zu lernen.
00:20:33Und das kommt vom Basismodell im Hintergrund.
00:20:37Aus Zeitgründen überspringe ich das.
00:20:39Anders als bei herkömmlichen Robotik-Pipelines,
00:20:42wo man Planung, Kartierung usw. hat,
00:20:44ist dies ein End-to-End-Gehirn.
00:20:46Nun ist “End-to-End” ein viel genutzter Begriff in vielen KI-Bereichen.
00:20:50Aber wenn ich End-to-End sage, meine ich wirklich End-to-End.
00:20:53Es liest direkt von den Kameras.
00:20:55Es gibt die Leistung direkt an die Motoren weiter.
00:20:59Wir nutzen also nichts dazwischen, außer einem PID
00:21:02ganz am Ende, um von 100 auf 500 Hertz zu kommen.
00:21:04Aber der PID ist kein Beitrag der Robotik.
00:21:06Das gab es schon vorher.
00:21:07Das stammt noch aus dem Zweiten Weltkrieg oder so.
00:21:10Der interessante Teil ist: Visuelle Erfassung
00:21:13ist für uns nur eine weitere Eingabe.
00:21:15Es ist also gar nicht so verrückt.
00:21:17Sie haben vielleicht schon viele Ergebnisse gesehen
00:21:20von Robotern, die tanzen, Karate machen, Kung Fu oder Salto.
00:21:23Denken Sie mal nach: Wie viele Ergebnisse
00:21:27haben Sie gesehen, bei denen Roboter Treppen steigen?
00:21:30Sehr wenige.
00:21:31Selbst die Spitzenunternehmen im Bereich der Humanoide
00:21:34haben nicht mehr als eine einzige Testtreppe gezeigt,
00:21:37nur um ein Häkchen dahinter zu setzen.
00:21:39Und die Leute reden darüber, dass Humanoide kommen, China gegen die USA.
00:21:42Das ist alles irgendwie Blödsinn.
00:21:44Wenn Humanoide keine Treppen steigen können,
00:21:47wozu braucht man dann Beine?
00:21:50Das ist der einzige Grund, warum man Beine hat.
00:21:51Das ist tatsächlich das Moravec’sche Paradoxon in Aktion.
00:21:55Das linke ist für einen Roboter eigentlich viel einfacher.
00:21:58Ein Salto, Tanzen, das ist für den Roboter viel einfacher.
00:22:01Sie denken vielleicht: Okay, warum gibt es dieses Paradoxon?
00:22:04Denken Sie eine Ebene tiefer.
00:22:05Wenn ein Roboter einen Salto macht, muss er
00:22:09nur seinen eigenen Körper kennen, sonst nichts.
00:22:13Richtig?
00:22:13Wenn also alles bekannt oder vollständig beobachtet ist,
00:22:17darin sind Computer gut.
00:22:20Weil sie jeden möglichen Aufbau simulieren können.
00:22:25Aber das rechte, selbst das einfache Treppensteigen,
00:22:27erfordert überhaupt erst einmal das Sehen der Treppe.
00:22:30Welche Höhe, welche Breite.
00:22:32Man misst Höhe und Breite nicht exakt,
00:22:34aber man passt sich allen Störungen an.
00:22:35Und das erfordert Sehen.
00:22:36Das rechte erfordert also Verständnis.
00:22:38Und deshalb ist es schwer, und man sieht so etwas nicht.
00:22:40Aber für uns ist es nur ein weiteres Ergebnis.
00:22:42Es spielt eigentlich keine Rolle.
00:22:43Wir haben dieses Ergebnis vor anderthalb Jahren veröffentlicht.
00:22:46Aufgenommen haben wir das vor zweieinhalb Jahren.
00:22:48Aber dieser Roboter kommt in jedem Szenario klar.
00:22:52Er stolpert nicht über Dinge.
00:22:53Er steigt absichtlich über Dinge hinweg.
00:22:55Und es gibt keine Kartierung oder Planung.
00:22:56Er erstellt keine 3D-Karte der Umgebung.
00:22:59Alles wird über die Kamera am Oberkörper gesteuert.
00:23:02Und man kann das in jeder Art von Umgebung einsetzen, auf jeder Treppe.
00:23:05Ich mache hier etwas schneller.
00:23:07Das sind Feuertreppen.
00:23:11Es ist etwas seltsam.
00:23:12Feuertreppen sind für Notfälle bei einem Brand gedacht.
00:23:15Und sie sind die schwierigsten in jedem Gebäude.
00:23:17Wir testen also in all diesen Umgebungen.
00:23:20Aber man kann ihn überall einsetzen.
00:23:21Man kann ihn auf Treppen stören.
00:23:22Das macht wirklich nichts aus.
00:23:23Das ist eine übermenschliche Fähigkeit.
00:23:25Weil der Roboter nicht sehen kann, dass er gezogen wird.
00:23:27Es ist also ein Überraschungsmoment für den Roboter,
00:23:29dass man an ihm zieht, während er steigt.
00:23:31Und wieder ist es in all diesen Szenarien
00:23:33dasselbe Modell.
00:23:35Also sehr einfach.
00:23:36Obwohl es einfach ist, sieht Parkour lustig aus.
00:23:40Und die Leute finden oft, dass...
00:23:45die Roboter das alles können.
00:23:47Aber das ist so viel einfacher als das, was ich vorhin gezeigt habe.
00:23:51Und selbst wenn Sie diese Videos jetzt sehen,
00:23:53werden viele von Ihnen das beeindruckender finden,
00:23:55obwohl ich Ihnen sage, dass es einfach ist.
00:23:57Es dauert eine halbe Stunde, das zu trainieren,
00:23:59während das vorherige viel länger dauert und viel
00:24:01schwieriger zu trainieren ist.
00:24:03Sie können also dieses Basismodell nehmen und es
00:24:06sehr schnell auf verschiedene Aufgaben überfragen.
00:24:08Das hier ist ein sehr altes Ergebnis
00:24:09von vor etwa anderthalb Jahren.
00:24:11Für das Einstecken von LAN-Kabeln usw.
00:24:13haben wir mittlerweile sehr fortgeschrittene Systeme.
00:24:14Aber wir setzen diese Modelle bereits
00:24:17in einer Vielzahl von Anwendungen ein.
00:24:18Denn um ein Daten-Schwungrad aufzubauen,
00:24:21ist der schwerste Teil der Einsatz selbst.
00:24:24Es gibt so viele andere Probleme neben Intelligenz
00:24:26und Hardware, die auftauchen, wenn man Robotik einsetzt.
00:24:30Das ist nicht dasselbe wie die Bereitstellung von ChatGPT über eine App.
00:24:34Weil man viele der...
00:24:36Ich glaube, Skydio hat davor einen Vortrag gehalten,
00:24:38und sie können Ihnen den ganzen Tag
00:24:40über die Schwierigkeiten beim Einsatz erzählen.
00:24:42Wir müssen also jetzt mit dem Einsatz beginnen,
00:24:44damit wir dieses Daten-Schwungrad in absehbarer Zukunft haben.
00:24:47Ich gebe Ihnen ein paar Beispiele für Einsätze, die wir durchführen.
00:24:49Ein Beispiel ist mit NVIDIA:
00:24:51NVIDIA eröffnet ihre erste Fabrik in Houston.
00:24:54Und ihre Grafikprozessoren, die Sie jetzt verwenden,
00:24:56werden alle außerhalb der USA gebaut, hauptsächlich in Taiwan.
00:24:59Und dort wird alles manuell gemacht.
00:25:01Menschen sind wirklich effizient und extrem gut
00:25:04darin, diese Dinge herzustellen.
00:25:05Aber nachhaltige Kosten, Skalierbarkeit und Durchsatz
00:25:08hier in den USA sind ohne diese Arbeitskräfte
00:25:10sehr schwer aufrechtzuerhalten.
00:25:11Hier automatisieren wir diese GPU-Montage für sie.
00:25:15Wir haben eine Live-Demo auf der NVIDIA GTC gezeigt.
00:25:19Das wurde bereits letzte Woche in der Fabrik eingesetzt,
00:25:21es ist also schon live.
00:25:22Aber den interessanten Teil, den ich hervorheben möchte:
00:25:25Das ist eine sehr traditionelle Fabrikaufgabe.
00:25:29Aber wenn man sich den gesamten Aufbau ansieht,
00:25:32ist das extrem unstrukturiert, extrem laut.
00:25:36Und wenn man in irgendeine Fabrik mit traditionellem Aufbau geht,
00:25:38ist es dort extrem sauber.
00:25:39Hier kann der Roboter, dasselbe Gehirn,
00:25:42nicht nur sehr präzise Aufgaben ausführen,
00:25:44er kann auch sehr robust gegenüber jeglicher Störung sein, was
00:25:46bedeutet, dass diese Roboter nicht mehr in einen Käfig müssen.
00:25:50Und sie können einfach so an diesen Fertigungsstraßen eingesetzt werden,
00:25:54ohne dass an der Fertigungsstraße etwas geändert werden muss.
00:25:56Neben Menschen, und wo Menschen sind, ist Unordnung.
00:26:00Verstanden?
00:26:00Man kann dasselbe Gehirn für Lieferanwendungen nutzen.
00:26:02Hier liefert der Roboter vom Lkw bis an die Haustür.
00:26:06Er muss herausfinden, wo die Haustür ist.
00:26:08Das ist also eine Frage des gesunden Menschenverstands.
00:26:09Es ist kein Mobilitätsproblem.
00:26:10Und wir haben bereits Pakete zugestellt
00:26:12und hinter den Kulissen mit vielen Partnern zusammengearbeitet,
00:26:15um Pakete bis an die Haustür von Häusern
00:26:17in diesen Gegenden zu liefern.
00:26:19Dasselbe Setup funktioniert auch in Lagerhallen und all dem.
00:26:23Um den Vortrag nun abzuschließen,
00:26:26ich habe erwähnt, dass dies ein omni-körperliches Gehirn ist.
00:26:29Und ich hoffe, es ist klar, warum das so essenziell ist,
00:26:31ein omni-körperliches Gehirn zu haben, um ein Daten-Schwungrad aufzubauen.
00:26:34Aber es gibt noch einen weiteren Vorteil.
00:26:35Und dieser Vorteil ist: Ihre Roboter können mit der Zeit kaputtgehen,
00:26:38auch in Bezug auf Sicherheitsszenarien.
00:26:41Und Sicherheit ist ein Nebenprodukt dieses omni-körperlichen Gehirns.
00:26:44Denn wenn Sie ein--
00:26:45wir können das-- ich überspringe das ganz schnell.
00:26:47Sie können es online sehen.
00:26:48Das ist alles online.
00:26:49Aber wir können dasselbe Gehirn in jedes dieser Systeme einsetzen,
00:26:52in jeden dieser Roboter.
00:26:55Und in diesem Fall haben wir noch nicht einmal auf diesen Robotern trainiert.
00:26:58Das ist ein kompletter Zero-Shot-Transfer
00:27:00auf all diese Humanoide und all diese Dinge.
00:27:02Und selbst wenn der Roboter kaputtgeht, und hier bricht das Bein,
00:27:05kann er sich innerhalb von Millisekunden erholen.
00:27:07Denn wenn Ihr Bein bricht, ist Ihr dreibeiniger Roboter
00:27:10ein neuer Roboter.
00:27:12Es spielt also keine Rolle, welche Form der Roboter hat.
00:27:14Wenn sich etwas ändert: Hier deaktivieren wir die Beine des Roboters.
00:27:17Er lernt in nur drei Versuchen, auf zwei Beinen zu laufen.
00:27:21Was Sie also auf dem Bildschirm sehen, ist das gesamte Training
00:27:24für den Roboter, das in diesen Systemen stattfindet.
00:27:27Er passt sich also in wenigen Millisekunden bis etwa 30 Sekunden an.
00:27:32Ein Beispiel hier: Er fährt auf Rädern.
00:27:34Man blockiert das Rad.
00:27:36Er fängt an zu laufen.
00:27:37Das ist ein weiteres Nebenprodukt des omni-körperlichen Gehirns.
00:27:40Sicherheit bekommt mit dieser Art von Modellen eine ganz neue Bedeutung,
00:27:45wenn der Roboter fliegen--
00:27:46oder entschuldigen Sie, wenn die Roboter laufen oder agieren können,
00:27:49obwohl sie nur noch den halben Körper haben.
00:27:50Ich habe einige der blutigen Szenen hier herausgenommen,
00:27:52aber wir haben den Roboter auch in zwei Hälften geschnitten.
00:27:54Er kann immer noch mit beiden Hälften separat arbeiten.
00:27:57Aber dafür können Sie auf YouTube nachsehen.
00:27:59Und das ist alles, was ich habe.
00:28:00Vielen Dank.

설명

Show a robotics demo from 1957 next to one from today, and most people can't tell which is which. Deepak Pathak, co-founder and CEO of Skild AI and a professor at Carnegie Mellon, argues robotics stalled because it was treated as a hardware problem rather than a problem of building a general brain. Collecting robot data by teleoperation at one example a minute, he calculates, would take the entire US population more than a century to reach GPT-3 scale. Skild's answer is an "omni-bodied" brain: one model for any robot and any task. It's pre-trained on scalable data like simulation and human video, post-trained on teleoperation, and improved by a deployment flywheel. Pathak shows it inserting AirPods with a simple gripper, learning from human video with under an hour of robot data, and cooking omelets on $4,000 arms with only a camera. He explains why climbing stairs is harder than a backflip. He also shows GPU assembly for NVIDIA's Houston factory, and a robot learning to walk on two legs in three tries after its other legs are disabled. Speaker info: X/Twitter: @pathak2206 (https://x.com/pathak2206) LinkedIn: https://www.linkedin.com/in/pathak22 Website: https://www.cs.cmu.edu/~dpathak Related links: Skild AI: https://www.skild.ai Timestamps: 0:00 AI's progress and the robotics hype 1:02 Robotics has been "almost here" for 70 years 1:27 A 1960s block-copying robot 2:17 Teleoperation in 1957 3:57 Why robotics is stuck: the missing general brain 4:27 Moravec's paradox 5:42 There's no internet of robot data 7:22 Skild's thesis: one brain, any robot, any task 8:22 Teaser: many robots, one brain 9:31 How to scale robot data: a career retrospective 12:01 The three properties of robot data that matter 13:21 Pre-training, post-training and the deployment flywheel 14:56 Why laundry folding is actually easy 16:17 The AirPods task 17:21 Learning from human videos 18:36 The robot's "dream": imagined training data 18:56 Cooking omelets on $4,000 arms 20:41 Truly end-to-end: camera in, motor power out 21:21 Why stairs are harder than backflips 24:50 Deployment: GPU assembly for NVIDIA 26:00 Package delivery to the front door 26:25 Safety: adapting when the robot breaks

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기