Das nächste Nadelöhr der Physischen KI sind die richtigen Videos — Rafael Levi, Bright Data
AAI Engineer
컴퓨터/소프트웨어경제 뉴스AI/미래기술
스크립트
00:00:00Hallo zusammen, herzlich willkommen. Danke an alle, die gekommen sind, um mich zu sehen. Und danke auch an diejenigen,
00:00:21die einfach nur so hier sind. Ich werde versuchen, euch zu unterhalten und euch etwas Neues beizubringen.
00:00:26Mein Name ist Rafael, ich arbeite bei Bright Data. Ich bin seit über acht Jahren dort, und wir bei Bright Data sammeln Daten und versuchen zu innovieren.
00:00:38Heute möchte ich über Video-Discovery für das Training agentischer Weltmodelle sprechen, und wir werden gleich noch genauer erklären, was das ist.
00:00:48Was braucht es also heute, um ein System zu bauen, das sehen, verstehen und handeln kann?
00:00:56Richtig? Ich meine, wir haben verstanden, was KI ist, und verbessern sie ständig. Das haben wir also gewissermaßen im Griff,
00:01:04aber der schwierige Teil ist jetzt: Welche Daten stellt man ihr zur Verfügung? Denn jeder weiß, dass eine KI ohne Daten nur eine leere Hülle ist.
00:01:13Richtig? Blicken wir also kurz in die Geschichte zurück: 2022 brachte Google einem Roboter durch Bilder
00:01:25Aktionen in der realen Welt bei. Danach gab es einen gewaltigen Sprung. 2023 steuerte eine KI bereits mehrere Roboter.
00:01:372024 erschien Open Source. Das hat das Spiel komplett verändert. Sobald Open Source da war, hatten alle Labore Zugang zur KI und begannen, sie in Roboter zu integrieren.
00:01:51Und jetzt steuern diese Modelle bereits humanoide Roboter. Ich sehe hier zwar einige, die natürlich größtenteils ferngesteuert sind,
00:02:00aber in San Francisco fahren die Waymo-Autos schon ganz ohne Fahrer. Wie cool ist das denn?
00:02:07Als ich das erste Mal eingestiegen bin, dachte ich, ich sterbe gleich, aber es war eigentlich richtig angenehm.
00:02:12Richtig? Und wie hat das Auto gelernt zu fahren? Indem es sich das Fahren selbst beigebracht hat, durch das Lernen aus Dashcam-Aufnahmen.
00:02:22Jedes Auto hat eine Dashcam. Wenn man der KI dieses Material gibt, kann sie herausfinden, wie man eine Maschine steuert.
00:02:31Wie gesagt: Die KI ist nicht mehr das schwierige Problem, sondern die Daten. Und genau darüber möchte ich sprechen.
00:02:39Für Chat-LLMs gibt es Billionen von Wörtern und Texten. Wir haben also Unmengen an Textdaten, um LLMs zu trainieren.
00:02:49Für die Bildgenerierung haben wir Milliarden von Bildern, von beschrifteten Bildern, auch das ist eine riesige Datenbank.
00:02:56Aber für Robotik gibt es nur etwa eine Million Videos. Das ist ein sehr kleiner, begrenzter Datensatz von Robotern, die Dinge tun.
00:03:09Viele Unternehmen da draußen bezahlen deshalb Leute dafür, dass sie bestimmte Handlungen aufnehmen.
00:03:20Zum Beispiel: "Filme für mich, wie du eine Tür öffnest" oder "Filme für mich, wie du auf dem Stuhl sitzt".
00:03:28Das Problem ist jedoch: Wenn jemand angewiesen wird, etwas zu tun, tut er es nicht natürlich.
00:03:34Ich nenne das "gestellt". Wenn man dir sagt, du sollst aufnehmen, wie du eine Tür öffnest, und du tust es für jemanden,
00:03:40ist das nicht dasselbe, wie wenn du einfach ins Haus gehst. Die Bewegung ist völlig anders.
00:03:45Sind diese Daten also gut für das Robotik-Training? Meiner Meinung nach nein. Es sind verzerrte Daten, die nicht dieselben Ergebnisse liefern.
00:03:53Der Roboter wird natürlich nicht so effektiv sein, als wenn er intuitiv agiert, richtig?
00:03:59Ich habe dazu einfach ein paar Beispiele auf die Folie geworfen.
00:04:06Manuell erzeugte Daten sind nicht vergleichbar mit Daten, die sozusagen beiläufig entstehen.
00:04:12Fakt ist auch, dass sich Menschen vor der Kamera ganz anders verhalten.
00:04:16Einige von euch wissen das: Manche Leute sind kamerascheu. Sobald man eine Kamera auf sie richtet, verändern sie sich.
00:04:23Aber in der natürlichen Welt ist das eine völlig andere Sache.
00:04:27Genau dieses Problem versuchen wir bei Bright Data zu lösen.
00:04:35Nochmals: Warum reichen die üblichen Datenquellen nicht aus?
00:04:37Simulationen: Sie sind virtuell und günstig, aber na ja, jeder spielt Videospiele.
00:04:44Die Physik in Videospielen ist zwar fast soweit, aber noch nicht gut genug, um einen Roboter daran zu trainieren.
00:04:50Manuelle Steuerung, also dass ein Mensch einen Roboter steuert, ist zwar machbar, aber wie viele Stunden am Tag kann man das aufnehmen?
00:04:57Wie viele Leute braucht man, um wirklich extrem große Datenmengen zu bekommen?
00:05:01Man kann vielleicht acht Stunden am Tag aufnehmen, jeden Tag.
00:05:04Wie viele Stunden kommen da in einem Jahr zusammen?
00:05:07Das ist nicht wirklich skalierbar.
00:05:09Und natürlich gibt es bereits vorgefertigte Datensätze, aber wie gesagt, sie sind klein.
00:05:13Es gibt derzeit nur etwa eine Million Videos.
00:05:15Was ist also die Alternative?
00:05:17Die Alternative ist das Web.
00:05:20Denken wir nur einmal an YouTube.
00:05:22Wie viele Videos gibt es auf YouTube?
00:05:25Ich weiß nicht, vielleicht fünf Milliarden Videos?
00:05:28Wie viele Handlungen stecken in diesen Videos, die ein Roboter nachahmen kann?
00:05:34Denken wir mal darüber nach.
00:05:35Was glaubt ihr, wie viele Videos es gibt, in denen jemand aus der Ego-Perspektive eine Tür öffnet?
00:05:42Millionen von Stunden.
00:05:43Ihr wärt überrascht.
00:05:45Jeden Tag zeigen Webvideos Schwerkraft, Bewegungen,
00:05:53Ursache und Wirkung – Unfälle sind natürlich das beste Beispiel für Ursache und Wirkung –
00:06:00wie Menschen mit Objekten umgehen, und das in Milliarden von Stunden.
00:06:04Großartiges Trainingsmaterial für Roboter. Aber wo liegt das Problem?
00:06:08Das Problem ist, dass es sehr viel Stördaten gibt, richtig?
00:06:12Nehmen wir zum Beispiel folgendes:
00:06:14Eines der KI-Modelle, das Meta trainiert hat, wurde mit etwa einer Million Stunden Videos aus der echten Welt gefüttert.
00:06:21Und danach brauchte es nur noch 62 Stunden an echten Robotikdaten, um einen echten Roboter zu steuern.
00:06:29Wenn man darüber nachdenkt: Die Daten wurden öffentlich gesammelt, richtig?
00:06:33Es trainierte den Roboter an ganz zufälligen Dingen, und nach 62 Robotik-Stunden bewegte er sich bereits.
00:06:41Keine Simulationen nötig, autonome Robotik schnell geliefert.
00:06:52Aber die Videos zeigen ja nicht, wie sich die Roboter bewegen, oder?
00:06:54Ihr denkt jetzt vielleicht: Wie nützlich ist es für einen Roboter, wenn ein Mensch Wasser in ein Glas gießt?
00:07:01Es gibt tatsächlich Methoden, wie eine KI die Handlungen im Video unterscheiden und daraus lernen kann.
00:07:09Man nimmt zwei Einzelbilder, Frame für Frame, und die KI misst den Unterschied in der Bewegung.
00:07:15Man hat also Bild A und Bild B, und dazwischen gibt es eine kleine Bewegungsänderung.
00:07:21Eine KI kann diese Veränderung genau messen.
00:07:24Wenn man das durch das gesamte Video hindurch macht, kann eine KI Winkel, Distanz
00:07:30und alles berechnen, was sie zum Trainieren eines Roboters braucht.
00:07:34Wir brauchen also nicht unbedingt Sensordaten. Aber natürlich bringt einen das Video allein, das man herunterlädt
00:07:41oder aus dem man die Daten extrahiert, von YouTube noch nicht zu 100 % ans Ziel.
00:07:48Man muss es noch weiterverarbeiten, aber die Möglichkeit ist da.
00:07:53Sie steht bereit, man muss die Daten nur noch verarbeiten.
00:07:58Hier noch ein paar Beispiele:
00:07:59Wenn NVIDIA beispielsweise ihren Cosmos-Roboter trainiert, verwerfen sie etwa 96 % des Videomaterials.
00:08:07Was bedeutet das?
00:08:09Sie laden eine Million Stunden Video herunter,
00:08:12aber nur 4 % davon sind tatsächlich nützlich.
00:08:15Alles andere wird weggeworfen.
00:08:16Das ist verschwendete Rechenleistung.
00:08:18Verschwendete Bandbreite.
00:08:19Verschwendeter Speicherplatz.
00:08:21Einfach eine Menge verschwendetes Geld.
00:08:23Stable Video Diffusion verwirft 74 % der Videos, die sie herunterladen.
00:08:30Bei Bright Data versuchen wir, dieses Problem zu lösen und noch einen Schritt weiterzugehen.
00:08:37Unser Ansatz lautet: Erst suchen, dann sammeln.
00:08:41Wir indexieren Videos und ermöglichen es euch, gezielt nach bestimmten Handlungen zu suchen.
00:08:50Da wir vorhin über eine Person gesprochen haben, die eine Tür öffnet, bleiben wir bei diesem Beispiel.
00:08:55Auf unserer Plattform kann man detaillierte Angaben machen,
00:09:01eine Suchanfrage wie: "Person spült Geschirr", "Person faltet ein T-Shirt" und so weiter.
00:09:06Und wir liefern genau die Ausschnitte aus den Videos, die diese Handlungen zeigen.
00:09:13Was bedeutet das also?
00:09:16Das bedeutet, dass bei der Datenerfassung deutlich weniger Ausschuss entsteht.
00:09:22Es wird weniger Speicherplatz und Bandbreite verschwendet.
00:09:25Noch ein paar Details zur Funktionsweise:
00:09:27Zuerst definiert man natürlich, wonach man sucht.
00:09:32Wir durchsuchen Milliarden von vorindexierten Videos.
00:09:36Nicht nach Stichwörtern, sondern nach Handlungen.
00:09:39Und wir liefern gebrauchsfertige Clips.
00:09:43Diese sind natürlich bereits für euer Training aufbereitet.
00:09:47Man muss sie nur noch leicht nachbearbeiten, etwa für Bewegung, Distanzsensoren und so weiter.
00:09:52Und schon können sie in einen Roboter eingespeist werden.
00:09:57Ich habe ein kurzes Videobeispiel vorbereitet, das zeigt, wie das auf unserer Plattform funktioniert.
00:10:02Ich drücke hier mal auf Play, wenn ich den Button finde.
00:10:07Hier sehen wir eine Person, die Geschirr von Hand im Spülbecken wäscht, Fett vom Teller entfernt,
00:10:12Schwamm und Spülmittel verwendet, inklusive Abspülen und Einräumen in den Abtropfständer, Nahaufnahme der Handbewegungen.
00:10:19Gerade durchsucht das System Milliarden von Videos.
00:10:24Das Video hier ist schon etwas älter.
00:10:26Da hatten wir erst etwa 100 Millionen indexiert, aber mittlerweile sind wir bei 1,1 Milliarden Videos.
00:10:31Und das System liefert – das hier ist etwas beschleunigt, um eure Zeit nicht zu verschwenden –
00:10:35Videoclips von Menschen, die Geschirr spülen.
00:10:41Hier sieht man all die Videos, die wir gefunden haben.
00:10:47Manche dieser Videos haben vielleicht gar nichts mit Geschirrspülen zu tun.
00:10:50Vielleicht geht es darin ums Putzen der Küche,
00:10:52oder um etwas ganz Anderes.
00:10:54Hier ist noch ein Beispiel:
00:10:55Mensch faltet verschiedene Arten von Kleidung.
00:10:59Richtig?
00:10:59Also etwas genauer beschrieben.
00:11:01Je detaillierter die Beschreibung ist, desto bessere Ergebnisse bekommt man zurück.
00:11:06Auch das ist wieder leicht beschleunigt.
00:11:08Schauen wir mal.
00:11:14Mir geht es darum, dass ihr versteht: Es kann alles Mögliche sein.
00:11:16Eine Person, die sich schminkt.
00:11:17Angenommen, ihr habt eine Marke und wollt Videos finden, in denen eure Marke vorkommt.
00:11:21Auch das können wir liefern.
00:11:23Hier sieht man also, wie Leute Kleidung falten.
00:11:26Damit kann man nun einen Roboter trainieren, wie man Wäsche faltet.
00:11:34Selbstverständlich ist alles über eine API verfügbar.
00:11:36Wir erwarten natürlich nicht, dass man das manuell macht.
00:11:39Richtig?
00:11:39Man kann es also per API anfragen.
00:11:41Sie erhalten einen Ausschnitt des Videos, die URL.
00:11:46Wir geben Ihnen den Link zum Originalvideo, falls Sie es ansehen möchten.
00:11:49Der Hauptpunkt ist aber, dass wir Ihnen Videoschnipsel zum Trainieren Ihrer Robotik liefern können.
00:11:57Ich bin mir nicht sicher, ob jemand von Ihnen Roboter trainiert.
00:12:01Deshalb gebe ich Ihnen ein weiteres Beispiel für den Nutzen.
00:12:04Nehmen wir an, Sie haben eine Marke.
00:12:06Und Sie wollen wissen, wo Ihre Marke in Videos demonstriert wird.
00:12:13Der Videotitel spielt keine Rolle, weil es eigentlich gar nicht um Ihr Produkt geht.
00:12:19Es ist nur jemand, der einen Podcast macht oder irgendetwas aufnimmt.
00:12:22Aber Sie sehen eine Frau, die sich schminkt.
00:12:25Und Sie sehen auf dem Tisch, dass es sich um Ihre Make-up-Marke handelt.
00:12:30Plötzlich können Sie alle Videos finden, in denen Ihre Marke verwendet wird.
00:12:34Was auch immer es ist.
00:12:35Richtig?
00:12:35Über die Suche nach dem Titel finden Sie es nicht.
00:12:38Durch Video-Indizierung können Sie genau die Dinge finden, die Sie interessieren.
00:12:45Ein Apfel, der vom Baum fällt.
00:12:47Und so weiter.
00:12:48Was bekommen Sie also zurück?
00:12:50Wir liefern Ihnen diesen Zeitstempel.
00:12:52Wir liefern Ihnen den Übereinstimmungswert.
00:12:53Wie nah es an Ihrer Suchanfrage ist.
00:12:55Und natürlich die Anzahl der Frames.
00:12:57Wie viele Frames genau das zeigen, wonach Sie suchen.
00:13:03Was ändert das also?
00:13:06Das ändert sehr viel.
00:13:07Okay, weniger Verschwendung.
00:13:09Sie müssen nicht Millionen Stunden an Videos herunterladen.
00:13:12Sie können genau die spezifischen Aktionen erhalten,
00:13:16die Sie interessieren.
00:13:20Das ist entscheidend für das Training von Robotern.
00:13:24Weil Stördaten Probleme verursachen, Halluzinationen.
00:13:28Richtig?
00:13:29Das filtert diese Stördaten heraus.
00:13:34Wofür ist das nützlich?
00:13:35Nicht nur für Roboter, sondern natürlich auch fürs autonome Fahren.
00:13:38Zum Beispiel Waymo.
00:13:39Richtig?
00:13:40Trainiert mit Dashcam-Videos.
00:13:43Und es gibt Millionen, Hunderte Millionen Stunden davon auf YouTube.
00:13:46An Dashcam-Aufnahmen.
00:13:47Wie viele von Ihnen schauen gerne Unfälle an?
00:13:49Dashcam-Unfälle.
00:13:52Sicherlich hat das jeder schon mal gesehen.
00:13:53Verrückte Fahrweisen in Russland.
00:13:55Richtig?
00:13:56Genau darum geht es hier.
00:13:58Richtig?
00:13:58Die Videos sind bereits da.
00:14:01Okay?
00:14:01Jemand, der über Rot fährt.
00:14:02Jemand, der bei Rot anhält.
00:14:04Links abbiegt.
00:14:05Rechts abbiegt.
00:14:06Und so weiter.
00:14:06All das können sehr nützliche Trainingsdaten sein.
00:14:11Und für jegliche andere Weltmodelle.
00:14:13Physik.
00:14:14Richtig?
00:14:14Roboter müssen Physik verstehen.
00:14:16Was ist Gravitation?
00:14:18Wie sitzt man?
00:14:18Wie geht man?
00:14:19Wie bewegt man sich?
00:14:21Natürlich kann man das vorab aufnehmen.
00:14:25Ich spreche derzeit oft mit Leuten,
00:14:27die Millionen von Menschen Videos für sich aufnehmen lassen.
00:14:30"Könnt ihr aufnehmen, wie ihr Türen öffnet?"
00:14:33Das ist doch verrückt.
00:14:34Warum braucht man eine Million Leute dafür, wenn alles bereits online verfügbar ist?
00:14:39Das Internet ist eine der größten Datenbanken überhaupt.
00:14:43Nur nutzen die Leute es nicht wirklich, weil es gar nicht so einfach ist, oder?
00:14:46Derzeit steht uns nur die Suche über Schlüsselwörter im Videotitel zur Verfügung.
00:14:53Und hier gibt es eine Quelle, das gesamte öffentliche Webvideo an einem Ort.
00:14:59Wir haben YouTube, Vimeo und so viele verschiedene Videoanbieter da draußen.
00:15:06Milliarden über Milliarden Stunden an Trainingsdaten warten dort nur darauf, dass Sie sie greifen,
00:15:13sammeln und verarbeiten.
00:15:14Das ist im Grunde ein neues Produkt, das wir bei Bright Data entwickeln, richtig?
00:15:18Wir indizieren Videos, damit Sie spezifische Aktionen finden können.
00:15:23Alles, was Sie sich vorstellen können, wissen Sie, es kann auch für Marken nützlich sein.
00:15:28Es ist nicht nur für Trainingsdaten gedacht.
00:15:31Alles, was Ihnen einfällt, könnte nützlich sein.
00:15:35Vielleicht sind Sie Gamer und wollen wissen, wie man dieses Level schafft.
00:15:40Aber es gibt genau so ein Video nicht.
00:15:42Sie können also suchen: Personen, die das Level im Videospiel meistern, richtig?
00:15:47Alles ist möglich, die Welt gehört Ihnen.
00:15:52Ich komme damit zum Schluss.
00:15:54Ich weiß nicht, ob Sie Fragen haben, aber wenn Sie sich vernetzen oder mehr darüber sprechen wollen,
00:15:58fügen Sie mich gerne auf LinkedIn hinzu.
00:16:01Und ja, ich danke Ihnen allen für Ihre Aufmerksamkeit.
00:16:06Ich bin am Stand von Bright Data, falls Sie mehr darüber sprechen möchten.
00:16:10Danke fürs Kommen.
00:16:17Bis zum nächsten Mal.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기