Das nächste Nadelöhr der Physischen KI sind die richtigen Videos — Rafael Levi, Bright Data

AAI Engineer
컴퓨터/소프트웨어경제 뉴스AI/미래기술

스크립트

00:00:00Hallo zusammen, herzlich willkommen. Danke an alle, die gekommen sind, um mich zu sehen. Und danke auch an diejenigen,
00:00:21die einfach nur so hier sind. Ich werde versuchen, euch zu unterhalten und euch etwas Neues beizubringen.
00:00:26Mein Name ist Rafael, ich arbeite bei Bright Data. Ich bin seit über acht Jahren dort, und wir bei Bright Data sammeln Daten und versuchen zu innovieren.
00:00:38Heute möchte ich über Video-Discovery für das Training agentischer Weltmodelle sprechen, und wir werden gleich noch genauer erklären, was das ist.
00:00:48Was braucht es also heute, um ein System zu bauen, das sehen, verstehen und handeln kann?
00:00:56Richtig? Ich meine, wir haben verstanden, was KI ist, und verbessern sie ständig. Das haben wir also gewissermaßen im Griff,
00:01:04aber der schwierige Teil ist jetzt: Welche Daten stellt man ihr zur Verfügung? Denn jeder weiß, dass eine KI ohne Daten nur eine leere Hülle ist.
00:01:13Richtig? Blicken wir also kurz in die Geschichte zurück: 2022 brachte Google einem Roboter durch Bilder
00:01:25Aktionen in der realen Welt bei. Danach gab es einen gewaltigen Sprung. 2023 steuerte eine KI bereits mehrere Roboter.
00:01:372024 erschien Open Source. Das hat das Spiel komplett verändert. Sobald Open Source da war, hatten alle Labore Zugang zur KI und begannen, sie in Roboter zu integrieren.
00:01:51Und jetzt steuern diese Modelle bereits humanoide Roboter. Ich sehe hier zwar einige, die natürlich größtenteils ferngesteuert sind,
00:02:00aber in San Francisco fahren die Waymo-Autos schon ganz ohne Fahrer. Wie cool ist das denn?
00:02:07Als ich das erste Mal eingestiegen bin, dachte ich, ich sterbe gleich, aber es war eigentlich richtig angenehm.
00:02:12Richtig? Und wie hat das Auto gelernt zu fahren? Indem es sich das Fahren selbst beigebracht hat, durch das Lernen aus Dashcam-Aufnahmen.
00:02:22Jedes Auto hat eine Dashcam. Wenn man der KI dieses Material gibt, kann sie herausfinden, wie man eine Maschine steuert.
00:02:31Wie gesagt: Die KI ist nicht mehr das schwierige Problem, sondern die Daten. Und genau darüber möchte ich sprechen.
00:02:39Für Chat-LLMs gibt es Billionen von Wörtern und Texten. Wir haben also Unmengen an Textdaten, um LLMs zu trainieren.
00:02:49Für die Bildgenerierung haben wir Milliarden von Bildern, von beschrifteten Bildern, auch das ist eine riesige Datenbank.
00:02:56Aber für Robotik gibt es nur etwa eine Million Videos. Das ist ein sehr kleiner, begrenzter Datensatz von Robotern, die Dinge tun.
00:03:09Viele Unternehmen da draußen bezahlen deshalb Leute dafür, dass sie bestimmte Handlungen aufnehmen.
00:03:20Zum Beispiel: "Filme für mich, wie du eine Tür öffnest" oder "Filme für mich, wie du auf dem Stuhl sitzt".
00:03:28Das Problem ist jedoch: Wenn jemand angewiesen wird, etwas zu tun, tut er es nicht natürlich.
00:03:34Ich nenne das "gestellt". Wenn man dir sagt, du sollst aufnehmen, wie du eine Tür öffnest, und du tust es für jemanden,
00:03:40ist das nicht dasselbe, wie wenn du einfach ins Haus gehst. Die Bewegung ist völlig anders.
00:03:45Sind diese Daten also gut für das Robotik-Training? Meiner Meinung nach nein. Es sind verzerrte Daten, die nicht dieselben Ergebnisse liefern.
00:03:53Der Roboter wird natürlich nicht so effektiv sein, als wenn er intuitiv agiert, richtig?
00:03:59Ich habe dazu einfach ein paar Beispiele auf die Folie geworfen.
00:04:06Manuell erzeugte Daten sind nicht vergleichbar mit Daten, die sozusagen beiläufig entstehen.
00:04:12Fakt ist auch, dass sich Menschen vor der Kamera ganz anders verhalten.
00:04:16Einige von euch wissen das: Manche Leute sind kamerascheu. Sobald man eine Kamera auf sie richtet, verändern sie sich.
00:04:23Aber in der natürlichen Welt ist das eine völlig andere Sache.
00:04:27Genau dieses Problem versuchen wir bei Bright Data zu lösen.
00:04:35Nochmals: Warum reichen die üblichen Datenquellen nicht aus?
00:04:37Simulationen: Sie sind virtuell und günstig, aber na ja, jeder spielt Videospiele.
00:04:44Die Physik in Videospielen ist zwar fast soweit, aber noch nicht gut genug, um einen Roboter daran zu trainieren.
00:04:50Manuelle Steuerung, also dass ein Mensch einen Roboter steuert, ist zwar machbar, aber wie viele Stunden am Tag kann man das aufnehmen?
00:04:57Wie viele Leute braucht man, um wirklich extrem große Datenmengen zu bekommen?
00:05:01Man kann vielleicht acht Stunden am Tag aufnehmen, jeden Tag.
00:05:04Wie viele Stunden kommen da in einem Jahr zusammen?
00:05:07Das ist nicht wirklich skalierbar.
00:05:09Und natürlich gibt es bereits vorgefertigte Datensätze, aber wie gesagt, sie sind klein.
00:05:13Es gibt derzeit nur etwa eine Million Videos.
00:05:15Was ist also die Alternative?
00:05:17Die Alternative ist das Web.
00:05:20Denken wir nur einmal an YouTube.
00:05:22Wie viele Videos gibt es auf YouTube?
00:05:25Ich weiß nicht, vielleicht fünf Milliarden Videos?
00:05:28Wie viele Handlungen stecken in diesen Videos, die ein Roboter nachahmen kann?
00:05:34Denken wir mal darüber nach.
00:05:35Was glaubt ihr, wie viele Videos es gibt, in denen jemand aus der Ego-Perspektive eine Tür öffnet?
00:05:42Millionen von Stunden.
00:05:43Ihr wärt überrascht.
00:05:45Jeden Tag zeigen Webvideos Schwerkraft, Bewegungen,
00:05:53Ursache und Wirkung – Unfälle sind natürlich das beste Beispiel für Ursache und Wirkung –
00:06:00wie Menschen mit Objekten umgehen, und das in Milliarden von Stunden.
00:06:04Großartiges Trainingsmaterial für Roboter. Aber wo liegt das Problem?
00:06:08Das Problem ist, dass es sehr viel Stördaten gibt, richtig?
00:06:12Nehmen wir zum Beispiel folgendes:
00:06:14Eines der KI-Modelle, das Meta trainiert hat, wurde mit etwa einer Million Stunden Videos aus der echten Welt gefüttert.
00:06:21Und danach brauchte es nur noch 62 Stunden an echten Robotikdaten, um einen echten Roboter zu steuern.
00:06:29Wenn man darüber nachdenkt: Die Daten wurden öffentlich gesammelt, richtig?
00:06:33Es trainierte den Roboter an ganz zufälligen Dingen, und nach 62 Robotik-Stunden bewegte er sich bereits.
00:06:41Keine Simulationen nötig, autonome Robotik schnell geliefert.
00:06:52Aber die Videos zeigen ja nicht, wie sich die Roboter bewegen, oder?
00:06:54Ihr denkt jetzt vielleicht: Wie nützlich ist es für einen Roboter, wenn ein Mensch Wasser in ein Glas gießt?
00:07:01Es gibt tatsächlich Methoden, wie eine KI die Handlungen im Video unterscheiden und daraus lernen kann.
00:07:09Man nimmt zwei Einzelbilder, Frame für Frame, und die KI misst den Unterschied in der Bewegung.
00:07:15Man hat also Bild A und Bild B, und dazwischen gibt es eine kleine Bewegungsänderung.
00:07:21Eine KI kann diese Veränderung genau messen.
00:07:24Wenn man das durch das gesamte Video hindurch macht, kann eine KI Winkel, Distanz
00:07:30und alles berechnen, was sie zum Trainieren eines Roboters braucht.
00:07:34Wir brauchen also nicht unbedingt Sensordaten. Aber natürlich bringt einen das Video allein, das man herunterlädt
00:07:41oder aus dem man die Daten extrahiert, von YouTube noch nicht zu 100 % ans Ziel.
00:07:48Man muss es noch weiterverarbeiten, aber die Möglichkeit ist da.
00:07:53Sie steht bereit, man muss die Daten nur noch verarbeiten.
00:07:58Hier noch ein paar Beispiele:
00:07:59Wenn NVIDIA beispielsweise ihren Cosmos-Roboter trainiert, verwerfen sie etwa 96 % des Videomaterials.
00:08:07Was bedeutet das?
00:08:09Sie laden eine Million Stunden Video herunter,
00:08:12aber nur 4 % davon sind tatsächlich nützlich.
00:08:15Alles andere wird weggeworfen.
00:08:16Das ist verschwendete Rechenleistung.
00:08:18Verschwendete Bandbreite.
00:08:19Verschwendeter Speicherplatz.
00:08:21Einfach eine Menge verschwendetes Geld.
00:08:23Stable Video Diffusion verwirft 74 % der Videos, die sie herunterladen.
00:08:30Bei Bright Data versuchen wir, dieses Problem zu lösen und noch einen Schritt weiterzugehen.
00:08:37Unser Ansatz lautet: Erst suchen, dann sammeln.
00:08:41Wir indexieren Videos und ermöglichen es euch, gezielt nach bestimmten Handlungen zu suchen.
00:08:50Da wir vorhin über eine Person gesprochen haben, die eine Tür öffnet, bleiben wir bei diesem Beispiel.
00:08:55Auf unserer Plattform kann man detaillierte Angaben machen,
00:09:01eine Suchanfrage wie: "Person spült Geschirr", "Person faltet ein T-Shirt" und so weiter.
00:09:06Und wir liefern genau die Ausschnitte aus den Videos, die diese Handlungen zeigen.
00:09:13Was bedeutet das also?
00:09:16Das bedeutet, dass bei der Datenerfassung deutlich weniger Ausschuss entsteht.
00:09:22Es wird weniger Speicherplatz und Bandbreite verschwendet.
00:09:25Noch ein paar Details zur Funktionsweise:
00:09:27Zuerst definiert man natürlich, wonach man sucht.
00:09:32Wir durchsuchen Milliarden von vorindexierten Videos.
00:09:36Nicht nach Stichwörtern, sondern nach Handlungen.
00:09:39Und wir liefern gebrauchsfertige Clips.
00:09:43Diese sind natürlich bereits für euer Training aufbereitet.
00:09:47Man muss sie nur noch leicht nachbearbeiten, etwa für Bewegung, Distanzsensoren und so weiter.
00:09:52Und schon können sie in einen Roboter eingespeist werden.
00:09:57Ich habe ein kurzes Videobeispiel vorbereitet, das zeigt, wie das auf unserer Plattform funktioniert.
00:10:02Ich drücke hier mal auf Play, wenn ich den Button finde.
00:10:07Hier sehen wir eine Person, die Geschirr von Hand im Spülbecken wäscht, Fett vom Teller entfernt,
00:10:12Schwamm und Spülmittel verwendet, inklusive Abspülen und Einräumen in den Abtropfständer, Nahaufnahme der Handbewegungen.
00:10:19Gerade durchsucht das System Milliarden von Videos.
00:10:24Das Video hier ist schon etwas älter.
00:10:26Da hatten wir erst etwa 100 Millionen indexiert, aber mittlerweile sind wir bei 1,1 Milliarden Videos.
00:10:31Und das System liefert – das hier ist etwas beschleunigt, um eure Zeit nicht zu verschwenden –
00:10:35Videoclips von Menschen, die Geschirr spülen.
00:10:41Hier sieht man all die Videos, die wir gefunden haben.
00:10:47Manche dieser Videos haben vielleicht gar nichts mit Geschirrspülen zu tun.
00:10:50Vielleicht geht es darin ums Putzen der Küche,
00:10:52oder um etwas ganz Anderes.
00:10:54Hier ist noch ein Beispiel:
00:10:55Mensch faltet verschiedene Arten von Kleidung.
00:10:59Richtig?
00:10:59Also etwas genauer beschrieben.
00:11:01Je detaillierter die Beschreibung ist, desto bessere Ergebnisse bekommt man zurück.
00:11:06Auch das ist wieder leicht beschleunigt.
00:11:08Schauen wir mal.
00:11:14Mir geht es darum, dass ihr versteht: Es kann alles Mögliche sein.
00:11:16Eine Person, die sich schminkt.
00:11:17Angenommen, ihr habt eine Marke und wollt Videos finden, in denen eure Marke vorkommt.
00:11:21Auch das können wir liefern.
00:11:23Hier sieht man also, wie Leute Kleidung falten.
00:11:26Damit kann man nun einen Roboter trainieren, wie man Wäsche faltet.
00:11:34Selbstverständlich ist alles über eine API verfügbar.
00:11:36Wir erwarten natürlich nicht, dass man das manuell macht.
00:11:39Richtig?
00:11:39Man kann es also per API anfragen.
00:11:41Sie erhalten einen Ausschnitt des Videos, die URL.
00:11:46Wir geben Ihnen den Link zum Originalvideo, falls Sie es ansehen möchten.
00:11:49Der Hauptpunkt ist aber, dass wir Ihnen Videoschnipsel zum Trainieren Ihrer Robotik liefern können.
00:11:57Ich bin mir nicht sicher, ob jemand von Ihnen Roboter trainiert.
00:12:01Deshalb gebe ich Ihnen ein weiteres Beispiel für den Nutzen.
00:12:04Nehmen wir an, Sie haben eine Marke.
00:12:06Und Sie wollen wissen, wo Ihre Marke in Videos demonstriert wird.
00:12:13Der Videotitel spielt keine Rolle, weil es eigentlich gar nicht um Ihr Produkt geht.
00:12:19Es ist nur jemand, der einen Podcast macht oder irgendetwas aufnimmt.
00:12:22Aber Sie sehen eine Frau, die sich schminkt.
00:12:25Und Sie sehen auf dem Tisch, dass es sich um Ihre Make-up-Marke handelt.
00:12:30Plötzlich können Sie alle Videos finden, in denen Ihre Marke verwendet wird.
00:12:34Was auch immer es ist.
00:12:35Richtig?
00:12:35Über die Suche nach dem Titel finden Sie es nicht.
00:12:38Durch Video-Indizierung können Sie genau die Dinge finden, die Sie interessieren.
00:12:45Ein Apfel, der vom Baum fällt.
00:12:47Und so weiter.
00:12:48Was bekommen Sie also zurück?
00:12:50Wir liefern Ihnen diesen Zeitstempel.
00:12:52Wir liefern Ihnen den Übereinstimmungswert.
00:12:53Wie nah es an Ihrer Suchanfrage ist.
00:12:55Und natürlich die Anzahl der Frames.
00:12:57Wie viele Frames genau das zeigen, wonach Sie suchen.
00:13:03Was ändert das also?
00:13:06Das ändert sehr viel.
00:13:07Okay, weniger Verschwendung.
00:13:09Sie müssen nicht Millionen Stunden an Videos herunterladen.
00:13:12Sie können genau die spezifischen Aktionen erhalten,
00:13:16die Sie interessieren.
00:13:20Das ist entscheidend für das Training von Robotern.
00:13:24Weil Stördaten Probleme verursachen, Halluzinationen.
00:13:28Richtig?
00:13:29Das filtert diese Stördaten heraus.
00:13:34Wofür ist das nützlich?
00:13:35Nicht nur für Roboter, sondern natürlich auch fürs autonome Fahren.
00:13:38Zum Beispiel Waymo.
00:13:39Richtig?
00:13:40Trainiert mit Dashcam-Videos.
00:13:43Und es gibt Millionen, Hunderte Millionen Stunden davon auf YouTube.
00:13:46An Dashcam-Aufnahmen.
00:13:47Wie viele von Ihnen schauen gerne Unfälle an?
00:13:49Dashcam-Unfälle.
00:13:52Sicherlich hat das jeder schon mal gesehen.
00:13:53Verrückte Fahrweisen in Russland.
00:13:55Richtig?
00:13:56Genau darum geht es hier.
00:13:58Richtig?
00:13:58Die Videos sind bereits da.
00:14:01Okay?
00:14:01Jemand, der über Rot fährt.
00:14:02Jemand, der bei Rot anhält.
00:14:04Links abbiegt.
00:14:05Rechts abbiegt.
00:14:06Und so weiter.
00:14:06All das können sehr nützliche Trainingsdaten sein.
00:14:11Und für jegliche andere Weltmodelle.
00:14:13Physik.
00:14:14Richtig?
00:14:14Roboter müssen Physik verstehen.
00:14:16Was ist Gravitation?
00:14:18Wie sitzt man?
00:14:18Wie geht man?
00:14:19Wie bewegt man sich?
00:14:21Natürlich kann man das vorab aufnehmen.
00:14:25Ich spreche derzeit oft mit Leuten,
00:14:27die Millionen von Menschen Videos für sich aufnehmen lassen.
00:14:30"Könnt ihr aufnehmen, wie ihr Türen öffnet?"
00:14:33Das ist doch verrückt.
00:14:34Warum braucht man eine Million Leute dafür, wenn alles bereits online verfügbar ist?
00:14:39Das Internet ist eine der größten Datenbanken überhaupt.
00:14:43Nur nutzen die Leute es nicht wirklich, weil es gar nicht so einfach ist, oder?
00:14:46Derzeit steht uns nur die Suche über Schlüsselwörter im Videotitel zur Verfügung.
00:14:53Und hier gibt es eine Quelle, das gesamte öffentliche Webvideo an einem Ort.
00:14:59Wir haben YouTube, Vimeo und so viele verschiedene Videoanbieter da draußen.
00:15:06Milliarden über Milliarden Stunden an Trainingsdaten warten dort nur darauf, dass Sie sie greifen,
00:15:13sammeln und verarbeiten.
00:15:14Das ist im Grunde ein neues Produkt, das wir bei Bright Data entwickeln, richtig?
00:15:18Wir indizieren Videos, damit Sie spezifische Aktionen finden können.
00:15:23Alles, was Sie sich vorstellen können, wissen Sie, es kann auch für Marken nützlich sein.
00:15:28Es ist nicht nur für Trainingsdaten gedacht.
00:15:31Alles, was Ihnen einfällt, könnte nützlich sein.
00:15:35Vielleicht sind Sie Gamer und wollen wissen, wie man dieses Level schafft.
00:15:40Aber es gibt genau so ein Video nicht.
00:15:42Sie können also suchen: Personen, die das Level im Videospiel meistern, richtig?
00:15:47Alles ist möglich, die Welt gehört Ihnen.
00:15:52Ich komme damit zum Schluss.
00:15:54Ich weiß nicht, ob Sie Fragen haben, aber wenn Sie sich vernetzen oder mehr darüber sprechen wollen,
00:15:58fügen Sie mich gerne auf LinkedIn hinzu.
00:16:01Und ja, ich danke Ihnen allen für Ihre Aufmerksamkeit.
00:16:06Ich bin am Stand von Bright Data, falls Sie mehr darüber sprechen möchten.
00:16:10Danke fürs Kommen.
00:16:17Bis zum nächsten Mal.

핵심 요약

Das Filtern und Extrahieren konkreter Handlungssequenzen aus Milliarden öffentlich zugänglicher Webvideos löst den Datenengpass beim Training physischer KI-Systeme ohne die hohe Ausschussquote herkömmlicher Videodatensätze.

하이라이트

  • Für das Training von Robotermodellen stehen weltweit lediglich rund eine Million spezifische Videos zur Verfügung, verglichen mit Milliarden Bildern und Billionen Wörtern für Text-LLMs.

  • Gestellte Videoaufnahmen von Auftragsarbeitern erzeugen unnatürliche Bewegungsmuster, die die Effizienz von KI-Steuerungen in der Praxis verschlechtern.

  • Meta trainierte ein Modell mit einer Million Stunden öffentlicher Weltvideos und benötigte danach nur noch 62 Stunden an realen Robotikdaten für die autonome Steuerung.

  • Entwicklungsteams wie NVIDIA Cosmos oder Stable Video Diffusion verwerfen bei der herkömmlichen Datenerfassung zwischen 74 % und 96 % des heruntergeladenen Videomaterials als unnutzbaren Ausschuss.

  • Die gezielte Indizierung von Webvideos nach Handlungen statt Videotiteln reduziert Speicherbedarf, Bandbreitenverbrauch und Trainingshalluzinationen.

타임라인

Der Datenengpass in der physischen KI

  • Die Entwicklung autonomer Systeme scheitert nicht mehr an den KI-Modellen, sondern am Mangel an geeigneten Trainingsdaten.
  • Während für Text- und Bildmodelle riesige Datenbanken existieren, umfasst der weltweite Datensatz für Robotik nur etwa eine Million Videos.

Die technische Entwicklung verlagert sich von rein virtuellen Modellen hin zur Steuerung physischer Roboter und autonomer Fahrzeuge. Text-LLMs greifen auf Billionen Wörter zurück und Bildgeneratoren auf Milliarden Beschriftungen. Für die Robotik fehlt eine vergleichbare Datenbasis, was den Fortschritt bremst.

Mängel manuell erzeugter Robotikdaten

  • Bezahlte Testpersonen zeigen unter Beobachtung unnatürliche Bewegungen, die verzerrte Trainingsdaten liefern.
  • Manuelle Robotersteuerungen und Aufnahmen sind zeitlich begrenzt und eignen sich nicht für eine Skalierung der Datenmengen.

Unternehmen beauftragen Menschen damit, alltägliche Handlungen wie das Öffnen von Türen vor der Kamera auszuführen. Das Bewusstsein, gefilmt zu werden, verändert jedoch die Mechanik der Ausführung. Auch physikalische Simulationen reichen in ihrer Präzision noch nicht an die reale Welt heran.

Das Web als Quelle für Bewegungsdaten

  • Milliarden von Online-Videos enthalten essenzielle Informationen über Schwerkraft, Objektinteraktionen und Ursache-Wirkungs-Prinzipien.
  • Durch den Vergleich von Einzelbildern berechnen KI-Modelle Winkel und Distanzen menschlicher Bewegungen ohne externe Sensordaten.

Plattformen wie YouTube bieten ein riesiges Archiv an Alltagsbewegungen aus der Ego-Perspektive. KI-Systeme analysieren Bewegungsunterschiede von Bild zu Bild, um daraus physikalische Parameter abzuleiten. Meta nutzte eine Million Stunden solcher Daten, um ein Modell vorzutrainieren, das anschließend mit nur 62 Stunden spezifischen Robotikdaten funktionierte.

Ausschussreduzierung durch gezielte Handlungsindizierung

  • Gängige Trainingsverfahren verwerfen bis zu 96 % des heruntergeladenen Videomaterials aufgrund irrelevanter Inhalte.
  • Eine Vorab-Indizierung ermöglicht das direkte Auslesen genauer Videoclips anhand definierter Aktionen statt diffuser Videotitel.

NVIDIA verwirft beim Cosmos-Projekt 96 % der geladenen Daten, während Stable Video Diffusion 74 % aussortiert. Dies erzeugt enorme Kosten für Bandbreite und Rechenleistung. Die vorgefilterte Suche nach konkreten Abläufen – wie dem Spülen von Geschirr oder Falten von Kleidung – liefert exakte Zeitstempel, Frame-Anzahlen und Relevanzwerte direkt über eine API.

Anwendungsbereiche für handlungsbasierte Videodaten

  • Präzise gefilterte Videosequenzen reduzieren Modellhalluzinationen beim autonomen Fahren und in der Robotik.
  • Das Verfahren identifiziert spezifische Handlungen und Markenprodukte auch in Videos, deren Titel keinen Hinweis darauf geben.

Dashcam-Aufnahmen von Verkehrsverstößen oder Ausweichmanövern dienen als Datenbasis für Systeme wie Waymo. Neben der Robotik lässt sich die Technologie für das Auffinden von Produktplatzierungen in Online-Videos nutzen, selbst wenn der Titel das jeweilige Produkt nicht nennt.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기