Le prochain obstacle de l'IA physique est de trouver la bonne vidéo — Rafael Levi, Bright Data

AAI Engineer
Computing/SoftwareBusiness NewsInternet Technology

Transcript

00:00:00Bonjour à tous, bienvenue. Pour ceux qui sont venus spécifiquement pour me voir, merci. Pour ceux qui
00:00:21passent juste par là, merci également. Je vais essayer de vous divertir et de vous apprendre quelque chose.
00:00:26Encore une fois, je m'appelle Rafael et je travaille chez Bright Data depuis plus de huit ans. Chez Bright Data, nous collectons des données et nous cherchons à innover.
00:00:38Aujourd'hui, je veux parler de la découverte vidéo pour l'entraînement des modèles du monde agentiques, et nous expliquerons ce que c'est dans un moment.
00:00:48Alors, que faut-il aujourd'hui pour construire un système capable de voir, de comprendre et d'agir ?
00:00:56C'est vrai, nous avons compris ce qu'est une IA, nous l'améliorons constamment, c'est un peu maîtrisé,
00:01:04mais maintenant, la partie difficile consiste à savoir quelles données lui fournir, car tout le monde sait qu'une IA sans données n'est qu'une boîte vide.
00:01:13Revenons un peu en arrière dans l'histoire. En 2022, Google a entraîné un robot grâce à des images
00:01:25représentant des actions du monde réel. Ensuite, il y a eu un bond. En 2023, une IA a réussi à contrôler plusieurs robots.
00:01:37En 2024, l'open source est arrivé. C'est là que les règles du jeu ont changé. Dès que nous avons eu l'open source, tous les laboratoires ont eu accès à l'IA et ont commencé à l'intégrer dans des robots.
00:01:51Désormais, ces modèles pilotent déjà des robots humanoïdes. J'en vois quelques-uns, bien sûr, la plupart ici sont télécommandés.
00:02:00Mais à San Francisco, vous avez Waymo qui roule sans aucun chauffeur. C'est incroyable, non ?
00:02:07La première fois que je suis monté dans la voiture, je pensais que j'allais mourir, mais c'était en fait très agréable.
00:02:12Comment pensez-vous qu'elle a appris à conduire ? En s'entraînant elle-même, en apprenant grâce à des caméras embarquées.
00:02:22Chaque voiture a une caméra. Si vous fournissez ces images à une IA, elle peut comprendre comment faire fonctionner une machine.
00:02:31Comme je l'ai dit, l'IA n'est plus la partie difficile, ce sont les données, et c'est de cela que je veux parler.
00:02:39Pour les LLM de chat, il y a des milliers de milliards de mots et de textes. Nous avons énormément de données textuelles pour entraîner les LLM.
00:02:49Pour la génération d'images, nous avons des milliards d'images étiquetées, c'est donc aussi une base de données gigantesque.
00:02:56Mais pour la robotique, il n'y a qu'environ un million de vidéos. C'est un jeu de données très réduit et limité de robots en train d'agir.
00:03:09L'idée ici est que, bien sûr, de nombreuses entreprises paient des gens pour enregistrer des actions.
00:03:20Par exemple, “Enregistre-moi la façon dont tu ouvres une porte”, ou “Enregistre la façon dont tu t'assois sur une chaise”.
00:03:28Mais le problème, c'est que lorsque l'on dit à quelqu'un de faire quelque chose, il ne le fait pas de manière naturelle.
00:03:34C'est ce que j'appelle du dirigé. Si on vous demande d'enregistrer comment vous ouvrez une porte et que vous le faites pour quelqu'un,
00:03:40ce ne sera pas la même chose que si vous entriez simplement chez vous. Le mouvement est totalement différent.
00:03:45Ces données sont-elles bonnes pour l'entraînement robotique ? Selon moi, non. Ce sont des données biaisées qui ne donnent pas les mêmes résultats.
00:03:53Évidemment, le robot ne sera pas aussi efficace que s'il agissait de manière intuitive.
00:03:59J'ai juste mis quelques exemples sur la diapositive.
00:04:06Les données créées manuellement ne sont pas équivalentes aux données capturées spontanément.
00:04:12De plus, les gens se comportent très différemment lorsqu'ils sont devant une caméra.
00:04:16Certains d'entre vous le savent, beaucoup de gens sont timides devant un objectif, donc dès qu'on les filme, ils changent.
00:04:23Mais dans le monde réel, c'est une tout autre histoire.
00:04:27C'est précisément ce problème que nous essayons de résoudre chez Bright Data.
00:04:35Pourquoi les sources de données habituelles ne suffisent-elles pas ?
00:04:37Les simulations virtuelles sont peu coûteuses, mais tout le monde joue aux jeux vidéo.
00:04:44La physique dans les jeux vidéo est presque au point, mais pas assez bonne pour entraîner un robot.
00:04:50Le contrôle manuel, lorsqu'une personne téléguide un robot, c'est faisable, mais combien d'heures par jour pouvez-vous enregistrer un robot ?
00:04:57De combien de personnes avez-vous besoin pour obtenir des données à très grande échelle ?
00:05:01Vous pouvez enregistrer peut-être huit heures par jour, tous les jours.
00:05:04Combien d'heures allez-vous obtenir en une année ?
00:05:07Ce n'est pas vraiment évolutif.
00:05:09Et bien sûr, il existe déjà des jeux de données préexistants, mais comme je l'ai dit, ils sont de taille réduite.
00:05:13Il n'y a qu'environ un million de vidéos à ce jour.
00:05:15Quelle est donc l'alternative ?
00:05:17L'alternative, c'est le Web.
00:05:20Pensons simplement à YouTube.
00:05:22Combien de vidéos y a-t-il sur YouTube ?
00:05:25Je ne sais pas, peut-être cinq milliards de vidéos ?
00:05:28Combien d'actions dans ces vidéos un robot pourrait-il reproduire ?
00:05:34Pensez-y un instant.
00:05:35Combien de vidéos existent selon vous où une personne ouvre une porte en vue à la première personne ?
00:05:42Des millions d'heures.
00:05:43Vous seriez surpris.
00:05:45Ainsi, chaque jour, les vidéos du Web montrent la gravité, les mouvements,
00:05:53les relations de cause à effet, et les accidents sont la meilleure illustration de la cause à effet.
00:06:00Elles montrent comment les gens manipulent des objets, et ce sur des milliards d'heures.
00:06:04C'est un excellent matériel d'entraînement pour les robots, mais quel est le problème ?
00:06:08Le problème, c'est qu'il y a énormément de bruit inutile.
00:06:12Voici un exemple.
00:06:14Pour l'un des modèles d'IA entraînés par Meta, ils ont fourni environ un million d'heures de vidéos du monde réel.
00:06:21Ensuite, il n'a fallu que 62 heures de données robotiques réelles pour contrôler un véritable robot.
00:06:29Quand on y pense, les données ont été collectées publiquement.
00:06:33Cela a permis d'entraîner le robot sur des choses variées, et en seulement 62 heures de pratique robotique, il se déplaçait déjà.
00:06:41Pas besoin de simulations, la robotique autonome est déployée rapidement.
00:06:52Mais les vidéos ne montrent pas comment les robots se déplacent.
00:06:54Vous vous dites sans doute : en quoi une personne qui verse de l'eau dans une tasse est-elle utile à un robot ?
00:07:01Il existe aujourd'hui des méthodes permettant à une IA de distinguer et d'apprendre des actions présentes dans une vidéo.
00:07:09Si vous prenez deux images consécutives et que l'IA mesure la différence de mouvement entre elles,
00:07:15vous avez une image A et une image B, avec un léger déplacement qui s'opère entre les deux.
00:07:21Une IA est capable de mesurer ce changement.
00:07:24Si vous répétez l'opération sur toute la vidéo, l'IA peut en déduire les angles, les distances
00:07:30et tout ce dont elle a besoin pour entraîner un robot.
00:07:34Nous n'avons donc pas nécessairement besoin des données des capteurs, mais bien sûr, la vidéo elle-même que vous téléchargez
00:07:41depuis YouTube ou dont vous extrayez les données ne vous amène pas à 100 % du résultat.
00:07:48Il faut appliquer un traitement supplémentaire par-dessus, mais c'est tout à fait faisable.
00:07:53C'est à portée de main, il suffit de traiter les données.
00:07:58Voici quelques exemples supplémentaires.
00:07:59Par exemple, chez NVIDIA, lorsqu'ils entraînent le robot Cosmos, ils rejettent environ 96 % des vidéos.
00:08:07Qu'est-ce que cela signifie ?
00:08:09Ils téléchargent un million d'heures de vidéo,
00:08:12et seuls 4 % se révèlent réellement utiles.
00:08:15Tout le reste est jeté.
00:08:16C'est de la puissance de calcul gaspillée.
00:08:18C'est de la bande passante inutile.
00:08:19C'est du stockage gâché.
00:08:21C'est tout simplement beaucoup d'argent jeté par les fenêtres.
00:08:23Aussi, Stable Video Diffusion élimine 74 % des vidéos téléchargées.
00:08:30Chez Bright Data, nous tentons de résoudre ce problème et d'aller encore plus loin.
00:08:37Notre approche consiste à chercher d'abord, puis collecter ensuite.
00:08:41Nous indexons les vidéos pour vous permettre de rechercher des actions bien précises.
00:08:50Puisque nous parlions d'une personne qui ouvre une porte, gardons cet exemple.
00:08:55Sur notre plateforme, vous pouvez saisir des critères extrêmement détaillés.
00:09:01Une requête du type : personne faisant la vaisselle, personne pliant un t-shirt, etc.
00:09:06Et nous vous fournirons les extraits vidéo de ces actions spécifiques.
00:09:13Qu'est-ce que cela implique ?
00:09:16Cela signifie qu'il y a beaucoup moins de gaspillage lors de la collecte.
00:09:22On économise ainsi du stockage et de la bande passante.
00:09:25Voici un peu plus de détails sur le fonctionnement.
00:09:27Évidemment, vous définissez ce que vous cherchez.
00:09:32Nous parcourons des milliards de vidéos pré-indexées.
00:09:36Non pas par mots-clés, mais par actions.
00:09:39Et nous vous fournissons des extraits prêts à l'emploi.
00:09:43Ces clips sont déjà préparés pour votre entraînement.
00:09:47Il vous suffit de les traiter légèrement pour le mouvement, les capteurs de distance, etc.
00:09:52Et les données sont prêtes à être intégrées dans un robot.
00:09:57J'ai un court exemple en vidéo qui montre le fonctionnement sur notre plateforme.
00:10:02Laissez-moi appuyer sur lecture, si je retrouve le bouton.
00:10:07Ici, on voit une personne lavant la vaisselle à la main dans un évier, dégraissant une assiette,
00:10:12utilisant une éponge et du savon, rinçant et posant la vaisselle sur un égouttoir, gros plan sur les mains.
00:10:19En ce moment même, le système recherche parmi des milliards de vidéos.
00:10:24Sur cette démonstration, la vidéo date un peu.
00:10:26On en avait qu'environ 100 millions d'indexées, mais aujourd'hui, on atteint 1,1 milliard de vidéos.
00:10:31Et le système va littéralement — c'est un peu accéléré pour ne pas vous faire perdre de temps —
00:10:35vous sortir des extraits de vidéos de personnes faisant la vaisselle.
00:10:41Vous pouvez voir ici toutes les vidéos que nous trouvons.
00:10:47Certaines d'entre elles n'ont peut-être pas de rapport direct avec la vaisselle.
00:10:50Elles montrent peut-être le nettoyage d'une cuisine.
00:10:52Ou une autre tâche ménagère.
00:10:54Voici un autre exemple.
00:10:55Par exemple, un humain pliant différents types de vêtements.
00:10:59D'accord ?
00:10:59Donc, un peu plus de détails.
00:11:01Plus vous donnez de détails, plus les résultats sont pertinents.
00:11:06Encore une fois, c'est légèrement accéléré.
00:11:08Voyons voir.
00:11:14Je veux que vous compreniez que cela peut s'appliquer à tout.
00:11:16Une personne qui se maquille.
00:11:17Imaginons que vous ayez une marque et souhaitiez trouver des vidéos où elle apparaît.
00:11:21Tout cela peut également être fourni.
00:11:23Voilà, on voit des gens plier du linge.
00:11:26Vous pouvez désormais entraîner un robot à plier du linge.
00:11:34Bien entendu, tout est accessible via API.
00:11:36Nous ne m'attendons pas à ce que les gens fassent quoi que ce soit manuellement.
00:11:39N'est-ce pas ?
00:11:39Vous pouvez donc lancer la recherche par API.
00:11:41Vous obtenez un extrait vidéo en retour, avec l'URL.
00:11:46On vous fournit le lien de la vidéo originale si vous voulez la regarder.
00:11:49Mais l'élément clé, c'est qu'on vous fournit ces extraits vidéo pour entraîner vos robots.
00:11:57Je ne sais pas si vous entraînez des robots actuellement,
00:12:01alors je vais vous donner un autre exemple très concret.
00:12:04Prenons le cas d'une marque.
00:12:06Vous voulez savoir dans quelles vidéos vos produits apparaissent en démonstration.
00:12:13Les titres des vidéos importent peu, car elles ne traitent pas directement de votre produit.
00:12:19Il peut s'agir d'un simple podcast ou d'un enregistrement banal.
00:12:22Mais vous y voyez une femme qui se maquille,
00:12:25et vous apercevez votre marque de maquillage sur la table.
00:12:30D'un coup, vous pouvez retrouver toutes les vidéos où votre marque est utilisée.
00:12:34Peu importe le contexte.
00:12:35D'accord ?
00:12:35Une simple recherche par nom de vidéo ne donnerait rien.
00:12:38Grâce à l'indexation vidéo, vous pouvez trouver des éléments visuels très précis.
00:12:45Une pomme qui tombe d'un arbre,
00:12:47et bien plus encore.
00:12:48Quelles sont les données renvoyées ?
00:12:50Nous vous fournissons l'horodatage.
00:12:52Nous vous fournissons le score de correspondance,
00:12:53qui indique la pertinence par rapport à votre requête,
00:12:55ainsi que le nombre d'images.
00:12:57C'est-à-dire la quantité d'images correspondant à votre recherche.
00:13:03Qu'est-ce que ça change ?
00:13:06Absolument tout.
00:13:07Moins de gâchis,
00:13:09plus besoin de télécharger des millions d'heures de vidéo.
00:13:12Vous pouvez cibler directement les actions précises
00:13:16qui vous intéressent.
00:13:20Encore une fois, c'est crucial pour l'entraînement de la robotique,
00:13:24car le bruit génère des erreurs et des hallucinations.
00:13:28Pas vrai ?
00:13:29Cela élimine les données parasites.
00:13:34À quoi cela sert-il d'autre ?
00:13:35Pas seulement aux robots, mais aussi à la conduite autonome,
00:13:38comme Waymo,
00:13:39par exemple.
00:13:40Entraîné sur des vidéos de caméras embarquées.
00:13:43Il y en a des centaines de millions d'heures sur YouTube.
00:13:46De dashcams.
00:13:47Combien d'entre vous aiment regarder des accidents ?
00:13:49Des accidents filmés par dashcam.
00:13:52Tout le monde en a déjà vu.
00:13:53La conduite folle en Russie,
00:13:55n'est-ce pas ?
00:13:56Voilà de quoi il s'agit.
00:13:58Pas vrai ?
00:13:58Les vidéos sont là.
00:14:01D'accord ?
00:14:01Quelqu'un qui grille un feu rouge.
00:14:02Quelqu'un qui s'arrête au feu rouge.
00:14:04Tourner à gauche.
00:14:05Tourner à droite.
00:14:06Et ainsi de suite.
00:14:06Tout cela peut être des données très utiles pour l'entraînement.
00:14:11Et pour tout autre modèle du monde.
00:14:13La physique.
00:14:14Pas vrai ?
00:14:14Les robots doivent comprendre la physique.
00:14:16Qu'est-ce que la gravité ?
00:14:18Comment s'asseoir ?
00:14:18Comment marcher ?
00:14:19Comment bouger ?
00:14:21Encore une fois, vous pouvez bien sûr tout préenregistrer.
00:14:25Souvent, en ce moment, je parle à certaines personnes,
00:14:27et elles ont des millions de personnes qui enregistrent des vidéos pour elles.
00:14:30« Hé, vous pouvez me filmer la façon dont vous ouvrez les portes ? »
00:14:33C'est fou.
00:14:34Pourquoi avoir besoin d'un million de personnes pour ça alors que tout est disponible en ligne ?
00:14:39Internet est l'une des plus vastes bases de données.
00:14:43C'est juste que les gens ne... ce n'est pas si facile à exploiter, vous voyez ?
00:14:46Je veux dire, pour l'instant, la seule recherche disponible se fait par mot-clé sur le titre de la vidéo.
00:14:53Et évidemment, une source unique rassemble tout le Web vidéo public au même endroit.
00:14:59On a YouTube, on a Vimeo, on a tellement de fournisseurs de vidéos différents.
00:15:06Des milliards d'heures de données d'entraînement n'attendent que vous pour être récupérées,
00:15:13collectées et traitées.
00:15:14En gros, c'est le nouveau produit que nous développons chez Bright Data.
00:15:18Indexer les vidéos pour que vous puissiez trouver des actions spécifiques.
00:15:23Tout ce que vous imaginez, vous savez, cela peut aussi être utile pour les marques.
00:15:28Ce n'est pas seulement pour les données d'entraînement.
00:15:31Tout ce à quoi vous pensez pourrait servir.
00:15:35Vous êtes peut-être gamer et vous voulez savoir comment réussir ce niveau ?
00:15:40Mais il n'y a pas exactement de vidéo à ce sujet.
00:15:42Vous pouvez chercher des gens qui passent le niveau dans le jeu vidéo, n'est-ce pas ?
00:15:47Absolument tout, le champ des possibles est à vous.
00:15:52Je vais donc conclure.
00:15:54Je ne sais pas si vous avez des questions, mais si vous voulez échanger davantage,
00:15:58n'hésitez pas à me contacter sur LinkedIn.
00:16:01Et voilà, je vous remercie tous pour votre attention.
00:16:06Je suis au stand Bright Data si vous souhaitez approfondir le sujet.
00:16:10Merci d'être venus.
00:16:17À la prochaine.

Key Takeaway

L'indexation et la recherche d'actions précises au sein de plus d'un milliard de vidéos Web résolvent la pénurie de données d'entraînement robotique tout en éliminant jusqu'à 96 % de gaspillage de calcul.

Highlights

  • Les jeux de données d'entraînement pour la robotique sont limités à seulement environ un million de vidéos, contre des milliers de milliards de mots pour les modèles linguistiques.

  • L'entraînement du modèle d'IA de Meta a nécessité un million d'heures de vidéo réelle et seulement 62 heures de données robotiques pour piloter un robot physique.

  • Des entreprises comme NVIDIA éliminent jusqu'à 96 % des vidéos téléchargées lors de l'entraînement de modèles comme Cosmos en raison du manque de pertinence des données.

  • L'indexation directe des actions dans les vidéos plutôt que les titres permet de filtrer 1,1 milliard de vidéos pour extraire uniquement les mouvements utiles.

  • Le filtrage en amont des vidéos Web réduit le gaspillage de bande passante, d'espace de stockage et de puissance de calcul requis pour l'IA physique.

Timeline

L'évolution de l'IA physique et le goulot d'étranglement des données

  • L'ouverture du code source en 2024 a accéléré l'intégration des modèles d'IA au sein de robots humanoïdes.
  • Les véhicules autonomes de Waymo apprennent à conduire grâce à l'analyse continue des flux d'images issus de caméras embarquées.
  • Le principal obstacle du développement de l'IA ne réside plus dans les algorithmes, mais dans l'accès aux données réelles.

Les progrès de la robotique sont passés de l'entraînement d'un seul robot par Google en 2022 à la gestion multitâche en 2023. L'avènement de l'open source en 2024 a permis aux laboratoires du monde entier de déployer ces modèles sur des systèmes physiques. Les caméras embarquées sur les véhicules enregistrent les interactions du monde réel, fournissant ainsi la base nécessaire à l'apprentissage de la conduite autonome sans intervention humaine.

Limites des jeux de données actuels et biais des données enregistrées

  • Les modèles linguistiques disposent de milliers de milliards de mots, alors que la robotique ne compte qu'environ un million de vidéos d'entraînement.
  • Les vidéos enregistrées sur commande produisent des mouvements dirigés et artificiels qui biaisent l'apprentissage des robots.
  • Les simulations virtuelles et le téléguidage manuel manquent d'échelle et ne reflètent pas la physique du monde réel.

Le volume de données disponibles pour la robotique reste très faible par rapport au texte ou aux images. Payer des individus pour filmer des gestes quotidiens modifie leur comportement naturel face à la caméra. Les simulations de jeux vidéo manquent de précision physique, et l'enregistrement manuel par télécommande est limité à quelques heures par jour, ce qui rend l'extrapolation impossible à grande échelle.

Exploitation de la vidéo Web et gaspillage de puissance de calcul

  • Un million d'heures de vidéo publique associées à 62 heures de pratique physique suffisent à contrôler un robot autonome.
  • NVIDIA rejette 96 % des vidéos téléchargées lors de l'entraînement de son modèle Cosmos faute de pertinence visuelle.
  • Le modèle Stable Video Diffusion élimine 74 % des données vidéo collectées avant l'entraînement.

Les plateformes comme YouTube regroupent des milliards d'heures de contenu montrant la gravité, la manipulation d'objets et les relations de cause à effet. L'analyse des variations de mouvement entre des images consécutives permet aux algorithmes de déduire les distances et les angles sans capteurs physiques. Cependant, le téléchargement brut entraîne une perte massive de ressources, car la majorité des vidéos contiennent du bruit inutile.

Indexation ciblée par action et applications sectorielles

  • L'indexation de 1,1 milliard de vidéos par action permet d'extraire des séquences précises sans télécharger l'intégralité des fichiers.
  • Les requêtes par API fournissent l'horodatage exact, le score de correspondance et le nombre d'images d'un geste spécifique.
  • La recherche visuelle permet d'identifier l'apparition de produits de marque au sein de vidéos non indexées par titre.

Inverser le processus en effectuant la recherche avant la collecte réduit la consommation de stockage et de bande passante. La plateforme analyse le contenu visuel pour isoler des tâches comme le lavage de la vaisselle ou le pliage de linge. Cette technologie sert également aux marques pour repérer le placement passif de leurs produits dans du contenu vidéo, indépendamment du titre ou des métadonnées texte.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video