Le prochain obstacle de l'IA physique est de trouver la bonne vidéo — Rafael Levi, Bright Data
AAI Engineer
Computing/SoftwareBusiness NewsInternet Technology
Transcript
00:00:00Bonjour à tous, bienvenue. Pour ceux qui sont venus spécifiquement pour me voir, merci. Pour ceux qui
00:00:21passent juste par là, merci également. Je vais essayer de vous divertir et de vous apprendre quelque chose.
00:00:26Encore une fois, je m'appelle Rafael et je travaille chez Bright Data depuis plus de huit ans. Chez Bright Data, nous collectons des données et nous cherchons à innover.
00:00:38Aujourd'hui, je veux parler de la découverte vidéo pour l'entraînement des modèles du monde agentiques, et nous expliquerons ce que c'est dans un moment.
00:00:48Alors, que faut-il aujourd'hui pour construire un système capable de voir, de comprendre et d'agir ?
00:00:56C'est vrai, nous avons compris ce qu'est une IA, nous l'améliorons constamment, c'est un peu maîtrisé,
00:01:04mais maintenant, la partie difficile consiste à savoir quelles données lui fournir, car tout le monde sait qu'une IA sans données n'est qu'une boîte vide.
00:01:13Revenons un peu en arrière dans l'histoire. En 2022, Google a entraîné un robot grâce à des images
00:01:25représentant des actions du monde réel. Ensuite, il y a eu un bond. En 2023, une IA a réussi à contrôler plusieurs robots.
00:01:37En 2024, l'open source est arrivé. C'est là que les règles du jeu ont changé. Dès que nous avons eu l'open source, tous les laboratoires ont eu accès à l'IA et ont commencé à l'intégrer dans des robots.
00:01:51Désormais, ces modèles pilotent déjà des robots humanoïdes. J'en vois quelques-uns, bien sûr, la plupart ici sont télécommandés.
00:02:00Mais à San Francisco, vous avez Waymo qui roule sans aucun chauffeur. C'est incroyable, non ?
00:02:07La première fois que je suis monté dans la voiture, je pensais que j'allais mourir, mais c'était en fait très agréable.
00:02:12Comment pensez-vous qu'elle a appris à conduire ? En s'entraînant elle-même, en apprenant grâce à des caméras embarquées.
00:02:22Chaque voiture a une caméra. Si vous fournissez ces images à une IA, elle peut comprendre comment faire fonctionner une machine.
00:02:31Comme je l'ai dit, l'IA n'est plus la partie difficile, ce sont les données, et c'est de cela que je veux parler.
00:02:39Pour les LLM de chat, il y a des milliers de milliards de mots et de textes. Nous avons énormément de données textuelles pour entraîner les LLM.
00:02:49Pour la génération d'images, nous avons des milliards d'images étiquetées, c'est donc aussi une base de données gigantesque.
00:02:56Mais pour la robotique, il n'y a qu'environ un million de vidéos. C'est un jeu de données très réduit et limité de robots en train d'agir.
00:03:09L'idée ici est que, bien sûr, de nombreuses entreprises paient des gens pour enregistrer des actions.
00:03:20Par exemple, “Enregistre-moi la façon dont tu ouvres une porte”, ou “Enregistre la façon dont tu t'assois sur une chaise”.
00:03:28Mais le problème, c'est que lorsque l'on dit à quelqu'un de faire quelque chose, il ne le fait pas de manière naturelle.
00:03:34C'est ce que j'appelle du dirigé. Si on vous demande d'enregistrer comment vous ouvrez une porte et que vous le faites pour quelqu'un,
00:03:40ce ne sera pas la même chose que si vous entriez simplement chez vous. Le mouvement est totalement différent.
00:03:45Ces données sont-elles bonnes pour l'entraînement robotique ? Selon moi, non. Ce sont des données biaisées qui ne donnent pas les mêmes résultats.
00:03:53Évidemment, le robot ne sera pas aussi efficace que s'il agissait de manière intuitive.
00:03:59J'ai juste mis quelques exemples sur la diapositive.
00:04:06Les données créées manuellement ne sont pas équivalentes aux données capturées spontanément.
00:04:12De plus, les gens se comportent très différemment lorsqu'ils sont devant une caméra.
00:04:16Certains d'entre vous le savent, beaucoup de gens sont timides devant un objectif, donc dès qu'on les filme, ils changent.
00:04:23Mais dans le monde réel, c'est une tout autre histoire.
00:04:27C'est précisément ce problème que nous essayons de résoudre chez Bright Data.
00:04:35Pourquoi les sources de données habituelles ne suffisent-elles pas ?
00:04:37Les simulations virtuelles sont peu coûteuses, mais tout le monde joue aux jeux vidéo.
00:04:44La physique dans les jeux vidéo est presque au point, mais pas assez bonne pour entraîner un robot.
00:04:50Le contrôle manuel, lorsqu'une personne téléguide un robot, c'est faisable, mais combien d'heures par jour pouvez-vous enregistrer un robot ?
00:04:57De combien de personnes avez-vous besoin pour obtenir des données à très grande échelle ?
00:05:01Vous pouvez enregistrer peut-être huit heures par jour, tous les jours.
00:05:04Combien d'heures allez-vous obtenir en une année ?
00:05:07Ce n'est pas vraiment évolutif.
00:05:09Et bien sûr, il existe déjà des jeux de données préexistants, mais comme je l'ai dit, ils sont de taille réduite.
00:05:13Il n'y a qu'environ un million de vidéos à ce jour.
00:05:15Quelle est donc l'alternative ?
00:05:17L'alternative, c'est le Web.
00:05:20Pensons simplement à YouTube.
00:05:22Combien de vidéos y a-t-il sur YouTube ?
00:05:25Je ne sais pas, peut-être cinq milliards de vidéos ?
00:05:28Combien d'actions dans ces vidéos un robot pourrait-il reproduire ?
00:05:34Pensez-y un instant.
00:05:35Combien de vidéos existent selon vous où une personne ouvre une porte en vue à la première personne ?
00:05:42Des millions d'heures.
00:05:43Vous seriez surpris.
00:05:45Ainsi, chaque jour, les vidéos du Web montrent la gravité, les mouvements,
00:05:53les relations de cause à effet, et les accidents sont la meilleure illustration de la cause à effet.
00:06:00Elles montrent comment les gens manipulent des objets, et ce sur des milliards d'heures.
00:06:04C'est un excellent matériel d'entraînement pour les robots, mais quel est le problème ?
00:06:08Le problème, c'est qu'il y a énormément de bruit inutile.
00:06:12Voici un exemple.
00:06:14Pour l'un des modèles d'IA entraînés par Meta, ils ont fourni environ un million d'heures de vidéos du monde réel.
00:06:21Ensuite, il n'a fallu que 62 heures de données robotiques réelles pour contrôler un véritable robot.
00:06:29Quand on y pense, les données ont été collectées publiquement.
00:06:33Cela a permis d'entraîner le robot sur des choses variées, et en seulement 62 heures de pratique robotique, il se déplaçait déjà.
00:06:41Pas besoin de simulations, la robotique autonome est déployée rapidement.
00:06:52Mais les vidéos ne montrent pas comment les robots se déplacent.
00:06:54Vous vous dites sans doute : en quoi une personne qui verse de l'eau dans une tasse est-elle utile à un robot ?
00:07:01Il existe aujourd'hui des méthodes permettant à une IA de distinguer et d'apprendre des actions présentes dans une vidéo.
00:07:09Si vous prenez deux images consécutives et que l'IA mesure la différence de mouvement entre elles,
00:07:15vous avez une image A et une image B, avec un léger déplacement qui s'opère entre les deux.
00:07:21Une IA est capable de mesurer ce changement.
00:07:24Si vous répétez l'opération sur toute la vidéo, l'IA peut en déduire les angles, les distances
00:07:30et tout ce dont elle a besoin pour entraîner un robot.
00:07:34Nous n'avons donc pas nécessairement besoin des données des capteurs, mais bien sûr, la vidéo elle-même que vous téléchargez
00:07:41depuis YouTube ou dont vous extrayez les données ne vous amène pas à 100 % du résultat.
00:07:48Il faut appliquer un traitement supplémentaire par-dessus, mais c'est tout à fait faisable.
00:07:53C'est à portée de main, il suffit de traiter les données.
00:07:58Voici quelques exemples supplémentaires.
00:07:59Par exemple, chez NVIDIA, lorsqu'ils entraînent le robot Cosmos, ils rejettent environ 96 % des vidéos.
00:08:07Qu'est-ce que cela signifie ?
00:08:09Ils téléchargent un million d'heures de vidéo,
00:08:12et seuls 4 % se révèlent réellement utiles.
00:08:15Tout le reste est jeté.
00:08:16C'est de la puissance de calcul gaspillée.
00:08:18C'est de la bande passante inutile.
00:08:19C'est du stockage gâché.
00:08:21C'est tout simplement beaucoup d'argent jeté par les fenêtres.
00:08:23Aussi, Stable Video Diffusion élimine 74 % des vidéos téléchargées.
00:08:30Chez Bright Data, nous tentons de résoudre ce problème et d'aller encore plus loin.
00:08:37Notre approche consiste à chercher d'abord, puis collecter ensuite.
00:08:41Nous indexons les vidéos pour vous permettre de rechercher des actions bien précises.
00:08:50Puisque nous parlions d'une personne qui ouvre une porte, gardons cet exemple.
00:08:55Sur notre plateforme, vous pouvez saisir des critères extrêmement détaillés.
00:09:01Une requête du type : personne faisant la vaisselle, personne pliant un t-shirt, etc.
00:09:06Et nous vous fournirons les extraits vidéo de ces actions spécifiques.
00:09:13Qu'est-ce que cela implique ?
00:09:16Cela signifie qu'il y a beaucoup moins de gaspillage lors de la collecte.
00:09:22On économise ainsi du stockage et de la bande passante.
00:09:25Voici un peu plus de détails sur le fonctionnement.
00:09:27Évidemment, vous définissez ce que vous cherchez.
00:09:32Nous parcourons des milliards de vidéos pré-indexées.
00:09:36Non pas par mots-clés, mais par actions.
00:09:39Et nous vous fournissons des extraits prêts à l'emploi.
00:09:43Ces clips sont déjà préparés pour votre entraînement.
00:09:47Il vous suffit de les traiter légèrement pour le mouvement, les capteurs de distance, etc.
00:09:52Et les données sont prêtes à être intégrées dans un robot.
00:09:57J'ai un court exemple en vidéo qui montre le fonctionnement sur notre plateforme.
00:10:02Laissez-moi appuyer sur lecture, si je retrouve le bouton.
00:10:07Ici, on voit une personne lavant la vaisselle à la main dans un évier, dégraissant une assiette,
00:10:12utilisant une éponge et du savon, rinçant et posant la vaisselle sur un égouttoir, gros plan sur les mains.
00:10:19En ce moment même, le système recherche parmi des milliards de vidéos.
00:10:24Sur cette démonstration, la vidéo date un peu.
00:10:26On en avait qu'environ 100 millions d'indexées, mais aujourd'hui, on atteint 1,1 milliard de vidéos.
00:10:31Et le système va littéralement — c'est un peu accéléré pour ne pas vous faire perdre de temps —
00:10:35vous sortir des extraits de vidéos de personnes faisant la vaisselle.
00:10:41Vous pouvez voir ici toutes les vidéos que nous trouvons.
00:10:47Certaines d'entre elles n'ont peut-être pas de rapport direct avec la vaisselle.
00:10:50Elles montrent peut-être le nettoyage d'une cuisine.
00:10:52Ou une autre tâche ménagère.
00:10:54Voici un autre exemple.
00:10:55Par exemple, un humain pliant différents types de vêtements.
00:10:59D'accord ?
00:10:59Donc, un peu plus de détails.
00:11:01Plus vous donnez de détails, plus les résultats sont pertinents.
00:11:06Encore une fois, c'est légèrement accéléré.
00:11:08Voyons voir.
00:11:14Je veux que vous compreniez que cela peut s'appliquer à tout.
00:11:16Une personne qui se maquille.
00:11:17Imaginons que vous ayez une marque et souhaitiez trouver des vidéos où elle apparaît.
00:11:21Tout cela peut également être fourni.
00:11:23Voilà, on voit des gens plier du linge.
00:11:26Vous pouvez désormais entraîner un robot à plier du linge.
00:11:34Bien entendu, tout est accessible via API.
00:11:36Nous ne m'attendons pas à ce que les gens fassent quoi que ce soit manuellement.
00:11:39N'est-ce pas ?
00:11:39Vous pouvez donc lancer la recherche par API.
00:11:41Vous obtenez un extrait vidéo en retour, avec l'URL.
00:11:46On vous fournit le lien de la vidéo originale si vous voulez la regarder.
00:11:49Mais l'élément clé, c'est qu'on vous fournit ces extraits vidéo pour entraîner vos robots.
00:11:57Je ne sais pas si vous entraînez des robots actuellement,
00:12:01alors je vais vous donner un autre exemple très concret.
00:12:04Prenons le cas d'une marque.
00:12:06Vous voulez savoir dans quelles vidéos vos produits apparaissent en démonstration.
00:12:13Les titres des vidéos importent peu, car elles ne traitent pas directement de votre produit.
00:12:19Il peut s'agir d'un simple podcast ou d'un enregistrement banal.
00:12:22Mais vous y voyez une femme qui se maquille,
00:12:25et vous apercevez votre marque de maquillage sur la table.
00:12:30D'un coup, vous pouvez retrouver toutes les vidéos où votre marque est utilisée.
00:12:34Peu importe le contexte.
00:12:35D'accord ?
00:12:35Une simple recherche par nom de vidéo ne donnerait rien.
00:12:38Grâce à l'indexation vidéo, vous pouvez trouver des éléments visuels très précis.
00:12:45Une pomme qui tombe d'un arbre,
00:12:47et bien plus encore.
00:12:48Quelles sont les données renvoyées ?
00:12:50Nous vous fournissons l'horodatage.
00:12:52Nous vous fournissons le score de correspondance,
00:12:53qui indique la pertinence par rapport à votre requête,
00:12:55ainsi que le nombre d'images.
00:12:57C'est-à-dire la quantité d'images correspondant à votre recherche.
00:13:03Qu'est-ce que ça change ?
00:13:06Absolument tout.
00:13:07Moins de gâchis,
00:13:09plus besoin de télécharger des millions d'heures de vidéo.
00:13:12Vous pouvez cibler directement les actions précises
00:13:16qui vous intéressent.
00:13:20Encore une fois, c'est crucial pour l'entraînement de la robotique,
00:13:24car le bruit génère des erreurs et des hallucinations.
00:13:28Pas vrai ?
00:13:29Cela élimine les données parasites.
00:13:34À quoi cela sert-il d'autre ?
00:13:35Pas seulement aux robots, mais aussi à la conduite autonome,
00:13:38comme Waymo,
00:13:39par exemple.
00:13:40Entraîné sur des vidéos de caméras embarquées.
00:13:43Il y en a des centaines de millions d'heures sur YouTube.
00:13:46De dashcams.
00:13:47Combien d'entre vous aiment regarder des accidents ?
00:13:49Des accidents filmés par dashcam.
00:13:52Tout le monde en a déjà vu.
00:13:53La conduite folle en Russie,
00:13:55n'est-ce pas ?
00:13:56Voilà de quoi il s'agit.
00:13:58Pas vrai ?
00:13:58Les vidéos sont là.
00:14:01D'accord ?
00:14:01Quelqu'un qui grille un feu rouge.
00:14:02Quelqu'un qui s'arrête au feu rouge.
00:14:04Tourner à gauche.
00:14:05Tourner à droite.
00:14:06Et ainsi de suite.
00:14:06Tout cela peut être des données très utiles pour l'entraînement.
00:14:11Et pour tout autre modèle du monde.
00:14:13La physique.
00:14:14Pas vrai ?
00:14:14Les robots doivent comprendre la physique.
00:14:16Qu'est-ce que la gravité ?
00:14:18Comment s'asseoir ?
00:14:18Comment marcher ?
00:14:19Comment bouger ?
00:14:21Encore une fois, vous pouvez bien sûr tout préenregistrer.
00:14:25Souvent, en ce moment, je parle à certaines personnes,
00:14:27et elles ont des millions de personnes qui enregistrent des vidéos pour elles.
00:14:30« Hé, vous pouvez me filmer la façon dont vous ouvrez les portes ? »
00:14:33C'est fou.
00:14:34Pourquoi avoir besoin d'un million de personnes pour ça alors que tout est disponible en ligne ?
00:14:39Internet est l'une des plus vastes bases de données.
00:14:43C'est juste que les gens ne... ce n'est pas si facile à exploiter, vous voyez ?
00:14:46Je veux dire, pour l'instant, la seule recherche disponible se fait par mot-clé sur le titre de la vidéo.
00:14:53Et évidemment, une source unique rassemble tout le Web vidéo public au même endroit.
00:14:59On a YouTube, on a Vimeo, on a tellement de fournisseurs de vidéos différents.
00:15:06Des milliards d'heures de données d'entraînement n'attendent que vous pour être récupérées,
00:15:13collectées et traitées.
00:15:14En gros, c'est le nouveau produit que nous développons chez Bright Data.
00:15:18Indexer les vidéos pour que vous puissiez trouver des actions spécifiques.
00:15:23Tout ce que vous imaginez, vous savez, cela peut aussi être utile pour les marques.
00:15:28Ce n'est pas seulement pour les données d'entraînement.
00:15:31Tout ce à quoi vous pensez pourrait servir.
00:15:35Vous êtes peut-être gamer et vous voulez savoir comment réussir ce niveau ?
00:15:40Mais il n'y a pas exactement de vidéo à ce sujet.
00:15:42Vous pouvez chercher des gens qui passent le niveau dans le jeu vidéo, n'est-ce pas ?
00:15:47Absolument tout, le champ des possibles est à vous.
00:15:52Je vais donc conclure.
00:15:54Je ne sais pas si vous avez des questions, mais si vous voulez échanger davantage,
00:15:58n'hésitez pas à me contacter sur LinkedIn.
00:16:01Et voilà, je vous remercie tous pour votre attention.
00:16:06Je suis au stand Bright Data si vous souhaitez approfondir le sujet.
00:16:10Merci d'être venus.
00:16:17À la prochaine.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video