Des VLM/VLA aux agents incarnés — Armen Aghajanyan, Perceptron AI

AAI Engineer
Computing/Software

Transcript

00:00:00Oui, je pense qu'on va pouvoir commencer. Je suis Armin, cofondateur et PDG de Perceptron.
00:00:20On reviendra un peu sur ce qu'on fait, mais aujourd'hui, je souhaite principalement parler de
00:00:25notre positionnement de recherche, visant à dépasser la distinction entre VLM, VLA,
00:00:32modèles de monde ou autre, pour aller vers ce qu'on appelle les modèles fondateurs incarnés.
00:00:42Chez Perceptron, notre objectif ultime est de pouvoir
00:00:48concevoir des bases d'IA physique capables de percevoir, comprendre et interagir
00:00:53avec le monde physique en temps réel. Notre mission principale est donc de jeter un pont entre
00:00:58le monde physique et le monde numérique. Cela signifie que partout où l'on trouve un appareil,
00:01:07un instrument, un robot, une caméra ou un capteur, nous sommes là pour lui apporter de l'intelligence.
00:01:14Et lorsqu'on évoque ce paradigme qui associe perception, raisonnement
00:01:19et action, nous le voyons comme une unification de la modélisation multimodale classique.
00:01:25Avant cela, j'ai passé six ans chez FAIR, où mon but était de trouver comment
00:01:31passer à l'échelle les méthodes pour modèles multimodaux. L'un des premiers sujets qu'on a étudiés,
00:01:37et sur lequel on a beaucoup publié, est la fusion précoce. L'idée est d'intégrer
00:01:41toutes ces modalités le plus tôt possible. La véritable difficulté réside dans la recherche
00:01:47de la bonne méthode pour représenter correctement toutes ces différentes modalités, tant en entrée
00:01:52qu'en sortie, de façon holistique. Les VLM sont alors devenus la norme ;
00:01:58quand je parle de modèles multimodaux, vous pensez sûrement aux VLM. Il s'agit d'ingérer
00:02:03de l'image, de la vidéo et du texte pour générer principalement du texte. Il en existe des variantes,
00:02:09comme les modèles ER, axés sur le raisonnement incarné, capables de fournir
00:02:15des points d'ancrage et de mieux réussir la compréhension spatiale ou le raisonnement.
00:02:20Ensuite, on trouve les VLA, qui étendent le domaine de sortie au-delà du simple texte pour inclure
00:02:25les actions. Ils continuent généralement de s'appuyer sur des architectures VLM classiques,
00:02:30même si des tentatives ont été faites pour s'éloigner
00:02:35des VLM vers des modèles de monde ou d'action du monde, sans grand succès
00:02:39jusqu'à présent. On arrive ensuite à des variantes plus intéressantes et complexes de modèles
00:02:46multimodaux, comme les modèles de monde, qui génèrent de la vidéo à partir d'entrées
00:02:51d'images, de vidéos, ou même d'un mélange d'images, de vidéos et d'actions. Enfin, le dernier point
00:02:57que je mentionnerai est récent : ce qu'on appelle les modèles de monde sémantiques. Ils ne génèrent rien,
00:03:02mais apprennent une représentation jugée utile pour la suite. Ce que nous considérons
00:03:08comme un modèle fondateur incarné est un cadre permettant de réaliser la perception
00:03:13standard, le raisonnement incarné et le contrôle final au sein d'un seul et même modèle.
00:03:20Il s'agit donc de raisonner sur différentes modalités sensorielles en entrée et d'accomplir
00:03:25la majeure partie des tâches citées en sortie, le tout au sein d'un modèle unique et unifié.
00:03:31Très rapidement, je vais évoquer deux défis fondamentaux de la recherche
00:03:35auxquels nous faisons face, en vous expliquant l'approche de notre entreprise
00:03:40ainsi que les solutions développées par d'autres acteurs.
00:03:43Premièrement, prenons le cas de la modélisation brute d'une vidéo,
00:03:48par exemple une heure de contenu. Selon la représentation, on peut se retrouver avec
00:03:52environ un million de tokens visuels en entrée. En réalité, il n'existe aucune vérité terrain
00:03:57exploitable de façon efficace. On peut bien sûr, comme cela a déjà été fait,
00:04:02extraire les transcriptions, les prédire à partir de la vidéo, ou étiqueter de manière synthétique
00:04:08certaines images pour poser des questions. Mais cela s'avère être un gâchis d'énergie colossal.
00:04:13En effet, quand vous donnez un million de tokens en entrée à votre modèle,
00:04:16vous ne calculez la perte que sur environ 0,2 % de l'ensemble
00:04:22des tokens injectés. C'est un problème très profond. Et peu importe la manière dont vous essayez
00:04:27de corriger cela, vous injectez un signal d'entraînement inadéquat.
00:04:31Soit le signal est trop clairsemé, soit trop synthétique, soit trop indifférencié. Au-delà
00:04:37de l'enrichissement synthétique, une autre approche consiste à prédire chaque pixel. C'est certes
00:04:42un signal très dense, mais cela répartit très mal l'attention. On accorde
00:04:47la même importance à un pixel d'arrière-plan qu'à l'extrémité d'une pince de robot,
00:04:51aux points de contact, aux erreurs spécifiques ou aux lois de la physique.
00:04:56C'est pourquoi chez Perceptron, et c'est l'un des piliers de notre propriété intellectuelle,
00:05:01nous nous interrogeons sur la nature d'un objectif perceptif naturel. Comment prédire
00:05:06de manière totalement automatique les percepts qui compteront dans le futur ? Par exemple,
00:05:11on peut coder en dur le fait que l'extrémité de la pince d'un bras robotique
00:05:16est un percept très utile à prédire au cours du temps. Certains ont commencé à explorer cette voie,
00:05:20comme l'équipe de MOMO Act chez AI2, ou d'autres modèles VLA.
00:05:26Cependant, cela reste un percept codé en dur. La question est de savoir s'il est possible
00:05:30de trouver un moyen automatique permettant au modèle d'apprendre sémantiquement cet objectif unique.
00:05:37Et la réponse est oui, nous avons trouvé une méthode. Nous ne la détaillerons pas ici,
00:05:41mais cela donne une idée de notre approche du problème de la rareté des données. Le second problème majeur
00:05:49auquel nous consacrons beaucoup de temps est la saturation du contexte. Avec des caméras actives en continu
00:05:54ou des robots qui fonctionnent sans s'arrêter, il faut traiter une quantité massive de tokens.
00:06:01Le texte est relativement dense, tandis que la vidéo est très dispersée. La question est donc : existe-t-il
00:06:08des avancées architecturales permettant de gérer ce problème de manière native,
00:06:13plutôt que d'essayer d'équilibrer artificiellement la situation ?
00:06:20Plusieurs options sont envisageables. Le principe de base consiste à commencer
00:06:25par traiter chaque modalité de manière distincte. Les tokens de texte ne doivent pas être traités
00:06:31comme des tokens d'image, audio ou vidéo. Une première piste à explorer est de se concentrer
00:06:36sur la compression spatiale ou la compression de tokens. Des approches très simplistes existent,
00:06:41et c'est par là que nous avons commencé ; elles donnent des résultats. On peut par exemple
00:06:44calculer la moyenne des représentations par patchs sur une vidéo ou une image. Cela permet d'obtenir
00:06:51des taux de compression intéressants, pouvant aller jusqu'à 10x. Cela reste toutefois du bricolage,
00:06:57faute de méthodes architecturales éprouvées pour résoudre ce problème. Ces derniers mois,
00:07:04nous avons publié ce qui constitue selon nous notre réponse à cette rareté variable des données :
00:07:10laisser le modèle déterminer lui-même quels tokens observer et lesquels ignorer.
00:07:14Nous avons ainsi publié notre article sur le mélange d'experts à données dispersées,
00:07:19qui permet précisément cela. Un routeur intégré au modèle lui permet
00:07:24de prédire quel token traiter et quel token ignorer, et ce, de façon quasi gratuite
00:07:30à travers l'ensemble des couches. Il s'avère que si l'on laisse le modèle apprendre,
00:07:36sans lui imposer a priori de contraintes architecturales fortes, il apprend très bien par lui-même.
00:07:43En visualisant le calcul à données dispersées utilisé par nos modèles, on s'aperçoit
00:07:49qu'ils apprennent naturellement à se concentrer sur les informations à forte densité ou pertinentes pour la tâche.
00:07:56En haut à droite, on voit que le modèle choisit de se focaliser sur le graphique,
00:08:00élément sur lequel un humain zoomerait également, car c'est la partie la plus intéressante
00:08:05de l'image. Cette allocation s'adapte aussi en fonction de la tâche demandée.
00:08:13Si vous posez une question très générale, comme en bas à gauche,
00:08:18la carte d'attention s'étend sur l'ensemble de l'image, car le modèle ne sait pas comment
00:08:22répartir le calcul efficacement. En revanche, si vous lui demandez de segmenter
00:08:27tous les fruits, il va allouer davantage de tokens aux zones qu'il identifie comme telles.
00:08:31C'est une astuce très efficace que nous utilisons et avons publiée, et que d'autres commencent
00:08:36à adopter. Elle consiste à intégrer dans l'architecture des a priori utiles pour traiter le déséquilibre
00:08:43de rareté entre les modalités, sans pour autant brider l'apprentissage natif du modèle.
00:08:49En combinant l'ensemble de ces avancées — vous avez d'ailleurs peut-être vu l'annonce —,
00:08:57nous avons lancé il y a quelques semaines ce qu'on considère comme le premier modèle fondateur
00:09:03incarné. Ce modèle rivalise directement avec Gemini 3.1 Pro.
00:09:09Il surpasse Gemini Embodied Reasoning tout en étant environ 15 fois moins cher.
00:09:15Il a été entraîné sur un ensemble de données d'un pétaoctet, rassemblant absolument tout :
00:09:20de l'aspiration de données web à nos propres méthodes d'entraînement intermédiaire et pipelines de données synthétiques.
00:09:28Ce pétaoctet regroupe du texte, des images, des vidéos et des trajectoires de natures très diverses,
00:09:34allant de l'utilisation d'un ordinateur de bureau à des sessions de jeux vidéo.
00:09:41En appliquant cette méthode, des propriétés très intéressantes finissent par émerger.
00:09:46La principale propriété observée, évidente avec le recul,
00:09:50c'est qu'on peut traiter les tâches de vision par ordinateur classiques comme des tâches agentiques. Ainsi,
00:09:57dans ce cas, nous avons reformulé la détection comme une tâche agentique. Notre modèle peut donc
00:10:02écrire du code. Il peut demander à zoomer sur des zones spécifiques, ajuster le contraste... Et vous
00:10:09pouvez le voir ici, c'est un problème très complexe. Il y a tout un subreddit Reddit dédié à ce genre
00:10:14de défis, qui consistent à repérer des objets très difficiles à voir sur des images. Et nos modèles y parviennent très
00:10:19bien. Mais ils le font de manière agentique. Ce n'est pas de la détection classique de type “encadre cette zone”.
00:10:24C'est le modèle lui-même qui décide qu'il doit découper l'image en tuiles, qu'il doit modifier le
00:10:28contraste. Il propose un cadre ici. Je crois qu'ici, oui, il augmente le contraste et parvient à repérer l'oiseau.
00:10:36Encore une fois, c'est très difficile, même pour un humain, alors que nous sommes très doués pour la perception.
00:10:42C'est une tâche relativement complexe. Et tout cela découle du simple fait d'avoir
00:10:46des modèles incarnés de manière native qui savent analyser différentes modalités.
00:10:51Ensuite, quel est le lien avec le domaine plus général de l'IA physique et de la robotique ?
00:10:57J'ai emprunté cette diapositive aux équipes de GDM. Ce qu'on commence à observer avec
00:11:04les systèmes agentiques en robotique, c'est cette séparation entre ce qu'on appelle les modèles de raisonnement incarné (ou
00:11:11orchestrateurs) et les modèles de politique tactile. On peut envisager le problème ainsi :
00:11:17si je prépare un café et que ça me prend trois minutes, je peux soit tenter de forcer
00:11:21l'ensemble de mon VLA à accomplir cette tâche individuelle, soit utiliser
00:11:26un modèle orchestrateur qui décompose ces tâches en sous-tâches, avec une politique
00:11:31de contrôle tactile qui s'exécute par-dessus. Il existe tout un éventail d'approches, du VLA
00:11:36pur et dur jusqu'à ce type de système agentique. Mais l'idée principale que je souhaite souligner, c'est que
00:11:41le raisonnement incarné est un problème fascinant et complexe, qui reste encore à résoudre.
00:11:46Cela étant dit, nos modèles restent à la pointe en matière de raisonnement incarné.
00:11:50Et comme ils sont à la pointe, nous commençons à observer des choses inédites et impressionnantes.
00:11:55Voici un exemple concret d'annotation de données robotiques
00:11:59très complexe. Vous pouvez voir ici le modèle naviguer dans la vidéo,
00:12:04examiner différentes sections, la découper, vérifier si
00:12:09les légendes sont correctes, faire de l'auto-vérification. Tout cela est possible parce que les modèles AR sont rapides.
00:12:15Ils sont nettement moins chers que tout ce qui existe sur le marché. Si vous faisiez cela avec Gemini,
00:12:20cette vidéo vous coûterait probablement quelques dollars, alors que pour nous, cela se compte en centimes.
00:12:24Et tout cela découle de ces capacités avancées de raisonnement incarné
00:12:29que nous n'avions jamais observées sur d'autres modèles auparavant.
00:12:37Je vais maintenant vous partager la plus grande avancée de notre recherche, et nous
00:12:41en dirons probablement plus dans les prochaines semaines sur Twitter. Nous avons
00:12:48découvert de nouvelles lois d'échelle pour les modèles de fondation incarnés. Ce sont des modèles, encore une fois, où
00:12:53l'on peut combiner l'entraînement basé sur le contrôle, sur la trajectoire, sur la perception,
00:12:59et sur le raisonnement incarné. Si vous trouvez la bonne façon de combiner tout cela
00:13:03avec les bons objectifs, vous commencez à débloquer des leviers très intéressants
00:13:08qui étaient auparavant hors de portée.
00:13:11Le levier concret dont je veux parler est cette possibilité de compenser, d'échanger des données de pré-entraînement vidéo
00:13:19générales contre des données de téléopération. Comme nous le savons, la téléopération coûte très cher. C'est de l'ordre
00:13:25de 100 $ par heure de données. Pour 100 $, je peux collecter énormément plus de données de pré-entraînement vidéo.
00:13:32Ce graphique montre que si l'on entraîne des VLA ou des politiques pures, on se retrouve limité dans
00:13:39cette plage. Il y a bien des lois d'échelle, donc on tire profit d'un volume croissant
00:13:43de données de téléopération. Cela dit, les bénéfices ne sont pas aussi importants que si l'on entraîne
00:13:48véritablement ces modèles de fondation incarnés unifiés. C'est ce que montre la partie inférieure du graphique.
00:13:55Et le levier vraiment génial qu'on obtient, c'est qu'on peut utiliser 10 fois moins de données de téléopération si
00:14:03l'on dispose de 10 fois plus de données de pré-entraînement vidéo. Et jusqu'à présent, cela s'est confirmé à la hauteur de la puissance de calcul
00:14:09dont dispose notre entreprise. Nous allons continuer à repousser les limites de ces modèles de fondation
00:14:16incarnés. Voici quelques vidéos d'une politique où nous espérons passer en open source
00:14:28l'un des plus petits modèles dans quelques semaines. Tout cela fonctionne de façon native au sein d'un seul modèle
00:14:33capable d'effectuer le raisonnement incarné nécessaire pour comprendre la tâche. En fait, il
00:14:38génère des jetons de contrôle. C'est un peu saccadé, mais ce n'est pas grave. Avec un changement d'échelle,
00:14:43ce sera résolu à grande échelle. Et vous pouvez voir des tâches très complexes qu'auparavant, je pense,
00:14:48de purs VLA auraient eu du mal à réaliser. Si vous regardez la vidéo de droite,
00:14:54le modèle doit lire le titre du livre, savoir de quel type de livre
00:14:58il s'agit, puis le placer correctement dans le bon bac. C'est une tâche en plusieurs étapes,
00:15:04entre perception et contrôle, qui est vraiment très difficile avec un modèle de contrôle
00:15:09purement de bout en bout qui n'a pas conscience des tâches perceptives nécessaires pour y parvenir.
00:15:23Ouais, c'est assez cool. Ça fonctionne aussi relativement bien en zéro-shot dès la sortie du carton. On a hâte de mettre ça
00:15:28entre vos mains dans quelques semaines, courant juillet.
00:15:33Voilà, je vais garder quelques minutes pour vos questions, mais si ça vous intéresse, échangeons.
00:15:41Une chose intéressante avec notre entreprise, c'est qu'on donne accès aux poids de Mark 1 à un nombre restreint de partenaires.
00:15:47On donne accès aux poids de nos grands modèles fondateurs incarnés. Envoyez-moi un e-mail ou un message sur Twitter, peu importe.
00:15:58Et puis voilà, je vais laisser la parole. Il reste quelques minutes pour les questions.
00:16:02Merci.
00:16:03Merci.
00:16:05Merci.
00:16:05Merci.
00:16:09Merci.
00:16:11Merci.
00:16:13Merci.
00:16:24Oui, je pense que... La question est : comment parvient-on à gérer la compréhension temporelle à ce point ?
00:16:31Bonne question. Pour être honnête, ce n'est pas encore parfait. Il reste du travail pour pouvoir déployer cela de manière fiable.
00:16:37Le point clé, c'est la gestion du contexte. Le contexte est relativement limité. Ici, les modèles ont un contexte d'un million, mais c'est assez facile à remplir avec de la vidéo à taux d'images élevé.
00:17:06Il faut donc commencer à réfléchir : y a-t-il des astuces intéressantes ? Je vous donne un exemple, c'est ce qu'on faisait avant : comment gérer les images clés par rapport aux images de différence ?
00:17:19Comment gérer mon contexte en faisant un compromis entre les deux ? Et puis, lors du pré-entraînement, comment intégrer nativement ce qui sera utile pour les tâches robotiques ?
00:17:32Par exemple, une chose très basique sur laquelle même les modèles Gemini avaient du mal — les nouveaux s'en sortent bien — c'est repérer les orientations spatiales.
00:17:40Distinguer la gauche de la droite est très dur en collectant des données sur le Web, car personne n'y étiquette des choses comme “cet objet est à gauche de celui-ci, ou en dessous”.
00:17:51Donc, bien réfléchir à la distribution des données dès le départ vous donne cette capacité assez rapidement. Et ce type de raisonnement incarné était un objectif très concret pour nous, ce qui explique, je pense, pourquoi nous avons pu dépasser Gemini ER avec relativement moins de puissance de calcul.
00:18:07La plus belle preuve de robustesse qu'on ait vue concerne spécifiquement les modèles VLA : si vous prenez l'un des modèles chinois,
00:18:35et que vous essayez de l'ajuster pour une politique spécifique, le simple fait de changer l'arrière-plan de la table fera échouer la politique.
00:18:47Ce qui est très intéressant avec cette modélisation conjointe perception/contrôle, c'est qu'on est bien plus robuste à ce genre d'erreurs ou aux variations de lumière.
00:18:56Et nous y voyons principalement une robustesse à l'arrière-plan que les modèles traditionnels n'ont pas forcément.
00:19:03Cela dit, je ne vais pas exagérer... Cela reste relativement difficile.
00:19:07Si j'éclairais l'un des bras avec une lampe de poche, ça ne marcherait probablement pas.
00:19:12Mais pouvoir modéliser ces éléments conjointement aide énormément.
00:19:16On fait aussi beaucoup d'augmentation en ligne, en simulant par exemple la désactivation de l'une des caméras du bras, vous voyez ?
00:19:27On simule de la lumière du soleil venant d'une certaine direction.
00:19:31On fait cela pendant l'entraînement pour améliorer la robustesse.
00:19:35Mais les plus grands gains viennent de l'adoption de ce paradigme de fusion précoce appliqué ensuite au domaine de la robotique.
00:19:43Cool.
00:19:44.
00:19:50Ah, les bases de connaissances ?
00:19:52C'est utile pour... Je veux dire, pour légender des images ou des vidéos, ça fonctionne plutôt bien.
00:19:57On travaille avec des partenaires en robotique pour des annotations égocentriques très complexes de ce type.
00:20:02Il ne s'agit pas forcément de s'appuyer sur une ontologie, mais de réaliser une extraction structurée très poussée,
00:20:07ce pour quoi nos modèles sont très bons, je pense.
00:20:10Oui.
00:20:11Au fait, tout ce que j'ai montré ici est accessible via des API publiques, vous pouvez tester.
00:20:15Les évaluations de référence sont publiques.
00:20:17Je crois que je n'ai plus de temps.
00:20:19On m'invite à conclure, je peux donc discuter avec vous dehors.
00:20:22Mais merci à tous.
00:20:27Merci.

Key Takeaway

L'unification de la perception, du raisonnement et du contrôle au sein d'un modèle fondateur incarné unique permet de remplacer la téléopération coûteuse par du pré-entraînement vidéo massif tout en surpassant les architectures VLM et VLA traditionnelles.

Highlights

  • Les modèles fondateurs incarnés unifiés permettent de diviser par 10 le besoin en données de téléopération robotique en augmentant d'un facteur 10 le pré-entraînement vidéo général.

  • La modélisation conjointe perception et contrôle surpasse Gemini Embodied Reasoning tout en réduisant les coûts de traitement d'un facteur 15.

  • L'architecture de mélange d'experts à données dispersées permet d'obtenir un taux de compression spatiale des tokens allant jusqu'à 10x sans perte de précision sémantique.

  • L'entraînement du modèle fondateur Mark 1 s'appuie sur un pétaoctet de données hétérogènes regroupant texte, vidéo, images et trajectoires d'action.

  • Le coût de la téléopération s'élève à environ 100 $ par heure de données collectées, ce qui rend l'apprentissage direct sur vidéo pré-entraînée nettement plus économique.

Timeline

Vers des modèles fondateurs incarnés unifiés

  • L'IA physique nécessite le dépassement de la séparation stricte entre VLM, VLA et modèles de monde.
  • Un modèle fondateur incarné intègre la perception, le raisonnement spatial et le contrôle au sein d'une seule architecture.
  • La fusion précoce des modalités sensorielles résout la fragmentation des représentations classiques.

Les architectures VLM conventionnelles se limitent à produire du texte à partir d'images ou de vidéos, tandis que les VLA étendent les sorties aux actions sans unifier la perception. Les tentatives de passage par des modèles de monde séparés manquent d'efficacité. La fusion précoce de l'ensemble des flux sensoriels dès l'entrée permet de construire une représentation sémantique globale exploitable directement pour le contrôle.

Défis de densité et saturation du contexte vidéo

  • L'entraînement sur vidéo brute souffre d'un signal de perte calculé sur à peine 0,2 % des tokens visuels.
  • La prédiction de pixels à 100 % attribue la même valeur attentionnelle au fond de la scène qu'aux points de contact du robot.
  • L'apprentissage automatique d'objectifs perceptifs ciblés remplace le codage manuel des points d'intérêt.

Traiter une heure de vidéo brute injecte un million de tokens visuels très dispersés. Tenter de prédire chaque pixel gaspille la capacité de calcul sur des détails d'arrière-plan irrelevants au lieu de se concentrer sur les lois de la physique ou l'extrémité des pinces robotiques. L'identification automatique de percepts utiles fournit un signal d'entraînement dense sans étiquetage synthétique coûteux.

Mélange d'experts à données dispersées pour la compression

  • Un routeur intégré sélectionne de manière dynamique les tokens visuels à traiter ou à ignorer.
  • L'allocation du calcul s'adapte automatiquement à la nature de la tâche demandée.
  • La compression par moyenne de patchs atteint un taux de 10x comme baseline d'architecture.

Plutôt que d'imposer des règles rigides de traitement, le modèle apprend à allouer son attention selon la requête. Sur une tâche de segmentation, le calcul se concentre sur les objets pertinents, tandis qu'une question générale génère une carte d'attention globale. Ce système de routage à données dispersées s'exécute à coût quasi nul à travers les couches.

Performances du modèle Mark 1 et approches agentiques

  • Le modèle Mark 1 traite les tâches de vision informatique classiques comme des séquences d'actions agentiques.
  • L'entraînement s'appuie sur un pétaoctet de données combinant sessions de jeu, navigation bureau et vidéos web.
  • Le découpage en tuiles et la modification dynamique du contraste sont décidés en autonomie par le modèle.

Au lieu d'appliquer des boîtes englobantes classiques, le modèle aborde la détection visuelle complexes en écrivant du code pour recadrer ou ajuster les images. Cette approche agentique permet d'identifier des objets masqués indétectables par les systèmes traditionnels. L'exécution de ces tâches s'effectue pour une fraction du coût des grands modèles comme Gemini 3.1 Pro.

Lois d'échelle et substitution des données de téléopération

  • Augmenter le pré-entraînement vidéo permet de réduire de 90 % le besoin en données de téléopération robotique.
  • La téléopération coûte environ 100 $ par heure contre un coût négligeable pour la collecte vidéo massive.
  • L'unification perception-contrôle apporte une robustesse accrue face aux variations d'éclairage et d'arrière-plan.

Les modèles VLA classiques plafonnent rapidement en fonction des données de téléopération disponibles. L'architecture unifiée débloque une nouvelle loi d'échelle où 10 fois plus de vidéo générale compense 10 fois moins d'heures de contrôle humain. La modélisation conjointe empêche également les politiques robotiques d'échouer lors d'un simple changement de décor ou de luminosité.

Gestion du contexte temporel et réponses aux questions

  • La distinction spatiale gauche-droite s'obtient par la structuration des distributions de données de pré-entraînement.
  • L'augmentation de données en ligne simule des pannes de capteurs et des variations de lumière du soleil.
  • Les modèles fondateurs permettent une extraction d'informations structurées sans ontologie rigide.

La gestion de la vidéo à haut débit de trames remplit rapidement une fenêtre de contexte d'un million de tokens. L'arbitrage entre images clés et images de différence préserve la mémoire contextuelle. L'entraînement inclut des simulations de défaillance de caméra pour garantir la continuité du contrôle en conditions réelles.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video