De VLMs/VLAs a Agentes Incorporados — Armen Aghajanyan, Perceptron AI

AAI Engineer
Computing/Software

Transcript

00:00:00É, acho que vamos começar. Eu sou o Armin, cofundador e CEO da Perceptron.
00:00:20Vamos falar um pouco sobre o que fazemos, mas o que mais quero abordar hoje é
00:00:25a nossa postura de pesquisa: queremos se afastar das distinções entre VLMs, VLAs,
00:00:32modelos de mundo ou como quiser chamar, para algo que chamamos de modelos base incorporados.
00:00:42Especificamente, o que fazemos na Perceptron, nosso objetivo principal, é conseguir
00:00:48construir bases de IA física que nos deem a capacidade de perceber, entender e interagir
00:00:53com o mundo físico em tempo real. Nossa grande missão é unir o
00:00:58mundo físico e o digital. No fundo, nosso objetivo é estar presente onde houver um dispositivo,
00:01:07um instrumento, um robô, uma câmera ou sensor, fornecendo inteligência a ele.
00:01:14Especificamente, quando falamos sobre esse paradigma de conseguir perceber, raciocinar
00:01:19e agir, vemos isso como uma unificação da modelagem multimodal tradicional.
00:01:25Eu vim da FAIR. Fiquei lá por seis anos e meu foco era tentar descobrir como
00:01:31escalar fórmulas para modelos multimodais. Uma das primeiras coisas em que começamos a trabalhar,
00:01:37e publicamos muito nessa área, foi a fusão precoce. É o conceito de integrar
00:01:41todas essas modalidades o quanto antes. A real complexidade aí é descobrir qual é
00:01:47a maneira correta de representar adequadamente todas as diferentes modalidades, tanto na entrada quanto
00:01:52na saída que você deseja representar de forma holística. E os VLMs se tornaram o...
00:01:58quando falo de modelos multimodais, você provavelmente pensa em VLMs. É a capacidade de receber
00:02:03imagem, vídeo e texto e conseguir gerar texto como saída, essencialmente. E há variações disso.
00:02:09Existem modelos como os ER, os modelos de raciocínio incorporado, que conseguem gerar
00:02:15pontos de ancoragem e ter uma compreensão ou raciocínio espacial um pouco melhor.
00:02:20Depois temos coisas como VLAs, que estendem o domínio de saída além do texto,
00:02:25incluindo ações. E esses continuam sendo construídos sobre estruturas padrão de VLM,
00:02:30embora tenha havido alguns esforços para migrar
00:02:35dos VLMs para coisas como modelos de mundo ou modelos de ação do mundo, mas nada muito
00:02:39promissor até agora. Aí entramos em variantes mais interessantes e complexas de modelos
00:02:46multimodais, como modelos de mundo, onde você gera vídeo a partir de entradas,
00:02:51que podem ser imagem, vídeo ou até imagem, vídeo e ações. O último ponto que quero
00:02:57mencionar é algo recente, os chamados modelos de mundo semânticos, nos quais você não gera nada,
00:03:02mas aprende um tipo de representação útil para o futuro. O que vemos como
00:03:08um modelo base incorporado é uma estrutura que permite fazer a percepção
00:03:13padrão, o raciocínio incorporado e o objetivo final de controle, tudo em um único modelo.
00:03:20Conseguindo raciocinar entre diferentes modalidades de sensores na entrada e realizar
00:03:25a maior parte do que mencionei na saída, tudo em um modelo único e unificado.
00:03:31Rapidamente, vou falar sobre dois desafios. São desafios fundamentais
00:03:35de pesquisa que enfrentamos, e vou abordar como nossa empresa lidou com isso
00:03:40e o que outras pessoas também estão fazendo.
00:03:43A primeira coisa é pensar puramente em tentar modelar algo como vídeo,
00:03:48como uma hora de vídeo. Dependendo da representação, você pode ter algo como
00:03:52um milhão de tokens visuais de entrada. A verdade é que não existe uma referência real
00:03:57que você possa usar de forma eficaz, certo? Você pode fazer coisas, como já fizeram,
00:04:02extrair transcrições, prevê-las a partir do vídeo ou rotular quadros
00:04:08sinteticamente e fazer perguntas. No fim, isso se mostra um desperdício gigante,
00:04:13certo? Pense no que entra no modelo: um milhão de tokens
00:04:16e você calcula a perda em cerca de 0,2% de todos esses tokens
00:04:22inseridos. Isso é fundamentalmente problemático. E a verdade é que, de qualquer forma
00:04:27que tente corrigir isso, você injeta um sinal de treinamento incorreto.
00:04:31Ou o sinal é escasso demais, sintético demais ou indiscriminado. Indo além
00:04:37do enriquecimento sintético, tentaram prever cada pixel. É um sinal
00:04:42muito denso, mas que aloca a atenção de forma ruim. Afinal,
00:04:47trata-se um pixel de fundo com o mesmo grau de importância dado à ponta
00:04:51de uma garra, aos pontos de contato, a falhas específicas ou à física.
00:04:56O que fazemos na Perceptron, e esta é parte da nossa PI principal,
00:05:01é pensar: como é um objetivo perceptivo natural? Como posso
00:05:06prever as percepções que importarão no futuro de forma automática? Por exemplo,
00:05:11em um braço robótico, a ponta das garras é uma percepção muito útil
00:05:16para prever no futuro. Pessoas começaram a fazer isso, como a equipe do MOMO Act
00:05:20da AI2, além de outros VLAs. Mas isso ainda é uma percepção fixa.
00:05:26A questão é: é possível achar um jeito automático do modelo aprender
00:05:30esse objetivo único de forma semântica? E a verdade é que descobrimos um jeito.
00:05:37Não vamos divulgar o método aqui, mas é uma pista de como abordamos
00:05:41o problema da escassez. O segundo problema central em que focamos muito
00:05:49é o inchaço de contexto. Com câmeras ligadas o tempo todo ou robôs que não
00:05:54param, é preciso raciocinar sobre uma quantidade enorme de tokens.
00:06:01O texto é denso e o vídeo é escasso. A questão é: existem avanços
00:06:08arquitetônicos para lidar com esse problema nativamente, em vez de tentar
00:06:13corrigir esse desequilíbrio de forma sintética?
00:06:20Há algumas coisas a fazer. Um princípio básico é que você precisa
00:06:25treinar modalidades diferentes de formas totalmente distintas. Não dá para tratar tokens de texto,
00:06:31imagem, áudio ou vídeo da mesma maneira. Algo que se pode começar a fazer
00:06:36é focar na compressão espacial ou de tokens. As pessoas fazem coisas bem simples,
00:06:41nós mesmos começamos assim, e funciona. Você pode calcular a média
00:06:44das representações por blocos em um vídeo ou imagem. Dá para obter taxas
00:06:51de compressão interessantes, de até 10x. Mas ainda é uma solução improvisada
00:06:57e faltam métodos arquitetônicos consagrados para resolver isso. Nos últimos meses,
00:07:04lançamos a nossa abordagem para lidar com variados graus de escassez:
00:07:10deixar o modelo decidir em quais tokens deve ou não focar.
00:07:14Publicamos nosso artigo sobre a mistura de especialistas com escassez de dados, que permite exatamente isso.
00:07:19Isso permite que o modelo — com um roteador interno — consiga prever
00:07:24qual token inserir e qual ignorar, fazendo isso quase sem custo adicional
00:07:30em todas as camadas. E se você simplesmente deixar o modelo aprender,
00:07:36sem impor restrições arquitetônicas rígidas, ele realmente aprende.
00:07:43Ao visualizar o processamento de dados escassos dos modelos, nota-se que eles
00:07:49aprendem sozinhos a focar em informações densas ou relevantes para a tarefa.
00:07:56No canto superior direito, vê-se que o modelo decide focar no gráfico,
00:08:00onde um humano também focaria, por ser o elemento interessante
00:08:05na imagem. E a alocação dependente da tarefa também acaba acontecendo.
00:08:13No canto inferior esquerdo, ao fazer uma pergunta genérica,
00:08:18vê-se um gráfico de atenção espalhado por toda a imagem. O modelo não sabe
00:08:22como alocar o processamento. Mas se você pedir para segmentar todas
00:08:27as frutas, ele alocará mais tokens para o que considera serem tokens de fruta.
00:08:31É um truque inteligente que usamos e publicamos, e que outros começam a usar,
00:08:36incorporando prioridades na arquitetura para lidar com o desequilíbrio de escassez
00:08:43das modalidades, sem limitar o aprendizado nativo dos modelos.
00:08:49Unindo tudo isso — talvez vocês tenham visto o anúncio — lançamos nosso modelo,
00:08:57considerado por nós o primeiro modelo base incorporado, há algumas semanas.
00:09:03Ele está no estado da arte em relação ao Gemini 3.1 Pro.
00:09:09Supera o Gemini Embodied Reasoning e é cerca de 15 vezes mais barato.
00:09:15Ele foi treinado neste conjunto de dados de um petabyte, coletado de praticamente
00:09:20tudo: de varreduras da internet a fórmulas próprias de treinamento intermediário e sintético.
00:09:28Temos esse petabyte de dados em texto, imagens, vídeos e trajetórias,
00:09:34que podem ser bem gerais: uso do computador ou partidas de videogame.
00:09:41Ao fazer isso, propriedades muito interessantes começam a emergir.
00:09:46A principal delas, óbvia em retrospectiva, é considerar tarefas
00:09:50é que você pode começar a pensar nas tarefas clássicas de visão computacional como tarefas de agente. E assim,
00:09:57neste caso, nós reformulamos a detecção como uma tarefa de agente. Então nosso modelo pode, sabe,
00:10:02escrever código. Ele pode pedir para dar zoom em partes específicas. Pode alterar o contraste. E você
00:10:09pode ver aqui, este é um problema muito difícil. Acho que há um subreddit inteiro no Reddit dedicado a esses
00:10:14problemas de tentar encontrar objetos muito difíceis em imagens. E nossos modelos fazem isso muito
00:10:19bem. Mas eles fazem isso no sentido de um agente. Não é a forma clássica de, sabe, detectar esta única
00:10:24caixa. É o próprio modelo decidindo que precisa dividir as coisas em blocos. Ele precisa alterar o
00:10:28contraste. Ele propõe uma caixa aqui. Acho que aqui ele, sim, aumenta o contraste e consegue encontrar o pássaro.
00:10:36Então, novamente, algo muito difícil de fazer, mesmo para um humano, e humanos são muito bons em tarefas perceptivas,
00:10:42isso é algo relativamente difícil de fazer. E tudo isso vem de simplesmente ter
00:10:46modelos incorporados nativamente que realmente entendem como olhar para diferentes modalidades.
00:10:51E prosseguindo, como isso se relaciona com a postura geral da IA física em relação à robótica?
00:10:57Bom, eu meio que peguei este slide do pessoal do GDM. E algo que estamos começando a ver nos sistemas
00:11:04agênticos de robótica é essa separação entre o que chamamos de modelos de raciocínio incorporado ou
00:11:11orquestradores e modelos de política tátil. Então você pode pensar em problemas como, sabe,
00:11:17se eu estou fazendo café e isso leva três minutos, uma coisa que posso fazer
00:11:21é tentar forçar todo o meu VLA a descobrir como fazer essa tarefa individual. Ou o que posso
00:11:26fazer é ter um modelo orquestrador que divide essas tarefas em subtarefas. E há uma política de controle
00:11:31tátil rodando por cima. E existe um espectro completo entre, sabe, apenas VLA completo
00:11:36até esse tipo de sistema agêntico. Mas o principal ponto que estou tentando destacar é que
00:11:41o raciocínio incorporado é, na verdade, um problema muito interessante e complexo que ainda não foi resolvido.
00:11:46Dito isso, nossos modelos continuam sendo de ponta em raciocínio incorporado.
00:11:50E por serem de ponta, começamos a ver coisas realmente incríveis que não tínhamos visto antes.
00:11:55Aqui está um exemplo concreto de anotação de dados robóticos muito complexa e egocêntrica -- bem, não
00:11:59egocêntrica, mas anotação de dados robóticos. E dá para ver aqui o modelo pulando de um ponto a outro,
00:12:04olhando para diferentes partes do vídeo, sabe, cortando, descobrindo se
00:12:09as legendas estão corretas ou não, fazendo autoverificação. E podemos fazer tudo isso porque os modelos AR são rápidos.
00:12:15Eles são significativamente mais baratos do que qualquer outra coisa no mercado. Se você tentasse fazer isso com o Gemini,
00:12:20este vídeo provavelmente custaria um par de dólares, enquanto para nós custa centavos.
00:12:24E tudo isso surge de sermos capazes de ter essas capacidades de ponta de raciocínio incorporado
00:12:29que simplesmente não tínhamos visto em outros modelos antes.
00:12:37Certo, agora vou compartilhar provavelmente o maior avanço de pesquisa que tivemos, e acho que
00:12:41compartilharemos mais sobre isso nas próximas semanas, provavelmente no Twitter. Mas descobrimos
00:12:48novas leis de escala para modelos fundamentais incorporados. São modelos, novamente, em que você
00:12:53pode fazer treinamento baseado em controle, treinamento de trajetória, treinamento perceptivo
00:12:59e treinamento de raciocínio incorporado de forma conjunta. Se você descobrir a maneira certa de misturar tudo isso
00:13:03e os objetivos certos a utilizar, você começa a ver alavancas muito interessantes que
00:13:08talvez antes não fosse capaz de ver.
00:13:11A alavanca concreta de que vou falar é a capacidade de trocar dados gerais de pré-treinamento em vídeo
00:13:19por dados de teleoperação. Como sabemos, dados de teleoperação são muito caros. Na ordem de,
00:13:25sabe, US$ 100 por hora de dados. Com US$ 100, posso coletar significativamente mais dados de pré-treinamento em vídeo.
00:13:32E o que este gráfico mostra é que, se você está treinando apenas VLAs puros, políticas puras, há uma
00:13:39faixa em que você fica preso. Você ainda tem leis de escala, então obtém benefícios com mais e
00:13:43mais dados de teleoperação. Dito isso, os benefícios não são tão substanciais quanto seriam se você estivesse realmente treinando
00:13:48esses modelos fundamentais incorporados unificados. E é isso que representa a metade inferior do gráfico.
00:13:55E a alavanca realmente incrível que obtemos é que você pode essencialmente usar 10 vezes menos dados de teleoperação se
00:14:03tiver 10 vezes mais dados de pré-treinamento em vídeo. E até agora, isso tem se mantido para a quantidade de capacidade computacional
00:14:09que nossa empresa possui. E continuaremos a expandir os limites de até onde é possível levar esses modelos
00:14:16fundamentais incorporados. Aqui estão alguns vídeos de uma política em que esperamos disponibilizar em código aberto um
00:14:28dos modelos menores em algumas semanas. Mas tudo isso roda nativamente em um único modelo
00:14:33que é capaz de fazer o raciocínio incorporado para compreender a tarefa. Na verdade, ele está
00:14:38gerando tokens de controle. Dá para ver que está um pouco trêmulo, mas tudo bem. Com sorte,
00:14:43será resolvido em escala. E você pode ver tarefas muito complexas que antes, acho,
00:14:48seriam bem difíceis para VLAs puros realizarem. Então, se você olhar o vídeo à direita, isso
00:14:54exige que o modelo leia o título do livro, saiba que tipo de livro
00:14:58é esse e, depois, aloque-o adequadamente em uma das caixas. Essa é uma tarefa de várias etapas
00:15:04entre percepção e controle que é muito difícil de fazer se você tiver um modelo de controle puramente de ponta a ponta
00:15:09que não tem ciência das diferentes tarefas perceptivas que precisa realizar para cumprir essa tarefa.
00:15:23É bem legal. Também funciona de forma zero-shot relativamente bem logo de cara. Estamos ansiosos para colocar isso nas mãos
00:15:28do pessoal em algumas semanas, em algum momento de julho.
00:15:33É. Vou deixar alguns minutos para perguntas gerais, mas se vocês tiverem interesse, vamos nos conectar.
00:15:41Uma coisa legal que fazemos na empresa é que, para um grupo limitado de parceiros, damos acesso aos pesos do nosso Mark 1.
00:15:47Damos acesso aos pesos dos nossos modelos fundamentais incorporados maiores. Então me envie um e-mail, me chame na DM do Twitter, o que for mais fácil.
00:15:58E aí, sim, vou abrir. Restam alguns minutos para perguntas.
00:16:02Obrigado.
00:16:03Obrigado.
00:16:05Obrigado.
00:16:05Obrigado.
00:16:09Obrigado.
00:16:11Obrigado.
00:16:13Obrigado.
00:16:24É, acho que... sim, a pergunta é: como conseguimos dominar a compreensão temporal nesse nível?
00:16:31É uma boa pergunta. Para ser sincero, não está totalmente dominado. Ainda há muito trabalho para chegar a um ponto de implantação confiável.
00:16:37A questão central é: como pensar sobre o gerenciamento de contexto? O contexto é relativamente limitado. Acho que os modelos aqui têm 1 milhão de contexto, mas isso é fácil de preencher com vídeo em alto FPS.
00:17:06Então você começa a pensar: existem coisas interessantes a se fazer? Vou dar um exemplo. Fazíamos isso, mas superamos, tipo: como penso sobre quadros-chave versus quadros delta?
00:17:19Como posso gerenciar meu contexto ajustando esses dois? Aí você começa a pensar, no seu objetivo de pré-treinamento, em como ingerir nativamente coisas que serão úteis para as tarefas robóticas.
00:17:32Por exemplo, algo bem básico que até os modelos do Gemini tinham dificuldade — acho que os novos são muito bons —, que é reconhecer direções e posições.
00:17:40Coisas como esquerda e direita são muito difíceis de identificar em varreduras na internet, pois ninguém na internet rotula coisas como “este objeto está à esquerda deste objeto” ou “está abaixo deste objeto”.
00:17:51Então, pensar na distribuição dos dados desde o início te dá essa capacidade de forma rápida. E o ER, esse raciocínio corporificado, foi um foco bem concreto nosso, e é por isso que superamos o Gemini ER com menos computação.
00:18:07A robustez mais legal que vimos é especificamente para modelos VLA. Por exemplo, se você pegar um dos modelos chineses
00:18:35e tentar ajustá-lo para uma política específica, se mudar o fundo da... sei lá, até da mesa, se mudar o fundo da mesa, a política vai falhar.
00:18:47O mais interessante é que, se você fizer essa modelagem conjunta de percepção e controle, fica muito mais robusto a esse tipo de erro ou a variações de iluminação.
00:18:56Enxergamos isso principalmente como uma robustez de fundo que os modelos tradicionais não têm necessariamente.
00:19:03Dito isso, não vou exagerar nas promessas, porque ainda é algo relativamente difícil.
00:19:07Se eu fosse apontar uma lanterna para um dos braços, provavelmente não funcionaria.
00:19:12Mas conseguir modelar essas coisas de forma conjunta ajuda significativamente.
00:19:16Também fazemos muita aumentação online, então simulamos, por exemplo, a câmera de um dos braços desligada, sabe?
00:19:27Simulamos a luz do sol vindo de uma determinada direção, entende?
00:19:31Fazemos essas coisas durante o treinamento para aumentar a robustez.
00:19:35Mas os grandes ganhos vêm de adotar esse paradigma de fusão precoce e aplicá-lo ao domínio da robótica.
00:19:43Legal.
00:19:44.
00:19:50Ah, bases de conhecimento?
00:19:52É útil para... bom, se você quiser legendar imagens e vídeos, funciona super bem.
00:19:57Trabalhamos com parceiros de robótica para anotações egocêntricas bem complexas assim.
00:20:02Então não é necessariamente criar uma ontologia, mas fazer uma extração estruturada bem profunda,
00:20:07e acho que os nossos modelos são muito bons nisso.
00:20:10É.
00:20:11A propósito, tudo o que mostrei aqui usa APIs públicas, então vocês podem testar.
00:20:15Os benchmarks são públicos.
00:20:17Acho que meu tempo acabou.
00:20:19Estão me cortando, então posso conversar com vocês lá fora.
00:20:22Mas obrigado, pessoal.
00:20:27Obrigado.

Key Takeaway

A substituição de modelos isolados por modelos base incorporados unificados permite reduzir em 10 vezes os caros dados de teleoperação robótica e supera sistemas como o Gemini 3.1 Pro a um custo 15 vezes menor.

Highlights

  • Modelos base incorporados unificam percepção, raciocínio espacial e controle em uma única arquitetura neural.

  • Avaliar um milhão de tokens de vídeo gerando perda em apenas 0,2% do total de entradas causa desperdício e injeta sinais de treinamento incorretos.

  • O uso de uma Mistura de Especialistas (MoE) com escassez de dados permite ao roteador interno selecionar quais tokens processar ou ignorar sem custo adicional por camada.

  • O modelo Mark 1 supera o Gemini 3.1 Pro em raciocínio incorporado e opera com um custo aproximadamente 15 vezes menor.

  • Aumentar em 10 vezes os dados de pré-treinamento em vídeo reduz em 10 vezes a necessidade de dados de teleoperação, que custam cerca de 100 dólares por hora.

  • A modelagem conjunta de percepção e controle aumenta a robustez do robô contra variações de iluminação e alterações no fundo do ambiente.

Timeline

Unificação de modelos multimodais em sistemas incorporados

  • A fusão precoce integra múltiplas modalidades de entrada e saída no início do processamento do modelo.
  • Arquiteturas tradicionais dividem-se entre VLMs focados em texto, VLAs com emissão de ações e modelos de mundo focados em geração de vídeo.
  • Modelos base incorporados realizam percepção, raciocínio e controle de robôs dentro de uma estrutura única.

A criação de inteligência física para dispositivos e sensores exige superar as divisões entre modelos de visão e linguagem (VLMs) e modelos de ação (VLAs). Integrar representações de texto, vídeo, imagens e sinais de controle desde o início resolve a fragmentação do raciocínio espacial. Essa abordagem unificada permite que o mesmo modelo perceba o ambiente, planeje etapas e execute o controle motor direto.

Desafios de escassez de sinal e inchaço de contexto em vídeo

  • Calcular a perda em apenas 0,2% dos tokens visuais de entrada gera um sinal de treinamento ineficiente e escasso.
  • Prever pixels individuais aloca atenção de forma inadequada ao tratar fundo e pontos de contato físico com o mesmo grau de importância.
  • O aprendizado automático de objetivos perceptivos futuros foca o processamento nas partes do robô que interagem com o mundo.

Vídeos longos de câmeras robóticas geram milhões de tokens, mas a maioria das abordagens de treinamento desperdiça computação. Extrair transcrições ou rotular quadros sinteticamente cria ruído, enquanto a previsão densa de cada pixel ignora a física da interação. Treinar o modelo para prever automaticamente os pontos de interesse futuros, como a ponta da garra de um braço robótico, resolve a escassez do sinal de supervisão.

Aumento de eficiência com Mistura de Especialistas e alocação de tokens

  • A compressão espacial por blocos reduz até 10 vezes o volume de tokens visuais, mas funciona apenas como solução temporária.
  • Mecanismos de roteamento interno em modelos MoE permitem descartar tokens irrelevantes quase sem custo computacional adicional.
  • Instruções específicas fazem o modelo alocar dinamicamente mais capacidade de processamento para os objetos relevantes da tarefa.

Texto é denso, enquanto vídeo é escasso e satura rapidamente a janela de contexto. Em vez de impor restrições arquitetônicas rígidas, uma Mistura de Especialistas (MoE) com escassez de dados permite que o próprio sistema escolha onde aplicar atenção. Diante de perguntas genéricas, o mapa de atenção distribui-se pela imagem inteira; ao solicitar a segmentação de objetos específicos, o roteador direciona automaticamente mais tokens para os alvos selecionados.

Desempenho do modelo Mark 1 em tarefas de raciocínio e agentes

  • O modelo Mark 1 atinge o estado da arte em relação ao Gemini 3.1 Pro gastando 15 vezes menos computação.
  • Reformular tarefas clássicas de visão computacional permite ao modelo agir como um agente que altera contraste e recorta imagens para encontrar objetos.
  • A orquestração agêntica divide tarefas complexas em etapas menores antes de acionar políticas de controle tátil.

Treinado em um conjunto de dados de um petabyte contendo texto, imagens, vídeos e trajetórias, o modelo desenvolveu capacidades avançadas de raciocínio espacial. Em testes difíceis de detecção visual, o sistema escreve código para dar zoom e ajustar a imagem por conta própria até localizar o alvo. Em fluxos de anotação de dados robóticos, essa velocidade e baixo custo viabilizam a autoverificação de vídeos por uma fração do preço dos modelos concorrentes.

Leis de escala e transferência entre vídeo e teleoperação

  • Dados de pré-treinamento em vídeo geral podem substituir dados caros de teleoperação robótica na proporção de 10 para 1.
  • Modelos unificados realizam tarefas perceptivas e de controle de várias etapas, como ler títulos de livros e organizá-los nas caixas corretas.
  • O treinamento conjunto com aumentações online impede que variações na mesa ou na iluminação causem falhas na execução.

Coletar dados de teleoperação custa aproximadamente 100 dólares por hora, criando um gargalo para o ajuste de robôs. Novas leis de escala provam que acumular dez vezes mais vídeos gerais de pré-treinamento reduz a necessidade de dados de teleoperação na mesma proporção. Essa base ampla permite ao robô executar instruções em várias etapas e manter a estabilidade operacional mesmo quando cenários, luzes e fundos mudam drasticamente.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video