Transcript
00:00:00É, acho que vamos começar. Eu sou o Armin, cofundador e CEO da Perceptron.
00:00:20Vamos falar um pouco sobre o que fazemos, mas o que mais quero abordar hoje é
00:00:25a nossa postura de pesquisa: queremos se afastar das distinções entre VLMs, VLAs,
00:00:32modelos de mundo ou como quiser chamar, para algo que chamamos de modelos base incorporados.
00:00:42Especificamente, o que fazemos na Perceptron, nosso objetivo principal, é conseguir
00:00:48construir bases de IA física que nos deem a capacidade de perceber, entender e interagir
00:00:53com o mundo físico em tempo real. Nossa grande missão é unir o
00:00:58mundo físico e o digital. No fundo, nosso objetivo é estar presente onde houver um dispositivo,
00:01:07um instrumento, um robô, uma câmera ou sensor, fornecendo inteligência a ele.
00:01:14Especificamente, quando falamos sobre esse paradigma de conseguir perceber, raciocinar
00:01:19e agir, vemos isso como uma unificação da modelagem multimodal tradicional.
00:01:25Eu vim da FAIR. Fiquei lá por seis anos e meu foco era tentar descobrir como
00:01:31escalar fórmulas para modelos multimodais. Uma das primeiras coisas em que começamos a trabalhar,
00:01:37e publicamos muito nessa área, foi a fusão precoce. É o conceito de integrar
00:01:41todas essas modalidades o quanto antes. A real complexidade aí é descobrir qual é
00:01:47a maneira correta de representar adequadamente todas as diferentes modalidades, tanto na entrada quanto
00:01:52na saída que você deseja representar de forma holística. E os VLMs se tornaram o...
00:01:58quando falo de modelos multimodais, você provavelmente pensa em VLMs. É a capacidade de receber
00:02:03imagem, vídeo e texto e conseguir gerar texto como saída, essencialmente. E há variações disso.
00:02:09Existem modelos como os ER, os modelos de raciocínio incorporado, que conseguem gerar
00:02:15pontos de ancoragem e ter uma compreensão ou raciocínio espacial um pouco melhor.
00:02:20Depois temos coisas como VLAs, que estendem o domínio de saída além do texto,
00:02:25incluindo ações. E esses continuam sendo construídos sobre estruturas padrão de VLM,
00:02:30embora tenha havido alguns esforços para migrar
00:02:35dos VLMs para coisas como modelos de mundo ou modelos de ação do mundo, mas nada muito
00:02:39promissor até agora. Aí entramos em variantes mais interessantes e complexas de modelos
00:02:46multimodais, como modelos de mundo, onde você gera vídeo a partir de entradas,
00:02:51que podem ser imagem, vídeo ou até imagem, vídeo e ações. O último ponto que quero
00:02:57mencionar é algo recente, os chamados modelos de mundo semânticos, nos quais você não gera nada,
00:03:02mas aprende um tipo de representação útil para o futuro. O que vemos como
00:03:08um modelo base incorporado é uma estrutura que permite fazer a percepção
00:03:13padrão, o raciocínio incorporado e o objetivo final de controle, tudo em um único modelo.
00:03:20Conseguindo raciocinar entre diferentes modalidades de sensores na entrada e realizar
00:03:25a maior parte do que mencionei na saída, tudo em um modelo único e unificado.
00:03:31Rapidamente, vou falar sobre dois desafios. São desafios fundamentais
00:03:35de pesquisa que enfrentamos, e vou abordar como nossa empresa lidou com isso
00:03:40e o que outras pessoas também estão fazendo.
00:03:43A primeira coisa é pensar puramente em tentar modelar algo como vídeo,
00:03:48como uma hora de vídeo. Dependendo da representação, você pode ter algo como
00:03:52um milhão de tokens visuais de entrada. A verdade é que não existe uma referência real
00:03:57que você possa usar de forma eficaz, certo? Você pode fazer coisas, como já fizeram,
00:04:02extrair transcrições, prevê-las a partir do vídeo ou rotular quadros
00:04:08sinteticamente e fazer perguntas. No fim, isso se mostra um desperdício gigante,
00:04:13certo? Pense no que entra no modelo: um milhão de tokens
00:04:16e você calcula a perda em cerca de 0,2% de todos esses tokens
00:04:22inseridos. Isso é fundamentalmente problemático. E a verdade é que, de qualquer forma
00:04:27que tente corrigir isso, você injeta um sinal de treinamento incorreto.
00:04:31Ou o sinal é escasso demais, sintético demais ou indiscriminado. Indo além
00:04:37do enriquecimento sintético, tentaram prever cada pixel. É um sinal
00:04:42muito denso, mas que aloca a atenção de forma ruim. Afinal,
00:04:47trata-se um pixel de fundo com o mesmo grau de importância dado à ponta
00:04:51de uma garra, aos pontos de contato, a falhas específicas ou à física.
00:04:56O que fazemos na Perceptron, e esta é parte da nossa PI principal,
00:05:01é pensar: como é um objetivo perceptivo natural? Como posso
00:05:06prever as percepções que importarão no futuro de forma automática? Por exemplo,
00:05:11em um braço robótico, a ponta das garras é uma percepção muito útil
00:05:16para prever no futuro. Pessoas começaram a fazer isso, como a equipe do MOMO Act
00:05:20da AI2, além de outros VLAs. Mas isso ainda é uma percepção fixa.
00:05:26A questão é: é possível achar um jeito automático do modelo aprender
00:05:30esse objetivo único de forma semântica? E a verdade é que descobrimos um jeito.
00:05:37Não vamos divulgar o método aqui, mas é uma pista de como abordamos
00:05:41o problema da escassez. O segundo problema central em que focamos muito
00:05:49é o inchaço de contexto. Com câmeras ligadas o tempo todo ou robôs que não
00:05:54param, é preciso raciocinar sobre uma quantidade enorme de tokens.
00:06:01O texto é denso e o vídeo é escasso. A questão é: existem avanços
00:06:08arquitetônicos para lidar com esse problema nativamente, em vez de tentar
00:06:13corrigir esse desequilíbrio de forma sintética?
00:06:20Há algumas coisas a fazer. Um princípio básico é que você precisa
00:06:25treinar modalidades diferentes de formas totalmente distintas. Não dá para tratar tokens de texto,
00:06:31imagem, áudio ou vídeo da mesma maneira. Algo que se pode começar a fazer
00:06:36é focar na compressão espacial ou de tokens. As pessoas fazem coisas bem simples,
00:06:41nós mesmos começamos assim, e funciona. Você pode calcular a média
00:06:44das representações por blocos em um vídeo ou imagem. Dá para obter taxas
00:06:51de compressão interessantes, de até 10x. Mas ainda é uma solução improvisada
00:06:57e faltam métodos arquitetônicos consagrados para resolver isso. Nos últimos meses,
00:07:04lançamos a nossa abordagem para lidar com variados graus de escassez:
00:07:10deixar o modelo decidir em quais tokens deve ou não focar.
00:07:14Publicamos nosso artigo sobre a mistura de especialistas com escassez de dados, que permite exatamente isso.
00:07:19Isso permite que o modelo — com um roteador interno — consiga prever
00:07:24qual token inserir e qual ignorar, fazendo isso quase sem custo adicional
00:07:30em todas as camadas. E se você simplesmente deixar o modelo aprender,
00:07:36sem impor restrições arquitetônicas rígidas, ele realmente aprende.
00:07:43Ao visualizar o processamento de dados escassos dos modelos, nota-se que eles
00:07:49aprendem sozinhos a focar em informações densas ou relevantes para a tarefa.
00:07:56No canto superior direito, vê-se que o modelo decide focar no gráfico,
00:08:00onde um humano também focaria, por ser o elemento interessante
00:08:05na imagem. E a alocação dependente da tarefa também acaba acontecendo.
00:08:13No canto inferior esquerdo, ao fazer uma pergunta genérica,
00:08:18vê-se um gráfico de atenção espalhado por toda a imagem. O modelo não sabe
00:08:22como alocar o processamento. Mas se você pedir para segmentar todas
00:08:27as frutas, ele alocará mais tokens para o que considera serem tokens de fruta.
00:08:31É um truque inteligente que usamos e publicamos, e que outros começam a usar,
00:08:36incorporando prioridades na arquitetura para lidar com o desequilíbrio de escassez
00:08:43das modalidades, sem limitar o aprendizado nativo dos modelos.
00:08:49Unindo tudo isso — talvez vocês tenham visto o anúncio — lançamos nosso modelo,
00:08:57considerado por nós o primeiro modelo base incorporado, há algumas semanas.
00:09:03Ele está no estado da arte em relação ao Gemini 3.1 Pro.
00:09:09Supera o Gemini Embodied Reasoning e é cerca de 15 vezes mais barato.
00:09:15Ele foi treinado neste conjunto de dados de um petabyte, coletado de praticamente
00:09:20tudo: de varreduras da internet a fórmulas próprias de treinamento intermediário e sintético.
00:09:28Temos esse petabyte de dados em texto, imagens, vídeos e trajetórias,
00:09:34que podem ser bem gerais: uso do computador ou partidas de videogame.
00:09:41Ao fazer isso, propriedades muito interessantes começam a emergir.
00:09:46A principal delas, óbvia em retrospectiva, é considerar tarefas
00:09:50é que você pode começar a pensar nas tarefas clássicas de visão computacional como tarefas de agente. E assim,
00:09:57neste caso, nós reformulamos a detecção como uma tarefa de agente. Então nosso modelo pode, sabe,
00:10:02escrever código. Ele pode pedir para dar zoom em partes específicas. Pode alterar o contraste. E você
00:10:09pode ver aqui, este é um problema muito difícil. Acho que há um subreddit inteiro no Reddit dedicado a esses
00:10:14problemas de tentar encontrar objetos muito difíceis em imagens. E nossos modelos fazem isso muito
00:10:19bem. Mas eles fazem isso no sentido de um agente. Não é a forma clássica de, sabe, detectar esta única
00:10:24caixa. É o próprio modelo decidindo que precisa dividir as coisas em blocos. Ele precisa alterar o
00:10:28contraste. Ele propõe uma caixa aqui. Acho que aqui ele, sim, aumenta o contraste e consegue encontrar o pássaro.
00:10:36Então, novamente, algo muito difícil de fazer, mesmo para um humano, e humanos são muito bons em tarefas perceptivas,
00:10:42isso é algo relativamente difícil de fazer. E tudo isso vem de simplesmente ter
00:10:46modelos incorporados nativamente que realmente entendem como olhar para diferentes modalidades.
00:10:51E prosseguindo, como isso se relaciona com a postura geral da IA física em relação à robótica?
00:10:57Bom, eu meio que peguei este slide do pessoal do GDM. E algo que estamos começando a ver nos sistemas
00:11:04agênticos de robótica é essa separação entre o que chamamos de modelos de raciocínio incorporado ou
00:11:11orquestradores e modelos de política tátil. Então você pode pensar em problemas como, sabe,
00:11:17se eu estou fazendo café e isso leva três minutos, uma coisa que posso fazer
00:11:21é tentar forçar todo o meu VLA a descobrir como fazer essa tarefa individual. Ou o que posso
00:11:26fazer é ter um modelo orquestrador que divide essas tarefas em subtarefas. E há uma política de controle
00:11:31tátil rodando por cima. E existe um espectro completo entre, sabe, apenas VLA completo
00:11:36até esse tipo de sistema agêntico. Mas o principal ponto que estou tentando destacar é que
00:11:41o raciocínio incorporado é, na verdade, um problema muito interessante e complexo que ainda não foi resolvido.
00:11:46Dito isso, nossos modelos continuam sendo de ponta em raciocínio incorporado.
00:11:50E por serem de ponta, começamos a ver coisas realmente incríveis que não tínhamos visto antes.
00:11:55Aqui está um exemplo concreto de anotação de dados robóticos muito complexa e egocêntrica -- bem, não
00:11:59egocêntrica, mas anotação de dados robóticos. E dá para ver aqui o modelo pulando de um ponto a outro,
00:12:04olhando para diferentes partes do vídeo, sabe, cortando, descobrindo se
00:12:09as legendas estão corretas ou não, fazendo autoverificação. E podemos fazer tudo isso porque os modelos AR são rápidos.
00:12:15Eles são significativamente mais baratos do que qualquer outra coisa no mercado. Se você tentasse fazer isso com o Gemini,
00:12:20este vídeo provavelmente custaria um par de dólares, enquanto para nós custa centavos.
00:12:24E tudo isso surge de sermos capazes de ter essas capacidades de ponta de raciocínio incorporado
00:12:29que simplesmente não tínhamos visto em outros modelos antes.
00:12:37Certo, agora vou compartilhar provavelmente o maior avanço de pesquisa que tivemos, e acho que
00:12:41compartilharemos mais sobre isso nas próximas semanas, provavelmente no Twitter. Mas descobrimos
00:12:48novas leis de escala para modelos fundamentais incorporados. São modelos, novamente, em que você
00:12:53pode fazer treinamento baseado em controle, treinamento de trajetória, treinamento perceptivo
00:12:59e treinamento de raciocínio incorporado de forma conjunta. Se você descobrir a maneira certa de misturar tudo isso
00:13:03e os objetivos certos a utilizar, você começa a ver alavancas muito interessantes que
00:13:08talvez antes não fosse capaz de ver.
00:13:11A alavanca concreta de que vou falar é a capacidade de trocar dados gerais de pré-treinamento em vídeo
00:13:19por dados de teleoperação. Como sabemos, dados de teleoperação são muito caros. Na ordem de,
00:13:25sabe, US$ 100 por hora de dados. Com US$ 100, posso coletar significativamente mais dados de pré-treinamento em vídeo.
00:13:32E o que este gráfico mostra é que, se você está treinando apenas VLAs puros, políticas puras, há uma
00:13:39faixa em que você fica preso. Você ainda tem leis de escala, então obtém benefícios com mais e
00:13:43mais dados de teleoperação. Dito isso, os benefícios não são tão substanciais quanto seriam se você estivesse realmente treinando
00:13:48esses modelos fundamentais incorporados unificados. E é isso que representa a metade inferior do gráfico.
00:13:55E a alavanca realmente incrível que obtemos é que você pode essencialmente usar 10 vezes menos dados de teleoperação se
00:14:03tiver 10 vezes mais dados de pré-treinamento em vídeo. E até agora, isso tem se mantido para a quantidade de capacidade computacional
00:14:09que nossa empresa possui. E continuaremos a expandir os limites de até onde é possível levar esses modelos
00:14:16fundamentais incorporados. Aqui estão alguns vídeos de uma política em que esperamos disponibilizar em código aberto um
00:14:28dos modelos menores em algumas semanas. Mas tudo isso roda nativamente em um único modelo
00:14:33que é capaz de fazer o raciocínio incorporado para compreender a tarefa. Na verdade, ele está
00:14:38gerando tokens de controle. Dá para ver que está um pouco trêmulo, mas tudo bem. Com sorte,
00:14:43será resolvido em escala. E você pode ver tarefas muito complexas que antes, acho,
00:14:48seriam bem difíceis para VLAs puros realizarem. Então, se você olhar o vídeo à direita, isso
00:14:54exige que o modelo leia o título do livro, saiba que tipo de livro
00:14:58é esse e, depois, aloque-o adequadamente em uma das caixas. Essa é uma tarefa de várias etapas
00:15:04entre percepção e controle que é muito difícil de fazer se você tiver um modelo de controle puramente de ponta a ponta
00:15:09que não tem ciência das diferentes tarefas perceptivas que precisa realizar para cumprir essa tarefa.
00:15:23É bem legal. Também funciona de forma zero-shot relativamente bem logo de cara. Estamos ansiosos para colocar isso nas mãos
00:15:28do pessoal em algumas semanas, em algum momento de julho.
00:15:33É. Vou deixar alguns minutos para perguntas gerais, mas se vocês tiverem interesse, vamos nos conectar.
00:15:41Uma coisa legal que fazemos na empresa é que, para um grupo limitado de parceiros, damos acesso aos pesos do nosso Mark 1.
00:15:47Damos acesso aos pesos dos nossos modelos fundamentais incorporados maiores. Então me envie um e-mail, me chame na DM do Twitter, o que for mais fácil.
00:15:58E aí, sim, vou abrir. Restam alguns minutos para perguntas.
00:16:02Obrigado.
00:16:03Obrigado.
00:16:05Obrigado.
00:16:05Obrigado.
00:16:09Obrigado.
00:16:11Obrigado.
00:16:13Obrigado.
00:16:24É, acho que... sim, a pergunta é: como conseguimos dominar a compreensão temporal nesse nível?
00:16:31É uma boa pergunta. Para ser sincero, não está totalmente dominado. Ainda há muito trabalho para chegar a um ponto de implantação confiável.
00:16:37A questão central é: como pensar sobre o gerenciamento de contexto? O contexto é relativamente limitado. Acho que os modelos aqui têm 1 milhão de contexto, mas isso é fácil de preencher com vídeo em alto FPS.
00:17:06Então você começa a pensar: existem coisas interessantes a se fazer? Vou dar um exemplo. Fazíamos isso, mas superamos, tipo: como penso sobre quadros-chave versus quadros delta?
00:17:19Como posso gerenciar meu contexto ajustando esses dois? Aí você começa a pensar, no seu objetivo de pré-treinamento, em como ingerir nativamente coisas que serão úteis para as tarefas robóticas.
00:17:32Por exemplo, algo bem básico que até os modelos do Gemini tinham dificuldade — acho que os novos são muito bons —, que é reconhecer direções e posições.
00:17:40Coisas como esquerda e direita são muito difíceis de identificar em varreduras na internet, pois ninguém na internet rotula coisas como “este objeto está à esquerda deste objeto” ou “está abaixo deste objeto”.
00:17:51Então, pensar na distribuição dos dados desde o início te dá essa capacidade de forma rápida. E o ER, esse raciocínio corporificado, foi um foco bem concreto nosso, e é por isso que superamos o Gemini ER com menos computação.
00:18:07A robustez mais legal que vimos é especificamente para modelos VLA. Por exemplo, se você pegar um dos modelos chineses
00:18:35e tentar ajustá-lo para uma política específica, se mudar o fundo da... sei lá, até da mesa, se mudar o fundo da mesa, a política vai falhar.
00:18:47O mais interessante é que, se você fizer essa modelagem conjunta de percepção e controle, fica muito mais robusto a esse tipo de erro ou a variações de iluminação.
00:18:56Enxergamos isso principalmente como uma robustez de fundo que os modelos tradicionais não têm necessariamente.
00:19:03Dito isso, não vou exagerar nas promessas, porque ainda é algo relativamente difícil.
00:19:07Se eu fosse apontar uma lanterna para um dos braços, provavelmente não funcionaria.
00:19:12Mas conseguir modelar essas coisas de forma conjunta ajuda significativamente.
00:19:16Também fazemos muita aumentação online, então simulamos, por exemplo, a câmera de um dos braços desligada, sabe?
00:19:27Simulamos a luz do sol vindo de uma determinada direção, entende?
00:19:31Fazemos essas coisas durante o treinamento para aumentar a robustez.
00:19:35Mas os grandes ganhos vêm de adotar esse paradigma de fusão precoce e aplicá-lo ao domínio da robótica.
00:19:43Legal.
00:19:44.
00:19:50Ah, bases de conhecimento?
00:19:52É útil para... bom, se você quiser legendar imagens e vídeos, funciona super bem.
00:19:57Trabalhamos com parceiros de robótica para anotações egocêntricas bem complexas assim.
00:20:02Então não é necessariamente criar uma ontologia, mas fazer uma extração estruturada bem profunda,
00:20:07e acho que os nossos modelos são muito bons nisso.
00:20:10É.
00:20:11A propósito, tudo o que mostrei aqui usa APIs públicas, então vocês podem testar.
00:20:15Os benchmarks são públicos.
00:20:17Acho que meu tempo acabou.
00:20:19Estão me cortando, então posso conversar com vocês lá fora.
00:20:22Mas obrigado, pessoal.
00:20:27Obrigado.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video