O Próximo Gargalo da IA Física É Encontrar o Vídeo Certo — Rafael Levi, Bright Data

AAI Engineer
컴퓨터/소프트웨어경제 뉴스AI/미래기술

스크립트

00:00:00Olá a todos, bem-vindos. Aos que vieram realmente para me ver, obrigado. Aos que estão
00:00:21apenas a passar o tempo aqui, também obrigado. Vou tentar entreter-vos e ensinar-vos algo novo.
00:00:26Mais uma vez, o meu nome é Rafael, trabalho na Bright Data, estou na Bright Data há mais de oito anos e, na Bright Data, recolhemos dados e tentamos inovar.
00:00:38Hoje quero falar sobre a descoberta de vídeos para o treino de modelos de mundo agênticos, e já vamos explicar o que isso é.
00:00:48Portanto, o que é preciso hoje para construir um sistema que consiga ver, compreender e agir?
00:00:56Certo? Quero dizer, já percebemos o que é uma IA, estamos constantemente a melhorá-la, isso está mais ou menos resolvido,
00:01:04mas agora a parte difícil é saber que dados lhe fornecemos, porque todos sabem que uma IA sem dados é apenas uma caixa.
00:01:13Certo? Vou recuar um pouco na história, está bem? Em 2022, a Google ensinou um robô através de imagens,
00:01:25ações do mundo real, certo? Depois, avançando no tempo, houve um salto. Em 2023, tivemos uma IA a controlar múltiplos robôs.
00:01:37Em 2024, surgiu o código aberto. Foi aqui que o jogo mudou. Assim que tivemos o código aberto, todos os laboratórios passaram a ter acesso à IA e começaram logo a colocá-la em robôs, certo?
00:01:51E agora estes modelos já estão a conduzir robôs humanoides. Vejo alguns, claro, a maioria aqui é controlada remotamente.
00:02:00Mas, quer dizer, em São Francisco, há carros da Waymo a conduzir sem qualquer condutor. Não é incrível?
00:02:07A primeira vez que entrei no carro, pensei que ia morrer, mas na verdade foi muito agradável.
00:02:12Certo? Agora, como acham que ele aprendeu a conduzir? A ensinar-se a si próprio, a aprender com câmaras de tablier, certo?
00:02:22Todos os carros têm um tablier. Portanto, se fornecerem isso a uma IA, ela consegue descobrir como operar uma máquina.
00:02:31Como disse, a IA já não é a parte difícil, os dados é que são, e é sobre isso que quero falar, certo?
00:02:39Para LLMs de chat, existem biliões de palavras e textos, certo? Temos tantos dados de texto para treinar os LLMs.
00:02:49Para geração de imagens, temos milhares de milhões de imagens etiquetadas, por isso também é uma base de dados gigante.
00:02:56Mas para robótica, existem apenas cerca de um milhão de vídeos. É um conjunto de dados muito pequeno e limitado de robôs a fazer coisas, certo?
00:03:09E a ideia aqui é que, claro, muitas empresas por aí o que fazem é pagar a pessoas para gravarem ações, certo?
00:03:20Por exemplo: “Grava-me como abres uma porta” ou “Grava-me como te sentas na cadeira”.
00:03:28Mas depois o problema é que, quando se diz a alguém para fazer algo, a pessoa não o faz de forma natural.
00:03:34Eu chamo-lhe instruído, certo? Se lhe pedirem para gravar como abre a porta e estiver a fazê-lo para alguém,
00:03:40não vai ser o mesmo do que entrar simplesmente em casa. O movimento é totalmente diferente.
00:03:45Portanto, esses dados são bons para o treino robótico? Na minha opinião, não. São dados enviesados e não entregam os mesmos resultados.
00:03:53Obviamente, o robô não vai ser tão eficaz como seria se fosse intuitivo, certo?
00:03:59Por isso, coloquei alguns exemplos no diapositivo, certo?
00:04:06Os dados criados manualmente não são iguais aos dados que estão ali ao lado, certo?
00:04:12E também há o facto de as pessoas se comportarem de forma muito diferente quando estão em câmara.
00:04:16Como sabem, há pessoas tímidas perante as câmaras, por isso, assim que se aponta uma câmara para elas, mudam.
00:04:23Mas no mundo natural, é algo totalmente diferente.
00:04:27É isto que estamos a tentar resolver na Bright Data, certo?
00:04:35Mais uma vez, porque é que as fontes de dados habituais não chegam, certo?
00:04:37Simulações. Virtuais, são baratas, mas, bem, toda a gente joga videojogos.
00:04:44A física nos videojogos está quase lá, mas não é suficientemente boa para treinar um robô, certo?
00:04:50Controlo manual, uma pessoa a controlar um robô, é viável, mas quantas horas por dia se pode gravar um robô?
00:04:57De quantas pessoas se precisa para obter dados em grande escala, certo?
00:05:01Pode-se gravar talvez oito horas por dia, todos os dias.
00:05:04Quantas horas se vão conseguir num ano?
00:05:07Não é realmente escalável.
00:05:09E claro, já existem conjuntos de dados pré-construídos, mas como disse antes, são pequenos.
00:05:13Neste momento, só existem cerca de um milhão de vídeos.
00:05:15Qual é a alternativa?
00:05:17A alternativa é a web.
00:05:20Pensem só no YouTube.
00:05:22Quantos vídeos existem no YouTube?
00:05:25Não sei, cinco mil milhões de vídeos?
00:05:28Quantas ações existem nesses vídeos que um robô possa replicar?
00:05:34Quero dizer, pensem nisto.
00:05:35Quantos vídeos acham que existem de uma pessoa a abrir a porta em primeira pessoa?
00:05:42Milhões de horas.
00:05:43Ficariam surpreendidos.
00:05:45Portanto, todos os dias, os vídeos da web mostram gravidade, movimentos, certo?
00:05:53Causa e efeito, obviamente acidentes, o maior exemplo de causa e efeito, certo?
00:06:00Como as pessoas manuseiam objetos, e milhares de milhões de horas.
00:06:04Ótimo material de treino para robôs, mas qual é o problema?
00:06:08O problema é que há muito ruído, certo?
00:06:12Por exemplo, certo?
00:06:14Num dos modelos de IA que a Meta treinou, deram-lhe cerca de um milhão de horas de vídeos do mundo real.
00:06:21E depois só foram precisas 62 horas de dados robóticos reais para controlar um robô a sério.
00:06:29Se pensarem nisso, os dados foram recolhidos publicamente, certo?
00:06:33Portanto, treinou o robô apenas com coisas aleatórias e, em 62 horas robóticas, ele já se mexia.
00:06:41Sem necessidade de simulações, robótica autónoma entregue rapidamente.
00:06:52Mas os vídeos não mostram como os robôs se movem, certo?
00:06:54Poderão pensar: “Quão útil é para um robô ver uma pessoa a deitar água num copo?”
00:07:01Existem métodos para uma IA distinguir e aprender com as ações no vídeo.
00:07:09Se pegarem em dois fotogramas, fotograma a fotograma, e a IA medir a diferença de movimento, certo?
00:07:15Têm uma imagem A e uma imagem 2, e há um pequeno movimento a mudar entre as duas imagens.
00:07:21Uma IA consegue realmente medir essa alteração.
00:07:24Se continuarem a fazer isso ao longo do vídeo, a IA consegue calcular ângulos, distâncias,
00:07:30e tudo o que precisa para treinar o robô, certo?
00:07:34Portanto, não precisamos necessariamente dos dados dos sensores, mas, claro, o vídeo em si que descarregam
00:07:41do YouTube, ou o vídeo de onde extraem os dados, não vos leva necessariamente a 100% até lá.
00:07:48É preciso haver algum processamento adicional, mas está disponível.
00:07:53Está ao nosso alcance, só precisam de o processar.
00:07:58Mais alguns exemplos, certo?
00:07:59Por exemplo, a NVIDIA, quando treina no robô Cosmos, deita fora cerca de 96% do vídeo.
00:08:07O que é que isso significa?
00:08:09Descarregam um milhão de horas de vídeo,
00:08:12e apenas 4% é realmente útil.
00:08:15Tudo o resto é descartado.
00:08:16Isso é desperdício de computação.
00:08:18Isso é desperdício de largura de banda.
00:08:19Isso é desperdício de armazenamento.
00:08:21É simplesmente muito dinheiro deitado fora.
00:08:23O Stable Video Diffusion está a descartar 74% dos vídeos que descarrega.
00:08:30Portanto, na Bright Data, estamos a tentar resolver esse problema e ir um passo mais além.
00:08:37O que propomos é: pesquisar primeiro, recolher depois.
00:08:41O que fazemos é indexar vídeos e permitir que pesquisem por ações específicas.
00:08:50Como estávamos a falar de uma pessoa a abrir uma porta, continuemos a usar esse exemplo.
00:08:55Na nossa plataforma, podem introduzir informações detalhadas, certo?
00:09:01Uma pesquisa: pessoa a lavar a loiça, pessoa a dobrar uma t-shirt, e assim por diante.
00:09:06E nós fornecemos os trechos dos vídeos com essas ações.
00:09:13O que é que isso significa?
00:09:16Significa que há menos desperdício na recolha de dados.
00:09:22Há menos desperdício de armazenamento e de largura de banda, certo?
00:09:25Um pouco mais sobre como funciona.
00:09:27Obviamente, definem o que procuram.
00:09:32Pesquisamos em milhares de milhões de vídeos pré-indexados.
00:09:36Não por palavras-chave, mas por ações.
00:09:39E fornecemos-vos clipes prontos a usar.
00:09:43E, obviamente, já estão preparados para o vosso treino.
00:09:47Só têm de os processar um pouco, talvez para movimento, sensores de distância, etc.
00:09:52E está pronto para ser introduzido num robô.
00:09:57Tenho um pequeno exemplo em vídeo de como funciona na nossa plataforma.
00:10:02Vou só carregar no play, se conseguir encontrar.
00:10:07Aqui vemos uma pessoa a lavar loiça à mão no lava-loiça, a tirar a gordura do prato,
00:10:12a usar esponja e detergente, incluindo enxaguar e colocar a loiça no escorredor, interações das mãos em plano de pormenor.
00:10:19Neste momento, o que está a acontecer é que está a pesquisar em milhares de milhões de vídeos.
00:10:24Este vídeo já é um pouco antigo.
00:10:26Só tínhamos cerca de 100 milhões indexados aí, mas agora já temos 1,1 milhar de milhão de vídeos.
00:10:31E vai literalmente... isto está um pouco acelerado para não vos fazer perder tempo.
00:10:35Mas vai fornecer-vos clipes de vídeos de pessoas a lavar a loiça.
00:10:41E podem ver aqui mesmo todos os vídeos que encontramos.
00:10:47Alguns destes vídeos podem não ter nada a ver com lavar a loiça.
00:10:50Podem ser sobre limpar a cozinha.
00:10:52Podem ser sobre outra coisa qualquer.
00:10:54E aqui está outro exemplo.
00:10:55Por exemplo, humano a dobrar diferentes tipos de roupa.
00:10:59Certo?
00:10:59Portanto, uma descrição mais pormenorizada.
00:11:01Quanto mais pormenorizada for a descrição, mais resultados obtêm.
00:11:06Mais uma vez, um pouco acelerado.
00:11:08Vejamos.
00:11:14Quero que percebam que pode ser qualquer coisa.
00:11:16Uma pessoa a maquilhar-se.
00:11:17Imaginemos que têm uma marca e querem encontrar vídeos onde a vossa marca aparece.
00:11:21Tudo isso também pode ser fornecido.
00:11:23Portanto, veem pessoas a dobrar roupa.
00:11:26Agora já podem treinar um robô sobre como dobrar roupa.
00:11:34Claro que tudo está disponível via API.
00:11:36Não esperamos que as pessoas façam nada manualmente.
00:11:39Certo?
00:11:39Portanto, podem acioná-lo por API.
00:11:41Você recebe um trecho do vídeo, a URL.
00:11:46Nós fornecemos o link do vídeo original se você quiser assistir.
00:11:49Mas o ponto principal aqui é que podemos te dar os trechos do vídeo para treinar sua robótica.
00:11:57Agora, não sei se algum de vocês está treinando robôs.
00:12:01Então, vou dar outro exemplo de como isso pode ser útil.
00:12:04Digamos que você tenha uma marca.
00:12:06E quer saber onde sua marca está sendo demonstrada em vídeos.
00:12:13O título do vídeo não importa porque não é sobre o seu produto.
00:12:19É só uma pessoa fazendo um podcast, gravando algo.
00:12:22Mas você vê uma mulher se maquiando.
00:12:25E vê na mesa que aquela é a sua marca de maquiagem.
00:12:30De repente, você consegue encontrar todos os vídeos onde sua marca está sendo usada.
00:12:34Seja lá o que for.
00:12:35Entende?
00:12:35Pesquisando pelo nome do vídeo, você não vai achar.
00:12:38Com a indexação de vídeo, você realmente encontra as coisas específicas que te interessam.
00:12:45Uma maçã caindo da árvore.
00:12:47E por aí vai.
00:12:48Então, o que você recebe de volta?
00:12:50Nós fornecemos este carimbo de data/hora.
00:12:52Fornecemos a pontuação de correspondência.
00:12:53O quão próximo está da sua busca.
00:12:55E, claro, a contagem de quadros.
00:12:57Quantos quadros mostram o que você está procurando.
00:13:03E o que isso muda?
00:13:06Isso muda muita coisa.
00:13:07Menos desperdício.
00:13:09Você não precisa baixar milhões de horas de vídeos.
00:13:12Você consegue exatamente as ações específicas
00:13:16que te interessam.
00:13:20Isso é crucial para o treinamento de robótica.
00:13:24Porque o ruído gera problemas, alucinações.
00:13:28Sabe?
00:13:29Isso remove o ruído.
00:13:34Para que isso é útil?
00:13:35Não só para robôs, mas também para direção autônoma.
00:13:38Por exemplo, a Waymo.
00:13:39Certo?
00:13:40Treinados com câmeras automotivas.
00:13:43E há milhões, centenas de milhões de horas no YouTube
00:13:46de câmeras veiculares.
00:13:47Quantos de vocês gostam de ver acidentes?
00:13:49Acidentes de trânsito em vídeo.
00:13:52Tenho certeza de que todos já viram.
00:13:53Motoristas loucos na Rússia.
00:13:55Não é?
00:13:56É disso que estamos falando.
00:13:58Viu?
00:13:58Os vídeos estão disponíveis por aí.
00:14:01Certo?
00:14:01Uma pessoa avançando o sinal vermelho.
00:14:02Uma pessoa parando no sinal vermelho.
00:14:04Dobrando à esquerda.
00:14:05Dobrando à direita.
00:14:06E por aí vai.
00:14:06Tudo isso pode ser um dado muito útil para treinamento.
00:14:11E para quaisquer outros modelos de mundo.
00:14:13Física.
00:14:14Entende?
00:14:14Os robôs precisam entender a física.
00:14:16O que é a gravidade?
00:14:18Como sentar?
00:14:18Como andar?
00:14:19Como se mover?
00:14:21Claro que você pode pré-gravar isso.
00:14:25Muitas vezes, converso com algumas pessoas agora,
00:14:27e elas têm milhões de pessoas gravando vídeos para elas.
00:14:30“Ei, vocês podem me gravar abrindo portas?”
00:14:33Isso é loucura.
00:14:34Por que precisar de um milhão de pessoas fazendo isso se tudo está disponível online?
00:14:39A internet é uma das maiores bases de dados que existem.
00:14:43É só que as pessoas não usam, não é tão fácil de usar, né?
00:14:46Quero dizer, a única busca disponível atualmente é pela palavra-chave do nome do vídeo.
00:14:53E, claro, ter toda a web pública de vídeos em um só lugar.
00:14:59Temos o YouTube, o Vimeo, e tantos outros provedores de vídeo por aí.
00:15:06Bilhões e bilhões de horas de dados de treinamento esperando para serem pegos,
00:15:13coletados e processados.
00:15:14Basicamente, esse é um novo produto que estamos fazendo na Bright Data, entenderam?
00:15:18Indexando vídeos para que vocês possam encontrar ações específicas.
00:15:23Qualquer coisa que pensar, sabe, também pode ser útil para marcas.
00:15:28Não serve apenas para dados de treinamento.
00:15:31Qualquer ideia que você tiver pode ser útil.
00:15:35Talvez você seja um gamer e queira saber como passar dessa fase,
00:15:40mas não existe um vídeo exato sobre isso.
00:15:42Então você pesquisa: pessoas passando da fase no jogo, certo?
00:15:47Qualquer coisa, o mundo é seu.
00:15:52Então, vou encerrar por aqui.
00:15:54Não sei se vocês têm dúvidas, mas se quiserem se conectar comigo e conversar mais,
00:15:58fiquem à vontade para me adicionar no LinkedIn.
00:16:01E bom, quero agradecer a todos pela atenção.
00:16:06Estarei no estande da Bright Data se quiserem conversar mais a respeito.
00:16:10E obrigado por virem.
00:16:17Vejo vocês na próxima.

설명

AI without data is just a box." Rafael Levi of Bright Data points out that LLMs train on trillions of words, but robotics has only about a million videos of robots doing things. Paying people to record staged actions produces biased data, because nobody opens a door naturally when told to. Meanwhile, the web holds billions of hours of real people handling objects and real physics, with gravity, motion and cause and effect. The catch is noise. Levi notes that NVIDIA discards about 96% of the video it downloads to train Cosmos, and Stable Video Diffusion discards 74%, which wastes compute, bandwidth and storage. Meta, on the other hand, trained on about a million hours of public video and needed only 62 hours of real robot data to control a robot. Bright Data's approach is "search first, collect second." It indexes more than a billion videos by the actions in them, not their titles, and returns trimmed clips with timestamps, match scores and frame counts through an API. Levi demos searches for dishwashing and clothes-folding clips and covers uses in self-driving and brand discovery. Speaker info: Bright Data: https://brightdata.com Timestamps: 00:00 Intro 0:50 The AI isn't the hard part anymore. The data is 1:15 A short history of robots learning from video 2:40 Trillions of words vs. about a million robot videos 3:15 Why staged recordings make biased data 4:35 Why simulation and teleoperation don't scale 5:14 The web as a training source 6:14 1 million hours of video, 62 hours of robot data 6:54 Learning actions from frame-to-frame motion 7:58 Throwing away 96% of the video 8:33 Search first, collect second 10:03 Demo: finding the exact action clips 11:38 The API and use cases beyond robotics 12:48 What comes back: timestamps, scores and frames 13:33 Self-driving, dashcams and physics 15:52 Wrap-up

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기