O Próximo Gargalo da IA Física É Encontrar o Vídeo Certo — Rafael Levi, Bright Data
AAI Engineer
컴퓨터/소프트웨어경제 뉴스AI/미래기술
스크립트
00:00:00Olá a todos, bem-vindos. Aos que vieram realmente para me ver, obrigado. Aos que estão
00:00:21apenas a passar o tempo aqui, também obrigado. Vou tentar entreter-vos e ensinar-vos algo novo.
00:00:26Mais uma vez, o meu nome é Rafael, trabalho na Bright Data, estou na Bright Data há mais de oito anos e, na Bright Data, recolhemos dados e tentamos inovar.
00:00:38Hoje quero falar sobre a descoberta de vídeos para o treino de modelos de mundo agênticos, e já vamos explicar o que isso é.
00:00:48Portanto, o que é preciso hoje para construir um sistema que consiga ver, compreender e agir?
00:00:56Certo? Quero dizer, já percebemos o que é uma IA, estamos constantemente a melhorá-la, isso está mais ou menos resolvido,
00:01:04mas agora a parte difícil é saber que dados lhe fornecemos, porque todos sabem que uma IA sem dados é apenas uma caixa.
00:01:13Certo? Vou recuar um pouco na história, está bem? Em 2022, a Google ensinou um robô através de imagens,
00:01:25ações do mundo real, certo? Depois, avançando no tempo, houve um salto. Em 2023, tivemos uma IA a controlar múltiplos robôs.
00:01:37Em 2024, surgiu o código aberto. Foi aqui que o jogo mudou. Assim que tivemos o código aberto, todos os laboratórios passaram a ter acesso à IA e começaram logo a colocá-la em robôs, certo?
00:01:51E agora estes modelos já estão a conduzir robôs humanoides. Vejo alguns, claro, a maioria aqui é controlada remotamente.
00:02:00Mas, quer dizer, em São Francisco, há carros da Waymo a conduzir sem qualquer condutor. Não é incrível?
00:02:07A primeira vez que entrei no carro, pensei que ia morrer, mas na verdade foi muito agradável.
00:02:12Certo? Agora, como acham que ele aprendeu a conduzir? A ensinar-se a si próprio, a aprender com câmaras de tablier, certo?
00:02:22Todos os carros têm um tablier. Portanto, se fornecerem isso a uma IA, ela consegue descobrir como operar uma máquina.
00:02:31Como disse, a IA já não é a parte difícil, os dados é que são, e é sobre isso que quero falar, certo?
00:02:39Para LLMs de chat, existem biliões de palavras e textos, certo? Temos tantos dados de texto para treinar os LLMs.
00:02:49Para geração de imagens, temos milhares de milhões de imagens etiquetadas, por isso também é uma base de dados gigante.
00:02:56Mas para robótica, existem apenas cerca de um milhão de vídeos. É um conjunto de dados muito pequeno e limitado de robôs a fazer coisas, certo?
00:03:09E a ideia aqui é que, claro, muitas empresas por aí o que fazem é pagar a pessoas para gravarem ações, certo?
00:03:20Por exemplo: “Grava-me como abres uma porta” ou “Grava-me como te sentas na cadeira”.
00:03:28Mas depois o problema é que, quando se diz a alguém para fazer algo, a pessoa não o faz de forma natural.
00:03:34Eu chamo-lhe instruído, certo? Se lhe pedirem para gravar como abre a porta e estiver a fazê-lo para alguém,
00:03:40não vai ser o mesmo do que entrar simplesmente em casa. O movimento é totalmente diferente.
00:03:45Portanto, esses dados são bons para o treino robótico? Na minha opinião, não. São dados enviesados e não entregam os mesmos resultados.
00:03:53Obviamente, o robô não vai ser tão eficaz como seria se fosse intuitivo, certo?
00:03:59Por isso, coloquei alguns exemplos no diapositivo, certo?
00:04:06Os dados criados manualmente não são iguais aos dados que estão ali ao lado, certo?
00:04:12E também há o facto de as pessoas se comportarem de forma muito diferente quando estão em câmara.
00:04:16Como sabem, há pessoas tímidas perante as câmaras, por isso, assim que se aponta uma câmara para elas, mudam.
00:04:23Mas no mundo natural, é algo totalmente diferente.
00:04:27É isto que estamos a tentar resolver na Bright Data, certo?
00:04:35Mais uma vez, porque é que as fontes de dados habituais não chegam, certo?
00:04:37Simulações. Virtuais, são baratas, mas, bem, toda a gente joga videojogos.
00:04:44A física nos videojogos está quase lá, mas não é suficientemente boa para treinar um robô, certo?
00:04:50Controlo manual, uma pessoa a controlar um robô, é viável, mas quantas horas por dia se pode gravar um robô?
00:04:57De quantas pessoas se precisa para obter dados em grande escala, certo?
00:05:01Pode-se gravar talvez oito horas por dia, todos os dias.
00:05:04Quantas horas se vão conseguir num ano?
00:05:07Não é realmente escalável.
00:05:09E claro, já existem conjuntos de dados pré-construídos, mas como disse antes, são pequenos.
00:05:13Neste momento, só existem cerca de um milhão de vídeos.
00:05:15Qual é a alternativa?
00:05:17A alternativa é a web.
00:05:20Pensem só no YouTube.
00:05:22Quantos vídeos existem no YouTube?
00:05:25Não sei, cinco mil milhões de vídeos?
00:05:28Quantas ações existem nesses vídeos que um robô possa replicar?
00:05:34Quero dizer, pensem nisto.
00:05:35Quantos vídeos acham que existem de uma pessoa a abrir a porta em primeira pessoa?
00:05:42Milhões de horas.
00:05:43Ficariam surpreendidos.
00:05:45Portanto, todos os dias, os vídeos da web mostram gravidade, movimentos, certo?
00:05:53Causa e efeito, obviamente acidentes, o maior exemplo de causa e efeito, certo?
00:06:00Como as pessoas manuseiam objetos, e milhares de milhões de horas.
00:06:04Ótimo material de treino para robôs, mas qual é o problema?
00:06:08O problema é que há muito ruído, certo?
00:06:12Por exemplo, certo?
00:06:14Num dos modelos de IA que a Meta treinou, deram-lhe cerca de um milhão de horas de vídeos do mundo real.
00:06:21E depois só foram precisas 62 horas de dados robóticos reais para controlar um robô a sério.
00:06:29Se pensarem nisso, os dados foram recolhidos publicamente, certo?
00:06:33Portanto, treinou o robô apenas com coisas aleatórias e, em 62 horas robóticas, ele já se mexia.
00:06:41Sem necessidade de simulações, robótica autónoma entregue rapidamente.
00:06:52Mas os vídeos não mostram como os robôs se movem, certo?
00:06:54Poderão pensar: “Quão útil é para um robô ver uma pessoa a deitar água num copo?”
00:07:01Existem métodos para uma IA distinguir e aprender com as ações no vídeo.
00:07:09Se pegarem em dois fotogramas, fotograma a fotograma, e a IA medir a diferença de movimento, certo?
00:07:15Têm uma imagem A e uma imagem 2, e há um pequeno movimento a mudar entre as duas imagens.
00:07:21Uma IA consegue realmente medir essa alteração.
00:07:24Se continuarem a fazer isso ao longo do vídeo, a IA consegue calcular ângulos, distâncias,
00:07:30e tudo o que precisa para treinar o robô, certo?
00:07:34Portanto, não precisamos necessariamente dos dados dos sensores, mas, claro, o vídeo em si que descarregam
00:07:41do YouTube, ou o vídeo de onde extraem os dados, não vos leva necessariamente a 100% até lá.
00:07:48É preciso haver algum processamento adicional, mas está disponível.
00:07:53Está ao nosso alcance, só precisam de o processar.
00:07:58Mais alguns exemplos, certo?
00:07:59Por exemplo, a NVIDIA, quando treina no robô Cosmos, deita fora cerca de 96% do vídeo.
00:08:07O que é que isso significa?
00:08:09Descarregam um milhão de horas de vídeo,
00:08:12e apenas 4% é realmente útil.
00:08:15Tudo o resto é descartado.
00:08:16Isso é desperdício de computação.
00:08:18Isso é desperdício de largura de banda.
00:08:19Isso é desperdício de armazenamento.
00:08:21É simplesmente muito dinheiro deitado fora.
00:08:23O Stable Video Diffusion está a descartar 74% dos vídeos que descarrega.
00:08:30Portanto, na Bright Data, estamos a tentar resolver esse problema e ir um passo mais além.
00:08:37O que propomos é: pesquisar primeiro, recolher depois.
00:08:41O que fazemos é indexar vídeos e permitir que pesquisem por ações específicas.
00:08:50Como estávamos a falar de uma pessoa a abrir uma porta, continuemos a usar esse exemplo.
00:08:55Na nossa plataforma, podem introduzir informações detalhadas, certo?
00:09:01Uma pesquisa: pessoa a lavar a loiça, pessoa a dobrar uma t-shirt, e assim por diante.
00:09:06E nós fornecemos os trechos dos vídeos com essas ações.
00:09:13O que é que isso significa?
00:09:16Significa que há menos desperdício na recolha de dados.
00:09:22Há menos desperdício de armazenamento e de largura de banda, certo?
00:09:25Um pouco mais sobre como funciona.
00:09:27Obviamente, definem o que procuram.
00:09:32Pesquisamos em milhares de milhões de vídeos pré-indexados.
00:09:36Não por palavras-chave, mas por ações.
00:09:39E fornecemos-vos clipes prontos a usar.
00:09:43E, obviamente, já estão preparados para o vosso treino.
00:09:47Só têm de os processar um pouco, talvez para movimento, sensores de distância, etc.
00:09:52E está pronto para ser introduzido num robô.
00:09:57Tenho um pequeno exemplo em vídeo de como funciona na nossa plataforma.
00:10:02Vou só carregar no play, se conseguir encontrar.
00:10:07Aqui vemos uma pessoa a lavar loiça à mão no lava-loiça, a tirar a gordura do prato,
00:10:12a usar esponja e detergente, incluindo enxaguar e colocar a loiça no escorredor, interações das mãos em plano de pormenor.
00:10:19Neste momento, o que está a acontecer é que está a pesquisar em milhares de milhões de vídeos.
00:10:24Este vídeo já é um pouco antigo.
00:10:26Só tínhamos cerca de 100 milhões indexados aí, mas agora já temos 1,1 milhar de milhão de vídeos.
00:10:31E vai literalmente... isto está um pouco acelerado para não vos fazer perder tempo.
00:10:35Mas vai fornecer-vos clipes de vídeos de pessoas a lavar a loiça.
00:10:41E podem ver aqui mesmo todos os vídeos que encontramos.
00:10:47Alguns destes vídeos podem não ter nada a ver com lavar a loiça.
00:10:50Podem ser sobre limpar a cozinha.
00:10:52Podem ser sobre outra coisa qualquer.
00:10:54E aqui está outro exemplo.
00:10:55Por exemplo, humano a dobrar diferentes tipos de roupa.
00:10:59Certo?
00:10:59Portanto, uma descrição mais pormenorizada.
00:11:01Quanto mais pormenorizada for a descrição, mais resultados obtêm.
00:11:06Mais uma vez, um pouco acelerado.
00:11:08Vejamos.
00:11:14Quero que percebam que pode ser qualquer coisa.
00:11:16Uma pessoa a maquilhar-se.
00:11:17Imaginemos que têm uma marca e querem encontrar vídeos onde a vossa marca aparece.
00:11:21Tudo isso também pode ser fornecido.
00:11:23Portanto, veem pessoas a dobrar roupa.
00:11:26Agora já podem treinar um robô sobre como dobrar roupa.
00:11:34Claro que tudo está disponível via API.
00:11:36Não esperamos que as pessoas façam nada manualmente.
00:11:39Certo?
00:11:39Portanto, podem acioná-lo por API.
00:11:41Você recebe um trecho do vídeo, a URL.
00:11:46Nós fornecemos o link do vídeo original se você quiser assistir.
00:11:49Mas o ponto principal aqui é que podemos te dar os trechos do vídeo para treinar sua robótica.
00:11:57Agora, não sei se algum de vocês está treinando robôs.
00:12:01Então, vou dar outro exemplo de como isso pode ser útil.
00:12:04Digamos que você tenha uma marca.
00:12:06E quer saber onde sua marca está sendo demonstrada em vídeos.
00:12:13O título do vídeo não importa porque não é sobre o seu produto.
00:12:19É só uma pessoa fazendo um podcast, gravando algo.
00:12:22Mas você vê uma mulher se maquiando.
00:12:25E vê na mesa que aquela é a sua marca de maquiagem.
00:12:30De repente, você consegue encontrar todos os vídeos onde sua marca está sendo usada.
00:12:34Seja lá o que for.
00:12:35Entende?
00:12:35Pesquisando pelo nome do vídeo, você não vai achar.
00:12:38Com a indexação de vídeo, você realmente encontra as coisas específicas que te interessam.
00:12:45Uma maçã caindo da árvore.
00:12:47E por aí vai.
00:12:48Então, o que você recebe de volta?
00:12:50Nós fornecemos este carimbo de data/hora.
00:12:52Fornecemos a pontuação de correspondência.
00:12:53O quão próximo está da sua busca.
00:12:55E, claro, a contagem de quadros.
00:12:57Quantos quadros mostram o que você está procurando.
00:13:03E o que isso muda?
00:13:06Isso muda muita coisa.
00:13:07Menos desperdício.
00:13:09Você não precisa baixar milhões de horas de vídeos.
00:13:12Você consegue exatamente as ações específicas
00:13:16que te interessam.
00:13:20Isso é crucial para o treinamento de robótica.
00:13:24Porque o ruído gera problemas, alucinações.
00:13:28Sabe?
00:13:29Isso remove o ruído.
00:13:34Para que isso é útil?
00:13:35Não só para robôs, mas também para direção autônoma.
00:13:38Por exemplo, a Waymo.
00:13:39Certo?
00:13:40Treinados com câmeras automotivas.
00:13:43E há milhões, centenas de milhões de horas no YouTube
00:13:46de câmeras veiculares.
00:13:47Quantos de vocês gostam de ver acidentes?
00:13:49Acidentes de trânsito em vídeo.
00:13:52Tenho certeza de que todos já viram.
00:13:53Motoristas loucos na Rússia.
00:13:55Não é?
00:13:56É disso que estamos falando.
00:13:58Viu?
00:13:58Os vídeos estão disponíveis por aí.
00:14:01Certo?
00:14:01Uma pessoa avançando o sinal vermelho.
00:14:02Uma pessoa parando no sinal vermelho.
00:14:04Dobrando à esquerda.
00:14:05Dobrando à direita.
00:14:06E por aí vai.
00:14:06Tudo isso pode ser um dado muito útil para treinamento.
00:14:11E para quaisquer outros modelos de mundo.
00:14:13Física.
00:14:14Entende?
00:14:14Os robôs precisam entender a física.
00:14:16O que é a gravidade?
00:14:18Como sentar?
00:14:18Como andar?
00:14:19Como se mover?
00:14:21Claro que você pode pré-gravar isso.
00:14:25Muitas vezes, converso com algumas pessoas agora,
00:14:27e elas têm milhões de pessoas gravando vídeos para elas.
00:14:30“Ei, vocês podem me gravar abrindo portas?”
00:14:33Isso é loucura.
00:14:34Por que precisar de um milhão de pessoas fazendo isso se tudo está disponível online?
00:14:39A internet é uma das maiores bases de dados que existem.
00:14:43É só que as pessoas não usam, não é tão fácil de usar, né?
00:14:46Quero dizer, a única busca disponível atualmente é pela palavra-chave do nome do vídeo.
00:14:53E, claro, ter toda a web pública de vídeos em um só lugar.
00:14:59Temos o YouTube, o Vimeo, e tantos outros provedores de vídeo por aí.
00:15:06Bilhões e bilhões de horas de dados de treinamento esperando para serem pegos,
00:15:13coletados e processados.
00:15:14Basicamente, esse é um novo produto que estamos fazendo na Bright Data, entenderam?
00:15:18Indexando vídeos para que vocês possam encontrar ações específicas.
00:15:23Qualquer coisa que pensar, sabe, também pode ser útil para marcas.
00:15:28Não serve apenas para dados de treinamento.
00:15:31Qualquer ideia que você tiver pode ser útil.
00:15:35Talvez você seja um gamer e queira saber como passar dessa fase,
00:15:40mas não existe um vídeo exato sobre isso.
00:15:42Então você pesquisa: pessoas passando da fase no jogo, certo?
00:15:47Qualquer coisa, o mundo é seu.
00:15:52Então, vou encerrar por aqui.
00:15:54Não sei se vocês têm dúvidas, mas se quiserem se conectar comigo e conversar mais,
00:15:58fiquem à vontade para me adicionar no LinkedIn.
00:16:01E bom, quero agradecer a todos pela atenção.
00:16:06Estarei no estande da Bright Data se quiserem conversar mais a respeito.
00:16:10E obrigado por virem.
00:16:17Vejo vocês na próxima.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기