A Robótica Está Estagnada Há 70 Anos — Deepak Pathak, Skild AI

스크립트

00:00:00Acho que todos vocês aqui sabem o quanto a IA avançou
00:00:15nos últimos cinco anos.
00:00:17Parece ser mais do que o progresso dos últimos 100 anos.
00:00:22E o que está acontecendo, especialmente na IA,
00:00:24é que a IA veio para a linguagem, depois voz, áudio, vídeo.
00:00:28E a empolgação de todos é que o próximo passo é a robótica.
00:00:32E essa empolgação está atingindo o auge este ano por algum motivo,
00:00:37o que ainda está além da minha compreensão.
00:00:40E você também pode ver líderes como Jensen
00:00:43falando sobre IA física como a próxima fronteira da robótica.
00:00:46Então, se você abrir o Twitter ou o LinkedIn,
00:00:49parece que a robótica já chegou.
00:00:51E teremos robôs domésticos em nossas casas em algum momento até dezembro,
00:00:56como está sendo dito por várias pessoas.
00:00:58Mas estou aqui para destacar que a robótica está quase chegando
00:01:03há cerca de 70 anos.
00:01:06Agora, aqueles de vocês que entraram para a robótica nos últimos quatro ou cinco
00:01:10anos, vão e façam qualquer curso de robótica.
00:01:14E se conseguirem diferenciar os vídeos sobre robótica
00:01:17de 30 anos atrás e de hoje, eu pago o seu jantar.
00:01:23Para dar um exemplo, vamos olhar para este robô.
00:01:26Este robô aqui é uma imagem.
00:01:27E o objetivo deste robô é olhar para esta imagem de blocos
00:01:31e organizar esses blocos na frente dele
00:01:34para que fiquem no mesmo padrão da imagem.
00:01:37Tudo bem?
00:01:38Esta é uma tarefa extremamente simples.
00:01:40Mas se você pensar sobre isso, é um bloco 3D.
00:01:42Você precisa olhar e entender o 3D de cada lado.
00:01:44E o robô consegue fazer isso com bastante precisão.
00:01:47Algum palpite de quão antigo é esse resultado?
00:01:51Alguém?
00:01:51É só um palpite.
00:01:52Podem dar qualquer palpite.
00:01:53Hein?
00:01:5440 anos.
00:01:55OK.
00:01:55Esse é o mais alto?
00:01:59Isso é da década de 1960.
00:02:01Isso foi muito antes de existirem computadores.
00:02:03Entendem?
00:02:04Isso é chamado de MIT Copy Demo.
00:02:06Este foi o começo de...
00:02:09isso antecede a IA como você a conhece hoje.
00:02:12Olhem para este aqui.
00:02:17Uma atração no congresso nuclear em Filadélfia
00:02:19tem a fórmula perfeita para a popularidade.
00:02:21O que está acontecendo aqui é que o cara nos bastidores
00:02:24está controlando esses robôs, um sistema líder-seguidor.
00:02:27E se você olhar para qualquer grande laboratório, qualquer grande empresa,
00:02:31qualquer grande laboratório acadêmico, como eles obtêm dados,
00:02:33eles usam sistemas de teleoperação, que
00:02:35seguem exatamente os mesmos princípios.
00:02:38Algum palpite para o ano deste aqui?
00:02:40O operador habilidoso do dispositivo eletrônico--
00:02:42Agora, todo mundo vai tentar adivinhar o ano de forma agressiva.
00:02:45Mas isso é de 1957, há 68 anos.
00:02:49Entendem?
00:02:51Pergunte a qualquer pessoa na sua família com mais de--
00:02:53na verdade, elas podem nem estar mais por aqui.
00:02:55Porque isso é--
00:02:57você teria que perguntar a alguém que tem 80 anos,
00:02:59qual era o estado da tecnologia naquela época?
00:03:02Para a memória RAM, para ter alguns KB de RAM, o tamanho seria o de uma sala,
00:03:06uma estrutura desse tamanho.
00:03:07E isso é daquela época em que as pessoas conseguiam fazer funcionar.
00:03:11E não é só isso, a cada década que passa,
00:03:14os vídeos continuam parecendo impressionantes.
00:03:15Como aqui, um robô humanoide fazendo malabarismo,
00:03:18jogando pebolim com um humano.
00:03:21E isso também é... todos eles antecedem o aprendizado profundo.
00:03:25Isso é de oito anos atrás.
00:03:26Este robô é o resultado de uma pesquisa em Berkeley,
00:03:29ele consegue limpar a mesa toda, organizar objetos numa caixa.
00:03:33Isso foi feito por um único pós-graduando com uma única máquina com GPU.
00:03:36Nada além disso.
00:03:37Tudo bem?
00:03:38Agora, essa imagem de... e se eu colorir todos esses vídeos
00:03:41do passado e aplicar um filtro de IA Generativa para uma voz moderna,
00:03:45você não consegue saber se o vídeo é de 1957
00:03:49ou se é de hoje.
00:03:50E esses nem são os resultados mais antigos.
00:03:52Os mais antigos remontam à década de 1940.
00:03:54Entendem?
00:03:55Então, por que se você olhar para os últimos 70 anos,
00:04:00todas as outras tecnologias, todas as outras tecnologias
00:04:02avançaram tanto--
00:04:04compreensão de linguagem, visão computacional, celulares, chips.
00:04:08Por que a robótica está estagnada nessa era primitiva há tanto tempo?
00:04:11E a razão é um cérebro geral.
00:04:14A robótica sempre foi abordada como um problema
00:04:17de hardware desde a base.
00:04:18E esse é o motivo pelo qual tudo ao redor da robótica
00:04:21progrediu, mas a robótica ainda continua presa no mesmo patamar
00:04:24dos últimos 70 anos.
00:04:25Existe um paradoxo muito famoso chamado Paradoxo de Moravec.
00:04:27Não sei se vocês conhecem o Moravec.
00:04:29Ele também era professor da CMU, e eu também sou professor da CMU.
00:04:32Então, com certeza preciso citá-lo.
00:04:34Ele foi uma das figuras fundadoras da IA.
00:04:36Após 30 anos trabalhando em robótica,
00:04:39ele chegou a uma conclusão muito simples.
00:04:41O difícil é fácil.
00:04:42O fácil é difícil.
00:04:43Entendem?
00:04:44Tudo o que um humano acreditava ser difícil
00:04:45é extremamente fácil para os computadores e vice-versa.
00:04:49E você pode ver isso acontecendo bem diante dos seus olhos.
00:04:51Você diria que fazer matemática é difícil.
00:04:53Uma medalha de ouro na Olimpíada de Matemática é muito, muito difícil.
00:04:56Subir uma escada?
00:04:57Era super fácil.
00:04:59Agora olhe ao seu redor na tecnologia.
00:05:01Onde estamos em termos do que foi resolvido
00:05:02e do que não foi resolvido.
00:05:04Esta é a robótica para vocês, entenderam?
00:05:05Ela é muito... não é apenas mais uma aplicação de IA.
00:05:09É para isso que a IA foi fundada bem no início
00:05:12e em que se fez pouquíssimo progresso.
00:05:14Esta não é apenas mais uma aplicação
00:05:15onde redes profundas podem chegar e dominar a área.
00:05:18Isso precisa ser pensado fundamentalmente a partir dos primeiros princípios,
00:05:22desde a base.
00:05:23Este é um exemplo muito famoso em que
00:05:25você pode ter um computador vencendo Garry Kasparov no xadrez
00:05:29nos anos 90, mas ainda não tem um computador, um robô,
00:05:34que consiga pegar as peças de xadrez e organizá-las
00:05:36no tabuleiro.
00:05:37Agora, então como nós resolvemos isso, OK?
00:05:43Em um tom mais positivo, nós temos a receita secreta
00:05:47para o sucesso da IA, certo?
00:05:49Você obtém um grande conjunto de dados.
00:05:51Você treina modelos grandes.
00:05:52E a mágica acontece, OK?
00:05:54Agora, nós sabemos que esse modelo está funcionando muito bem
00:05:57em muitos tópicos, OK?
00:05:59Agora, podemos aplicar essa mesma receita à robótica?
00:06:02Bem, não é diretamente aplicável porque não temos dados.
00:06:06Não existe uma internet de dados de robótica.
00:06:09E como eu disse antes, você pode ir e coletar dados manualmente
00:06:12no robô, algo chamado teleoperação.
00:06:14E como vocês notaram, a teleoperação não é algo de cinco anos atrás.
00:06:18É algo de 68 ou 70 anos atrás.
00:06:21A parte engraçada é que, se você voltar
00:06:24e olhar para toda a evolução dos modelos GPT-3 e GPT-4,
00:06:28volte para o GPT-3 há três anos.
00:06:31Parece que faz uma eternidade.
00:06:33O GPT-3 só começou a funcionar e a chamar a atenção das pessoas
00:06:36quando foi possível treinar esses modelos com trilhões de tokens.
00:06:40Então o GPT-3 já tinha mais de 30 trilhões de tokens.
00:06:42E hoje, são centenas de trilhões de tokens.
00:06:44E se você coleta dados manualmente por teleoperação,
00:06:47leva cerca de um minuto para conseguir um exemplo.
00:06:49Vocês podem fazer as contas.
00:06:50Se você usasse toda a população dos EUA,
00:06:53levaria mais de um século para atingir a mesma escala
00:06:55do GPT-3, que é tipo...
00:06:59E ninguém usa o GPT-3 hoje.
00:07:00Certo?
00:07:01Então isso é muito lento e caro.
00:07:02Portanto, na robótica, eu diria que ninguém
00:07:05realmente escalou a robótica ainda.
00:07:07E estamos muito longe de falar em escalar a robótica
00:07:10da forma como outras áreas viram essa escala.
00:07:14Certo?
00:07:14Então é nisso que temos nos concentrado.
00:07:17A Skild tem cerca de três anos.
00:07:19Mas eu trabalho nesse problema há mais de uma década.
00:07:22É tudo o que fiz na minha carreira.
00:07:24Nada mais.
00:07:26A nossa tese na Skild é
00:07:27construir o que chamamos de inteligência omnicorporal.
00:07:32Qualquer robô, qualquer tarefa, um só cérebro.
00:07:35Certo?
00:07:36Qualquer robô... pode ser um humanoide.
00:07:37Pode ser um quadrúpede.
00:07:38Pode ser um braço robótico numa esteira ou uma mão diestra.
00:07:41Não importa de verdade.
00:07:42E até essa hipótese é muito mais
00:07:45geral do que se argumentaria sobre os humanos,
00:07:48porque nós controlamos nosso próprio corpo.
00:07:50E por que temos que ir tão longe na generalização?
00:07:51Bom, o argumento é que, na robótica,
00:07:54não há dados de qualquer forma.
00:07:56Então não posso escolher de qual hardware vou usar dados.
00:07:59E deveríamos conseguir usar dados de qualquer tipo de hardware,
00:08:02qualquer tipo de tarefa, qualquer tipo de cenário.
00:08:04E essa é a única maneira de realmente alcançar
00:08:06a escala do que os modelos de linguagem alcançaram há três anos.
00:08:10E o objetivo aqui é toda essa ideia de qualquer robô,
00:08:13qualquer tarefa, um só cérebro.
00:08:15E, ao longo desta palestra, espero
00:08:16convencer vocês de que este é o caminho para a robótica.
00:08:20Certo?
00:08:20Então essa é a introdução geral.
00:08:23Mas antes de entrar em mais detalhes,
00:08:24deixe-me mostrar um pequeno demonstrativo.
00:08:28Neste resultado, cada um dos robôs
00:08:31é de uma empresa diferente, um hardware diferente.
00:08:34E todos são controlados por um cérebro da Skild,
00:08:37sejam humanoides subindo e descendo escadas,
00:08:39qualquer tipo de cenário.
00:08:42E estes não são resultados novos.
00:08:43Eles têm uns dois anos de idade aqui.
00:08:47Robustos a perturbações.
00:08:51Você pode colocá-los sem treino prévio em novos cenários.
00:09:03Então a ideia aqui é que cada robô neste vídeo realiza
00:09:08qualquer ação em qualquer lugar do mundo.
00:09:11O cérebro nos bastidores melhora,
00:09:13porque é um cérebro omnicorporal.
00:09:15É, isso é muito difícil, né?
00:09:16Porque os ovos estão inteiros.
00:09:17Então essa é uma prévia do nosso trabalho.
00:09:33Quero tornar esta palestra mais científica e informativa
00:09:38do que uma propaganda da empresa.
00:09:39Então falarei sobre como escalamos os dados na robótica.
00:09:42Vamos relembrar como as pessoas abordavam isso.
00:09:45Vou dar uma olhada na minha própria carreira.
00:09:48E minha hipótese sobre dados mudou ao longo dos anos.
00:09:51Quando comecei a trabalhar e a escalar coisas,
00:09:55a ideia era que você pode coletar dados para robôs manualmente,
00:09:59mas é lento demais.
00:10:00E os robôs deveriam poder coletar dados sozinhos.
00:10:03Então tivemos essa ideia de exploração movida pela curiosidade,
00:10:06permitindo que os robôs explorem o ambiente com curiosidade.
00:10:10E isso tem muitas vantagens, como não precisar de humanos.
00:10:13Os robôs podem ir, continuar interagindo e coletar mais dados.
00:10:15Chamávamos isso de dados de exploração na época.
00:10:17É muito rico, pois tem força, sensores e ângulos de articulação.
00:10:21Mas a dificuldade é que existe apenas no mundo físico.
00:10:24Então é muito difícil de escalar.
00:10:27O Google estava tentando isso na época, tendo centenas de robôs.
00:10:31Até para o Google, é caro e lento demais para escalar.
00:10:34A outra ideia é, novamente, a teleoperação.
00:10:36Como eu disse, é uma ideia antiga.
00:10:38Mas, novamente, os mesmos problemas.
00:10:39Impossível de escalar, porque agora você não precisa só do robô.
00:10:42Você também precisa de humanos.
00:10:43Então é ainda mais caro.
00:10:45E a diversidade é muito limitada.
00:10:46Porque mesmo que coloque um robô em um ambiente com um humano,
00:10:50você pode obter 1.000 exemplos.
00:10:51Mas todos estarão na mesma configuração.
00:10:53O ideal seria levar o robô para uma nova casa
00:10:57a cada dia, um novo cenário.
00:10:58E isso é incrivelmente difícil de escalar.
00:11:01Aí tivemos um avanço enorme no aprendizado
00:11:03por simulação.
00:11:04Esse foi um dos primeiros resultados a mostrar
00:11:08aprendizado de reforço profundo, treinado em simulação,
00:11:12sendo transferido para um robô real.
00:11:13Foi um artigo premiado na época.
00:11:16E agora é usado em todo humanoide, em toda empresa por aí.
00:11:20Isso veio de um laboratório em Berkeley e da CMU.
00:11:23Mas, novamente, há prós e contras.
00:11:25É muito fácil de escalar.
00:11:27Mas a diversidade é difícil, pois você precisa criar
00:11:29cada cena na simulação manualmente.
00:11:31Então, se estão ouvindo isso, não há
00:11:34uma resposta única para a qual estou caminhando.
00:11:35Não existe uma solução única.
00:11:39Este é outro trabalho que fizemos anteriormente.
00:11:41Tudo isso antes de escalar.
00:11:43Aprender com vídeos de humanos.
00:11:44Você observa o humano fazendo e o robô copia.
00:11:47Novamente, alta diversidade.
00:11:48Você pode usar vídeos do YouTube, etc.
00:11:50Altamente escalável.
00:11:51Mas é uma forma de dado muito fraca,
00:11:54porque está muito distante do robô.
00:11:57Então qual é a solução aqui?
00:11:59A resposta é que não há um caminho perfeito.
00:12:01É preciso pensar em dados no contexto
00:12:05de diferentes características.
00:12:06Na minha opinião, existem apenas três características
00:12:09que importam na robótica:
00:12:12escalabilidade, diversidade e o quão próximo você está
00:12:15dos ângulos das articulações do robô.
00:12:18Escalabilidade significa: posso escalar isso rapidamente em vários cenários?
00:12:22Diversidade significa: posso obter dados variados?
00:12:25Porque ter 100 trilhões de tokens
00:12:27é totalmente inútil se estiverem todos
00:12:29no mesmo ambiente e nos mesmos cenários.
00:12:32E a proximidade do robô significa: o quão distante você está
00:12:35dos dados reais dos ângulos das articulações do robô?
00:12:38Se olhar para a simulação: muito escalável, pouca diversidade,
00:12:42mas moderadamente próxima do robô.
00:12:44Vídeos humanos são muito escaláveis e diversos,
00:12:46mas muito distantes dos dados do robô.
00:12:47É preciso aprender a mapear o humano para o robô.
00:12:49Essas outras duas, teleoperação e interfaces de manipulação,
00:12:52estão meio que no meio do caminho.
00:12:54E dá para ver aqui, atualmente, pelo mundo,
00:12:57se olhar para diferentes empresas,
00:12:58todas estão focadas em uma dessas abordagens.
00:13:01A maioria está em teleoperação ou sistemas Yumi.
00:13:05Muito poucas no resto.
00:13:07Mas não existe uma resposta mágica.
00:13:09Cada uma delas tem um lado negativo.
00:13:11Mas a grande vantagem é que todas se complementam.
00:13:15Elas não... os contras delas não coincidem exatamente
00:13:16entre si.
00:13:19É aqui que a receita para a qual convergimos ao longo dos anos
00:13:20foi perceber... separar o treinamento em duas partes,
00:13:24pré-treinamento e pós-treinamento.
00:13:27Sem surpresas até aí, né?
00:13:29Mas como fazemos o pré-treinamento?
00:13:30Queremos pré-treinar usando dados
00:13:31Você quer pré-treinar usando dados que
00:13:32sejam altamente escaláveis e diversos, mas talvez de baixa qualidade.
00:13:35Como simulação, vídeos humanos, etc.
00:13:37É assim que se faz o pré-treinamento.
00:13:39E depois, no pós-treinamento, você usa dados de teleoperação.
00:13:42O que são dados de teleoperação?
00:13:43São de altíssima qualidade, mas em pequena quantidade, ok?
00:13:47Alta qualidade, pequena quantidade.
00:13:48Isso nos lembra exatamente a receita dos modelos de linguagem.
00:13:51Você faz o pré-treinamento com dados da internet.
00:13:53Depois faz o pós-treinamento para programação, para a sua empresa, etc.
00:13:59Mas na robótica há mais uma categoria,
00:14:00que são os dados de implantação.
00:14:02E os dados de implantação são altamente escaláveis
00:14:05assim que a implantação ganha escala.
00:14:07Então, com o tempo, esses dados vão superar todos os outros.
00:14:11E o que estamos tentando construir é o que
00:14:14chamamos de volante de dados, que
00:14:16pega esses dados da etapa de pós-treinamento
00:14:18e os coloca de volta no pré-treinamento.
00:14:20E agora você percebe por que essa ideia de cérebro multicorporal
00:14:23é extremamente importante, porque
00:14:25é muito improvável que você tenha só um robô, só uma
00:14:28versão implantada para sempre em todas as tarefas do mundo.
00:14:32Isso nunca acontece em nenhuma área de hardware, exceto chips,
00:14:36porque eles são muito difíceis de fabricar.
00:14:38E ainda assim você vê, até mesmo nos chips,
00:14:40chips de inferência surgindo a todo momento
00:14:42para várias empresas hoje em dia.
00:14:43Então em hardware esse nunca é o caso.
00:14:45Você ter só uma versão do robô, um só formato,
00:14:48e é por isso que a inteligência multicorporal
00:14:50é o elemento chave do que chamamos de volante de dados de implantação.
00:14:56Então vamos ver agora alguns resultados bem rápidos.
00:14:58Esse cérebro é extremamente geral,
00:15:00então podemos realizar uma variedade de tarefas muito rapidamente.
00:15:03Vocês já devem ter visto muitas tarefas como dobrar roupa,
00:15:06e coisas assim.
00:15:07É uma tarefa muito popular no Vale do Silício, por algum motivo.
00:15:10E o ponto aqui é: quando foi que você
00:15:14pensou, ao dobrar uma camiseta, que se errasse a mão
00:15:18por um centímetro, a dobradura da camiseta viraria uma bagunça?
00:15:22Você não pensa assim.
00:15:23As pessoas nem pensam enquanto dobram.
00:15:25Elas só pegam em qualquer lugar.
00:15:26Você simplesmente faz.
00:15:27A tolerância a erros é extremamente, extremamente alta.
00:15:31Então por que essa tarefa é difícil?
00:15:35Alguém... por que as pessoas são enganadas
00:15:38achando que essa tarefa é difícil?
00:15:39Deixe-me colocar dessa forma.
00:15:42Tecido, certo?
00:15:43Por que tecido é difícil?
00:15:46Simulação, mas ninguém está usando simulação de qualquer forma.
00:15:48É tudo feito por teleoperação.
00:15:49Por que isso é difícil?
00:15:51Sabe por que é difícil?
00:15:52Porque é difícil para a versão clássica da robótica.
00:15:56Classicamente na robótica, as pessoas modelavam toda a física,
00:15:59criavam modelos à mão e depois faziam isso.
00:16:01É muito difícil para isso.
00:16:02Mas para a robótica baseada em aprendizado profundo,
00:16:04essa é a tarefa mais fácil possível,
00:16:06porque tem alta tolerância a erros.
00:16:08Então é completamente...
00:16:09agora, tantas empresas focando nessa tarefa.
00:16:12Agora, o que é difícil, eu diria,
00:16:13é algo como, digamos, essa tarefa.
00:16:17Se eu perguntasse a você, antes de ver esse vídeo,
00:16:19essa tarefa é viável sem ter mãos?
00:16:22Muito provavelmente, metade das pessoas diria não,
00:16:24porque exige colocar...
00:16:25tipo, quantos de vocês já perderam AirPods?
00:16:29E na nossa empresa, há um canal
00:16:30chamado "AirPod direito", porque as pessoas vivem
00:16:32perdendo o AirPod direito.
00:16:34Nesse caso, o robô não tem mão.
00:16:36Ele tem garra.
00:16:37Então aqui a tarefa é muito difícil para a garra.
00:16:41Isso exige um nível mais alto de inteligência,
00:16:43porque o braço precisa ir e se orientar
00:16:46para pegar o AirPod do jeito certo,
00:16:49de modo que possa ser inserido, pois as garras só podem
00:16:52se fechar assim.
00:16:54Elas são paralelas às suas pinças.
00:16:55Portanto, você não pode girar o AirPod no final.
00:16:59O que você está vendo aqui não são AirPods reais.
00:17:02São falsificados da Temu, de uns 5 ou 10 dólares cada.
00:17:05Então eles não têm ímã dentro.
00:17:07Assim, o robô tem que se esforçar muito para encaixar isso direito,
00:17:11porque não há ímã para puxar facilmente.
00:17:13Então esses são todos falsos.
00:17:15Isso é ainda mais difícil do que parece no vídeo.
00:17:17Você também pode... depois que constrói o cérebro geral nos bastidores,
00:17:23aprender a partir de uma variedade de vídeos apenas de humanos,
00:17:26sem realmente ter dados de ajuste fino
00:17:28no momento da teleoperação.
00:17:29Nesse cenário, o que fizemos foi
00:17:31treinar com vídeos humanos como este, em primeira pessoa.
00:17:34Agora estamos tentando transferir isso para vídeos em terceira pessoa.
00:17:38E se funcionar em terceira pessoa, você pode aprender pelo YouTube,
00:17:40qualquer tipo de dado de código aberto.
00:17:43Nesse caso, nós vemos o vídeo
00:17:45e depois adicionamos menos de uma hora de dados do robô.
00:17:47Ou seja, uma transformação muito rápida.
00:17:50E aí isso pode ser transferido para humanoides.
00:17:53Agora, estes aqui têm mãos.
00:17:54Ter mãos ou não ter é um grande debate.
00:17:57As pessoas costumam usar as mãos como desculpa para dizer por que a robótica não
00:18:00está avançada, mas não é o caso.
00:18:02É sempre a inteligência por trás de tudo.
00:18:07Nós não implantamos mãos agora, porque não há nenhuma
00:18:09disponível que possa ser usada em fábricas.
00:18:12Elas quebram em menos de 100 horas.
00:18:14Escolha qualquer uma.
00:18:17Se você tiver uma mão melhor, eu adoraria
00:18:19comprar 10 unidades o quanto antes para testar.
00:18:22Então são cenários robustos.
00:18:25Agora, a ideia é que dá para fazer muitas tarefas observando humanos.
00:18:28E a razão pela qual podemos trabalhar com pouquíssimos dados,
00:18:31que é menos de uma hora de dados do robô,
00:18:33é porque o robô imagina as coisas em sua própria cabeça
00:18:36e tenta multiplicar o aprendizado para vários cenários.
00:18:39O que você vê aqui é um vídeo totalmente simulação.
00:18:42Você pode chamar de sonho do robô.
00:18:43Acontece dentro do próprio modelo do robô,
00:18:45onde ele pode imaginar cenários.
00:18:48Portanto, estes não são dados reais.
00:18:49É tudo gerado pelo próprio modelo do robô.
00:18:52Você pode transferir isso para tarefas mais complexas
00:18:56e até para hardware de menor custo.
00:18:57Esta é uma tarefa de fazer ovos, como fazer uma omelete.
00:19:02Aqui, toda essa estrutura custa cerca de 4.000 dólares.
00:19:06Braços extremamente baratos comparados ao que se vê por aí.
00:19:11E se você notar aqui, esse conjunto é barato demais
00:19:15até para ter qualquer sensor.
00:19:16O único sensor aqui é só uma câmera, sem força, nada mais.
00:19:20E o robô consegue fazer tarefas que exigem força apenas através da visão.
00:19:25Agora, não estou dizendo que esse seja o futuro.
00:19:26Como se você não devesse fazer isso.
00:19:27Tenho certeza de que os sensores vão melhorar.
00:19:29Mas, com os sensores existentes, nós
00:19:33estamos muito atrás do potencial que temos só sob a
00:19:36perspectiva da inteligência.
00:19:38Então isso pode continuar rodando.
00:19:39Este é meu orientador de Berkeley.
00:19:41Ele não acreditava que os robôs pudessem fazer isso.
00:19:43Ele ficou parado ali por cerca de uma hora.
00:19:45E o robô continuou fazendo omeletes.
00:19:48E a parte interessante aqui é que este
00:19:49é um sistema totalmente ponta a ponta.
00:19:51Não há máquina de estados, nada.
00:19:53Então a razão pela qual o robô está preparando o ovo,
00:19:55é porque há um prato vazio na frente dele.
00:19:56Não sei por que está oscilando.
00:19:58Não há nenhum corte no vídeo.
00:20:00Garanto isso a vocês.
00:20:01É um problema no HDMI.
00:20:02Então, assim que você remove o prato...
00:20:06desculpe, não sei por que isso aconteceu.
00:20:08Sim, não há máquina de estados.
00:20:10Quando o robô começa, quando o robô termina,
00:20:11é tudo automatizado.
00:20:12E é muito robusto, mesmo a perturbações.
00:20:14Você pode mudar os objetos de lugar.
00:20:16Você pode adicionar... estes são todos objetos inéditos.
00:20:20Apenas a frigideira e o fogão a gás são os mesmos.
00:20:22Todo o resto é diferente.
00:20:23E o robô pode continuar sem parar.
00:20:25Assim você obtém uma robustez básica.
00:20:27Isso tudo foi treinado com menos de 10 horas de dados.
00:20:30São pouquíssimos dados para aprender essa robustez.
00:20:33E isso vem do modelo base nos bastidores.
00:20:37Vou pular isso para poupar tempo.
00:20:39Diferente das arquiteturas tradicionais de robótica,
00:20:42onde você tem planejamento, mapeamento, etc.,
00:20:44este é um cérebro ponta a ponta.
00:20:46Agora, “ponta a ponta” é um termo muito usado em várias áreas de IA.
00:20:50Mas quando digo ponta a ponta, é realmente ponta a ponta.
00:20:53Ele lê diretamente das câmeras.
00:20:55Ele aplica energia diretamente aos motores.
00:20:59Não usamos nada no meio, exceto apenas um PID
00:21:02bem no final, para passar de 100 para 500 Hertz.
00:21:04Mas o PID não é uma contribuição da robótica.
00:21:06É de antes.
00:21:07Remonta à Segunda Guerra Mundial ou algo assim.
00:21:10Agora, a parte interessante é que a visão, para nós,
00:21:13é apenas mais uma entrada.
00:21:15Não há nada de tão demais nisso.
00:21:17Se vocês viram... talvez tenham visto muitos resultados
00:21:20de robôs dançando, fazendo caratê, kung fu, mortal para trás.
00:21:23Pensem bem: quantos resultados
00:21:27vocês viram de robôs subindo e descendo escadas?
00:21:30Muito poucos.
00:21:31Mesmo as principais empresas de humanoides,
00:21:34elas não mostraram mais do que um degrau de amostra
00:21:37só para cumprir tabela.
00:21:39E as pessoas dizem que os humanoides estão chegando, China versus EUA.
00:21:42Tudo isso é meio bobagem.
00:21:44Afinal, se os humanoides não conseguem subir escadas,
00:21:47qual é o sentido de ter pernas?
00:21:50Essa é a única razão para se ter pernas.
00:21:51Isso é na verdade o paradoxo de Moravec em ação.
00:21:55O da esquerda na verdade é muito mais fácil para um robô.
00:21:58Um mortal para trás, dançar, é muito mais fácil para o robô.
00:22:01E vocês podem pensar: “Ok, por que esse paradoxo existe?”
00:22:04Pensem um nível mais fundo.
00:22:05Quando um robô está dando um mortal para trás,
00:22:09ele só precisa saber sobre seu próprio corpo, nada mais.
00:22:13Certo?
00:22:13E quando tudo é conhecido ou totalmente observado,
00:22:17é nisso que os computadores são bons.
00:22:20Porque eles podem simular cada configuração possível.
00:22:25Mas o da direita, até o simples ato de subir escadas,
00:22:27exige enxergar os degraus em primeiro lugar.
00:22:30Ou qual é a altura, qual é a largura.
00:22:32Você não mede a altura e a largura com precisão,
00:22:34mas se ajusta a todas as perturbações.
00:22:35E isso requer visão.
00:22:36Então o da direita requer compreensão.
00:22:38E é por isso que é difícil e você não vê nada disso.
00:22:40Mas para nós, é apenas mais um resultado.
00:22:42Não importa muito.
00:22:43Publicamos este resultado há um ano e meio.
00:22:46Gravamos isso há dois anos e meio.
00:22:48Mas este robô pode ir a qualquer cenário.
00:22:52Ele não fica tropeçando nas coisas.
00:22:53Ele passa por cima das coisas intencionalmente.
00:22:55E não há mapeamento nem planejamento.
00:22:56Ele não faz nenhum mapa 3D dos arredores.
00:22:59Ele opera totalmente a partir da câmera no torso.
00:23:02E você pode colocá-lo em qualquer tipo de ambiente, qualquer escada.
00:23:05Vou passar mais rápido aqui.
00:23:07Estas são escadas de incêndio.
00:23:11É um pouco estranho.
00:23:12Escadas de incêndio são para emergências de incêndio.
00:23:15E são as mais difíceis de qualquer prédio.
00:23:17Então estamos testando em todos esses ambientes.
00:23:20Mas você pode colocar de qualquer jeito.
00:23:21Você pode empurrá-lo nas escadas.
00:23:22Não importa.
00:23:23Esta é uma capacidade sobre-humana.
00:23:25Porque o robô não consegue ver que está sendo puxado.
00:23:27Então há um fator surpresa para o robô
00:23:29quando você o puxa enquanto ele sobe.
00:23:31E, novamente, é o mesmo modelo em todos os lugares
00:23:33em todos esses cenários.
00:23:35Então é muito simples.
00:23:36Embora seja simples, o parkour parece divertido.
00:23:40E as pessoas costumam achar que, tipo...
00:23:45os robôs conseguem fazer tudo isso.
00:23:47Mas isso é muito mais fácil do que o que mostrei antes.
00:23:51E mesmo que vejam estes vídeos agora,
00:23:53muitos de vocês acharão isso mais impressionante,
00:23:55embora eu esteja dizendo que é fácil.
00:23:57Leva meia hora para treinar isso,
00:23:59enquanto o anterior leva muito mais tempo e é bem mais
00:24:01difícil de treinar.
00:24:03Você pode pegar esse modelo base e transferi-lo
00:24:06para uma variedade de tarefas muito rapidamente.
00:24:08Aqui, este é um resultado bem antigo,
00:24:09de cerca de um ano e meio atrás.
00:24:11Para inserir cabos de rede, etc.,
00:24:13temos sistemas muito avançados agora.
00:24:14Mas já estamos implantando esses modelos
00:24:17em uma variedade de aplicações.
00:24:18Por exemplo, para construir um ciclo de dados,
00:24:21a parte mais difícil é a própria implantação.
00:24:24Existem tantos outros problemas além da inteligência
00:24:26e do hardware que surgem quando você implanta a robótica.
00:24:30Isso não é o mesmo que implantar o ChatGPT num aplicativo.
00:24:34Porque você precisa contornar muitos dos...
00:24:36acho que a Skydio deu uma palestra antes,
00:24:38e eles podem falar com vocês o dia todo
00:24:40sobre a dificuldade da implantação.
00:24:42Então precisamos começar a implantação agora,
00:24:44para ter esse ciclo de dados num futuro próximo.
00:24:47E vou dar alguns exemplos de implantação que estamos fazendo.
00:24:49Um dos exemplos é com a NVIDIA...
00:24:51a NVIDIA está abrindo sua primeira fábrica em Houston.
00:24:54E as GPUs deles, que vocês usam agora,
00:24:56são todas construídas fora dos EUA, principalmente em Taiwan.
00:24:59E é tudo feito manualmente lá.
00:25:01E os humanos são muito eficientes e muito, muito bons
00:25:04em fazer essas coisas.
00:25:05Mas sustentar o custo, a escalabilidade e o rendimento
00:25:08aqui nos EUA é muito difícil de manter
00:25:10sem essa força de trabalho.
00:25:11Então, aqui, estamos automatizando a montagem de GPUs para eles.
00:25:15Fizemos uma demonstração ao vivo no NVIDIA GTC.
00:25:19Isso já foi implantado na fábrica na semana passada,
00:25:21então já está em operação.
00:25:22Mas a parte interessante que quero destacar:
00:25:25esta é uma tarefa de fábrica muito tradicional.
00:25:29Mas se você olhar para toda a estrutura,
00:25:32ela é extremamente aleatória, extremamente ruidosa.
00:25:36E se você for a qualquer fábrica, em uma estrutura tradicional,
00:25:38elas são extremamente limpas.
00:25:39Aqui, o robô, o mesmo cérebro,
00:25:42pode não apenas fazer tarefas muito precisas,
00:25:44como pode ser muito robusto a qualquer tipo de perturbação, o que
00:25:46significa que agora esses robôs não precisam ficar em uma gaiola.
00:25:50E podem ser implantados como estão nessas linhas de fábrica
00:25:54sem qualquer alteração na linha de montagem.
00:25:56Ao lado de humanos, e onde há humanos, há bagunça.
00:26:00Certo?
00:26:00Você pode usar o mesmo cérebro para aplicações de entrega.
00:26:02Aqui, o robô faz entregas do caminhão até a porta.
00:26:06Ele tem que descobrir onde fica a porta da frente.
00:26:08Portanto, é um problema de bom senso.
00:26:09Não é um problema de mobilidade.
00:26:10E nós já temos entregado pacotes,
00:26:12trabalhando nos bastidores com vários parceiros,
00:26:15para entregar pacotes na porta da frente das casas
00:26:17nessas áreas.
00:26:19A mesma configuração funciona em armazéns e em tudo mais.
00:26:23Agora, apenas para encerrar a palestra, fechar o tópico,
00:26:26eu mencionei que este é um cérebro omnicorpo.
00:26:29E espero que esteja muito claro por que é extremamente essencial
00:26:31ter um cérebro omnicorpo para construir um volante de dados.
00:26:34Mas há um benefício extra.
00:26:35E o benefício é que seus robôs podem quebrar com o tempo
00:26:38e nos cenários de segurança.
00:26:41E a segurança é um subproduto desse cérebro omnicorpo.
00:26:44Porque se você tem um...
00:26:45podemos colocar o... estou pulando muito rápido.
00:26:47Você pode ver online.
00:26:48Isso é tudo online.
00:26:49Mas podemos colocar o mesmo cérebro em cada um desses sistemas,
00:26:52em cada um desses robôs.
00:26:55E neste caso, nós nem sequer treinamos nestes robôs.
00:26:58Esta é uma transferência completamente zero-shot
00:27:00para todos esses humanoides e todas essas coisas.
00:27:02E mesmo que o robô quebre, e aqui a perna quebra,
00:27:05ele consegue se recuperar em milissegundos.
00:27:07Porque quando sua perna quebra, seu robô de três pernas
00:27:10é um robô novo.
00:27:12Portanto, não importa realmente qual é o formato do robô.
00:27:14Com qualquer mudança, aqui desativamos as pernas do robô.
00:27:17Ele aprende a andar em duas pernas em apenas três tentativas.
00:27:21Então, o que você está vendo na tela é todo o treinamento
00:27:24para o robô que está acontecendo nesses sistemas.
00:27:27Portanto, ele se adapta em poucos milissegundos a 30 segundos ou mais.
00:27:32E como um exemplo aqui, ele está andando sobre rodas.
00:27:34Você trava a roda.
00:27:36Ele começa a andar.
00:27:37Este é outro subproduto do cérebro omnicorpo.
00:27:40A segurança assume um significado muito diferente com esses tipos de modelos
00:27:45quando o robô pode voar...
00:27:46ou desculpe, quando os robôs podem andar ou operar
00:27:49com apenas metade do corpo.
00:27:50Eu removi algumas das cenas sangrentas daqui,
00:27:52mas também cortamos o robô ao meio.
00:27:54Ele ainda pode funcionar com as duas metades separadamente.
00:27:57Mas para isso, você pode ir ao YouTube.
00:27:59E é tudo o que tenho.
00:28:00Obrigado.

설명

Show a robotics demo from 1957 next to one from today, and most people can't tell which is which. Deepak Pathak, co-founder and CEO of Skild AI and a professor at Carnegie Mellon, argues robotics stalled because it was treated as a hardware problem rather than a problem of building a general brain. Collecting robot data by teleoperation at one example a minute, he calculates, would take the entire US population more than a century to reach GPT-3 scale. Skild's answer is an "omni-bodied" brain: one model for any robot and any task. It's pre-trained on scalable data like simulation and human video, post-trained on teleoperation, and improved by a deployment flywheel. Pathak shows it inserting AirPods with a simple gripper, learning from human video with under an hour of robot data, and cooking omelets on $4,000 arms with only a camera. He explains why climbing stairs is harder than a backflip. He also shows GPU assembly for NVIDIA's Houston factory, and a robot learning to walk on two legs in three tries after its other legs are disabled. Speaker info: X/Twitter: @pathak2206 (https://x.com/pathak2206) LinkedIn: https://www.linkedin.com/in/pathak22 Website: https://www.cs.cmu.edu/~dpathak Related links: Skild AI: https://www.skild.ai Timestamps: 0:00 AI's progress and the robotics hype 1:02 Robotics has been "almost here" for 70 years 1:27 A 1960s block-copying robot 2:17 Teleoperation in 1957 3:57 Why robotics is stuck: the missing general brain 4:27 Moravec's paradox 5:42 There's no internet of robot data 7:22 Skild's thesis: one brain, any robot, any task 8:22 Teaser: many robots, one brain 9:31 How to scale robot data: a career retrospective 12:01 The three properties of robot data that matter 13:21 Pre-training, post-training and the deployment flywheel 14:56 Why laundry folding is actually easy 16:17 The AirPods task 17:21 Learning from human videos 18:36 The robot's "dream": imagined training data 18:56 Cooking omelets on $4,000 arms 20:41 Truly end-to-end: camera in, motor power out 21:21 Why stairs are harder than backflips 24:50 Deployment: GPU assembly for NVIDIA 26:00 Package delivery to the front door 26:25 Safety: adapting when the robot breaks

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기