70년간 제자리걸음이었던 로봇 공학 기술 — 디팍 파탁, Skild AI

Transcript

00:00:00지난 5년 동안 AI가 얼마나 눈부시게
00:00:15발전했는지는 다들 잘 아실 겁니다.
00:00:17지난 100년 동안 이뤄낸 발전보다 더 크게 느껴질 정도죠.
00:00:22특히 AI 분야의 흐름을 보면
00:00:24언어에서 시작해 음성, 오디오, 비디오로 확장되어 왔습니다.
00:00:28그리고 모두가 기대하는 다음 단계는 로봇공학입니다.
00:00:32이러한 기대감은 무슨 이유에서인지 올해 정점에 달하고 있는데,
00:00:37저는 아직도 그 이유를 잘 이해하기 어렵습니다.
00:00:40젠슨 황 같은 리더들도
00:00:43로봇공학의 다음 개척지로 피지컬 AI를 언급하는 것을 보셨을 겁니다.
00:00:46트위터나 링크드인을 열어보면
00:00:49마치 로봇 기술이 이미 도래한 것처럼 보입니다.
00:00:51많은 이들이 장담하듯, 오는 12월쯤이면 가정용 로봇을
00:00:56집에 하나씩 두게 될 것처럼 말이죠.
00:00:58하지만 로봇공학은 지난 70년 동안이나
00:01:03'곧 상용화될 기술'에 머물러 있었다는 점을 짚고 싶습니다.
00:01:06최근 4~5년 사이에 로봇공학에 입문하신 분들은
00:01:10아무 로봇공학 강의나 하나 들어보십시오.
00:01:14만약 30년 전 로봇 영상과 오늘날의 영상을
00:01:17구분해내실 수 있다면, 제가 맛있는 저녁을 사드리죠.
00:01:23예를 들어, 이 로봇을 한 번 보시죠.
00:01:26여기 있는 건 로봇과 사진입니다.
00:01:27이 로봇의 목표는 블록 사진을 보고
00:01:31자신 앞에 있는 블록들을 배치해서
00:01:34사진 속 패턴과 똑같이 만드는 것입니다.
00:01:37아시겠죠?
00:01:38매우 간단한 작업처럼 보입니다.
00:01:40하지만 생각해보면 3D 블록이잖아요.
00:01:42각 각도에서 입체 형태를 파악해야 합니다.
00:01:44그리고 이 로봇은 꽤 정교하게 해냅니다.
00:01:47이 실험 결과가 얼마나 오래전 것인지 맞혀보실 분 계신가요?
00:01:51아무나 편하게
00:01:51추측해보세요.
00:01:52아무 숫자나 불러보세요.
00:01:53네?
00:01:5440년이요.
00:01:55좋습니다.
00:01:55그게 가장 높이 부른 수인가요?
00:01:59이 영상은 1960년대 것입니다.
00:02:01컴퓨터가 보급되기도 훨씬 전이죠.
00:02:03아시겠나요?
00:02:04'MIT 카피 데모'라 불리는 시연입니다.
00:02:06이것이 시작이었죠--
00:02:09우리가 오늘날 아는 AI보다도 앞선 시대였습니다.
00:02:12이 영상도 한번 보시죠.
00:02:17필라델피아 원자력 의회에 전시된 한 출품작이
00:02:19엄청난 인기를 끌고 있습니다.
00:02:21무슨 상황이냐면, 무대 뒤에 있는 사람이
00:02:24마스터-슬레이브 시스템으로 로봇을 제어하는 것입니다.
00:02:27오늘날 거대 연구소, 대기업,
00:02:31유명 대학 연구실에서 데이터를 수집하는 방식을 보면
00:02:33원격 조작 시스템을 사용하는데, 이 역시
00:02:35정확히 똑같은 원리를 따르고 있죠.
00:02:38이 영상은 몇 년도 것일까요?
00:02:40전자 장치를 다루는 숙련된 작업자가--
00:02:42이제 다들 연도를 훨씬 높여서 예상하시겠죠.
00:02:45이것은 68년 전인 1957년 영상입니다.
00:02:49놀랍죠?
00:02:51가족 중 더 연세가 있으신 분께--
00:02:53사실 당시를 기억하는 분이 안 계실 수도 있겠네요.
00:02:55왜냐하면 이건...
00:02:5780세이신 분께 여쭤봐야 하는데,
00:02:59당시 기술 수준이 어땠는지 물어보셔야 하니까요.
00:03:02RAM 몇 킬로바이트를 얻으려면 방 하나만한 크기의
00:03:06거대한 장비가 필요하던 시절이었습니다.
00:03:07그런 시대에 이미 저런 기술을 구현해낸 겁니다.
00:03:11이뿐만이 아니라 10년 단위로 돌아가서 봐도
00:03:14영상 속 로봇들은 여전히 근사합니다.
00:03:15여기 저글링을 하고 사람과 테이블 축구를 하는
00:03:18휴머노이드 로봇이 있습니다.
00:03:21이 역시 모두 딥러닝이 등장하기 전의 일입니다.
00:03:25이것은 8년 전 영상인데요.
00:03:26버클리 대학에서 만든 이 로봇은
00:03:29탁자 전체를 치우고 물건을 상자에 정리할 수 있습니다.
00:03:33대학원생 한 명이 단 한 대의 GPU 컴퓨터로 해낸 결과물이었죠.
00:03:36그 이상 특별한 건 없었습니다.
00:03:37그렇죠?
00:03:38만약 제가 이 과거 영상들에 색을 입히고
00:03:41생성형 AI 필터를 씌워 세련된 목소리를 입힌다면
00:03:45이 영상이 1957년 영상인지,
00:03:49아니면 오늘날의 영상인지 구분할 수 없을 겁니다.
00:03:50심지어 이것들도 가장 오래된 연구 결과가 아닙니다.
00:03:52가장 오래된 것은 1940년대까지 거슬러 올라갑니다.
00:03:54아시겠나요?
00:03:55지난 70년을 돌이켜보면
00:04:00다른 모든 기술 분야는
00:04:02엄청난 발전을 이루었습니다.
00:04:04언어 이해, 컴퓨터 비전, 모바일, 반도체까지 말이죠.
00:04:08그런데 왜 로봇공학은 이토록 오랫동안 원시적인 단계에 갇혀 있을까요?
00:04:11그 이유는 범용 두뇌의 부재 때문입니다.
00:04:14로봇공학은 늘 근본적으로
00:04:17하드웨어 문제로만 접근되어 왔습니다.
00:04:18그렇기 때문에 로봇 주변의 모든 기술은 발전했어도
00:04:21로봇공학 자체는 지난 70년 동안
00:04:24제자리에 정체되어 있었던 것입니다.
00:04:25여기 '모라벡의 역설'이라는 매우 유명한 역설이 있습니다.
00:04:27모라벡에 대해 들어보셨는지 모르겠네요.
00:04:29그분도 CMU 교수였고, 저 역시 CMU 교수입니다.
00:04:32그러니 당연히 인용해야겠죠.
00:04:34그는 AI 분야의 개척자 중 한 명이었습니다.
00:04:36로봇공학 연구에 30년을 바친 끝에
00:04:39그는 아주 명쾌한 결론에 도달했습니다.
00:04:41'어려운 것은 쉽고,
00:04:42쉬운 것은 어렵다.'
00:04:43무슨 뜻일까요?
00:04:44인간이 어렵다고 생각하는 일은
00:04:45컴퓨터에게는 너무나 쉽고, 그 반대도 마찬가지라는 겁니다.
00:04:49지금 여러분 눈앞에서도 그 현상이 벌어지고 있죠.
00:04:51수학 문제를 푸는 건 어렵다고 생각할 겁니다.
00:04:53수학 올림피아드 금메달을 따는 건 정말 어렵죠.
00:04:56그럼 계단을 오르는 건요?
00:04:57우리에게는 너무나 쉬운 일입니다.
00:04:59이제 지금의 기술 현실을 둘러보십시오.
00:05:01무엇이 해결되었고
00:05:02무엇이 아직 해결되지 않았는지를요.
00:05:04이것이 바로 로봇공학의 현주소입니다.
00:05:05로봇공학은 단순히 AI를 응용하는 또 하나의 분야가 아닙니다.
00:05:09원래 AI가 처음 탄생한 목적이었지만
00:05:12가장 진전이 없었던 분야인 것이죠.
00:05:14심층 신경망을 단순 적용해서
00:05:15정복할 수 있는 그런 흔한 분야가 아닙니다.
00:05:18이 문제는 제1원칙에 기반해 근본적으로
00:05:22다시 고민해야 하는 분야입니다.
00:05:23유명한 예시가 하나 있죠.
00:05:251990년대에 이미 컴퓨터가 체스 세계 챔피언 가리 카스파로프를 이겼지만,
00:05:29체스말을 직접 집어서 체스판 위에
00:05:34배치할 수 있는 컴퓨터나 로봇은
00:05:36여전히 존재하지 않는다는 점입니다.
00:05:37그렇다면 이 문제를 어떻게 해결해야 할까요?
00:05:43긍정적인 면을 보자면, 우리에게는 AI 성공을 이끄는 비법이 있습니다.
00:05:47그렇죠?
00:05:49방대한 데이터셋을 구축하고,
00:05:51거대 모델을 학습시키면
00:05:52마법 같은 일이 일어납니다.
00:05:54이 공식이 여러 분야에서 아주 잘 작동한다는 것을
00:05:57우리는 이미 알고 있습니다.
00:05:59그렇다면 같은 방식을 로봇공학에도 적용할 수 있을까요?
00:06:02안타깝게도 데이터가 없기 때문에 바로 적용할 수는 없습니다.
00:06:06로봇공학 분야에는 인터넷 같은 데이터 집합체가 없습니다.
00:06:09앞서 말씀드렸듯, 원격 조작이라는 방식으로
00:06:12로봇 데이터를 수동으로 수집할 수는 있습니다.
00:06:14하지만 아시다시피 원격 조작은 최근 5년 사이에 나온 기술이 아닙니다.
00:06:18무려 68년, 70년이나 된 기술이죠.
00:06:21재미있는 점은, 지난 시간을 돌아보며
00:06:24GPT-3, GPT-4 모델의 진화 과정을 살펴보면
00:06:283년 전 GPT-3 시절로 돌아가 보겠습니다.
00:06:31까마득한 옛날처럼 느껴지죠.
00:06:33GPT-3가 제대로 작동하고 사람들의 주목을 받기 시작한 건
00:06:36수조 개의 토큰으로 모델을 학습시킬 수 있게 되면서부터였습니다.
00:06:40GPT-3 때 이미 30조 개 이상의 토큰이 쓰였고,
00:06:42오늘날에는 수백조 개의 토큰이 사용됩니다.
00:06:44반면 원격 조작으로 데이터를 직접 수집하면
00:06:47데이터 1개를 얻는 데 약 1분이 걸립니다.
00:06:49계산을 한번 해보십시오.
00:06:50미국 인구 전체를 동원하더라도
00:06:53GPT-3 수준의 규모에 도달하려면
00:06:55100년 이상이 걸립니다. 이건 마치...
00:06:59그리고 오늘날 아무도 GPT-3를 쓰지 않죠.
00:07:00그렇죠?
00:07:01따라서 이 방식은 너무 느리고 비용이 많이 듭니다.
00:07:02그래서 로봇 공학에서는 아무도
00:07:05로보틱스를 제대로 확장하지 못했다고 봅니다.
00:07:07다른 분야에서 이루어낸 스케일링을
00:07:10로보틱스에서 논하기에는 아직 갈 길이 멉니다.
00:07:14아시겠죠?
00:07:14이것이 바로 저희가 집중해 온 부분입니다.
00:07:17스케일드는 설립된 지 3년 정도 되었지만,
00:07:19저는 10년 이상 이 문제를 연구해 왔습니다.
00:07:22내 커리어 동안 한 일은 그게 전부입니다.
00:07:24다른 건 없습니다.
00:07:26스케일드의 핵심 가설은
00:07:27'옴니바디 지능(omnibodied intelligence)'을 구축하는 것입니다.
00:07:32어떤 로봇, 어떤 작업이든 하나의 뇌로 처리하는 거죠.
00:07:35이해되시죠?
00:07:36어떤 로봇이든—휴머노이드일 수도 있고,
00:07:374족 보행 로봇일 수도 있으며,
00:07:38컨베이어 벨트 위의 로봇 팔이나 정교한 로봇 손일 수도 있습니다.
00:07:41하드웨어 형태는 상관없습니다.
00:07:42이 가설은 인간의 신체 제어보다
00:07:45훨씬 더 범용적이라고 할 수 있습니다.
00:07:48인간은 자기 자신의 몸만 제어하니까요.
00:07:50왜 이렇게까지 범용적이어야 할까요?
00:07:51로보틱스 분야에는 어차피
00:07:54데이터가 절대적으로 부족하기 때문입니다.
00:07:56따라서 특정 하드웨어의 데이터만 골라 쓸 여유가 없습니다.
00:07:59어떤 종류의 하드웨어, 어떤 작업,
00:08:02어떤 시나리오의 데이터든 활용할 수 있어야 합니다.
00:08:04그것만이 3년 전 언어 모델이 달성한
00:08:06스케일에 진정으로 도달할 수 있는 유일한 길입니다.
00:08:10목표는 '어떤 로봇, 어떤 작업이든
00:08:13하나의 뇌로'라는 구상입니다.
00:08:15오늘 강연을 통해 이것이 왜 로보틱스가
00:08:16나아가야 할 방향인지 설득해 드리겠습니다.
00:08:20아시겠죠?
00:08:20여기까지가 대략적인 서론입니다.
00:08:23더 자세한 내용으로 들어가기 전에,
00:08:24맛보기 결과 영상을 먼저 보여드리겠습니다.
00:08:28이 영상에 나오는 모든 로봇은
00:08:31각기 다른 회사의 서로 다른 하드웨어입니다.
00:08:34그리고 모두 스케일드의 AI 뇌로 제어되고 있죠.
00:08:37계단을 오르내리는 휴머노이드이든,
00:08:39어떤 시나리오든 상관없이 말입니다.
00:08:42이것들은 최근 결과가 아닙니다.
00:08:43몇 년 전의 결과물들입니다.
00:08:47방해 공작에도 견뎌내는 강건함을 보여주죠.
00:08:51새로운 환경에 사전 학습 없이 배치할 수도 있습니다.
00:09:03핵심 개념은, 이 영상 속 모든 로봇이
00:09:08세계 어느 곳에서든 동작을 수행할 때마다
00:09:11백그라운드의 AI 뇌가 지속적으로 발전한다는 점입니다.
00:09:13모든 신체를 아우르는 옴니바디 뇌이기 때문이죠.
00:09:15네, 이건 정말 어렵습니다.
00:09:16달걀은 무사하네요.
00:09:17이상으로 저희 연구의 맛보기 소개를 마치겠습니다.
00:09:33단순한 회사 홍보보다 학술적이고 정보가 유익한 강연으로 만들고자 합니다.
00:09:39따라서 로보틱스에서 데이터를 스케일업하는 방법에 대해 말씀드리겠습니다.
00:09:42기존에 사람들이 이 문제에 어떻게 접근했는지 돌아보죠.
00:09:45제 연구 커리어를 되돌아보겠습니다.
00:09:48데이터에 대한 저의 가설은 수년간 계속 변화해 왔습니다.
00:09:51제가 처음 연구를 시작하고 규모를 확장할 때
00:09:55지배적인 생각은, 사람이 로봇 데이터를 수동 수집하는 방식은
00:09:59너무 느리다는 것이었습니다.
00:10:00로봇이 스스로 데이터를 수집하게 해야 한다고 보았죠.
00:10:03그래서 호기심 기반 탐색(curiosity-driven exploration) 개념을 도입해
00:10:06로봇이 환경을 자율적으로 탐색하도록 했습니다.
00:10:10사람이 필요 없다는 큰 장점이 있었죠.
00:10:13로봇이 계속 놀면서 더 많은 데이터를 수집할 수 있습니다.
00:10:15당시 우리는 이를 '놀이 데이터(play data)'라 불렀습니다.
00:10:17힘, 센서, 관절 각도 정보가 포함되어 매우 풍부합니다.
00:10:21하지만 문제는 이것이 물리 세계에서만 일어난다는 점입니다.
00:10:24따라서 데이터 확장이 매우 어렵습니다.
00:10:27당시 구글은 수백 대의 로봇을 동원해 연구 중이었습니다.
00:10:31하지만 구글조차도 확장을 추진하기엔 비용과 시간이 너무 많이 들었죠.
00:10:34또 다른 접근법은 원격 조종(tele-operation)입니다.
00:10:36말씀드렸듯 오래된 방식이죠.
00:10:38하지만 역시 동일한 한계가 존재합니다.
00:10:39확장이 불가능한데, 이제는 로봇뿐만 아니라
00:10:42사람까지 필요하기 때문입니다.
00:10:43비용이 훨씬 더 비싸집니다.
00:10:45게다가 데이터의 다양성도 매우 제한적입니다.
00:10:46한 장소에 로봇과 작업자를 두고
00:10:501,000개의 예시 데이터를 얻는다 해도
00:10:51모두 동일한 환경에서 나온 데이터일 테니까요.
00:10:53이상적으로 원하는 것은 매일 로봇을 새로운 가정,
00:10:57새로운 시나리오로 옮기는 것이지만,
00:10:58그렇게 확장하는 것은 불가능에 가깝습니다.
00:11:01그러다 시뮬레이션 기반 학습에서
00:11:03큰 돌파구가 마련되었습니다.
00:11:04시뮬레이션에서 훈련시킨 심층 강화학습을
00:11:12실제 로봇으로 전이할 수 있음을 보여준 초기 연구 중 하나였죠.
00:11:13당시 수상 경력이 있는 논문이었습니다.
00:11:16지금은 모든 휴머노이드 회사에서 사용하고 있죠.
00:11:20버클리와 카네기 멜런 대학(CMU) 연구실에서 나온 성과였습니다.
00:11:23하지만 이 역시 장단점이 명확합니다.
00:11:25스케일업은 매우 쉽지만,
00:11:27시뮬레이션 내 모든 장면을 수동 엔지니어링해야 하므로
00:11:29다양성을 확보하기 어렵습니다.
00:11:31들어보시면 아시겠지만,
00:11:34제가 제시하려는 단 하나의 정답은 없습니다.
00:11:35단 하나의 완벽한 해결책은 존재하지 않죠.
00:11:39이것은 저희가 이전에 진행했던 또 다른 연구입니다.
00:11:41스케일드를 시작하기 전의 일입니다.
00:11:43사람의 영상에서 학습하는 방식인데,
00:11:44사람이 행동하는 것을 관찰하고 로봇이 이를 따라 합니다.
00:11:47다양성이 매우 높다는 장점이 있죠.
00:11:48유튜브 등의 동영상을 활용할 수 있으니까요.
00:11:50확장성도 매우 뛰어납니다.
00:11:51하지만 로봇 제어와는 거리가 멀기 때문에
00:11:54품질이 매우 낮은 형태의 데이터입니다.
00:11:57그렇다면 해결책은 무엇일까요?
00:11:59정답은 '지름길은 없다'는 것입니다.
00:12:01다양한 특성의 관점에서
00:12:05데이터를 고려해야 합니다.
00:12:06제 견해로는 로보틱스에서 중요한 요소는
00:12:09단 세 가지뿐입니다.
00:12:12확장성, 다양성, 그리고 실제 로봇 관절 각도와
00:12:15얼마나 가까운지 여부입니다.
00:12:18확장성은 다양한 시나리오로 신속히 확장 가능한지를 의미합니다.
00:12:22다양성은 다채로운 데이터를 얻을 수 있는가를 뜻하죠.
00:12:25100조 개의 토큰이 있다 해도
00:12:27모두 동일한 환경과 동일한 시나리오라면
00:12:29전혀 쓸모가 없기 때문입니다.
00:12:32그리고 '로봇과의 근접성'은 실제 로봇의
00:12:35관절 각도 참값(ground truth)에 얼마나 가까운가를 뜻합니다.
00:12:38시뮬레이션을 보면 확장성은 높고 다양성은 낮으며,
00:12:42로봇과의 근접성은 중간 정도입니다.
00:12:44사람의 영상은 확장성과 다양성이 매우 높지만,
00:12:46실제 로봇 데이터와는 거리가 멀어서
00:12:47사람의 동작을 로봇에 매핑하는 법을 학습시켜야 합니다.
00:12:49다른 두 방식인 원격 조종과 조작 인터페이스 방식은
00:12:52그 중간쯤 위치합니다.
00:12:54보시다시피 현재 전 세계의
00:12:57여러 로봇 기업들을 보면,
00:12:58다들 이 중 하나의 접근 방식에만 집중하고 있습니다.
00:13:01대부분 원격 조종이나 윰(Yumi) 장비 환경에 치중해 있고
00:13:05그 외의 방식을 쓰는 곳은 극히 드뭅니다.
00:13:07하지만 절대적인 정답은 없습니다.
00:13:09각 방식마다 단점이 명확하니까요.
00:13:11희망적인 사실은 이 방법들이 서로를 보완해 준다는 점입니다.
00:13:16서로의 단점이 정확히 일치하지 않기 때문이죠.
00:13:20그래서 저희가 수년간 수렴해 온 해결책은
00:13:24학습 과정을 사전 학습(pre-training)과 사후 학습(post-training)의
00:13:27두 단계로 분리하는 것임을 깨달았습니다.
00:13:29익숙한 개념이죠?
00:13:30그렇다면 사전 학습은 어떻게 할까요?
00:13:31사전 학습에는 데이터를 활용하고자 합니다.
00:13:32확장성이 뛰어나고 다양하지만 품질은 다소 낮을 수 있죠.
00:13:35시뮬레이션이나 사람이 찍은 영상 등이 해당됩니다.
00:13:37이런 방식으로 사전 학습을 진행합니다.
00:13:39그리고 사후 학습에는 원격 조종 데이터를 사용합니다.
00:13:42원격 조종 데이터란 무엇일까요?
00:13:43품질은 매우 높지만 양은 적습니다.
00:13:47고품질이지만 양이 적은 편이죠.
00:13:48언어 모델 학습 방식과 매우 흡사합니다.
00:13:51인터넷 데이터로 사전 학습을 거친 뒤
00:13:53코딩이나 자사 용도에 맞춰 사후 학습을 진행하듯이 말이죠.
00:13:59하지만 로봇공학에는 영역이 하나 더 있는데,
00:14:00바로 배포 데이터입니다.
00:14:02배포 데이터는 실제 배포가 본격화되면
00:14:05엄청난 확장성을 가집니다.
00:14:07시간이 지나면 이 데이터가 다른 모든 것을 압도할 것입니다.
00:14:11저희가 구축하려는 것은
00:14:14일종의 데이터 플라이휠입니다.
00:14:16사후 학습 단계의 데이터를 가져와
00:14:18사전 학습에 다시 투입하는 구조죠.
00:14:20이제 범용 신체 두뇌(omnibodied brain)라는 개념이
00:14:23왜 그토록 중요한지 이해하실 것입니다.
00:14:25단 하나의 로봇, 단 하나의 버전만으로 전 세계의 모든 작업에
00:14:28영구 배포되는 상황은 가능성이 매우 희박하기 때문입니다.
00:14:32제조가 까다로운 칩 분야를 제외하면,
00:14:36하드웨어 분야에서 이런 일은 결코 일어나지 않습니다.
00:14:38게다가 칩 시장조차도
00:14:40요즘은 여러 기업에서 추론용 칩이
00:14:42쏟아져 나오고 있죠.
00:14:43따라서 하드웨어에서는 단 하나의
00:14:45로봇 모델, 단 하나의 형태만 존재하는 경우가 없습니다.
00:14:48그렇기에 범용 신체 지능이야말로
00:14:50배포 데이터 플라이휠을 가능하게 하는 핵심 요소입니다.
00:14:56그럼 이제 몇 가지 결과를 빠르게 살펴보겠습니다.
00:14:58이 두뇌는 매우 범용적이어서
00:15:00다양한 작업을 아주 신속하게 수행할 수 있습니다.
00:15:03빨래 접기 같은 작업을 자주 보셨을 겁니다.
00:15:06실리콘밸리에서는
00:15:07왠지 모르게 매우 인기 있는 시연 과제죠.
00:15:10하지만 여기서 핵심 질문은,
00:15:14티셔츠를 접을 때 “손 위치가 1cm만 빗나가면
00:15:18망하겠구나” 하고 생각해보신 적이 있으신가요?
00:15:22아무도 그렇게 생각하지 않습니다.
00:15:23사람들은 접을 때 별생각도 하지 않죠.
00:15:25그냥 아무 데나 잡고
00:15:26대충 척척 접어냅니다.
00:15:27즉 오차 허용 범위가 엄청나게 넓다는 뜻입니다.
00:15:31그렇다면 왜 이 작업이 어려운 걸까요?
00:15:35다들 왜 이 작업이 어렵다는 착각에
00:15:38빠지는 걸까요?
00:15:39질문을 그렇게 바꿔보죠.
00:15:42천(직물) 때문일까요?
00:15:43천 제어가 왜 어려울까요?
00:15:46시뮬레이션 문제라 하지만, 시뮬레이션을 쓰지도 않습니다.
00:15:48이건 전부 원격 조종 데이터 기반입니다.
00:15:49그렇다면 왜 어려울까요?
00:15:51이유를 아시나요?
00:15:52고전적인 로봇공학 방식에나 어려웠던 과제이기 때문입니다.
00:15:56과거에는 전체 물리학을 수식화하고
00:15:59모델을 수작업으로 만들어 제어했습니다.
00:16:01그런 방식에는 매우 어렵죠.
00:16:02하지만 딥러닝 기반 로봇공학에서는
00:16:04이보다 더 쉬운 작업이 없습니다.
00:16:06오차 허용 범위가 매우 크니까요.
00:16:08그런데 수많은
00:16:09기업이 여전히 이 작업에만 집중하고 있습니다.
00:16:12진짜 어려운 작업은
00:16:13이런 종류의 작업이라고 봅니다.
00:16:17영상을 보기 전에 여쭤봤다면,
00:16:19사람 손 없이도 이 작업이 가능할까요?
00:16:22절반 정도는 불가능하다고 하셨을 겁니다.
00:16:24에어팟 집어넣기 같은 작업이니까요.
00:16:25혹시 에어팟 잃어버려 보신 분 계신가요?
00:16:29저희 회사 슬랙에는 '오른쪽 에어팟'이라는
00:16:30채널이 있을 정도입니다. 다들
00:16:32오른쪽 에어팟을 자꾸 잃어버리거든요.
00:16:34지금 이 로봇은 손이 없고
00:16:36집게(그리퍼)만 달려 있습니다.
00:16:37이런 집게에는 매우 고난도의 과제입니다.
00:16:41더 높은 수준의 지능이 필요한데,
00:16:43에어팟을 쏙 넣을 수 있도록
00:16:46로봇 팔이 올바른 방향으로 접근해 집어야 하기 때문입니다.
00:16:49평행 그리퍼는 이런 식으로만 다물어지므로
00:16:52손가락처럼 쥐고 있는 상태에서
00:16:54마지막 순간에 방향을 비틀 수 없거든요.
00:16:55그리고 영상에 나오는 에어팟은 정품이 아닙니다.
00:16:59테무에서 개당 5달러, 10달러 주고 산 짝퉁이죠.
00:17:02그래서 내부 자석도 없습니다.
00:17:05끌어당겨 주는 자석이 없으니
00:17:07케이스에 제대로 넣으려면 로봇이 훨씬 더 정밀하게 움직여야 합니다.
00:17:11전부 짝퉁 제품입니다.
00:17:13보기보다 훨씬 난이도가 높은 작업이죠.
00:17:15범용 두뇌 시스템을 한 번 구축해 두면,
00:17:17원격 조종 시점의 미세 조정 데이터 없이도
00:17:23사람이 일하는 다양한 영상만 보고 학습을 진행할 수 있습니다.
00:17:26이 시나리오에서는
00:17:281인칭 시점의 사람 영상으로
00:17:29학습을 시켰습니다.
00:17:31현재는 3인칭 시점 영상으로 전이하는 시도를 하고 있습니다.
00:17:343인칭 시점 학습이 가능해지면 유튜브 같은
00:17:38온갖 오픈소스 데이터에서 배울 수 있게 됩니다.
00:17:40이 사례에서는 영상 학습을 거친 뒤
00:17:431시간 미만의 로봇 데이터를 추가했습니다.
00:17:45매우 빠른 전이가 이루어지죠.
00:17:47그리고 휴머노이드에도 전이할 수 있습니다.
00:17:50이 로봇들은 사람 형태의 손을 가지고 있습니다.
00:17:53손이 필요한가에 대해서는 논쟁이 많죠.
00:17:54흔히 로봇의 상용화가 더딘 핑계로
00:17:57손(의수)의 부재를 대곤 하지만, 실제 원인은 그게 아닙니다.
00:18:00핵심은 언제나 백엔드의 지능입니다.
00:18:02저희가 당장 다지창 손을 현장에 도입하지 않는 이유는
00:18:07공장에 투입할 만한 내구성의 제품이 없기 때문입니다.
00:18:09어떤 제품을 가져와도 100시간 이내에 고장 납니다.
00:18:12아무거나 골라 테스트해 봐도 마찬가지죠.
00:18:14더 뛰어난 로봇 손이 있다면
00:18:17테스트용으로 당장 10대를 구매하고 싶습니다.
00:18:19내구성이 중요한 실제 현장 시나리오의 문제죠.
00:18:22핵심은 사람이 하는 행동을 관찰하는 것만으로
00:18:25수많은 작업을 배울 수 있다는 점입니다.
00:18:281시간 미만의 로봇 데이터라는 극히 적은 데이터로도
00:18:31작동할 수 있는 이유는
00:18:33로봇이 머릿속으로 스스로 상황을 상상하며
00:18:36다양한 시나리오에 맞춰 학습 효과를 증폭시키기 때문입니다.
00:18:39지금 보시는 영상은 완전히 가상으로 생성된 것입니다.
00:18:42'로봇의 꿈'이라고 불러도 좋겠네요.
00:18:43로봇 내부의 자체 모델 안에서
00:18:45여러 시나리오를 상상해 보는 것입니다.
00:18:48실제 촬영 데이터가 아니라
00:18:49로봇의 인공지능 모델이 생성해 낸 가상 영상입니다.
00:18:52이 기술을 더 복잡한 작업이나
00:18:56더 저렴한 하드웨어에도 적용할 수 있습니다.
00:18:57이 영상은 계란 요리, 즉 오믈렛을 만드는 작업입니다.
00:19:02여기 보이는 전체 장비 비용은 약 4,000달러 수준입니다.
00:19:06시중에 나온 제품들에 비해 엄청나게 저렴한 로봇 팔이죠.
00:19:11유심히 보시면, 이 구성은 너무 저가형이라
00:19:15별도의 센서조차 갖춰져 있지 않습니다.
00:19:16센서라고는 카메라 한 대뿐이며, 힘 센서 등은 전혀 없습니다.
00:19:20그럼에도 시각 정보만으로 힘 조절이 필요한 작업들을 해냅니다.
00:19:25이 방식이 지향해야 할 미래라거나
00:19:26센서 없이 가야 한다는 뜻은 아닙니다.
00:19:27앞으로 센서 성능은 더욱 향상될 것입니다.
00:19:29다만 현재의 센서 수준을 기준으로 봐도
00:19:33우리가 소프트웨어 지능 측면에서 도달할 수 있는 한계치에
00:19:36한참 미치지 못하고 있었다는 의미입니다.
00:19:38작업은 끊임없이 이어질 수 있습니다.
00:19:39이분은 제 버클리 지도교수님이신데요.
00:19:41로봇이 이걸 해낼 수 있다는 걸 믿지 않으셨습니다.
00:19:43그래서 1시간 동안 계속 서서 지켜보셨죠.
00:19:45로봇은 멈추지 않고 계속 오믈렛을 만들었고요.
00:19:48여기서 흥미로운 점은
00:19:49이게 완전한 엔드투엔드 시스템이라는 사실입니다.
00:19:51상태 머신 같은 하드코딩된 로직이 전혀 없습니다.
00:19:53로봇이 계란 요리를 하는 이유는
00:19:55단지 앞에 빈 접시가 놓여 있기 때문입니다.
00:19:56왜 화면이 깜빡이는지 모르겠네요.
00:19:58영상에는 편집이 전혀 없습니다.
00:20:00그건 장담합니다.
00:20:01HDMI 문제예요.
00:20:02접시를 치우자마자...
00:20:06죄송합니다, 왜 이런지 모르겠네요.
00:20:08네, 그래서 상태 머신이 없습니다.
00:20:10로봇이 언제 시작하고 언제 끝나는지가
00:20:11모두 자동화되어 있죠.
00:20:12방해 공작에도 매우 강합니다.
00:20:14주변 물체를 바꿔도 되고요.
00:20:16추가해도 되는데, 전부 학습 때 보지 못한 물체들입니다.
00:20:20팬과 가스레인지 빼고는
00:20:22모든 것이 다릅니다.
00:20:23그래도 로봇은 계속 작동하죠.
00:20:25기본적인 강건함을 얻을 수 있는 겁니다.
00:20:27이 모든 것은 10시간 미만의 데이터로 학습되었습니다.
00:20:30이 정도의 강건함을 배우기엔 매우 적은 데이터량이죠.
00:20:33이는 비하인드에 있는 기반 모델 덕분입니다.
00:20:37시간 관계상 이 부분은 넘어갈게요.
00:20:39계획, 매핑 등이 존재하는
00:20:42기존 로보틱스 파이프라인과 달리,
00:20:44이것은 엔드투엔드 뇌입니다.
00:20:46'엔드투엔드'는 AI의 많은 분야에서 오용되는 용어인데요.
00:20:50제가 말하는 엔드투엔드는 말 그대로 '진짜' 엔드투엔드입니다.
00:20:53카메라에서 직접 데이터를 읽어 들여
00:20:55모터에 전력을 직접 인가합니다.
00:20:59따라서 100Hz를 500Hz로 변환하기 위해
00:21:02맨 끝단에 처리하는 PID 제어 말고는 중간에 아무것도 쓰지 않죠.
00:21:04하지만 PID는 로보틱스 진영의 기여가 아닙니다.
00:21:06그 이전의 기술이죠.
00:21:07제2차 세계대전인가 그 시절까지 거슬러 올라갑니다.
00:21:10흥미로운 점은, 저희에게 시각 정보는
00:21:13그저 수많은 입력 중 하나일 뿐이라는 겁니다.
00:21:15특별 대단할 것도 없죠.
00:21:17여러분도 로봇이 춤을 추거나, 가라테나 쿵후를 하고,
00:21:20백덤블링하는 결과는 많이 보셨을 겁니다.
00:21:23그렇다면 한번 돌이켜 생각해 보세요.
00:21:27로봇이 계단을 오르내리는 영상은 몇 번이나 보셨나요?
00:21:30극히 드뭅니다.
00:21:31휴머노이드 분야 최정상급 기업들조차
00:21:34그저 체크리스트 채우기용으로 샘플 계단 하나를
00:21:37오르는 수준 이상은 보여주지 못했습니다.
00:21:39사람들은 휴머노이드의 시대가 온다, 중국 대 미국이다 말하지만,
00:21:42이건 다 헛소리입니다.
00:21:44휴머노이드가 계단조차 못 오른다면
00:21:47다리가 있을 이유가 없지 않습니까?
00:21:50계단을 오르는 게 다리가 있는 유일한 이유입니다.
00:21:51이것이 바로 모라벡의 역설이 실제로 작용하는 모습입니다.
00:21:55왼쪽 행동이 사실 로봇에게 훨씬 쉽습니다.
00:21:58공중제비나 춤추기는 로봇에겐 훨씬 쉬운 일이죠.
00:22:01'왜 이런 역설이 존재하지?' 싶으실 겁니다.
00:22:04한 단계 더 깊이 생각해 보세요.
00:22:05로봇이 공중제비를 돌 때는
00:22:09자신의 몸 상태만 알고 있으면 되며, 다른 것은 필요 없습니다.
00:22:13그렇죠?
00:22:13모든 요소가 이미 알려져 있거나 완전히 관찰 가능한 상태는
00:22:17컴퓨터가 가장 잘하는 영역입니다.
00:22:20가능한 모든 설정을 시뮬레이션할 수 있으니까요.
00:22:25하지만 오른쪽처럼 단순히 계단을 오르는 것조차
00:22:27우선 계단 자체를 볼 수 있어야 합니다.
00:22:30높이나 너비가 얼마인지 말이죠.
00:22:32높이와 너비를 정확히 측정하지 않더라도
00:22:34모든 변수에 적응해야만 합니다.
00:22:35그리고 거기엔 비전(시각)이 필요하죠.
00:22:36즉, 오른쪽 작업은 '이해'가 필요합니다.
00:22:38그래서 어렵고, 다른 곳에서 이런 사례를 못 보는 겁니다.
00:22:40하지만 저희에게는 그저 흔한 결과물 하나일 뿐입니다.
00:22:42별로 대단할 게 없죠.
00:22:43저희는 이 결과를 1년 반 전에 공개했습니다.
00:22:46촬영은 2년 반 전에 했고요.
00:22:48이 로봇은 어떤 환경이든 이동할 수 있습니다.
00:22:52물건에 걸려 넘어지지 않죠.
00:22:53의도적으로 장애물을 넘어갑니다.
00:22:55매핑이나 경로 계획도 없습니다.
00:22:56주변 환경의 3D 지도를 전혀 만들지 않아요.
00:22:59오직 상체에 달린 카메라로만 작동합니다.
00:23:02어떤 환경, 어떤 계단에 가져다 놓아도 작동하죠.
00:23:05조금 빠르게 넘어갈게요.
00:23:07이건 비상 탈출용 비상 계단입니다.
00:23:11구조가 조금 특이하죠.
00:23:12비상 계단은 화재 등 긴급 상황에서 사용하는 곳인데,
00:23:15어느 건물에서나 이동하기 가장 까다롭습니다.
00:23:17저희는 이런 모든 환경에서 테스트를 거치고 있습니다.
00:23:20하지만 어디에 놓아도 상관없습니다.
00:23:21계단에서 로봇을 방해해도 괜찮아요.
00:23:22아무런 상관이 없습니다.
00:23:23이건 인간을 뛰어넘는 능력입니다.
00:23:25로봇은 자기가 잡아당겨지는 걸 볼 수 없으니까요.
00:23:27따라서 계단을 오르는 동안 뒤에서 당기는 것은
00:23:29로봇 입장에선 예기치 못한 교란 변수입니다.
00:23:31다시 말씀드리지만, 이 모든 상황에
00:23:33동일한 모델이 쓰였습니다.
00:23:35매우 간단하죠.
00:23:36쉽다고 해도 파쿠르는 보기 재미있긴 합니다.
00:23:40사람들은 종종 이런 영상을 보고
00:23:45로봇이 이 모든 것을 해낸다고 놀라지만,
00:23:47이건 제가 아까 보여드린 것보다 훨씬 더 쉬운 작업입니다.
00:23:51지금 이 영상들을 보시더라도
00:23:53많은 분이 이게 더 인상적이라고 느끼실 겁니다.
00:23:55제가 이게 더 쉽다고 말씀드리는데도 말이죠.
00:23:57이걸 학습시키는 데는 30분밖에 안 걸립니다.
00:23:59반면 이전 작업은 학습 시간이 훨씬 더 오래 걸리고
00:24:01난이도도 훨씬 높습니다.
00:24:03이 기반 모델을 가져와서 다양한 작업으로
00:24:06매우 빠르게 전이시킬 수 있습니다.
00:24:08여기 보이는 건 1년 반 전의
00:24:09아주 오래된 결과물입니다.
00:24:11LAN 케이블 삽입 등의 작업을 위해
00:24:13현재 매우 고급화된 시스템을 갖추고 있죠.
00:24:14하지만 저희는 이미 다양한 응용 분야에
00:24:17이 모델들을 배치하고 있습니다.
00:24:18왜냐하면 데이터 플라이휠을 구축하는 데 있어서
00:24:21가장 어려운 부분은 현장 배치 그 자체이기 때문입니다.
00:24:24로보틱스를 실제로 현장에 적용할 때는
00:24:26지능이나 하드웨어 외에도 수많은 문제들이 발생합니다.
00:24:30앱 형태로 ChatGPT를 배포하는 것과는 차원이 다릅니다.
00:24:34수많은 수식 요소를 다뤄야 하기 때문이죠.
00:24:36아까 Skydio 발표가 있었던 것으로 아는데,
00:24:38현장 배치의 어려움에 대해서라면
00:24:40하루 종일이라도 얘기해 줄 수 있을 겁니다.
00:24:42그래서 저희는 지금 당장 배치를 시작해야 합니다.
00:24:44그래야 가시적인 미래에 데이터 플라이휠을 구축할 수 있으니까요.
00:24:47저희가 진행 중인 현장 배치 사례를 몇 가지 들어보겠습니다.
00:24:49한 예로 엔비디아와의 협업이 있습니다.
00:24:51엔비디아가 휴스턴에 첫 공장을 열 예정인데요.
00:24:54여러분께서 지금 쓰시는 엔비디아 GPU는
00:24:56전부 미국 외 지역, 주로 대만에서 제작됩니다.
00:24:59현지에서 전부 수작업으로 이루어지죠.
00:25:01사람은 정말 효율적이고 이런 제품을 만드는 데
00:25:04매우 탁월합니다.
00:25:05하지만 미국 내에서 지속적인 비용 절감과 확장성, 처리량을
00:25:08이러한 노동력 없이 유지하기란
00:25:10매우 어렵습니다.
00:25:11그래서 저희는 이 GPU 조립 공정을 자동화하고 있습니다.
00:25:15이건 엔비디아 GTC에서 라이브로 시연했던 것인데요.
00:25:19지난주에 이미 공장에 배치되었기 때문에
00:25:21이미 실제로 작동 중입니다.
00:25:22하지만 제가 강조하고 싶은 흥미로운 점은,
00:25:25이게 매우 전형적인 공장 작업이라는 것입니다.
00:25:29하지만 전체적인 설정을 살펴보면
00:25:32엄청나게 무작위적이고 잡음이 많습니다.
00:25:36기존 공장의 전형적인 설비를 가보면
00:25:38매우 정돈되어 있거든요.
00:25:39여기서는 동일한 뇌를 가진 로봇이
00:25:42정밀한 작업을 수행할 수 있을 뿐만 아니라,
00:25:44어떤 종류의 방해에도 매우 강건하게 대처합니다.
00:25:46즉, 이 로봇들이 펜스 안에 갇혀 있을 필요가 없다는 뜻이죠.
00:25:50공장 생산 라인을 전혀 변경하지 않고도
00:25:54그대로 현장에 배치할 수 있는 겁니다.
00:25:56사람과 함께 일하는 곳엔 언제나 어지러움이 존재하니까요.
00:26:00이해되시죠?
00:26:00동일한 뇌를 배송 응용 분야에도 적용할 수 있습니다.
00:26:02여기 보이는 로봇은 트럭에서 현관 앞까지 배송을 수행합니다.
00:26:06현관문이 어디 있는지 찾아야 하므로
00:26:08상식적인 판단의 문제이지,
00:26:09이동 능력의 문제가 아닙니다.
00:26:10저희는 이미 수많은 파트너들과
00:26:12보이지 않는 곳에서 협력하여
00:26:15이 지역 주택들의 현관 앞까지
00:26:17소화물을 배송해 오고 있습니다.
00:26:19동일한 설정이 물류창고 등 여러 환경에서도 동일하게 작동합니다.
00:26:23이제 발표를 마무리하며 요약해 보자면,
00:26:26앞서 이것이 '범용 로봇 뇌(Omnibodied Brain)'라고 말씀드렸습니다.
00:26:29데이터 플라이휠을 구축하기 위해 범용 로봇 뇌가
00:26:31왜 그토록 필수적인지 잘 이해하셨으리라 생각합니다.
00:26:34하지만 또 하나의 장점이 있습니다.
00:26:35바로 로봇이 시간에 지남에 따라 고장 나거나
00:26:38안전 상황에 직면할 때 발휘되는 장점입니다.
00:26:41안전성은 범용 로봇 뇌가 가져다주는 부산물입니다.
00:26:44왜냐하면 만약--
00:26:45빠르게 넘어가도록 하겠습니다.
00:26:47온라인에서도 확인하실 수 있습니다.
00:26:48이 영상들은 모두 온라인에 공개되어 있습니다.
00:26:49하지만 우리는 동일한 뇌를 각각의 시스템,
00:26:52각각의 로봇에 탑재할 수 있습니다.
00:26:55심지어 이 경우에는 해당 로봇들로 학습조차 진행하지 않았습니다.
00:26:58이 모든 휴머노이드와 여러 로봇 형태에 적용된
00:27:00이 모든 휴머노이드와 장치들로 확장되는 것이죠.
00:27:02심지어 로봇이 고장 나거나, 여기서처럼 다리가 부러져도
00:27:05몇 밀리초 만에 회복할 수 있습니다.
00:27:07다리 하나가 부러지면, 기존의 삼족 로봇은
00:27:10새로운 로봇이 되기 때문입니다.
00:27:12따라서 로봇의 형태가 어떤지는 중요하지 않습니다.
00:27:14뭐든 변하면 회복하죠. 여기선 로봇 다리를 비활성화했는데요.
00:27:17단 세 번의 시도 만에 두 다리로 걷는 법을 습득합니다.
00:27:21지금 화면에서 보고 계신 것은 이 시스템들 내부에서
00:27:24진행 중인 로봇의 전체 학습 과정입니다.
00:27:27몇 밀리초에서 30초 안에 적응을 완료하죠.
00:27:32한 예로, 여기 바퀴로 굴러가는 로봇이 있습니다.
00:27:34바퀴를 가로막으면,
00:27:36걸어가기 시작합니다.
00:27:37이것이 옴니보디드 브레인의 또 다른 부산물입니다.
00:27:40이러한 모델에서는 안전의 의미가 완전히 달라집니다.
00:27:45로봇이 날아다닐 때...
00:27:46아 죄송합니다, 로봇이 몸의 절반만으로도
00:27:49걸어 다니거나 작동할 수 있으니까요.
00:27:50잔인한 장면 일부는 영상에서 뺐지만,
00:27:52저희는 로봇을 반으로 잘라보기도 했습니다.
00:27:54잘린 두 반쪽이 각각 여전히 정상 작동하더군요.
00:27:57그 영상은 유튜브에서 확인하실 수 있습니다.
00:27:59제가 준비한 발표는 여기까지입니다.
00:28:00감사합니다.

Key Takeaway

로봇공학은 지난 70년 동안 하드웨어 중심의 접근과 데이터 부족으로 정체되어 있었으나, 다양한 하드웨어와 작업을 아우르는 '옴니바디 지능'과 사전·사후 학습을 결합한 데이터 플라이휠을 통해 해결될 수 있다.

Highlights

  • 로봇공학은 지난 70년 동안 하드웨어 문제로만 접근되어 범용 두뇌의 부재로 인해 상용화 단계에 머물러 있었다.

  • GPT-3 수준의 데이터 규모에 도달하려면 미국 인구 전체를 동원하더라도 원격 조작 방식으로는 100년 이상이 소요된다.

  • 스케일드의 핵심 가설은 어떤 로봇과 작업이든 하나의 뇌로 처리하는 '옴니바디 지능(omnibodied intelligence)'을 구축하는 것이다.

  • 에어팟 케이스 넣기 작업은 짝퉁 제품과 평행 그리퍼 환경에서도 로봇이 높은 정밀도로 수행해낸다.

  • 약 4,000달러 수준의 저가형 로봇 팔과 카메라 한 대만으로도 시각 정보만을 활용해 오믈렛 조리 작업을 완수한다.

  • 로봇이 다리가 부러지거나 바퀴가 막히는 등의 상황에서도 옴니바디 뇌를 통해 단 몇 번의 시도 만에 회복한다.

Timeline

로봇공학의 70년 정체기와 모라벡의 역설

  • 로봇공학은 지난 70년 동안 근본적으로 하드웨어 문제로만 접근되어 원시적인 단계에 갇혀 있었다.
  • 인간에게 쉬운 계단 오르기 등의 작업이 컴퓨터에게는 훨씬 어려운 과제가 되는 모라벡의 역설이 존재한다.
  • 체스 세계 챔피언을 이긴 컴퓨터가 체스말을 직접 집지 못하듯, 범용 두뇌의 부재가 발전의 걸림돌이었다.

언어와 비전 분야가 눈부시게 발전한 반면, 로봇공학은 1960년대 MIT 카피 데모나 1957년 원격 조작 시스템과 비교해 본질적인 진전이 더뎠다. 컴퓨터가 수학이나 체스 같은 복잡한 연산은 쉽게 해내지만 신체 제어와 물리적 환경 적응은 어려워하는 현상은 로봇공학이 단순히 신경망을 적용하는 것 이상의 제1원칙적 접근을 요구함을 보여준다.

데이터 스케일링의 한계와 옴니바디 지능

  • 원격 조작 방식으로 GPT-3 규모의 데이터를 수집하려면 미국 인구를 동원해도 100년 이상이 걸린다.
  • 스케일드의 핵심 가설은 휴머노이드, 4족 보행, 로봇 팔 등 형태와 상관없이 모든 로봇을 제어하는 옴니바디 지능이다.
  • 사전 학습에는 확장성과 다양성이 높은 시뮬레이션 및 영상 데이터를 사용하고, 사후 학습에는 원격 조작 데이터를 활용한다.

AI 성공의 비법인 방대한 데이터셋과 거대 모델 학습을 로봇공학에 그대로 적용하기에는 인터넷 같은 데이터 집합체가 부족하다. 수동 수집 방식은 너무 느리고 비용이 많이 들기 때문에, 확장성과 다양성, 로봇 관절 각도 참값의 근접성을 고려하여 사전 학습과 사후 학습을 분리한 데이터 플라이휠 구축이 필수적이다.

범용 로봇 뇌를 통한 다양한 작업 수행

  • 평행 그리퍼만 달린 로봇이 자석이 없는 짝퉁 에어팟을 케이스에 정확히 집어넣는 고난도 작업을 수행한다.
  • 약 4,000달러의 저가형 로봇 팔과 카메라 한 대로 10시간 미만의 학습을 통해 연속적으로 오믈렛을 조리한다.
  • 3D 지도나 경로 계획 없이 상체 카메라만으로 비상 계단 같은 복잡한 환경을 강건하게 이동한다.

범용 신체 두뇌 시스템을 구축하면 원격 조작 미세 조정 데이터 없이도 사람의 1인칭 시점 영상 등을 활용해 빠르게 학습을 전이할 수 있다. 에어팟 집어넣기나 오믈렛 조리처럼 상태 머신이 없는 완전한 엔드투엔드 시스템을 통해, 로봇은 방해 공작이나 예측하지 못한 변수 속에서도 안정적으로 작동한다.

현장 배치와 옴니바디 지능의 안전성

  • 엔비디아 휴스턴 공장의 GPU 조립 공정 자동화 등 실제 현장에 로봇이 배치되어 작동 중이다.
  • 로봇이 고장 나거나 다리가 부러지는 상황에서도 옴니바디 뇌를 통해 밀리초에서 몇 초 만에 회복한다.
  • 로봇 다리가 비활성화되거나 몸의 일부가 잘려도 남은 신체로 걷는 법을 단 수 번의 시도 만에 습득한다.

지능과 하드웨어 외에도 현장 배치 과정에는 수많은 문제가 발생하므로 데이터 플라이휠을 위해 지금 배치를 시작해야 한다. 옴니바디 지능의 부산물로써 로봇은 형태에 구애받지 않으며, 고장이나 신체 손상 등의 비상 상황에서도 스스로 적응하고 회복하는 뛰어난 강건함을 발휘한다.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video