Transcript
00:00:00지난 5년 동안 AI가 얼마나 눈부시게
00:00:15발전했는지는 다들 잘 아실 겁니다.
00:00:17지난 100년 동안 이뤄낸 발전보다 더 크게 느껴질 정도죠.
00:00:22특히 AI 분야의 흐름을 보면
00:00:24언어에서 시작해 음성, 오디오, 비디오로 확장되어 왔습니다.
00:00:28그리고 모두가 기대하는 다음 단계는 로봇공학입니다.
00:00:32이러한 기대감은 무슨 이유에서인지 올해 정점에 달하고 있는데,
00:00:37저는 아직도 그 이유를 잘 이해하기 어렵습니다.
00:00:40젠슨 황 같은 리더들도
00:00:43로봇공학의 다음 개척지로 피지컬 AI를 언급하는 것을 보셨을 겁니다.
00:00:46트위터나 링크드인을 열어보면
00:00:49마치 로봇 기술이 이미 도래한 것처럼 보입니다.
00:00:51많은 이들이 장담하듯, 오는 12월쯤이면 가정용 로봇을
00:00:56집에 하나씩 두게 될 것처럼 말이죠.
00:00:58하지만 로봇공학은 지난 70년 동안이나
00:01:03'곧 상용화될 기술'에 머물러 있었다는 점을 짚고 싶습니다.
00:01:06최근 4~5년 사이에 로봇공학에 입문하신 분들은
00:01:10아무 로봇공학 강의나 하나 들어보십시오.
00:01:14만약 30년 전 로봇 영상과 오늘날의 영상을
00:01:17구분해내실 수 있다면, 제가 맛있는 저녁을 사드리죠.
00:01:23예를 들어, 이 로봇을 한 번 보시죠.
00:01:26여기 있는 건 로봇과 사진입니다.
00:01:27이 로봇의 목표는 블록 사진을 보고
00:01:31자신 앞에 있는 블록들을 배치해서
00:01:34사진 속 패턴과 똑같이 만드는 것입니다.
00:01:37아시겠죠?
00:01:38매우 간단한 작업처럼 보입니다.
00:01:40하지만 생각해보면 3D 블록이잖아요.
00:01:42각 각도에서 입체 형태를 파악해야 합니다.
00:01:44그리고 이 로봇은 꽤 정교하게 해냅니다.
00:01:47이 실험 결과가 얼마나 오래전 것인지 맞혀보실 분 계신가요?
00:01:51아무나 편하게
00:01:51추측해보세요.
00:01:52아무 숫자나 불러보세요.
00:01:53네?
00:01:5440년이요.
00:01:55좋습니다.
00:01:55그게 가장 높이 부른 수인가요?
00:01:59이 영상은 1960년대 것입니다.
00:02:01컴퓨터가 보급되기도 훨씬 전이죠.
00:02:03아시겠나요?
00:02:04'MIT 카피 데모'라 불리는 시연입니다.
00:02:06이것이 시작이었죠--
00:02:09우리가 오늘날 아는 AI보다도 앞선 시대였습니다.
00:02:12이 영상도 한번 보시죠.
00:02:17필라델피아 원자력 의회에 전시된 한 출품작이
00:02:19엄청난 인기를 끌고 있습니다.
00:02:21무슨 상황이냐면, 무대 뒤에 있는 사람이
00:02:24마스터-슬레이브 시스템으로 로봇을 제어하는 것입니다.
00:02:27오늘날 거대 연구소, 대기업,
00:02:31유명 대학 연구실에서 데이터를 수집하는 방식을 보면
00:02:33원격 조작 시스템을 사용하는데, 이 역시
00:02:35정확히 똑같은 원리를 따르고 있죠.
00:02:38이 영상은 몇 년도 것일까요?
00:02:40전자 장치를 다루는 숙련된 작업자가--
00:02:42이제 다들 연도를 훨씬 높여서 예상하시겠죠.
00:02:45이것은 68년 전인 1957년 영상입니다.
00:02:49놀랍죠?
00:02:51가족 중 더 연세가 있으신 분께--
00:02:53사실 당시를 기억하는 분이 안 계실 수도 있겠네요.
00:02:55왜냐하면 이건...
00:02:5780세이신 분께 여쭤봐야 하는데,
00:02:59당시 기술 수준이 어땠는지 물어보셔야 하니까요.
00:03:02RAM 몇 킬로바이트를 얻으려면 방 하나만한 크기의
00:03:06거대한 장비가 필요하던 시절이었습니다.
00:03:07그런 시대에 이미 저런 기술을 구현해낸 겁니다.
00:03:11이뿐만이 아니라 10년 단위로 돌아가서 봐도
00:03:14영상 속 로봇들은 여전히 근사합니다.
00:03:15여기 저글링을 하고 사람과 테이블 축구를 하는
00:03:18휴머노이드 로봇이 있습니다.
00:03:21이 역시 모두 딥러닝이 등장하기 전의 일입니다.
00:03:25이것은 8년 전 영상인데요.
00:03:26버클리 대학에서 만든 이 로봇은
00:03:29탁자 전체를 치우고 물건을 상자에 정리할 수 있습니다.
00:03:33대학원생 한 명이 단 한 대의 GPU 컴퓨터로 해낸 결과물이었죠.
00:03:36그 이상 특별한 건 없었습니다.
00:03:37그렇죠?
00:03:38만약 제가 이 과거 영상들에 색을 입히고
00:03:41생성형 AI 필터를 씌워 세련된 목소리를 입힌다면
00:03:45이 영상이 1957년 영상인지,
00:03:49아니면 오늘날의 영상인지 구분할 수 없을 겁니다.
00:03:50심지어 이것들도 가장 오래된 연구 결과가 아닙니다.
00:03:52가장 오래된 것은 1940년대까지 거슬러 올라갑니다.
00:03:54아시겠나요?
00:03:55지난 70년을 돌이켜보면
00:04:00다른 모든 기술 분야는
00:04:02엄청난 발전을 이루었습니다.
00:04:04언어 이해, 컴퓨터 비전, 모바일, 반도체까지 말이죠.
00:04:08그런데 왜 로봇공학은 이토록 오랫동안 원시적인 단계에 갇혀 있을까요?
00:04:11그 이유는 범용 두뇌의 부재 때문입니다.
00:04:14로봇공학은 늘 근본적으로
00:04:17하드웨어 문제로만 접근되어 왔습니다.
00:04:18그렇기 때문에 로봇 주변의 모든 기술은 발전했어도
00:04:21로봇공학 자체는 지난 70년 동안
00:04:24제자리에 정체되어 있었던 것입니다.
00:04:25여기 '모라벡의 역설'이라는 매우 유명한 역설이 있습니다.
00:04:27모라벡에 대해 들어보셨는지 모르겠네요.
00:04:29그분도 CMU 교수였고, 저 역시 CMU 교수입니다.
00:04:32그러니 당연히 인용해야겠죠.
00:04:34그는 AI 분야의 개척자 중 한 명이었습니다.
00:04:36로봇공학 연구에 30년을 바친 끝에
00:04:39그는 아주 명쾌한 결론에 도달했습니다.
00:04:41'어려운 것은 쉽고,
00:04:42쉬운 것은 어렵다.'
00:04:43무슨 뜻일까요?
00:04:44인간이 어렵다고 생각하는 일은
00:04:45컴퓨터에게는 너무나 쉽고, 그 반대도 마찬가지라는 겁니다.
00:04:49지금 여러분 눈앞에서도 그 현상이 벌어지고 있죠.
00:04:51수학 문제를 푸는 건 어렵다고 생각할 겁니다.
00:04:53수학 올림피아드 금메달을 따는 건 정말 어렵죠.
00:04:56그럼 계단을 오르는 건요?
00:04:57우리에게는 너무나 쉬운 일입니다.
00:04:59이제 지금의 기술 현실을 둘러보십시오.
00:05:01무엇이 해결되었고
00:05:02무엇이 아직 해결되지 않았는지를요.
00:05:04이것이 바로 로봇공학의 현주소입니다.
00:05:05로봇공학은 단순히 AI를 응용하는 또 하나의 분야가 아닙니다.
00:05:09원래 AI가 처음 탄생한 목적이었지만
00:05:12가장 진전이 없었던 분야인 것이죠.
00:05:14심층 신경망을 단순 적용해서
00:05:15정복할 수 있는 그런 흔한 분야가 아닙니다.
00:05:18이 문제는 제1원칙에 기반해 근본적으로
00:05:22다시 고민해야 하는 분야입니다.
00:05:23유명한 예시가 하나 있죠.
00:05:251990년대에 이미 컴퓨터가 체스 세계 챔피언 가리 카스파로프를 이겼지만,
00:05:29체스말을 직접 집어서 체스판 위에
00:05:34배치할 수 있는 컴퓨터나 로봇은
00:05:36여전히 존재하지 않는다는 점입니다.
00:05:37그렇다면 이 문제를 어떻게 해결해야 할까요?
00:05:43긍정적인 면을 보자면, 우리에게는 AI 성공을 이끄는 비법이 있습니다.
00:05:47그렇죠?
00:05:49방대한 데이터셋을 구축하고,
00:05:51거대 모델을 학습시키면
00:05:52마법 같은 일이 일어납니다.
00:05:54이 공식이 여러 분야에서 아주 잘 작동한다는 것을
00:05:57우리는 이미 알고 있습니다.
00:05:59그렇다면 같은 방식을 로봇공학에도 적용할 수 있을까요?
00:06:02안타깝게도 데이터가 없기 때문에 바로 적용할 수는 없습니다.
00:06:06로봇공학 분야에는 인터넷 같은 데이터 집합체가 없습니다.
00:06:09앞서 말씀드렸듯, 원격 조작이라는 방식으로
00:06:12로봇 데이터를 수동으로 수집할 수는 있습니다.
00:06:14하지만 아시다시피 원격 조작은 최근 5년 사이에 나온 기술이 아닙니다.
00:06:18무려 68년, 70년이나 된 기술이죠.
00:06:21재미있는 점은, 지난 시간을 돌아보며
00:06:24GPT-3, GPT-4 모델의 진화 과정을 살펴보면
00:06:283년 전 GPT-3 시절로 돌아가 보겠습니다.
00:06:31까마득한 옛날처럼 느껴지죠.
00:06:33GPT-3가 제대로 작동하고 사람들의 주목을 받기 시작한 건
00:06:36수조 개의 토큰으로 모델을 학습시킬 수 있게 되면서부터였습니다.
00:06:40GPT-3 때 이미 30조 개 이상의 토큰이 쓰였고,
00:06:42오늘날에는 수백조 개의 토큰이 사용됩니다.
00:06:44반면 원격 조작으로 데이터를 직접 수집하면
00:06:47데이터 1개를 얻는 데 약 1분이 걸립니다.
00:06:49계산을 한번 해보십시오.
00:06:50미국 인구 전체를 동원하더라도
00:06:53GPT-3 수준의 규모에 도달하려면
00:06:55100년 이상이 걸립니다. 이건 마치...
00:06:59그리고 오늘날 아무도 GPT-3를 쓰지 않죠.
00:07:00그렇죠?
00:07:01따라서 이 방식은 너무 느리고 비용이 많이 듭니다.
00:07:02그래서 로봇 공학에서는 아무도
00:07:05로보틱스를 제대로 확장하지 못했다고 봅니다.
00:07:07다른 분야에서 이루어낸 스케일링을
00:07:10로보틱스에서 논하기에는 아직 갈 길이 멉니다.
00:07:14아시겠죠?
00:07:14이것이 바로 저희가 집중해 온 부분입니다.
00:07:17스케일드는 설립된 지 3년 정도 되었지만,
00:07:19저는 10년 이상 이 문제를 연구해 왔습니다.
00:07:22내 커리어 동안 한 일은 그게 전부입니다.
00:07:24다른 건 없습니다.
00:07:26스케일드의 핵심 가설은
00:07:27'옴니바디 지능(omnibodied intelligence)'을 구축하는 것입니다.
00:07:32어떤 로봇, 어떤 작업이든 하나의 뇌로 처리하는 거죠.
00:07:35이해되시죠?
00:07:36어떤 로봇이든—휴머노이드일 수도 있고,
00:07:374족 보행 로봇일 수도 있으며,
00:07:38컨베이어 벨트 위의 로봇 팔이나 정교한 로봇 손일 수도 있습니다.
00:07:41하드웨어 형태는 상관없습니다.
00:07:42이 가설은 인간의 신체 제어보다
00:07:45훨씬 더 범용적이라고 할 수 있습니다.
00:07:48인간은 자기 자신의 몸만 제어하니까요.
00:07:50왜 이렇게까지 범용적이어야 할까요?
00:07:51로보틱스 분야에는 어차피
00:07:54데이터가 절대적으로 부족하기 때문입니다.
00:07:56따라서 특정 하드웨어의 데이터만 골라 쓸 여유가 없습니다.
00:07:59어떤 종류의 하드웨어, 어떤 작업,
00:08:02어떤 시나리오의 데이터든 활용할 수 있어야 합니다.
00:08:04그것만이 3년 전 언어 모델이 달성한
00:08:06스케일에 진정으로 도달할 수 있는 유일한 길입니다.
00:08:10목표는 '어떤 로봇, 어떤 작업이든
00:08:13하나의 뇌로'라는 구상입니다.
00:08:15오늘 강연을 통해 이것이 왜 로보틱스가
00:08:16나아가야 할 방향인지 설득해 드리겠습니다.
00:08:20아시겠죠?
00:08:20여기까지가 대략적인 서론입니다.
00:08:23더 자세한 내용으로 들어가기 전에,
00:08:24맛보기 결과 영상을 먼저 보여드리겠습니다.
00:08:28이 영상에 나오는 모든 로봇은
00:08:31각기 다른 회사의 서로 다른 하드웨어입니다.
00:08:34그리고 모두 스케일드의 AI 뇌로 제어되고 있죠.
00:08:37계단을 오르내리는 휴머노이드이든,
00:08:39어떤 시나리오든 상관없이 말입니다.
00:08:42이것들은 최근 결과가 아닙니다.
00:08:43몇 년 전의 결과물들입니다.
00:08:47방해 공작에도 견뎌내는 강건함을 보여주죠.
00:08:51새로운 환경에 사전 학습 없이 배치할 수도 있습니다.
00:09:03핵심 개념은, 이 영상 속 모든 로봇이
00:09:08세계 어느 곳에서든 동작을 수행할 때마다
00:09:11백그라운드의 AI 뇌가 지속적으로 발전한다는 점입니다.
00:09:13모든 신체를 아우르는 옴니바디 뇌이기 때문이죠.
00:09:15네, 이건 정말 어렵습니다.
00:09:16달걀은 무사하네요.
00:09:17이상으로 저희 연구의 맛보기 소개를 마치겠습니다.
00:09:33단순한 회사 홍보보다 학술적이고 정보가 유익한 강연으로 만들고자 합니다.
00:09:39따라서 로보틱스에서 데이터를 스케일업하는 방법에 대해 말씀드리겠습니다.
00:09:42기존에 사람들이 이 문제에 어떻게 접근했는지 돌아보죠.
00:09:45제 연구 커리어를 되돌아보겠습니다.
00:09:48데이터에 대한 저의 가설은 수년간 계속 변화해 왔습니다.
00:09:51제가 처음 연구를 시작하고 규모를 확장할 때
00:09:55지배적인 생각은, 사람이 로봇 데이터를 수동 수집하는 방식은
00:09:59너무 느리다는 것이었습니다.
00:10:00로봇이 스스로 데이터를 수집하게 해야 한다고 보았죠.
00:10:03그래서 호기심 기반 탐색(curiosity-driven exploration) 개념을 도입해
00:10:06로봇이 환경을 자율적으로 탐색하도록 했습니다.
00:10:10사람이 필요 없다는 큰 장점이 있었죠.
00:10:13로봇이 계속 놀면서 더 많은 데이터를 수집할 수 있습니다.
00:10:15당시 우리는 이를 '놀이 데이터(play data)'라 불렀습니다.
00:10:17힘, 센서, 관절 각도 정보가 포함되어 매우 풍부합니다.
00:10:21하지만 문제는 이것이 물리 세계에서만 일어난다는 점입니다.
00:10:24따라서 데이터 확장이 매우 어렵습니다.
00:10:27당시 구글은 수백 대의 로봇을 동원해 연구 중이었습니다.
00:10:31하지만 구글조차도 확장을 추진하기엔 비용과 시간이 너무 많이 들었죠.
00:10:34또 다른 접근법은 원격 조종(tele-operation)입니다.
00:10:36말씀드렸듯 오래된 방식이죠.
00:10:38하지만 역시 동일한 한계가 존재합니다.
00:10:39확장이 불가능한데, 이제는 로봇뿐만 아니라
00:10:42사람까지 필요하기 때문입니다.
00:10:43비용이 훨씬 더 비싸집니다.
00:10:45게다가 데이터의 다양성도 매우 제한적입니다.
00:10:46한 장소에 로봇과 작업자를 두고
00:10:501,000개의 예시 데이터를 얻는다 해도
00:10:51모두 동일한 환경에서 나온 데이터일 테니까요.
00:10:53이상적으로 원하는 것은 매일 로봇을 새로운 가정,
00:10:57새로운 시나리오로 옮기는 것이지만,
00:10:58그렇게 확장하는 것은 불가능에 가깝습니다.
00:11:01그러다 시뮬레이션 기반 학습에서
00:11:03큰 돌파구가 마련되었습니다.
00:11:04시뮬레이션에서 훈련시킨 심층 강화학습을
00:11:12실제 로봇으로 전이할 수 있음을 보여준 초기 연구 중 하나였죠.
00:11:13당시 수상 경력이 있는 논문이었습니다.
00:11:16지금은 모든 휴머노이드 회사에서 사용하고 있죠.
00:11:20버클리와 카네기 멜런 대학(CMU) 연구실에서 나온 성과였습니다.
00:11:23하지만 이 역시 장단점이 명확합니다.
00:11:25스케일업은 매우 쉽지만,
00:11:27시뮬레이션 내 모든 장면을 수동 엔지니어링해야 하므로
00:11:29다양성을 확보하기 어렵습니다.
00:11:31들어보시면 아시겠지만,
00:11:34제가 제시하려는 단 하나의 정답은 없습니다.
00:11:35단 하나의 완벽한 해결책은 존재하지 않죠.
00:11:39이것은 저희가 이전에 진행했던 또 다른 연구입니다.
00:11:41스케일드를 시작하기 전의 일입니다.
00:11:43사람의 영상에서 학습하는 방식인데,
00:11:44사람이 행동하는 것을 관찰하고 로봇이 이를 따라 합니다.
00:11:47다양성이 매우 높다는 장점이 있죠.
00:11:48유튜브 등의 동영상을 활용할 수 있으니까요.
00:11:50확장성도 매우 뛰어납니다.
00:11:51하지만 로봇 제어와는 거리가 멀기 때문에
00:11:54품질이 매우 낮은 형태의 데이터입니다.
00:11:57그렇다면 해결책은 무엇일까요?
00:11:59정답은 '지름길은 없다'는 것입니다.
00:12:01다양한 특성의 관점에서
00:12:05데이터를 고려해야 합니다.
00:12:06제 견해로는 로보틱스에서 중요한 요소는
00:12:09단 세 가지뿐입니다.
00:12:12확장성, 다양성, 그리고 실제 로봇 관절 각도와
00:12:15얼마나 가까운지 여부입니다.
00:12:18확장성은 다양한 시나리오로 신속히 확장 가능한지를 의미합니다.
00:12:22다양성은 다채로운 데이터를 얻을 수 있는가를 뜻하죠.
00:12:25100조 개의 토큰이 있다 해도
00:12:27모두 동일한 환경과 동일한 시나리오라면
00:12:29전혀 쓸모가 없기 때문입니다.
00:12:32그리고 '로봇과의 근접성'은 실제 로봇의
00:12:35관절 각도 참값(ground truth)에 얼마나 가까운가를 뜻합니다.
00:12:38시뮬레이션을 보면 확장성은 높고 다양성은 낮으며,
00:12:42로봇과의 근접성은 중간 정도입니다.
00:12:44사람의 영상은 확장성과 다양성이 매우 높지만,
00:12:46실제 로봇 데이터와는 거리가 멀어서
00:12:47사람의 동작을 로봇에 매핑하는 법을 학습시켜야 합니다.
00:12:49다른 두 방식인 원격 조종과 조작 인터페이스 방식은
00:12:52그 중간쯤 위치합니다.
00:12:54보시다시피 현재 전 세계의
00:12:57여러 로봇 기업들을 보면,
00:12:58다들 이 중 하나의 접근 방식에만 집중하고 있습니다.
00:13:01대부분 원격 조종이나 윰(Yumi) 장비 환경에 치중해 있고
00:13:05그 외의 방식을 쓰는 곳은 극히 드뭅니다.
00:13:07하지만 절대적인 정답은 없습니다.
00:13:09각 방식마다 단점이 명확하니까요.
00:13:11희망적인 사실은 이 방법들이 서로를 보완해 준다는 점입니다.
00:13:16서로의 단점이 정확히 일치하지 않기 때문이죠.
00:13:20그래서 저희가 수년간 수렴해 온 해결책은
00:13:24학습 과정을 사전 학습(pre-training)과 사후 학습(post-training)의
00:13:27두 단계로 분리하는 것임을 깨달았습니다.
00:13:29익숙한 개념이죠?
00:13:30그렇다면 사전 학습은 어떻게 할까요?
00:13:31사전 학습에는 데이터를 활용하고자 합니다.
00:13:32확장성이 뛰어나고 다양하지만 품질은 다소 낮을 수 있죠.
00:13:35시뮬레이션이나 사람이 찍은 영상 등이 해당됩니다.
00:13:37이런 방식으로 사전 학습을 진행합니다.
00:13:39그리고 사후 학습에는 원격 조종 데이터를 사용합니다.
00:13:42원격 조종 데이터란 무엇일까요?
00:13:43품질은 매우 높지만 양은 적습니다.
00:13:47고품질이지만 양이 적은 편이죠.
00:13:48언어 모델 학습 방식과 매우 흡사합니다.
00:13:51인터넷 데이터로 사전 학습을 거친 뒤
00:13:53코딩이나 자사 용도에 맞춰 사후 학습을 진행하듯이 말이죠.
00:13:59하지만 로봇공학에는 영역이 하나 더 있는데,
00:14:00바로 배포 데이터입니다.
00:14:02배포 데이터는 실제 배포가 본격화되면
00:14:05엄청난 확장성을 가집니다.
00:14:07시간이 지나면 이 데이터가 다른 모든 것을 압도할 것입니다.
00:14:11저희가 구축하려는 것은
00:14:14일종의 데이터 플라이휠입니다.
00:14:16사후 학습 단계의 데이터를 가져와
00:14:18사전 학습에 다시 투입하는 구조죠.
00:14:20이제 범용 신체 두뇌(omnibodied brain)라는 개념이
00:14:23왜 그토록 중요한지 이해하실 것입니다.
00:14:25단 하나의 로봇, 단 하나의 버전만으로 전 세계의 모든 작업에
00:14:28영구 배포되는 상황은 가능성이 매우 희박하기 때문입니다.
00:14:32제조가 까다로운 칩 분야를 제외하면,
00:14:36하드웨어 분야에서 이런 일은 결코 일어나지 않습니다.
00:14:38게다가 칩 시장조차도
00:14:40요즘은 여러 기업에서 추론용 칩이
00:14:42쏟아져 나오고 있죠.
00:14:43따라서 하드웨어에서는 단 하나의
00:14:45로봇 모델, 단 하나의 형태만 존재하는 경우가 없습니다.
00:14:48그렇기에 범용 신체 지능이야말로
00:14:50배포 데이터 플라이휠을 가능하게 하는 핵심 요소입니다.
00:14:56그럼 이제 몇 가지 결과를 빠르게 살펴보겠습니다.
00:14:58이 두뇌는 매우 범용적이어서
00:15:00다양한 작업을 아주 신속하게 수행할 수 있습니다.
00:15:03빨래 접기 같은 작업을 자주 보셨을 겁니다.
00:15:06실리콘밸리에서는
00:15:07왠지 모르게 매우 인기 있는 시연 과제죠.
00:15:10하지만 여기서 핵심 질문은,
00:15:14티셔츠를 접을 때 “손 위치가 1cm만 빗나가면
00:15:18망하겠구나” 하고 생각해보신 적이 있으신가요?
00:15:22아무도 그렇게 생각하지 않습니다.
00:15:23사람들은 접을 때 별생각도 하지 않죠.
00:15:25그냥 아무 데나 잡고
00:15:26대충 척척 접어냅니다.
00:15:27즉 오차 허용 범위가 엄청나게 넓다는 뜻입니다.
00:15:31그렇다면 왜 이 작업이 어려운 걸까요?
00:15:35다들 왜 이 작업이 어렵다는 착각에
00:15:38빠지는 걸까요?
00:15:39질문을 그렇게 바꿔보죠.
00:15:42천(직물) 때문일까요?
00:15:43천 제어가 왜 어려울까요?
00:15:46시뮬레이션 문제라 하지만, 시뮬레이션을 쓰지도 않습니다.
00:15:48이건 전부 원격 조종 데이터 기반입니다.
00:15:49그렇다면 왜 어려울까요?
00:15:51이유를 아시나요?
00:15:52고전적인 로봇공학 방식에나 어려웠던 과제이기 때문입니다.
00:15:56과거에는 전체 물리학을 수식화하고
00:15:59모델을 수작업으로 만들어 제어했습니다.
00:16:01그런 방식에는 매우 어렵죠.
00:16:02하지만 딥러닝 기반 로봇공학에서는
00:16:04이보다 더 쉬운 작업이 없습니다.
00:16:06오차 허용 범위가 매우 크니까요.
00:16:08그런데 수많은
00:16:09기업이 여전히 이 작업에만 집중하고 있습니다.
00:16:12진짜 어려운 작업은
00:16:13이런 종류의 작업이라고 봅니다.
00:16:17영상을 보기 전에 여쭤봤다면,
00:16:19사람 손 없이도 이 작업이 가능할까요?
00:16:22절반 정도는 불가능하다고 하셨을 겁니다.
00:16:24에어팟 집어넣기 같은 작업이니까요.
00:16:25혹시 에어팟 잃어버려 보신 분 계신가요?
00:16:29저희 회사 슬랙에는 '오른쪽 에어팟'이라는
00:16:30채널이 있을 정도입니다. 다들
00:16:32오른쪽 에어팟을 자꾸 잃어버리거든요.
00:16:34지금 이 로봇은 손이 없고
00:16:36집게(그리퍼)만 달려 있습니다.
00:16:37이런 집게에는 매우 고난도의 과제입니다.
00:16:41더 높은 수준의 지능이 필요한데,
00:16:43에어팟을 쏙 넣을 수 있도록
00:16:46로봇 팔이 올바른 방향으로 접근해 집어야 하기 때문입니다.
00:16:49평행 그리퍼는 이런 식으로만 다물어지므로
00:16:52손가락처럼 쥐고 있는 상태에서
00:16:54마지막 순간에 방향을 비틀 수 없거든요.
00:16:55그리고 영상에 나오는 에어팟은 정품이 아닙니다.
00:16:59테무에서 개당 5달러, 10달러 주고 산 짝퉁이죠.
00:17:02그래서 내부 자석도 없습니다.
00:17:05끌어당겨 주는 자석이 없으니
00:17:07케이스에 제대로 넣으려면 로봇이 훨씬 더 정밀하게 움직여야 합니다.
00:17:11전부 짝퉁 제품입니다.
00:17:13보기보다 훨씬 난이도가 높은 작업이죠.
00:17:15범용 두뇌 시스템을 한 번 구축해 두면,
00:17:17원격 조종 시점의 미세 조정 데이터 없이도
00:17:23사람이 일하는 다양한 영상만 보고 학습을 진행할 수 있습니다.
00:17:26이 시나리오에서는
00:17:281인칭 시점의 사람 영상으로
00:17:29학습을 시켰습니다.
00:17:31현재는 3인칭 시점 영상으로 전이하는 시도를 하고 있습니다.
00:17:343인칭 시점 학습이 가능해지면 유튜브 같은
00:17:38온갖 오픈소스 데이터에서 배울 수 있게 됩니다.
00:17:40이 사례에서는 영상 학습을 거친 뒤
00:17:431시간 미만의 로봇 데이터를 추가했습니다.
00:17:45매우 빠른 전이가 이루어지죠.
00:17:47그리고 휴머노이드에도 전이할 수 있습니다.
00:17:50이 로봇들은 사람 형태의 손을 가지고 있습니다.
00:17:53손이 필요한가에 대해서는 논쟁이 많죠.
00:17:54흔히 로봇의 상용화가 더딘 핑계로
00:17:57손(의수)의 부재를 대곤 하지만, 실제 원인은 그게 아닙니다.
00:18:00핵심은 언제나 백엔드의 지능입니다.
00:18:02저희가 당장 다지창 손을 현장에 도입하지 않는 이유는
00:18:07공장에 투입할 만한 내구성의 제품이 없기 때문입니다.
00:18:09어떤 제품을 가져와도 100시간 이내에 고장 납니다.
00:18:12아무거나 골라 테스트해 봐도 마찬가지죠.
00:18:14더 뛰어난 로봇 손이 있다면
00:18:17테스트용으로 당장 10대를 구매하고 싶습니다.
00:18:19내구성이 중요한 실제 현장 시나리오의 문제죠.
00:18:22핵심은 사람이 하는 행동을 관찰하는 것만으로
00:18:25수많은 작업을 배울 수 있다는 점입니다.
00:18:281시간 미만의 로봇 데이터라는 극히 적은 데이터로도
00:18:31작동할 수 있는 이유는
00:18:33로봇이 머릿속으로 스스로 상황을 상상하며
00:18:36다양한 시나리오에 맞춰 학습 효과를 증폭시키기 때문입니다.
00:18:39지금 보시는 영상은 완전히 가상으로 생성된 것입니다.
00:18:42'로봇의 꿈'이라고 불러도 좋겠네요.
00:18:43로봇 내부의 자체 모델 안에서
00:18:45여러 시나리오를 상상해 보는 것입니다.
00:18:48실제 촬영 데이터가 아니라
00:18:49로봇의 인공지능 모델이 생성해 낸 가상 영상입니다.
00:18:52이 기술을 더 복잡한 작업이나
00:18:56더 저렴한 하드웨어에도 적용할 수 있습니다.
00:18:57이 영상은 계란 요리, 즉 오믈렛을 만드는 작업입니다.
00:19:02여기 보이는 전체 장비 비용은 약 4,000달러 수준입니다.
00:19:06시중에 나온 제품들에 비해 엄청나게 저렴한 로봇 팔이죠.
00:19:11유심히 보시면, 이 구성은 너무 저가형이라
00:19:15별도의 센서조차 갖춰져 있지 않습니다.
00:19:16센서라고는 카메라 한 대뿐이며, 힘 센서 등은 전혀 없습니다.
00:19:20그럼에도 시각 정보만으로 힘 조절이 필요한 작업들을 해냅니다.
00:19:25이 방식이 지향해야 할 미래라거나
00:19:26센서 없이 가야 한다는 뜻은 아닙니다.
00:19:27앞으로 센서 성능은 더욱 향상될 것입니다.
00:19:29다만 현재의 센서 수준을 기준으로 봐도
00:19:33우리가 소프트웨어 지능 측면에서 도달할 수 있는 한계치에
00:19:36한참 미치지 못하고 있었다는 의미입니다.
00:19:38작업은 끊임없이 이어질 수 있습니다.
00:19:39이분은 제 버클리 지도교수님이신데요.
00:19:41로봇이 이걸 해낼 수 있다는 걸 믿지 않으셨습니다.
00:19:43그래서 1시간 동안 계속 서서 지켜보셨죠.
00:19:45로봇은 멈추지 않고 계속 오믈렛을 만들었고요.
00:19:48여기서 흥미로운 점은
00:19:49이게 완전한 엔드투엔드 시스템이라는 사실입니다.
00:19:51상태 머신 같은 하드코딩된 로직이 전혀 없습니다.
00:19:53로봇이 계란 요리를 하는 이유는
00:19:55단지 앞에 빈 접시가 놓여 있기 때문입니다.
00:19:56왜 화면이 깜빡이는지 모르겠네요.
00:19:58영상에는 편집이 전혀 없습니다.
00:20:00그건 장담합니다.
00:20:01HDMI 문제예요.
00:20:02접시를 치우자마자...
00:20:06죄송합니다, 왜 이런지 모르겠네요.
00:20:08네, 그래서 상태 머신이 없습니다.
00:20:10로봇이 언제 시작하고 언제 끝나는지가
00:20:11모두 자동화되어 있죠.
00:20:12방해 공작에도 매우 강합니다.
00:20:14주변 물체를 바꿔도 되고요.
00:20:16추가해도 되는데, 전부 학습 때 보지 못한 물체들입니다.
00:20:20팬과 가스레인지 빼고는
00:20:22모든 것이 다릅니다.
00:20:23그래도 로봇은 계속 작동하죠.
00:20:25기본적인 강건함을 얻을 수 있는 겁니다.
00:20:27이 모든 것은 10시간 미만의 데이터로 학습되었습니다.
00:20:30이 정도의 강건함을 배우기엔 매우 적은 데이터량이죠.
00:20:33이는 비하인드에 있는 기반 모델 덕분입니다.
00:20:37시간 관계상 이 부분은 넘어갈게요.
00:20:39계획, 매핑 등이 존재하는
00:20:42기존 로보틱스 파이프라인과 달리,
00:20:44이것은 엔드투엔드 뇌입니다.
00:20:46'엔드투엔드'는 AI의 많은 분야에서 오용되는 용어인데요.
00:20:50제가 말하는 엔드투엔드는 말 그대로 '진짜' 엔드투엔드입니다.
00:20:53카메라에서 직접 데이터를 읽어 들여
00:20:55모터에 전력을 직접 인가합니다.
00:20:59따라서 100Hz를 500Hz로 변환하기 위해
00:21:02맨 끝단에 처리하는 PID 제어 말고는 중간에 아무것도 쓰지 않죠.
00:21:04하지만 PID는 로보틱스 진영의 기여가 아닙니다.
00:21:06그 이전의 기술이죠.
00:21:07제2차 세계대전인가 그 시절까지 거슬러 올라갑니다.
00:21:10흥미로운 점은, 저희에게 시각 정보는
00:21:13그저 수많은 입력 중 하나일 뿐이라는 겁니다.
00:21:15특별 대단할 것도 없죠.
00:21:17여러분도 로봇이 춤을 추거나, 가라테나 쿵후를 하고,
00:21:20백덤블링하는 결과는 많이 보셨을 겁니다.
00:21:23그렇다면 한번 돌이켜 생각해 보세요.
00:21:27로봇이 계단을 오르내리는 영상은 몇 번이나 보셨나요?
00:21:30극히 드뭅니다.
00:21:31휴머노이드 분야 최정상급 기업들조차
00:21:34그저 체크리스트 채우기용으로 샘플 계단 하나를
00:21:37오르는 수준 이상은 보여주지 못했습니다.
00:21:39사람들은 휴머노이드의 시대가 온다, 중국 대 미국이다 말하지만,
00:21:42이건 다 헛소리입니다.
00:21:44휴머노이드가 계단조차 못 오른다면
00:21:47다리가 있을 이유가 없지 않습니까?
00:21:50계단을 오르는 게 다리가 있는 유일한 이유입니다.
00:21:51이것이 바로 모라벡의 역설이 실제로 작용하는 모습입니다.
00:21:55왼쪽 행동이 사실 로봇에게 훨씬 쉽습니다.
00:21:58공중제비나 춤추기는 로봇에겐 훨씬 쉬운 일이죠.
00:22:01'왜 이런 역설이 존재하지?' 싶으실 겁니다.
00:22:04한 단계 더 깊이 생각해 보세요.
00:22:05로봇이 공중제비를 돌 때는
00:22:09자신의 몸 상태만 알고 있으면 되며, 다른 것은 필요 없습니다.
00:22:13그렇죠?
00:22:13모든 요소가 이미 알려져 있거나 완전히 관찰 가능한 상태는
00:22:17컴퓨터가 가장 잘하는 영역입니다.
00:22:20가능한 모든 설정을 시뮬레이션할 수 있으니까요.
00:22:25하지만 오른쪽처럼 단순히 계단을 오르는 것조차
00:22:27우선 계단 자체를 볼 수 있어야 합니다.
00:22:30높이나 너비가 얼마인지 말이죠.
00:22:32높이와 너비를 정확히 측정하지 않더라도
00:22:34모든 변수에 적응해야만 합니다.
00:22:35그리고 거기엔 비전(시각)이 필요하죠.
00:22:36즉, 오른쪽 작업은 '이해'가 필요합니다.
00:22:38그래서 어렵고, 다른 곳에서 이런 사례를 못 보는 겁니다.
00:22:40하지만 저희에게는 그저 흔한 결과물 하나일 뿐입니다.
00:22:42별로 대단할 게 없죠.
00:22:43저희는 이 결과를 1년 반 전에 공개했습니다.
00:22:46촬영은 2년 반 전에 했고요.
00:22:48이 로봇은 어떤 환경이든 이동할 수 있습니다.
00:22:52물건에 걸려 넘어지지 않죠.
00:22:53의도적으로 장애물을 넘어갑니다.
00:22:55매핑이나 경로 계획도 없습니다.
00:22:56주변 환경의 3D 지도를 전혀 만들지 않아요.
00:22:59오직 상체에 달린 카메라로만 작동합니다.
00:23:02어떤 환경, 어떤 계단에 가져다 놓아도 작동하죠.
00:23:05조금 빠르게 넘어갈게요.
00:23:07이건 비상 탈출용 비상 계단입니다.
00:23:11구조가 조금 특이하죠.
00:23:12비상 계단은 화재 등 긴급 상황에서 사용하는 곳인데,
00:23:15어느 건물에서나 이동하기 가장 까다롭습니다.
00:23:17저희는 이런 모든 환경에서 테스트를 거치고 있습니다.
00:23:20하지만 어디에 놓아도 상관없습니다.
00:23:21계단에서 로봇을 방해해도 괜찮아요.
00:23:22아무런 상관이 없습니다.
00:23:23이건 인간을 뛰어넘는 능력입니다.
00:23:25로봇은 자기가 잡아당겨지는 걸 볼 수 없으니까요.
00:23:27따라서 계단을 오르는 동안 뒤에서 당기는 것은
00:23:29로봇 입장에선 예기치 못한 교란 변수입니다.
00:23:31다시 말씀드리지만, 이 모든 상황에
00:23:33동일한 모델이 쓰였습니다.
00:23:35매우 간단하죠.
00:23:36쉽다고 해도 파쿠르는 보기 재미있긴 합니다.
00:23:40사람들은 종종 이런 영상을 보고
00:23:45로봇이 이 모든 것을 해낸다고 놀라지만,
00:23:47이건 제가 아까 보여드린 것보다 훨씬 더 쉬운 작업입니다.
00:23:51지금 이 영상들을 보시더라도
00:23:53많은 분이 이게 더 인상적이라고 느끼실 겁니다.
00:23:55제가 이게 더 쉽다고 말씀드리는데도 말이죠.
00:23:57이걸 학습시키는 데는 30분밖에 안 걸립니다.
00:23:59반면 이전 작업은 학습 시간이 훨씬 더 오래 걸리고
00:24:01난이도도 훨씬 높습니다.
00:24:03이 기반 모델을 가져와서 다양한 작업으로
00:24:06매우 빠르게 전이시킬 수 있습니다.
00:24:08여기 보이는 건 1년 반 전의
00:24:09아주 오래된 결과물입니다.
00:24:11LAN 케이블 삽입 등의 작업을 위해
00:24:13현재 매우 고급화된 시스템을 갖추고 있죠.
00:24:14하지만 저희는 이미 다양한 응용 분야에
00:24:17이 모델들을 배치하고 있습니다.
00:24:18왜냐하면 데이터 플라이휠을 구축하는 데 있어서
00:24:21가장 어려운 부분은 현장 배치 그 자체이기 때문입니다.
00:24:24로보틱스를 실제로 현장에 적용할 때는
00:24:26지능이나 하드웨어 외에도 수많은 문제들이 발생합니다.
00:24:30앱 형태로 ChatGPT를 배포하는 것과는 차원이 다릅니다.
00:24:34수많은 수식 요소를 다뤄야 하기 때문이죠.
00:24:36아까 Skydio 발표가 있었던 것으로 아는데,
00:24:38현장 배치의 어려움에 대해서라면
00:24:40하루 종일이라도 얘기해 줄 수 있을 겁니다.
00:24:42그래서 저희는 지금 당장 배치를 시작해야 합니다.
00:24:44그래야 가시적인 미래에 데이터 플라이휠을 구축할 수 있으니까요.
00:24:47저희가 진행 중인 현장 배치 사례를 몇 가지 들어보겠습니다.
00:24:49한 예로 엔비디아와의 협업이 있습니다.
00:24:51엔비디아가 휴스턴에 첫 공장을 열 예정인데요.
00:24:54여러분께서 지금 쓰시는 엔비디아 GPU는
00:24:56전부 미국 외 지역, 주로 대만에서 제작됩니다.
00:24:59현지에서 전부 수작업으로 이루어지죠.
00:25:01사람은 정말 효율적이고 이런 제품을 만드는 데
00:25:04매우 탁월합니다.
00:25:05하지만 미국 내에서 지속적인 비용 절감과 확장성, 처리량을
00:25:08이러한 노동력 없이 유지하기란
00:25:10매우 어렵습니다.
00:25:11그래서 저희는 이 GPU 조립 공정을 자동화하고 있습니다.
00:25:15이건 엔비디아 GTC에서 라이브로 시연했던 것인데요.
00:25:19지난주에 이미 공장에 배치되었기 때문에
00:25:21이미 실제로 작동 중입니다.
00:25:22하지만 제가 강조하고 싶은 흥미로운 점은,
00:25:25이게 매우 전형적인 공장 작업이라는 것입니다.
00:25:29하지만 전체적인 설정을 살펴보면
00:25:32엄청나게 무작위적이고 잡음이 많습니다.
00:25:36기존 공장의 전형적인 설비를 가보면
00:25:38매우 정돈되어 있거든요.
00:25:39여기서는 동일한 뇌를 가진 로봇이
00:25:42정밀한 작업을 수행할 수 있을 뿐만 아니라,
00:25:44어떤 종류의 방해에도 매우 강건하게 대처합니다.
00:25:46즉, 이 로봇들이 펜스 안에 갇혀 있을 필요가 없다는 뜻이죠.
00:25:50공장 생산 라인을 전혀 변경하지 않고도
00:25:54그대로 현장에 배치할 수 있는 겁니다.
00:25:56사람과 함께 일하는 곳엔 언제나 어지러움이 존재하니까요.
00:26:00이해되시죠?
00:26:00동일한 뇌를 배송 응용 분야에도 적용할 수 있습니다.
00:26:02여기 보이는 로봇은 트럭에서 현관 앞까지 배송을 수행합니다.
00:26:06현관문이 어디 있는지 찾아야 하므로
00:26:08상식적인 판단의 문제이지,
00:26:09이동 능력의 문제가 아닙니다.
00:26:10저희는 이미 수많은 파트너들과
00:26:12보이지 않는 곳에서 협력하여
00:26:15이 지역 주택들의 현관 앞까지
00:26:17소화물을 배송해 오고 있습니다.
00:26:19동일한 설정이 물류창고 등 여러 환경에서도 동일하게 작동합니다.
00:26:23이제 발표를 마무리하며 요약해 보자면,
00:26:26앞서 이것이 '범용 로봇 뇌(Omnibodied Brain)'라고 말씀드렸습니다.
00:26:29데이터 플라이휠을 구축하기 위해 범용 로봇 뇌가
00:26:31왜 그토록 필수적인지 잘 이해하셨으리라 생각합니다.
00:26:34하지만 또 하나의 장점이 있습니다.
00:26:35바로 로봇이 시간에 지남에 따라 고장 나거나
00:26:38안전 상황에 직면할 때 발휘되는 장점입니다.
00:26:41안전성은 범용 로봇 뇌가 가져다주는 부산물입니다.
00:26:44왜냐하면 만약--
00:26:45빠르게 넘어가도록 하겠습니다.
00:26:47온라인에서도 확인하실 수 있습니다.
00:26:48이 영상들은 모두 온라인에 공개되어 있습니다.
00:26:49하지만 우리는 동일한 뇌를 각각의 시스템,
00:26:52각각의 로봇에 탑재할 수 있습니다.
00:26:55심지어 이 경우에는 해당 로봇들로 학습조차 진행하지 않았습니다.
00:26:58이 모든 휴머노이드와 여러 로봇 형태에 적용된
00:27:00이 모든 휴머노이드와 장치들로 확장되는 것이죠.
00:27:02심지어 로봇이 고장 나거나, 여기서처럼 다리가 부러져도
00:27:05몇 밀리초 만에 회복할 수 있습니다.
00:27:07다리 하나가 부러지면, 기존의 삼족 로봇은
00:27:10새로운 로봇이 되기 때문입니다.
00:27:12따라서 로봇의 형태가 어떤지는 중요하지 않습니다.
00:27:14뭐든 변하면 회복하죠. 여기선 로봇 다리를 비활성화했는데요.
00:27:17단 세 번의 시도 만에 두 다리로 걷는 법을 습득합니다.
00:27:21지금 화면에서 보고 계신 것은 이 시스템들 내부에서
00:27:24진행 중인 로봇의 전체 학습 과정입니다.
00:27:27몇 밀리초에서 30초 안에 적응을 완료하죠.
00:27:32한 예로, 여기 바퀴로 굴러가는 로봇이 있습니다.
00:27:34바퀴를 가로막으면,
00:27:36걸어가기 시작합니다.
00:27:37이것이 옴니보디드 브레인의 또 다른 부산물입니다.
00:27:40이러한 모델에서는 안전의 의미가 완전히 달라집니다.
00:27:45로봇이 날아다닐 때...
00:27:46아 죄송합니다, 로봇이 몸의 절반만으로도
00:27:49걸어 다니거나 작동할 수 있으니까요.
00:27:50잔인한 장면 일부는 영상에서 뺐지만,
00:27:52저희는 로봇을 반으로 잘라보기도 했습니다.
00:27:54잘린 두 반쪽이 각각 여전히 정상 작동하더군요.
00:27:57그 영상은 유튜브에서 확인하실 수 있습니다.
00:27:59제가 준비한 발표는 여기까지입니다.
00:28:00감사합니다.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video