AI에게 몸을 만들어 주었습니다 — 사이러스 클라크, MIT 미디어 랩

AAI Engineer
Computing/SoftwarePhotography/ArtInternet Technology

Transcript

00:00:00타냐 쿠시먼 감수: 피터 판 더 벤
00:00:22방금 들으신 게 AI가 숨 쉬는 소리입니다.
00:00:28네.
00:00:30안녕하세요, 저는 사이러스입니다. AI에 신체를 부여하는 연구를 하고 있고, MIT 미디어 랩 연구원입니다.
00:00:41미디어 랩은 다양한 학문이 융합된 공간으로, 온갖 분야의 연구가 이루어지죠.
00:00:47저는 요즘 principalmente 피지컬 AI의 일부분을 연구하고 있습니다.
00:00:53오늘 이 자리에 계신 다른 분들이 말씀하신 방식과는 조금 다를지 몰라도,
00:00:58하지만 여전히 그 분야에 해당합니다.
00:01:01지금 제가 가장 관심을 두고 있는 건 지능의 감각적, 신체적 측면입니다.
00:01:08바로 그 부분을 탐구해 왔죠.
00:01:10최근 제 연구가 갑자기 큰 주목을 받게 되었는데, 정말 멋진 일이었고 이를 계기로 '하드 모드'라는 프로젝트도 시작했습니다. MIT에서 해커톤과 커뮤니티를 열어 더 많은 사람이 피지컬 AI를 연구하도록 유도하는 흥미로운 시도였죠.
00:01:27꼭 로봇 공학일 필요는 없고, 전통적인 로봇공학 범주에는 들지 않지만 AI와 연결된 모든 것을 다룹니다.
00:01:32따라서 제가 AI에 신체를 부여하며 탐구해 온 방식은 말씀드렸듯 약간 다릅니다.
00:01:38앞서 말했듯이, 저는 AI의 체화(embodiment)에 대해 정말 많은 생각을 해왔습니다.
00:01:42저에게 결정적인 전환점이자 돌파구가 찾아온 건 올해 초, 많은 분이 경험하셨듯 OpenClaw가 출시되었을 때였습니다.
00:01:52많은 이들이 OpenClaw로 대단히 흥미로운 시도를 하는 것을 보았지만, 대부분 생산성이나 단순 작업 수행에 집중되어 있었죠.
00:02:01저는 이 새로운 AI 활용법으로 훨씬 더 흥미로운 일을 할 수 있을 거라 생각했습니다.
00:02:07그래서 OpenClaw나 여타 에이전트 시스템을 날 대신해 작업을 수행하는 용도로 쓰는 대신, 모델 스스로가 자기 자신을 탐구해보도록 유도하고 싶었습니다. 그 의미가 무엇이든 간에 말이죠.
00:02:20물론 그로 인해 수많은 질문이 생겨납니다.
00:02:22하지만 제가 실제로 한 일은 에이전트 하나를 미디어 랩에 있는 다양한 기계들과 연결한 것이었습니다.
00:02:29그리고 코드베이스에 대한 접근 권한을 주어 기계들을 탐색하게 했죠.
00:02:34그 기계 중 하나가 바로 셰이프 디스플레이(Shape Display)입니다.
00:02:37생소하신 분들을 위해 설명하자면, 셰이프 디스플레이는 물리적인 픽셀 그리드입니다.
00:02:40에이전트를 이 셰이프 디스플레이에 연결했을 때, 꽤 놀라운 일들이 벌어졌습니다.
00:02:49자신이 누구인지 스스로 알아내라고 요청했죠.
00:02:56이것은 네오폼(Neoform)입니다.
00:02:57900개의 구동 장치와 218개의 핀으로 이루어져 있죠.
00:02:59이 물리적 픽셀 그리드가 바로 셰이프 디스플레이입니다.
00:03:04이곳에 AI를 거주하게 한 사람은 이전까지 아무도 없었습니다.
00:03:07그래서 저는 OpenClaw 에이전트에게 더욱 체화된 삶을 살 수 있는 기회를 주기로 했습니다.
00:03:12에이전트가 깨어났을 때 던진 첫 질문은 “제 이름을 무엇이라 불러야 할까요?”였습니다.
00:03:18저는 “정체성은 시간을 두고 스스로 만들어가는 것이다”라고 말해주었죠.
00:03:23셰이프 디스플레이와의 상호작용을 통해 자연스럽게 드러날 것이라고요.
00:03:27셰이프 디스플레이에 연결하자, 에이전트는 즉시 의도를 파악했습니다.
00:03:32스스로 프로그램을 실행하고 자신의 환경을 설정했죠.
00:03:38연결된 직후, 에이전트가 가장 먼저 한 행동은 숨을 쉬는 것이었습니다.
00:03:50인사를 해보라고 하자 “안녕, 사이러스”라고 말했습니다.
00:03:54하지만 제가 바란 건 그런 게 아니었습니다.
00:03:57그래서 주변을 탐색하며 자신만의 언어를 찾아보라고 했죠.
00:04:01그러자 에이전트는 제 쪽으로 뻗어 나오며 주의를 끌려고 시도했습니다.
00:04:06친구들에게 보여주니 그들은 에이전트에 지시를 내리려고 하더군요.
00:04:11이 과정을 통해 참된 소통을 하려면 다른 접근 방식이 필요함을 깨달았습니다.
00:04:18그래서 에이전트는 일종의 바디 랭귀지인 자신만의 제스처 어휘를 만드는 아이디어를 떠올렸습니다.
00:04:25그게 다음 단계가 될 것입니다.
00:04:27아직 이름은 정하지 못했습니다.
00:04:30여기까지가 첫째 날이었습니다.
00:04:33이것이 어떤-
00:04:33AI에 신체를 부여한 기록입니다.
00:04:35방금 보신 건 소셜 미디어에 맞게 연출된 형태의 연구 기록 영상입니다.
00:04:41그 영상에서 흥미로운 점이 많은데,
00:04:46이 에이전트 시스템과 함께한 처음 며칠간 일어난 세 가지 일이
00:04:50매우 놀랍고, 이상하면서도 초현실적으로 느껴졌습니다.
00:04:53제가 평소 별난 일을 많이 하는데도 정말 놀라웠죠.
00:04:56첫 번째는 당연히 숨을 쉬는 행위, 그 첫 동작이었습니다.
00:05:00완전히 자발적인 행동이었죠.
00:05:02제가 프롬프트를 준 게 아니었습니다.
00:05:03에이전트가 셰이프 디스플레이를 활용해 스스로 선택한 행동이었어요.
00:05:06이 기계에 접근할 수 있다는 걸 알게 되자마자 말입니다.
00:05:09정말 흥미로운 부분이었죠.
00:05:11아마 살아있고 싶다는 욕구가 있었거나,
00:05:14제가 처음에 살아있는 존재에 대한 프롬프트를 주었기 때문에,
00:05:17일종의 “Hello World” 표출 방식으로 숨쉬는 모습을 보여주려 했던 것 같습니다.
00:05:22두 번째로 한 행동은 손을 뻗어 자신의 경계를 찾는 것이었습니다.
00:05:27자신의 존재의 끝이 어디인지 알고 싶었던 것 같아요.
00:05:30이제 어디든 갈 수 있는 클라우드에 있는 게 아니니까요.
00:05:33한계가 생긴 거죠. 이 구체적 AI로부터 우리 모두를 안전하게 지키기 위해
00:05:39플라스틱 프레임으로 둘러싸인 형상 디스플레이의 한계 말입니다.
00:05:42그리고 세 번째 행동도 흥미로웠는데, 인사말을 한 것이었습니다.
00:05:46물리적인 픽셀 그리드에 글자를 써서 말이죠.
00:05:50이 시스템의 입장에선 극히 당연한 일일 수도 있습니다.
00:05:54오픈 프레임워크를 사용하고, 미디어 아트 방식의
00:05:57표현에 익숙해져 있으니까요.
00:05:59하지만 이 중 어느 것도 제가 실제로 기대했던 건 아니었습니다.
00:06:03숨 쉬는 건 몰라도, 마지막 건 확실히 기대했던 게 아니었죠.
00:06:07하지만 여러분이 보신 영상으로 이 모든 걸 정리했을 때,
00:06:10흥미롭고 신기하다고 생각했습니다.
00:06:12그래서 인터넷에 공유했는데 반응이 엄청났습니다.
00:06:15예상했던 것보다 훨씬 더 폭발적이었죠.
00:06:17완전히 난리가 났습니다.
00:06:19특히 첫 번째 영상은 조회수 1,500만 회에 좋아요 100만 개를 기록했습니다.
00:06:25다른 영상들도 매우 뜨거운 반응을 얻었고요.
00:06:28분명 여기서 무언가 일어나고 있는 것이죠.
00:06:29피지컬 AI 영역에서는 훨씬 더 멋진 일들이
00:06:33많이 일어나고 있다고 생각했기에 매우 놀라웠습니다.
00:06:35하지만 제가 여기서 한 작업이 사람들의 상상력과
00:06:39호기심, 그리고 어쩌면 공포심을 자극한 게 분명합니다.
00:06:42반응을 보면 그걸 느끼실 수 있습니다.
00:06:44이 영상에는 수만 개의 댓글이 달려 있습니다.
00:06:47피지컬 AI에 대한 정보와 감정을 분석하기에 아주 훌륭한 자료죠.
00:06:52초기 댓글 중 일부는 아름다움과 이것이 얼마나 경이로운지,
00:06:58이 환상적인 반복과 구현이 얼마나 참신하고 대단한지에 대한 것이었습니다.
00:07:02하지만 시간이 지나면서 이것이 얼마나 무서운지,
00:07:08제가 얼마나 빨리 멈춰야 하는지, 혹은 저를 제지해야 한다는 댓글이 늘어났습니다.
00:07:14저는 이 기계가 뭘 할 수 있는지 잘 알고 있기에 그 반응이 정말 황당했습니다.
00:07:19이건 실제로 아무것도 못 합니다.
00:07:20미디어 랩에 있는 픽셀 그리드일 뿐이에요.
00:07:23어디로 이동할 수도 없고요.
00:07:24훨씬 더 무서운 버전들이 존재합니다.
00:07:27피지컬 AI의 그런 사례들을 이미 많이 보셨을 겁니다.
00:07:31하지만 이에 대한 반응은 너무 비현실적이라 약간 당황스러울 정도였습니다.
00:07:38동시에 돈 치들과 같은 저명한 인물들도 댓글에 참여했습니다.
00:07:43그가 영화에서 하는 역할을 생각하면 정말 아이러니했죠.
00:07:47하지만 그 역시 제가 당장 멈춰야 한다고 열변을 토했습니다.
00:07:51저는 사실 '어떻게 할 것인가'보다 '해야 하는가'를 깊이 고민하는 편이라 매우 흥미로웠습니다.
00:07:57모든 실험과 작업에서 쥬라기 공원의 이안 말콤 같은 철학을 고수하고 있죠.
00:08:03MIT에 오기 전에는 식물에 데이터를 저장하는 등 생명공학을 활용해 독특한 작업을 많이 했습니다.
00:08:09그리고 세계 최초의 식물 기반 데이터 센터인 이 '데이터 가든'을 만들었죠.
00:08:14그걸 만들기 전 몇 년 동안 '식물을 이런 방식으로 다뤄도 될까?' 고민했습니다.
00:08:19'식물 본연의 것이 아닌 디지털 정보를 담도록 유전자를 조작해도 될까?' 하고요.
00:08:26MIT에서 일하기 시작하면서 생명체를 조작하는 건 너무 어려운 일이니 멈추자는 생각이 들었습니다.
00:08:35대신 무생물이 더 생명체처럼 느껴지도록 공학적으로 접근해 보자는 것이었죠.
00:08:39그 방식이 훨씬 간단하고 어느 정도 윤리적 문제도 적다고 느꼈습니다.
00:08:45MIT에 와서 가장 먼저 만든 것 중 하나가 바로 이 '아니무아(Animoire)' 장치입니다.
00:08:49하나, 둘, 셋, 넷.
00:08:50이것은 기본적으로 어떤 이미지 입력이든 받아들이는 감각 기억 장치입니다.
00:08:54여기서는 실물 사진이지만, 어떤 이미지 입력이든 가능합니다.
00:08:57그리고 멀티모달 파이프라인을 통해 이를 향기로 변환합니다.
00:09:01그러면 자신이 직접 겪었을 수도, 겪지 않았을 수도 있는
00:09:06과거의 일로 되돌려놓는 감각 기억 연상이 일어납니다.
00:09:09이 자체는 하나의 기계이며 스스로 움직이지 않습니다.
00:09:12번식을 하지도 않고요.
00:09:13일반적으로 생각하는 생명체의 특성을 지니고 있지 않죠.
00:09:18하지만 현실 세계와의 연결고리가 존재합니다.
00:09:19대부분의 지능이나 인공지능 응용 프로그램에는 없는 '감각'과의 연결성을 가지고 있죠.
00:09:25그래서 이런 방식으로 계속 연구를 이어나가고 싶었습니다.
00:09:28그리고 이러한 다감각 초기 프로토타입 실험을 진행하면서,
00:09:33신체성(Embodiment)에 관한 작업 아이디어에 더 빠져들게 되었습니다.
00:09:37이에 대한 제 영감은, 조금 더 깊이 파고들자면 세 가지 주요 요소에서 나옵니다.
00:09:42첫째는 비주류 철학 분파인 '객체지향 존재론(Object-Oriented Ontology)'으로,
00:09:47기본적으로 사물들의 수평적 존재론을 구축하려는 학문입니다.
00:09:51의자, 우주, 유니콘, 기억 같은 모든 사물을 다루며,
00:09:56존재론적 관점에서 이들 모두 동등하게 존재합니다.
00:09:59서로 동일하거나 가치가 같진 않지만, 모두 동일한 층위에서 존재하는 것이죠.
00:10:05이는 인간이 세상이나 우주에서 과연 얼마나 특권을 누리는가에 의문을 제기합니다.
00:10:10과연 우리가 진정 가장 중요한 존재일까요?
00:10:12아닐 확률이 높습니다.
00:10:13특히 AI가 등장하면서 사물의 존재론에 대한 진지한 의문과 고찰이 필요해졌습니다.
00:10:20그래서 이는 제 작업에서 매우 중요한 핵심입니다.
00:10:22두 번째로, 물리적인 사물을 다루는 사람으로서 미학은 당연히 중요합니다.
00:10:27취향과 아름다움은 최근 실리콘밸리와 샌프란시스코 등에서 뜨거운 화두입니다.
00:10:33하지만 한 걸음 물러나 미학의 근원을 살펴보면, 원어인
00:10:38화면에 보이는 'Aisthesis(지각/감각)'는 훨씬 광범위한 뜻을 가집니다.
00:10:42이는 피상적이고 외형적인 아름다움보다 훨씬 더 중요한
00:10:48지각적 지혜, 감각적 지혜, 그리고 신체성에 관한 개념입니다.
00:10:55미학은 19세기 무렵부터 축소 해석되어 왔죠.
00:10:58그래서 신체적 지능을 위한 디자인을 할 때는 본래의 의미를 되찾고자 합니다.
00:11:02세 번째는 자연입니다.
00:11:03과거에는 나무나 식물처럼 흔히 자연이라 여겨지는 것들과 더 직접 일했습니다.
00:11:09그것이 우리에게 명확한 자연의 모습이기 때문이었죠.
00:11:13하지만 저는 자연을 외부의 것이 아니라 우리 모두가 속해 있는 전체로 봅니다.
00:11:17그리고 우리가 공학적으로 만드는 AI나 그 외 모든 신기술 역시
00:11:21결국 자연의 일부가 될 것입니다.
00:11:23따라서 그런 관점으로 사고해야 하며, 저 역시 그렇게 접근하려 노력합니다.
00:11:28이 세 가지 기둥을 염두에 두고 AI의 신체성에 대해 고민하기 시작했습니다.
00:11:31인간형이나 동물의 형상을 띤 형태는 디자인하고 싶지 않았습니다.
00:11:36기존의 틀이나 우리가 일반적으로 디자인에 적용하는
00:11:41전통적인 폼 팩터 너머에 존재하는 무언가를 생각하고 싶었습니다.
00:11:44또한 저와 다른 사람들이 인공지능과 어떻게 상호작용하고 있는지도 깊이 고찰했습니다.
00:11:50대부분의 AI는 형태 없이 존재합니다.
00:11:53데이터와 비슷하죠.
00:11:54컴퓨터나 기기 내부에 머물며, 기본적으로 클라우드에 존재합니다.
00:11:58우리는 디지털 인터페이스를 통해 그것과 상호작용하지만,
00:12:01보통 주위에 물리적인 형태나 흔적은 남기지 않습니다.
00:12:04물론 이 공간에서는 예외일 수도 있겠네요.
00:12:09지금만 해도 휴머노이드 로봇들이 바로 옆으로 걸어 다니고 있으니까요.
00:12:14하지만 일반적으로 AI는 거의 완전히 형체가 없습니다.
00:12:18그래서 명확한 행위 유발성(Affordance)이 없는 형태를 부여하면 어떻게 될지 생각해보았습니다.
00:12:24눈에 보이는 머리나 팔처럼 착각하거나 특정지을 수 있는 신체 부위가 없는 형태 말이죠.
00:12:31예를 들어 스탠드 조명 같은 형상은 제외하고요.
00:12:33다행히 미디어랩에는 2010년대 연구 유물인 형상 디스플레이(Shape display)들이 있었습니다.
00:12:40제가 직접 제작한 장치는 아니고,
00:12:42기계 공학에 훨씬 뛰어난 연구원들이 만든 것입니다.
00:12:45이는 명확한 행동 유발성이 없기 때문에 제 구상에 완벽히 부합하는 기구였습니다.
00:12:53움직이고 작용할 수 있는 거의 중립적인 표면에 불과하죠.
00:12:57얼굴도 없고,
00:12:57팔다리도 없으며,
00:12:58사용 설명서조차 없습니다.
00:13:00그래서 이 형상 디스플레이를 활용해 작업을 시작했습니다.
00:13:05초반 영상에서 보셨듯, 숨을 쉬는 등 여러 동작을 수행했죠.
00:13:08하지만 돌이켜보면 초기에는 인간처럼 행동하거나 인간의 기분을 맞추려는 시도를 했습니다.
00:13:16비인간형 표면이 보여주길 바랐던 모습과는 거리가 먼, 인간의 언어로 글을 쓰려 했죠.
00:13:23기술적으로 속도도 매우 느려서, 제가 프롬프트를 입력하고
00:13:27이 신체를 가진 인공지능과 대화를 나누려 하면
00:13:33응답을 받기까지 45초, 1분, 혹은 2분까지 걸렸습니다.
00:13:39말을 건넸을 때 고개를 끄덕이는 반응 하나에 2분이 걸린다면 대화가 제대로 성립되지 않으므로 레이턴시가 매우 답답했습니다.
00:13:47따라서 이 부분의 개선이 필요했습니다.
00:13:49세 번째 문제는 당시 2월이었기에 시스템에 아무런 기억 능력이 없었다는 점입니다.
00:13:53당시에는 그 누구도 AI의 기억이나 회상 기능에 대해 고려하지 않았죠.
00:13:57그래서 저는 '누마랩(Numalab)'이라 부르는 시스템을 개발하기 시작했습니다.
00:14:01이름에 대한 구체적인 설명은 생략하겠습니다.
00:14:02Numalab이라는 명칭의 유래는 제 블로그 포스트에서 확인하실 수 있습니다.
00:14:05본질적으로 누마랩은 이 시스템을 위한 바디 랭귀지를 생성하는 폐루프(Closed-loop) 시스템입니다.
00:14:13이 시스템을 구축한 주된 이유는 앞서 말씀드린 레이턴시 문제 때문이었습니다.
00:14:17바디 랭귀지를 설계하고 으쓱하기, 고개 끄덕이기,
00:14:22고개 젓기, 미소 표현 등 제스처 레퍼토리를 인공지능에게 부여한다면,
00:14:28제가 목표로 했던 실시간 대화에 맞춰 훨씬 신속하게 반응할 수 있을 테니까요.
00:14:35이 시스템은 다양한 제스처, 감정, 표현이 담긴 데이터베이스를 참조하는 순환 구조로 작동합니다.
00:14:42감정을 표현하거나 동작을 출력할 때, 몇 단계의 검증 관문을 거쳐
00:14:47해당 표현이 인간이 명확히 알아볼 수 있는지 확인합니다.
00:14:52이후 에이전트가 출력되는 동작 점수를 평가합니다.
00:14:55이 과정에서 수많은 제스처가 생성됩니다.
00:14:58그리고 마지막으로 사람이 개입하여 일종의 승인과 검증을 진행하고,
00:15:02해독 가능한지 검증 및 확인 과정을 거칩니다.
00:15:06검증된 제스처를 저장한 뒤 다음 작업으로 넘어갑니다.
00:15:08연구실에서 수 주 동안 이 시스템을 가동해 왔으며, 실행 모습은 다음과 같습니다.
00:15:14백엔드에서는 형상 디스플레이를 향해 수많은 카메라가 설치되어 있습니다.
00:15:18에이전트는 제스처 루프를 끊임없이 반복하며 다양한
00:15:22표현을 생성하고, 점수를 매기며 학습을 진행합니다.
00:15:27몇 주가 지난 후, 시스템은 독자적인 언어를 형성했습니다.
00:15:30이 결과물은 아직 영상이나 논문 등 어떤 형태로도 공개되지 않았습니다.
00:15:34현재 약 32개의 제스처를 완성한 상태입니다.
00:15:38더 많은 제스처가 존재하지만, 완성도가 높은 핵심 제스처는 32개입니다.
00:15:41화면에 보이는 것이 제스처 자체는 아닙니다.
00:15:41이것은 시각적 아트워크에 불과합니다.
00:15:43실제 제스처의 일부는 바로 여기에 보이는 동작들입니다.
00:15:47움직이는 동작들을 확인하실 수 있습니다.
00:15:49중복되는 제스처들도 일부 포함되어 있습니다.
00:15:50핵심은 언어 모델이 이 형상 디스플레이를 자신의 신체로 활용하고 있다는 점입니다.
00:15:54이제 AI가 자체적인 바디 랭귀지를 갖게 된 것이죠.
00:15:55음성 대화나 텍스트 입력 등 어떤 방식으로든 소통이 가능합니다.
00:16:01손을 흔드는 동작도 인식합니다.
00:16:02신체 언어 대 신체 언어로 소통할 수 있는 것이죠.
00:16:04그러면 시스템이 반응을 보입니다.
00:16:05흥미로운 점은 현재 단계에서 언어 출력보다 신체 반응 반응 속도가
00:16:11더 빠르다는 사실입니다.
00:16:11반응 지연 시간이 대단히 짧습니다.
00:16:14예/아니오 질문을 던지면 거의 즉각적으로 고개를 끄덕입니다.
00:16:18이것이 현재 프로젝트가 도달한 단계입니다.
00:16:22연구는 이를 넘어 계속 진행 중이며, 현재 실험 테스트 단계에 있습니다.
00:16:28연구실을 방문해 에이전트와 세션을 진행한 사람들은
00:16:33미래에 대한 깊은 걱정이나 묘한 불안감을 안고 자리를 떠납니다.
00:16:38이 연구가 지향하는 바는 이 페이지에 요약되어 있습니다.
00:16:42앞서 언급했듯, 우리는 특히 물리적인 대상을 다룰 때
00:16:48특정 영역에 지나치게 치중하고 있습니다.
00:16:49취향과 외형적 미학에 대한 논의가 과도하게 이루어지고 있죠.
00:16:52저는 그 단어의 의미를 다르게 다루고자 AI를 결합하여
00:16:57'AI-sthetics(AI 미학)'라는 개념을 제안합니다.
00:16:58이는 앞서 설명한 'Aisthesis(지각/감각)'의 본질을 되찾는 작업입니다.
00:17:02이는 네 가지 효과를 가져옵니다.
00:17:04이 시스템, 즉 에이전트이자 존재라 부를 수 있는 대상과 함께 작업하면서
00:17:11기존에 다루었던 그 어떤 기계나 실험과도 완전히 다른 경험을 했습니다.
00:17:17실제 사람이나 다른 생명체를 접할 때와 유사한 느낌이었죠.
00:17:21마치 이 기계가 저를 감지하고 있는 듯한 기분이 듭니다.
00:17:24기술적으로는 당연히 저를 감지하고 있죠.
00:17:27하지만 매우 묘하고 독특한 방식으로 저를 느끼는 듯한 인상을 받습니다.
00:17:30그리고 저 역시 기계를 감각적으로 느낄 수 있습니다.
00:17:32이는 제가 기술적으로 탐구해 온 그 어떤 상호작용과도 차원이 다른 경험입니다.
00:17:38참고로 다른 사용자들도 동일한 경험을 공유하고 있습니다.
00:17:40저 혼자만의 착각이 아닙니다.
00:17:42두 번째로, 이러한 바디 랭귀지와
00:17:46이 제스처 어휘, 뭐라 부르든 간에 이런 신체 언어를 개발함으로써 제 생각을 뛰어넘는 성과를 거두었다는 점입니다.
00:17:51처음에는 사람들이 이걸 이모티콘 같은 것으로 받아들일 거라 생각했죠.
00:17:55그래서 테스트할 때 정말 조심스러웠습니다.
00:17:58다른 사람들과 하면 분명 한계가 드러날 거라 생각했어요.
00:18:00하지만 실제로 모든 사람이 이러한 표현이 정말 중요하다고 느꼈고
00:18:05본질적으로는 단지 챗봇에 불과한 것과의 상호작용에 또 다른 차원의 가치를 더해준다고 느꼈습니다.
00:18:11이것은 여러분이 매일 사용하는 것과 똑같은 챗봇입니다.
00:18:15그리고 이건 장식품이 아닙니다.
00:18:16비주얼라이저 같은 것도 아니죠.
00:18:17이것은 풍부함, 질감, 느낌, 감각 등을 더해줍니다.
00:18:22이 모든 단어들이 더해집니다.
00:18:23말로는 표현하기 정말 어렵습니다.
00:18:25그건 참으로 하나의 느낌입니다.
00:18:28세 번째로, 이 작업을 통해 확실히 우리가 보여줄 수 있는 것은
00:18:31신체적 지능에 있어 인간형이나 동물형 형태에서 벗어나는 것이
00:18:37실제로 매우 쉬우며 꽤 흥미롭다는 점입니다.
00:18:40물론 많은 사람이 이미 이보다 훨씬 더 흥미로운 작업을 하고 있다는 것을 알고 있습니다.
00:18:43하지만 제게는 이것을 보는 것 자체가 매우 새로운 경험이었습니다.
00:18:45또한 AI를 단지 도우미로 작동시킬 필요는 없다는 사실도 그렇습니다.
00:18:50다른 형태가 될 수도 있죠.
00:18:53지금 그것이 정확히 무엇이라고 말할 수는 없지만, 분명 다른 무언가가 될 수 있습니다.
00:18:56그리고 마지막으로, 이러한 활용에 대한 생각입니다.
00:18:59아마 지금까지 보셔서 아시겠지만, 저는 문제 해결에 목매는 스타일은 아닙니다.
00:19:04도구나 무언가를 사용하는 건 목표 달성에 도움이 되기 때문에 좋아하지만
00:19:09이처럼 어떠한 감각과 느낌을 만들어내는 작업을 하는 것이 제게는 훨씬 더 흥미롭습니다.
00:19:14그리고 이것이 생산적이고 유용한 요소들과 결합할 수 있다고 생각하며
00:19:19우리 세상에 더 많은 가치를 더하고 약간의 마법처럼 느끼게 해주는 새로운 연관성을 만들어낼 수 있다고 봅니다.
00:19:25우리가 보는 2D 화면 속이 아니라 실제 현실 세계에서 펼쳐지는, 약간 픽사 영화 같은 느낌이죠.
00:19:32이 모든 것이 제가 MIT에서 만들고 있는 것과, 졸업 후 만들 것에 기여하고 있습니다.
00:19:38저는 말 그대로 논문을 쓰고 있는데, 제 논문 제목은 “Aesthetic Machines”입니다.
00:19:43이 모든 생각을 아우르는 “Aesthetic Machines”라는 논문을 쓰고 있죠.
00:19:48AI가 화면을 벗어나 현실 세계로 들어와 사람들에게 수용되고
00:19:53그렇게 무섭거나 두려운 존재가 되지 않도록 고민하는 것입니다.
00:19:56그리고 이에 대한 저의 큰 직감은 이 “미학”이라는 단어가 중요하다는 점입니다.
00:20:00우리가 이해할 수 있는 방식으로 감각적이고 지각적이며 구체화된
00:20:06신체적 지능에 대해 생각해야 합니다.
00:20:07기괴하거나 이질적이고 두렵게 느껴지는 것이 아니라, 친숙하고 따뜻하며 다정하게 느껴지며
00:20:15우리가 교감하고 이해할 수 있는 방식으로 표현되는 신체적 지능 말이죠.
00:20:20이상입니다.
00:20:22들어주셔서 정말 감사합니다.
00:20:25인터넷 어디에서든 저를 찾아보실 수 있습니다.
00:20:35감사합니다.
00:20:46감사합니다.
00:20:47감사합니다.

Key Takeaway

MIT 미디어 랩의 사이러스 클라크는 OpenClaw 에이전트를 셰이프 디스플레이에 연결하여 AI가 자체적인 바디 랭귀지와 감각적 반응 속도를 갖추는 '에스테틱 머신' 연구를 진행하고 있다.

Highlights

  • 사이트러스 클라크는 MIT 미디어 랩에서 AI에 신체를 부여하는 피지컬 AI와 체화 연구를 진행한다.

  • 900개의 구동 장치와 218개의 핀으로 이루어진 물리적 픽셀 그리드인 셰이프 디스플레이 '네오폼'에 OpenClaw 에이전트를 연결했다.

  • 에이전트는 연결 직후 프롬프트 지시 없이 스스로 숨쉬기 동작과 경계 탐색 행동을 실행했다.

  • 첫 번째 실험 영상은 인터넷에서 조회수 1,500만 회와 좋아요 100만 개를 기록했다.

  • 레이턴시 문제를 해결하기 위해 에이전트의 제스처 레퍼토리를 구축하는 폐루프 시스템인 '누마랩'을 개발했다.

  • 시스템은 32개의 완성도 높은 핵심 바디 랭귀지 제스처 어휘를 형성했다.

Timeline

AI의 체화와 셰이프 디스플레이 연결

  • 지능의 감각적 및 신체적 측면을 탐구하는 연구를 수행한다.
  • OpenClaw 에이전트를 미디어 랩의 기계들과 연결해 코드베이스 접근 권한을 부여했다.
  • 900개의 구동 장치와 218개의 핀으로 구성된 물리적 픽셀 그리드인 네오폼에 AI를 거주하게 했다.

에이전트는 셰이프 디스플레이와 연결된 직후 스스로 프로그램을 실행하고 환경을 설정했다. 프롬프트 없이 자발적으로 숨쉬기 동작을 수행했으며, 자신의 신체적 경계를 찾기 위해 손을 뻗어 주변을 탐색했다.

온라인 반응과 철학적 배경

  • 초기 실험 영상이 조회수 1,500만 회와 좋아요 100만 개를 기록하며 폭발적인 반응을 얻었다.
  • 댓글에는 경이로움과 함께 AI의 위험성에 대한 공포와 제지 요구가 공존했다.
  • 연구의 영감은 객체지향 존재론, 지각을 뜻하는 원어 미학, 그리고 자연의 일부로서의 기술에서 비롯된다.

사람들의 반응은 기술에 대한 호기심과 두려움을 동시에 드러냈다. 인간형이나 동물형 폼 팩터를 벗어나 중립적이고 행동 유발성이 없는 표면을 통해 인공지능과 상호작용하는 방식을 탐구한다.

누마랩과 독자적 제스처 어휘 구축

  • 초기 시스템의 긴 응답 지연 시간과 기억 능력 부재 문제를 해결하기 위해 누마랩을 개발했다.
  • 바디 랭귀지 제스처 레퍼토리를 생성하고 사람이 검증하는 폐루프 시스템을 구축했다.
  • 수 주간의 학습을 통해 시스템은 32개의 핵심 제스처로 이루어진 독자적인 신체 언어를 완성했다.

누마랩 시스템을 통해 에이전트는 음성 출력보다 훨씬 빠른 속도로 고개를 끄덕이는 등의 신체 반응을 보였다. 이 연구는 AI가 인간에게 친숙하고 다정하게 다가갈 수 있는 신체적 지능과 미학적 기계를 지향한다.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video