VLM/VLA에서 구체화된 인공지능(Embodied Agent)으로 — 아르멘 아가자니안, Perceptron AI

AAI Engineer
컴퓨터/소프트웨어

스크립트

00:00:00네, 그럼 시작해 보겠습니다. 저는 퍼셉트론(Perceptron)의 공동 창업자이자 CEO인 아르민입니다.
00:00:20저희가 하는 일에 대해 간단히 소개드리겠지만, 오늘 주로 말씀드리고 싶은 내용은
00:00:25VLM, VLA, 월드 모델 등 무엇이라 부르든 간에 이러한 구분을 탈피하고자 하는
00:00:32저희의 연구 방향, 즉 '임바디드 파운데이션 모델(Embodied Foundation Models)'에 관한 것입니다.
00:00:42퍼셉트론에서 저희가 수행하는 작업, 다시 말해 저희의 궁극적인 지향점은
00:00:48물리적 세계를 실시간으로 인지하고 이해하며 상호작용할 수 있는
00:00:53피지컬 AI 기반을 구축하는 것입니다. 따라서 저희의 궁극적 미션은 물리적 세계와
00:00:58디지털 세계를 연결하는 것입니다. 본질적으로 디바이스, 장비,
00:01:07로봇, 카메라, 센서가 있는 곳이라면 어디든 지능을 제공하는 것이 저희의 목표입니다.
00:01:14구체적으로 인지하고, 추론하고, 행동하는 이러한 패러다임을 논할 때,
00:01:19저희는 이를 기존 멀티모달 모델링의 통합으로 바라봅니다.
00:01:25저는 FAIR 출신으로, 그곳에서 6년간 재직하며 멀티모달 모델의
00:01:31스케일업 레시피를 밝혀내는 데 주력했습니다. 그 당시 초기에 시작했던 작업이자
00:01:37이 분야에서 수많은 논문을 발표한 분야가 바로 '얼리 융합(Early Fusion)'입니다. 가능한 한 초기에
00:01:41이 모든 모달리티를 통합한다는 개념이죠. 여기서 핵심적인 복잡성은
00:01:47입력과 출력 모두에서 표현하고자 하는 다양한 모달리티를
00:01:52어떻게 올바르게 전체론적으로 표현할 것인가를 알아내는 것입니다. 그리하여 VLM이 대표적인...
00:01:58제가 멀티모달 모델을 언급할 때 아마 가장 먼저 떠올리실 게 VLM일 텐데요. 이는
00:02:03이미지나 비디오, 텍스트를 입력받아 기본적으로 텍스트를 출력하는 능력입니다. 변형 모델들도 존재합니다.
00:02:09ER 모델, 즉 체화된 추론(Embodied Reasoning) 모델처럼 바운딩 포인트를 출력하거나
00:02:15공간 이해 및 추론을 조금 더 잘 수행할 수 있는 모델들도 있죠.
00:02:20다음으로는 단순히 텍스트에 머물던 출력 영역을 행동(Action)으로 확장한 VLA가 있습니다.
00:02:25이들은 전통적으로 표준 VLM 백본을 기반으로 계속 구축되어 왔지만,
00:02:30VLM에서 탈피하여
00:02:35월드 모델이나 월드 액션 모델 등으로 전환하려는 시도도 있었습니다. 아직 대단한 결실을 보진 못했지만요.
00:02:39그리고 더 흥미롭고 복잡한 변형 형태의 멀티모달 모델로 넘어가면,
00:02:46입력값으로부터 비디오를 출력하는 월드 모델이 있습니다. 입력값은 이미지나 비디오,
00:02:51혹은 이미지, 비디오, 행동의 조합이 될 수 있죠. 마지막으로 말씀드릴 부분은
00:02:57최근에 등장한 '시맨틱 월드 모델(Semantic World Models)'입니다. 아무것도 직접 출력하진 않지만,
00:03:02향후 유용하게 쓰일 일종의 표현 방식을 학습하는 모델이죠. 저희가 정의하는
00:03:08'임바디드 파운데이션 모델'은 표준적인 인지, 체화된 추론,
00:03:13그리고 궁극적 목표인 제어(Control)까지 모두 단일 모델 내에서 수행할 수 있게 하는 프레임워크입니다.
00:03:20입력 측면에서 다양한 감각 모달리티를 넘나들며 추론하고,
00:03:25출력 측면에서 앞서 언급한 대부분의 작업을 하나의 통합 모델 내에서 해내는 것이죠.
00:03:31이제 두 가지 과제에 대해 빠르게 말씀드리겠습니다. 이는 저희가 직면한
00:03:35근본적인 연구 과제들로, 저희 회사가 이에 어떻게 접근했는지,
00:03:40그리고 다른 연구자들은 이 분야에서 어떻게 대응하고 있는지 말씀드리겠습니다.
00:03:43첫째로, 순수하게 1시간 분량의 비디오 같은 데이터를
00:03:48모델링하려고 할 때를 생각해 봅시다. 표현 방식에 따라 다르겠지만
00:03:52약 100만 개의 시각적 토큰이 입력될 수 있습니다. 문제는 효율적으로 사용할 수 있는
00:03:57정답 데이터(Ground Truth)가 실제로는 존재하지 않는다는 점입니다. 자막 추출이나
00:04:02비디오에서의 자막 예측, 혹은 특정 프레임에 대한 합성 라벨링,
00:04:08질의응답 등을 수행할 수 있고 사람들도 실제로 그렇게 해왔지만, 이는 엄청난 낭비임이 밝혀졌습니다.
00:04:13모델에 들어가는 입력을 생각해 보면, 100만 개의 토큰이 들어가는데
00:04:16실제 손실(Loss)을 계산하는 대상은 전체 입력 토큰의
00:04:220.2% 정도에 불과합니다. 이는 근본적으로 매우 문제가 됩니다. 사실 이를 수정하려는
00:04:27어떤 방식을 쓰더라도 결국 잘못된 학습 신호를 주입하게 됩니다.
00:04:31신호가 너무 희소하거나, 지나치게 인위적이거나, 혹은 무분별하기 때문이죠. 그래서
00:04:37단순 합성 강화를 넘어서는 접근법으로 모든 픽셀을 예측하자는 방식이 등장했습니다. 물론
00:04:42매우 조밀한 신호이긴 하지만, 어텐션 배분 측면에서는 매우 비효율적입니다.
00:04:47배경 픽셀을 그리퍼의 끝부분이나 접촉점,
00:04:51특정 실패 지점, 물리적 현상과 동일한 중요도로 다루게 되니까요.
00:04:56따라서 퍼셉트론에서 저희가 취한 방식이자 핵심 지적재산(IP) 중 하나는
00:05:01자연스러운 인지 목표가 어떤 모습이어야 하는가 고민하는 것입니다. 즉, 향후 중요해질
00:05:06인지 요소(Percept)를 매우 자동화된 방식으로 예측하는 방법이죠. 예컨대
00:05:11로봇 암이 있다면, 그리퍼 끝부분이 미래 예측에 있어 매우 유용한 인지 요소가 될 수 있도록
00:05:16하드코딩할 수 있습니다. AI2의 MOMO Act 팀 등 다른 VLA 연구진에서도
00:05:20이러한 시도를 시작했습니다. 하지만 이는 여전히 하드코딩된 인지 요소입니다. 그렇다면 질문은
00:05:26모델이 의미론적으로 이 독특한 목표를 스스로 학습할 수 있는 자동화 방식을
00:05:30찾아낼 수 있느냐입니다. 그리고 저희는 실제로 그 방법을 찾아냈습니다. 구체적 방식은
00:05:37여기서 공개하지 않겠지만, 희소성 문제에 저희가 어떻게 접근하는지 힌트를 드리는 것입니다.
00:05:41저희가 많은 시간을 할애해 집중하는 두 번째 핵심 문제는 '컨텍스트 비대화(Context Bloat)'입니다.
00:05:49항상 켜져 있는 카메라나, 멈추거나 대기하지 않는 로봇이 있다면
00:05:54결국 엄청나게 긴 토큰에 대해 추론을 수행해야 합니다.
00:06:01텍스트는 상대적으로 조밀한 반면 비디오는 희소합니다. 따라서 인위적인 수준에서
00:06:08이 불균형을 해결하려 하기보다, 이 문제를 근본적으로 처리하기 위한
00:06:13아키텍처적 돌파구가 존재하는지가 핵심 질문이 됩니다.
00:06:20여기서 취할 수 있는 몇 가지 방법이 있습니다. 첫 번째 핵심 원칙은
00:06:25서로 다른 모달리티를 완전히 별개로 다루기 시작해야 한다는 점입니다. 텍스트 토큰을
00:06:31이미지, 오디오, 비디오 토큰과 동일하게 취급해서는 안 됩니다. 따라서 고려해 볼 수 있는 한 가지는
00:06:36공간 압축이나 토큰 압축에 집중하는 것입니다. 사람들은 단순한 방식을 쓰기도 하며,
00:06:41저희 역시 처음에는 그런 단순한 방식으로 시작했고 실제로 효과가 있었습니다. 비디오나
00:06:44이미지 전체의 패치 단위 표현을 평균화하는 방식을 고려해 볼 수 있죠.
00:06:51최대 10배까지 흥미로운 압축률을 얻을 수는 있지만, 이는 여전히 임시방편에 가깝고
00:06:57이를 실제로 해결할 검증된 아키텍처적 기법은 아닙니다. 이에 저희는
00:07:04지난 몇 달간 다양한 수준의 희소성을 다루기 위해 저희만의 접근법을 공개했습니다.
00:07:10그 핵심은 어떤 토큰을 주시하고 어떤 토큰을 지나칠지 모델이 직접 결정하게 하는 것입니다.
00:07:14그렇게 발표한 '데이터 희소 혼합 전문가(Data-Sparse MoE)' 논문이 바로 이 기능을 가능하게 합니다.
00:07:19모델 내 라우터가 어떤 토큰을 입력하고 어떤 토큰을 건너뛸지
00:07:24직접 예측하게 하며, 이를 모든 레이어에 걸쳐 연산 비용 없이
00:07:30수행할 수 있게 합니다. 과도한 아키텍처적 사전지식을 직접 부여하지 않고
00:07:36모델 스스로 학습하도록 내버려두면, 실제로 모델이 학습해낸다는 사실이 밝혀졌습니다.
00:07:43저희 모델이 사용하는 데이터 희소 연산을 시각화해 보면, 모델이 선천적으로
00:07:49정보 밀도가 매우 높거나 작업 연관성이 높은 정보에 집중하기 시작하는 것을 볼 수 있습니다.
00:07:56우측 상단을 보면 모델이 그래프 부분에 집중하기로 결정한 것을 볼 수 있는데,
00:08:00그림 내에서 가장 흥미로운 부분일 가능성이 높기에 사람 역시 그 부분에 주목하게 됩니다.
00:08:05또한 작업에 의존적인 자원 배분 역시 일어나는 것으로 나타났습니다.
00:08:13좌측 하단을 보면 매우 일반적인 질문을 던졌을 때
00:08:18이미지 전체에 어텐션 그래프가 퍼져 있는 것을 볼 수 있습니다. 연산을 배분할 적절한 방법을 찾지 못한 것이죠.
00:08:22반면에 모든 과일을 분할(Segment)하라는 식의 지시를 내리면,
00:08:27과일 토큰이라고 판단되는 대상에 더 많은 토큰을 배분하는 것을 확인할 수 있습니다.
00:08:31이는 매우 훌륭하고 영리한 기법으로, 각 모달리티의 희소성 불균형을 해결하는 데
00:08:36유용한 사전지식을 아키텍처에 내재화하면서도, 모델 본연의 학습 능력을 해치지 않는 수준을 유지합니다.
00:08:43저희 논문 발표 이후 다른 연구진도 이를 활용하기 시작했습니다.
00:08:49저희는 이 모든 요소를 종합하여, 소식을 접하셨을 수도 있겠지만
00:08:57몇 주 전 최초의 임바디드 파운데이션 모델이라 자부하는 모델을 공개했습니다.
00:09:03이 모델은 제미나이 3.1 프로(Gemini 3.1 Pro) 수준의 최고 성능을 자랑하며,
00:09:09Gemini Embodied Reasoning보다 우수한 성능을 보이면서도 비용은 약 15배 저렴합니다.
00:09:15기본적으로 모든 영역에 걸쳐 수집한 1페타바이트 규모의 데이터셋으로 학습되었죠.
00:09:20웹 크롤링부터 자체 맞춤형 중간 학습(Mid-training) 레시피, 합성 데이터 파이프라인에 이르기까지
00:09:28텍스트, 이미지, 비디오, 궤적(Trajectory) 데이터를 아우르는 1페타바이트의 데이터를 보유하고 있으며,
00:09:34이 궤적 데이터는 데스크톱 사용 궤적이든 비디오 게임 플레이 궤적이든 매우 광범위합니다.
00:09:41이러한 작업을 진행하자 매우 흥미로운 특성들이 발현되기 시작했습니다.
00:09:46지나고 보면 당연하지만 저희가 발견한 가장 큰 특성은
00:09:50고전적인 컴퓨터 비전(CV) 작업을 에이전트 작업으로 볼 수 있다는 점입니다.
00:09:57이 경우, 우리는 객체 감지를 에이전트 작업으로 재구성했습니다. 모델이 코드를 작성할 수도 있고,
00:10:02특정 영역을 확대하거나 대비를 조정해 달라고 요청할 수도 있죠. 보시다시피
00:10:09이건 아주 어려운 문제입니다. 레딧에는 이미지 속에서 찾아내기 힘든 물체를 찾는
00:10:14서브레딧 게시판이 따로 있을 정도죠. 저희 모델은 이런 작업을 아주 잘 해냅니다.
00:10:19하지만 이건 에이전트 방식의 처리입니다. “이 하나의 영역을 감지해” 같은 고전적인 방식이 아니라
00:10:24모델 스스로 이미지를 타일링해야 한다고 판단하고, 대비를 조정해야 한다고 결정하는 것이죠.
00:10:28여기 박스를 제안하고, 대비를 높여서 새를 찾아내는 모습을 볼 수 있습니다.
00:10:36다시 말씀드리지만, 시각 인지 능력이 뛰어난 사람에게조차 매우 어려운 작업입니다.
00:10:42이 모든 것은 다양한 모달리티를 이해하는
00:10:46네이티브 체화형(Embodied) 모델이 있기에 가능합니다.
00:10:51그그렇다면 이것이 로보틱스 기반의 일반적인 피지컬 AI 방향성과는 어떻게 연결될까요?
00:10:57이 슬라이드는 GDM 팀의 자료를 가져온 것인데요, 로보틱스 에이전트 시스템에서
00:11:04체화형 추론 모델(오케스트레이터)과 촉각 제어 정책 모델 간의 분리가 나타나기 시작했습니다.
00:11:11예를 들어, 커피를 내리는 데 3분이 걸리는 작업이 있다고 해봅시다.
00:11:17단일 VLA 모델에게 이 개별 작업을 전부 파악하도록 강제할 수도 있겠지만,
00:11:21오케스트레이터 모델을 두어 작업을 하위 작업으로 나누고, 그 위에서 실행되는 촉각 제어 정책을 이용할 수도 있습니다.
00:11:26완전한 VLA 단일 구성부터 이러한 에이전트 형태의 시스템까지 넓은 스펙트럼이 존재하죠.
00:11:31여기서 강조하고자 하는 핵심은 체화형 추론이 매우 흥미롭고 복잡하며,
00:11:36아직 해결해야 할 도전 과제라는 점입니다.
00:11:41그럼에도 불구하고 저희 모델은 체화형 추론 분야에서 최고의 성능을 유지하고 있습니다.
00:11:46최첨단 성능을 갖추었기에 이전에는 보지 못했던 놀라운 현상들이 관찰되기 시작했습니다.
00:11:501인칭 시점은 아니지만 매우 복잡한 로봇 데이터 주석 처리(Annotation)의
00:11:55구체적인 예시를 하나 보여드리겠습니다.
00:11:59영상 속에서 모델이 구간을 넘겨가며 영상의 여러 부분을 확인하고,
00:12:04자르고, 캡션이 정확한지 스스로 검증하는 모습을 볼 수 있습니다.
00:12:09저희 AR 모델의 처리 속도가 빠르기 때문에 가능한 일입니다.
00:12:15기존의 다른 어떠한 모델보다 훨씬 저렴합니다. 제미나이(Gemini)로 이 작업을 처리한다면
00:12:20영상당 몇 달러가 들겠지만, 저희 모델은 몇 센트 수준에 불과합니다.
00:12:24이 모든 성과는 기존 모델들에서는 볼 수 없었던 최고의 체화형 추론 역량 덕분입니다.
00:12:29이제 저희가 달성한 가장 중요한 연구 돌파구를 공유해 드리겠습니다.
00:12:37자세한 내용은 몇 주 내로 트위터 등을 통해 추가 발표할 예정입니다.
00:12:41저희는 체화형 파운데이션 모델을 위한 새로운 스케일링 법칙(Scaling Laws)을 발견했습니다.
00:12:48이 모델들은 제어 기반 학습, 궤적 학습, 인지 학습,
00:12:53그리고 체화형 추론 학습을 결합하여 수행할 수 있습니다.
00:12:59이 요소들을 조합하는 최적의 방법과 적절한 목적 함수를 알아낸다면
00:13:03이전에는 발견하지 못했던 매우 흥미로운 제어 요소를 활용할 수 있게 됩니다.
00:13:08구체적인 활용 사례로, 일반 비디오 사전 학습 데이터와
00:13:11원격 조작(Tele-op) 데이터를 맞교환(Trade-off)할 수 있는 기능을 말씀드리겠습니다.
00:13:19잘 아시다시피 원격 조작 데이터는 시간당 100달러 수준으로 매우 비쌉니다.
00:13:25100달러면 훨씬 더 많은 양의 비디오 사전 학습 데이터를 수집할 수 있죠.
00:13:32그래프가 보여주는 것은 순수 VLA 및 제어 정책만 학습시킬 때의 성능 범위입니다.
00:13:39스케일링 법칙이 여전히 적용되므로 원격 조작 데이터가 늘어날수록 이점이 있지만,
00:13:43통합된 체화형 파운데이션 모델을 학습시킬 때만큼 성능 향상이 크지는 않습니다.
00:13:48그래프 하단이 바로 그 차이를 보여줍니다.
00:13:55여기서 얻는 매우 멋진 이점은, 비디오 사전 학습 데이터가 10배 더 있다면
00:14:03원격 조작 데이터를 10분의 1로 줄여서 대체할 수 있다는 점입니다.
00:14:09현재 저희 회사의 연산 자원 규모 내에서는 이 법칙이 유효하게 성립하고 있으며,
00:14:16체화형 파운데이션 모델의 한계를 계속해서 확장해 나갈 계획입니다.
00:14:28몇 주 안에 소형 모델 중 하나를 오픈소스로 공개하길 기대하며,
00:14:33작업 파악을 위한 체화형 추론 능력을 갖춘 단일 모델 내부에서
00:14:38모든 프로세스가 네이티브로 실행되는 정책 영상 몇 개를 보여드리겠습니다.
00:14:43모델이 제어 토큰을 출력하고 있는데 약간 떨림이 있지만 스케일을 키우면 해결될 것입니다.
00:14:48기존의 순수 VLA 모델로는 처리하기 힘들었던 매우 복잡한 작업들을 확인할 수 있습니다.
00:14:54오른쪽 영상을 보시면 모델이 책 제목을 읽고 어떤 종류의 책인지 파악한 뒤,
00:14:58알맞은 수거함에 올바르게 분류해야 합니다. 이 작업은 인지와 제어가 결합된 다단계 작업으로,
00:15:04수행해야 할 시각 인지 과제를 제대로 인식하지 못하는
00:15:09순수 엔드투엔드 제어 모델로는 완수하기가 정말 극도로 어렵습니다.
00:15:23네, 아주 훌륭합니다. 사전에 학습되지 않은 제로샷(Zero-shot) 환경에서도 상당히 잘 작동하죠.
00:15:287월 중, 몇 주 안으로 여러분께 이 모델을 선보이게 되어 기대가 큽니다.
00:15:33질문받을 시간을 몇 분 남겨두겠습니다. 관심 있는 분들은 언제든 연락해 주세요.
00:15:41저희 회사는 제한된 일부 파트너를 대상으로 Mark 1 가중치(Weights) 접근 권한을 제공합니다.
00:15:47더 큰 규모의 체화형 파운데이션 모델 가중치에 접근하실 수 있으니 이메일이나 트위터 DM 중 편하신 쪽으로 연락 주세요.
00:15:58남은 몇 분 동안 질의응답 시간을 갖겠습니다.
00:16:02감사합니다.
00:16:03감사합니다.
00:16:05감사합니다.
00:16:05감사합니다.
00:16:09감사합니다.
00:16:11감사합니다.
00:16:13감사합니다.
00:16:24네, 질문은 시계열/시간적 이해를 어떻게 이 정도로 완벽하게 처리할 수 있었냐는 것이군요.
00:16:31좋은 질문입니다. 솔직히 말씀드리면 완벽하지는 않습니다. 실제 현장에 안정적으로 배포하기까지는 아직 많은 과제가 남아있죠.
00:16:37핵심은 컨텍스트 관리 방식입니다. 컨텍스트 길이가 제한되어 있으니까요. 여기서 사용된 모델은 100만 토큰 컨텍스트를 지원하지만 높은 FPS의 비디오를 담기에는 금방 차버립니다.
00:17:06따라서 어떤 창의적인 방식을 적용할지 고민해야 합니다. 과거에 썼다 지금은 넘어선 방식을 예로 들면, 키 프레임과 델타 프레임을 어떻게 다룰 것인가 하는 점입니다.
00:17:19이 둘의 밸런스를 맞춰 학습시킴으로써 컨텍스트를 관리하고, 사전 학습 과정에서 로보틱스 작업에 유용한 요소를 어떻게 자연스럽게 주입할지 고민하게 됩니다.
00:17:32예를 들어, 제미나이 모델조차 어려워했던 아주 기본적인 것, 지금 신규 모델들은 꽤 잘하지만 방위나 위치 관계를 구분하는 일 말이죠.
00:17:40인터넷 크롤링 데이터에서는 '이 물체가 왼쪽이나 아래에 있다'고 라벨링해두지 않기 때문에 좌우 구분이 매우 어렵습니다.
00:17:51초기 단계부터 데이터 분포를 제대로 고민하면 이러한 역량을 신속하게 확보할 수 있습니다. 또한 체화형 추론(ER)에 명확히 집중했기에 적은 연산 자원으로 Gemini ER을 능가할 수 있었습니다.
00:18:07저희가 확인한 가장 뛰어난 견고성(Robustness) 사례를 말씀드리자면, 기존 VLA 모델들, 예를 들어 중국산 모델을 가져와서
00:18:35특정 정책에 맞게 파인튜닝할 때, 테이블 배경만 조금 바꾸어도 제어 정책이 실패하고 맙니다.
00:18:47흥미로운 점은 시각 인지와 제어를 결합해 모델링하면 이러한 환경 변화나 조명 차이에 훨씬 견고해진다는 것입니다.
00:18:56기존 모델들이 가지지 못한 '배경 변화에 대한 견고성'을 확보했다고 볼 수 있습니다.
00:19:03그렇다고 과장하려는 것은 아닙니다. 여전히 해결하기 어려운 문제들이 많으니까요.
00:19:07로봇 암 카메라에 손전등을 직접 비춘다면 제대로 작동하지 않을 것입니다.
00:19:12하지만 두 요소를 결합해 모델링하는 방식이 성능 향상에 상당한 도움을 줍니다.
00:19:16또한 실시간 데이터 증강(Online Augmentation)을 수행하여, 한쪽 로봇 암 카메라가 꺼진 상황을 가상으로 연출하거나
00:19:27특정 방향에서 햇빛이 비추는 상황 등을 가상으로 만들어 적용합니다.
00:19:31학습 과정에서 이러한 작업들을 수행하여 견고성을 향상시킵니다.
00:19:35하지만 가장 큰 성능 향상은 이 조기 융합(Early Fusion) 패러다임을 로보틱스 영역에 적용하는 데서 옵니다.
00:19:43좋습니다.
00:19:44.
00:19:50아, 지식 베이스(Knowledge bases) 말씀이신가요?
00:19:52이미지나 비디오의 캡션을 작성하는 데 꽤 유용하게 쓰입니다.
00:19:57저희는 이러한 복잡한 1인칭 데이터 주석 작업을 위해 로보틱스 파트너들과 협력하고 있습니다.
00:20:02온톨로지 구축과는 조금 다르지만, 깊이 있고 구조화된 정보 추출 작업에
00:20:07저희 모델이 매우 뛰어난 성능을 발휘합니다.
00:20:10네.
00:20:11참고로 오늘 보여드린 모든 기능은 공개 API로 제공되고 있어 직접 사용해 보실 수 있습니다.
00:20:15벤치마크 결과도 공개되어 있습니다.
00:20:17주어진 시간이 다 된 것 같네요.
00:20:19마무리를 요청하셔서, 추가 문의는 밖에서 도와드리겠습니다.
00:20:22모두 감사합니다.
00:20:27감사합니다.

핵심 요약

퍼셉트론은 Data-Sparse MoE 및 조기 융합 구조 기반의 임바디드 파운데이션 모델을 통해 기존 VLA 대비 15배 저렴한 비용으로 시각 인지와 제어를 통합하며 원격 조작 데이터 의존도를 10분의 1로 절감한다.

하이라이트

  • 퍼셉트론(Perceptron)의 임바디드 파운데이션 모델은 제미나이 3.1 프로 수준의 성능을 보이며 Gemini Embodied Reasoning보다 약 15배 저렴하다.

  • Data-Sparse MoE 아키텍처를 적용하여 연산 비용 추가 없이 라우터가 직접 중요한 입력 토큰을 선택하게 함으로써 비디오 입력의 컨텍스트 비대화 문제를 해결한다.

  • 비디오 사전 학습 데이터를 10배 늘리면 시간당 100달러에 달하는 원격 조작(Tele-op) 데이터를 10분의 1 수준으로 감축할 수 있는 스케일링 법칙이 성립한다.

  • 시각 인지와 제어를 단일 네이티브 모델로 결합할 경우 테이블 배경 변화나 조명 차이 등의 환경 변화에 대한 견고성이 기존 VLA 모델 대비 크게 향상된다.

타임라인

임바디드 파운데이션 모델 패러다임의 정의

  • 기존 멀티모달 모델은 VLM, VLA, 월드 모델로 분절되어 있으나 이를 단일 체계로 통합하는 접근이 필요하다.
  • 임바디드 파운데이션 모델은 인지, 체화된 추론, 물리 제어까지 하나의 모델 내에서 네이티브로 처리한다.

기존 멀티모달 프레임워크는 텍스트를 출력하는 VLM이나 행동을 출력하는 VLA, 비디오를 출력하는 월드 모델 등으로 나뉘어 학습되었다. 퍼셉트론이 지향하는 피지컬 AI는 모달리티를 초기에 통합하는 얼리 융합(Early Fusion) 방식을 채택한다. 다양한 감각 입력을 기반으로 공간 이해, 추론, 최종 기계 제어까지 통합 수행하는 단일 모델 구조를 지향한다.

학습 신호 희소성 및 컨텍스트 비대화 문제 해결

  • 100만 개 시각 토큰 입력 중 실제 Loss 계산 대상은 0.2%에 불과하여 학습 신호가 극도로 희소하다.
  • Data-Sparse MoE를 도입하여 모델 스스로 정보 밀도가 높은 토큰에 연산 자원을 배분하도록 설계한다.

비디오 데이터 학습 시 전체 픽셀을 예측하는 방식은 배경과 주요 접촉점에 동일한 어텐션을 부여하여 연산 효율을 저하시킨다. 그리퍼 끝부분과 같은 주요 인지 요소를 모델이 스스로 학습하도록 유도함으로써 학습 신호 희소성을 해결한다. 또한 Data-Sparse MoE 논문에서 제시된 라우팅 방식을 통해 모든 레이어에서 연산 추가 비용 없이 작업 관련성이 높은 과일, 그래프 등의 토큰만 집중 추론한다.

에이전트 방식 시각 인지 및 로봇 오케스트레이션

  • 1페타바이트 규모 데이터셋으로 학습된 모델은 고전적 객체 감지 과제를 에이전트형 동작으로 재구성한다.
  • 고성능 체화형 추론 역량은 영상 자르기, 구간 건너뛰기, 캡션 검증 등의 주석 처리를 영상당 수 센트 비용으로 가능하게 한다.

단순 박스 지정 방식의 비전 감지와 달리, 모델 스스로 타일링을 결정하거나 대비를 조절해 이미지 속 숨겨진 물체를 감지하는 에이전트형 인지를 수행한다. 로보틱스 시스템에서는 장시간 작업을 하위 작업으로 분할하는 오케스트레이터 모델과 하위 제어 정책이 결합하는 구조를 보인다. 고속 처리 속도와 저렴한 비용을 바탕으로 복잡한 1인칭 로봇 데이터에 대한 자동 주석 작업을 효율화한다.

체화형 파운데이션 모델의 스케일링 법칙 및 현장 적용성

  • 일반 비디오 사전 학습 데이터와 고가의 원격 조작 데이터 간의 트레이드오프 스케일링 법칙을 발견했다.
  • 시각 인지와 제어의 결합 모델링은 테이블 배경이나 조명 변화에 따른 제어 정책 실패를 방지한다.

시간당 100달러에 달하는 원격 조작 데이터 수집 비용을 비디오 사전 학습 데이터 10배 확충을 통해 10분의 1 수준으로 대체 가능한 스케일링 법칙을 입증했다. 인지 및 제어가 결합된 통합 모델은 책 제목을 읽고 분류하는 다단계 제로샷 작업을 성공적으로 완수한다. 또한 실시간 데이터 증강 기법과 얼리 융합 패러다임을 결합하여 시각적 환경 변형에 강건한 물리 제어 성능을 확보한다.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기