스크립트
00:00:00네, 그럼 시작해 보겠습니다. 저는 퍼셉트론(Perceptron)의 공동 창업자이자 CEO인 아르민입니다.
00:00:20저희가 하는 일에 대해 간단히 소개드리겠지만, 오늘 주로 말씀드리고 싶은 내용은
00:00:25VLM, VLA, 월드 모델 등 무엇이라 부르든 간에 이러한 구분을 탈피하고자 하는
00:00:32저희의 연구 방향, 즉 '임바디드 파운데이션 모델(Embodied Foundation Models)'에 관한 것입니다.
00:00:42퍼셉트론에서 저희가 수행하는 작업, 다시 말해 저희의 궁극적인 지향점은
00:00:48물리적 세계를 실시간으로 인지하고 이해하며 상호작용할 수 있는
00:00:53피지컬 AI 기반을 구축하는 것입니다. 따라서 저희의 궁극적 미션은 물리적 세계와
00:00:58디지털 세계를 연결하는 것입니다. 본질적으로 디바이스, 장비,
00:01:07로봇, 카메라, 센서가 있는 곳이라면 어디든 지능을 제공하는 것이 저희의 목표입니다.
00:01:14구체적으로 인지하고, 추론하고, 행동하는 이러한 패러다임을 논할 때,
00:01:19저희는 이를 기존 멀티모달 모델링의 통합으로 바라봅니다.
00:01:25저는 FAIR 출신으로, 그곳에서 6년간 재직하며 멀티모달 모델의
00:01:31스케일업 레시피를 밝혀내는 데 주력했습니다. 그 당시 초기에 시작했던 작업이자
00:01:37이 분야에서 수많은 논문을 발표한 분야가 바로 '얼리 융합(Early Fusion)'입니다. 가능한 한 초기에
00:01:41이 모든 모달리티를 통합한다는 개념이죠. 여기서 핵심적인 복잡성은
00:01:47입력과 출력 모두에서 표현하고자 하는 다양한 모달리티를
00:01:52어떻게 올바르게 전체론적으로 표현할 것인가를 알아내는 것입니다. 그리하여 VLM이 대표적인...
00:01:58제가 멀티모달 모델을 언급할 때 아마 가장 먼저 떠올리실 게 VLM일 텐데요. 이는
00:02:03이미지나 비디오, 텍스트를 입력받아 기본적으로 텍스트를 출력하는 능력입니다. 변형 모델들도 존재합니다.
00:02:09ER 모델, 즉 체화된 추론(Embodied Reasoning) 모델처럼 바운딩 포인트를 출력하거나
00:02:15공간 이해 및 추론을 조금 더 잘 수행할 수 있는 모델들도 있죠.
00:02:20다음으로는 단순히 텍스트에 머물던 출력 영역을 행동(Action)으로 확장한 VLA가 있습니다.
00:02:25이들은 전통적으로 표준 VLM 백본을 기반으로 계속 구축되어 왔지만,
00:02:30VLM에서 탈피하여
00:02:35월드 모델이나 월드 액션 모델 등으로 전환하려는 시도도 있었습니다. 아직 대단한 결실을 보진 못했지만요.
00:02:39그리고 더 흥미롭고 복잡한 변형 형태의 멀티모달 모델로 넘어가면,
00:02:46입력값으로부터 비디오를 출력하는 월드 모델이 있습니다. 입력값은 이미지나 비디오,
00:02:51혹은 이미지, 비디오, 행동의 조합이 될 수 있죠. 마지막으로 말씀드릴 부분은
00:02:57최근에 등장한 '시맨틱 월드 모델(Semantic World Models)'입니다. 아무것도 직접 출력하진 않지만,
00:03:02향후 유용하게 쓰일 일종의 표현 방식을 학습하는 모델이죠. 저희가 정의하는
00:03:08'임바디드 파운데이션 모델'은 표준적인 인지, 체화된 추론,
00:03:13그리고 궁극적 목표인 제어(Control)까지 모두 단일 모델 내에서 수행할 수 있게 하는 프레임워크입니다.
00:03:20입력 측면에서 다양한 감각 모달리티를 넘나들며 추론하고,
00:03:25출력 측면에서 앞서 언급한 대부분의 작업을 하나의 통합 모델 내에서 해내는 것이죠.
00:03:31이제 두 가지 과제에 대해 빠르게 말씀드리겠습니다. 이는 저희가 직면한
00:03:35근본적인 연구 과제들로, 저희 회사가 이에 어떻게 접근했는지,
00:03:40그리고 다른 연구자들은 이 분야에서 어떻게 대응하고 있는지 말씀드리겠습니다.
00:03:43첫째로, 순수하게 1시간 분량의 비디오 같은 데이터를
00:03:48모델링하려고 할 때를 생각해 봅시다. 표현 방식에 따라 다르겠지만
00:03:52약 100만 개의 시각적 토큰이 입력될 수 있습니다. 문제는 효율적으로 사용할 수 있는
00:03:57정답 데이터(Ground Truth)가 실제로는 존재하지 않는다는 점입니다. 자막 추출이나
00:04:02비디오에서의 자막 예측, 혹은 특정 프레임에 대한 합성 라벨링,
00:04:08질의응답 등을 수행할 수 있고 사람들도 실제로 그렇게 해왔지만, 이는 엄청난 낭비임이 밝혀졌습니다.
00:04:13모델에 들어가는 입력을 생각해 보면, 100만 개의 토큰이 들어가는데
00:04:16실제 손실(Loss)을 계산하는 대상은 전체 입력 토큰의
00:04:220.2% 정도에 불과합니다. 이는 근본적으로 매우 문제가 됩니다. 사실 이를 수정하려는
00:04:27어떤 방식을 쓰더라도 결국 잘못된 학습 신호를 주입하게 됩니다.
00:04:31신호가 너무 희소하거나, 지나치게 인위적이거나, 혹은 무분별하기 때문이죠. 그래서
00:04:37단순 합성 강화를 넘어서는 접근법으로 모든 픽셀을 예측하자는 방식이 등장했습니다. 물론
00:04:42매우 조밀한 신호이긴 하지만, 어텐션 배분 측면에서는 매우 비효율적입니다.
00:04:47배경 픽셀을 그리퍼의 끝부분이나 접촉점,
00:04:51특정 실패 지점, 물리적 현상과 동일한 중요도로 다루게 되니까요.
00:04:56따라서 퍼셉트론에서 저희가 취한 방식이자 핵심 지적재산(IP) 중 하나는
00:05:01자연스러운 인지 목표가 어떤 모습이어야 하는가 고민하는 것입니다. 즉, 향후 중요해질
00:05:06인지 요소(Percept)를 매우 자동화된 방식으로 예측하는 방법이죠. 예컨대
00:05:11로봇 암이 있다면, 그리퍼 끝부분이 미래 예측에 있어 매우 유용한 인지 요소가 될 수 있도록
00:05:16하드코딩할 수 있습니다. AI2의 MOMO Act 팀 등 다른 VLA 연구진에서도
00:05:20이러한 시도를 시작했습니다. 하지만 이는 여전히 하드코딩된 인지 요소입니다. 그렇다면 질문은
00:05:26모델이 의미론적으로 이 독특한 목표를 스스로 학습할 수 있는 자동화 방식을
00:05:30찾아낼 수 있느냐입니다. 그리고 저희는 실제로 그 방법을 찾아냈습니다. 구체적 방식은
00:05:37여기서 공개하지 않겠지만, 희소성 문제에 저희가 어떻게 접근하는지 힌트를 드리는 것입니다.
00:05:41저희가 많은 시간을 할애해 집중하는 두 번째 핵심 문제는 '컨텍스트 비대화(Context Bloat)'입니다.
00:05:49항상 켜져 있는 카메라나, 멈추거나 대기하지 않는 로봇이 있다면
00:05:54결국 엄청나게 긴 토큰에 대해 추론을 수행해야 합니다.
00:06:01텍스트는 상대적으로 조밀한 반면 비디오는 희소합니다. 따라서 인위적인 수준에서
00:06:08이 불균형을 해결하려 하기보다, 이 문제를 근본적으로 처리하기 위한
00:06:13아키텍처적 돌파구가 존재하는지가 핵심 질문이 됩니다.
00:06:20여기서 취할 수 있는 몇 가지 방법이 있습니다. 첫 번째 핵심 원칙은
00:06:25서로 다른 모달리티를 완전히 별개로 다루기 시작해야 한다는 점입니다. 텍스트 토큰을
00:06:31이미지, 오디오, 비디오 토큰과 동일하게 취급해서는 안 됩니다. 따라서 고려해 볼 수 있는 한 가지는
00:06:36공간 압축이나 토큰 압축에 집중하는 것입니다. 사람들은 단순한 방식을 쓰기도 하며,
00:06:41저희 역시 처음에는 그런 단순한 방식으로 시작했고 실제로 효과가 있었습니다. 비디오나
00:06:44이미지 전체의 패치 단위 표현을 평균화하는 방식을 고려해 볼 수 있죠.
00:06:51최대 10배까지 흥미로운 압축률을 얻을 수는 있지만, 이는 여전히 임시방편에 가깝고
00:06:57이를 실제로 해결할 검증된 아키텍처적 기법은 아닙니다. 이에 저희는
00:07:04지난 몇 달간 다양한 수준의 희소성을 다루기 위해 저희만의 접근법을 공개했습니다.
00:07:10그 핵심은 어떤 토큰을 주시하고 어떤 토큰을 지나칠지 모델이 직접 결정하게 하는 것입니다.
00:07:14그렇게 발표한 '데이터 희소 혼합 전문가(Data-Sparse MoE)' 논문이 바로 이 기능을 가능하게 합니다.
00:07:19모델 내 라우터가 어떤 토큰을 입력하고 어떤 토큰을 건너뛸지
00:07:24직접 예측하게 하며, 이를 모든 레이어에 걸쳐 연산 비용 없이
00:07:30수행할 수 있게 합니다. 과도한 아키텍처적 사전지식을 직접 부여하지 않고
00:07:36모델 스스로 학습하도록 내버려두면, 실제로 모델이 학습해낸다는 사실이 밝혀졌습니다.
00:07:43저희 모델이 사용하는 데이터 희소 연산을 시각화해 보면, 모델이 선천적으로
00:07:49정보 밀도가 매우 높거나 작업 연관성이 높은 정보에 집중하기 시작하는 것을 볼 수 있습니다.
00:07:56우측 상단을 보면 모델이 그래프 부분에 집중하기로 결정한 것을 볼 수 있는데,
00:08:00그림 내에서 가장 흥미로운 부분일 가능성이 높기에 사람 역시 그 부분에 주목하게 됩니다.
00:08:05또한 작업에 의존적인 자원 배분 역시 일어나는 것으로 나타났습니다.
00:08:13좌측 하단을 보면 매우 일반적인 질문을 던졌을 때
00:08:18이미지 전체에 어텐션 그래프가 퍼져 있는 것을 볼 수 있습니다. 연산을 배분할 적절한 방법을 찾지 못한 것이죠.
00:08:22반면에 모든 과일을 분할(Segment)하라는 식의 지시를 내리면,
00:08:27과일 토큰이라고 판단되는 대상에 더 많은 토큰을 배분하는 것을 확인할 수 있습니다.
00:08:31이는 매우 훌륭하고 영리한 기법으로, 각 모달리티의 희소성 불균형을 해결하는 데
00:08:36유용한 사전지식을 아키텍처에 내재화하면서도, 모델 본연의 학습 능력을 해치지 않는 수준을 유지합니다.
00:08:43저희 논문 발표 이후 다른 연구진도 이를 활용하기 시작했습니다.
00:08:49저희는 이 모든 요소를 종합하여, 소식을 접하셨을 수도 있겠지만
00:08:57몇 주 전 최초의 임바디드 파운데이션 모델이라 자부하는 모델을 공개했습니다.
00:09:03이 모델은 제미나이 3.1 프로(Gemini 3.1 Pro) 수준의 최고 성능을 자랑하며,
00:09:09Gemini Embodied Reasoning보다 우수한 성능을 보이면서도 비용은 약 15배 저렴합니다.
00:09:15기본적으로 모든 영역에 걸쳐 수집한 1페타바이트 규모의 데이터셋으로 학습되었죠.
00:09:20웹 크롤링부터 자체 맞춤형 중간 학습(Mid-training) 레시피, 합성 데이터 파이프라인에 이르기까지
00:09:28텍스트, 이미지, 비디오, 궤적(Trajectory) 데이터를 아우르는 1페타바이트의 데이터를 보유하고 있으며,
00:09:34이 궤적 데이터는 데스크톱 사용 궤적이든 비디오 게임 플레이 궤적이든 매우 광범위합니다.
00:09:41이러한 작업을 진행하자 매우 흥미로운 특성들이 발현되기 시작했습니다.
00:09:46지나고 보면 당연하지만 저희가 발견한 가장 큰 특성은
00:09:50고전적인 컴퓨터 비전(CV) 작업을 에이전트 작업으로 볼 수 있다는 점입니다.
00:09:57이 경우, 우리는 객체 감지를 에이전트 작업으로 재구성했습니다. 모델이 코드를 작성할 수도 있고,
00:10:02특정 영역을 확대하거나 대비를 조정해 달라고 요청할 수도 있죠. 보시다시피
00:10:09이건 아주 어려운 문제입니다. 레딧에는 이미지 속에서 찾아내기 힘든 물체를 찾는
00:10:14서브레딧 게시판이 따로 있을 정도죠. 저희 모델은 이런 작업을 아주 잘 해냅니다.
00:10:19하지만 이건 에이전트 방식의 처리입니다. “이 하나의 영역을 감지해” 같은 고전적인 방식이 아니라
00:10:24모델 스스로 이미지를 타일링해야 한다고 판단하고, 대비를 조정해야 한다고 결정하는 것이죠.
00:10:28여기 박스를 제안하고, 대비를 높여서 새를 찾아내는 모습을 볼 수 있습니다.
00:10:36다시 말씀드리지만, 시각 인지 능력이 뛰어난 사람에게조차 매우 어려운 작업입니다.
00:10:42이 모든 것은 다양한 모달리티를 이해하는
00:10:46네이티브 체화형(Embodied) 모델이 있기에 가능합니다.
00:10:51그그렇다면 이것이 로보틱스 기반의 일반적인 피지컬 AI 방향성과는 어떻게 연결될까요?
00:10:57이 슬라이드는 GDM 팀의 자료를 가져온 것인데요, 로보틱스 에이전트 시스템에서
00:11:04체화형 추론 모델(오케스트레이터)과 촉각 제어 정책 모델 간의 분리가 나타나기 시작했습니다.
00:11:11예를 들어, 커피를 내리는 데 3분이 걸리는 작업이 있다고 해봅시다.
00:11:17단일 VLA 모델에게 이 개별 작업을 전부 파악하도록 강제할 수도 있겠지만,
00:11:21오케스트레이터 모델을 두어 작업을 하위 작업으로 나누고, 그 위에서 실행되는 촉각 제어 정책을 이용할 수도 있습니다.
00:11:26완전한 VLA 단일 구성부터 이러한 에이전트 형태의 시스템까지 넓은 스펙트럼이 존재하죠.
00:11:31여기서 강조하고자 하는 핵심은 체화형 추론이 매우 흥미롭고 복잡하며,
00:11:36아직 해결해야 할 도전 과제라는 점입니다.
00:11:41그럼에도 불구하고 저희 모델은 체화형 추론 분야에서 최고의 성능을 유지하고 있습니다.
00:11:46최첨단 성능을 갖추었기에 이전에는 보지 못했던 놀라운 현상들이 관찰되기 시작했습니다.
00:11:501인칭 시점은 아니지만 매우 복잡한 로봇 데이터 주석 처리(Annotation)의
00:11:55구체적인 예시를 하나 보여드리겠습니다.
00:11:59영상 속에서 모델이 구간을 넘겨가며 영상의 여러 부분을 확인하고,
00:12:04자르고, 캡션이 정확한지 스스로 검증하는 모습을 볼 수 있습니다.
00:12:09저희 AR 모델의 처리 속도가 빠르기 때문에 가능한 일입니다.
00:12:15기존의 다른 어떠한 모델보다 훨씬 저렴합니다. 제미나이(Gemini)로 이 작업을 처리한다면
00:12:20영상당 몇 달러가 들겠지만, 저희 모델은 몇 센트 수준에 불과합니다.
00:12:24이 모든 성과는 기존 모델들에서는 볼 수 없었던 최고의 체화형 추론 역량 덕분입니다.
00:12:29이제 저희가 달성한 가장 중요한 연구 돌파구를 공유해 드리겠습니다.
00:12:37자세한 내용은 몇 주 내로 트위터 등을 통해 추가 발표할 예정입니다.
00:12:41저희는 체화형 파운데이션 모델을 위한 새로운 스케일링 법칙(Scaling Laws)을 발견했습니다.
00:12:48이 모델들은 제어 기반 학습, 궤적 학습, 인지 학습,
00:12:53그리고 체화형 추론 학습을 결합하여 수행할 수 있습니다.
00:12:59이 요소들을 조합하는 최적의 방법과 적절한 목적 함수를 알아낸다면
00:13:03이전에는 발견하지 못했던 매우 흥미로운 제어 요소를 활용할 수 있게 됩니다.
00:13:08구체적인 활용 사례로, 일반 비디오 사전 학습 데이터와
00:13:11원격 조작(Tele-op) 데이터를 맞교환(Trade-off)할 수 있는 기능을 말씀드리겠습니다.
00:13:19잘 아시다시피 원격 조작 데이터는 시간당 100달러 수준으로 매우 비쌉니다.
00:13:25100달러면 훨씬 더 많은 양의 비디오 사전 학습 데이터를 수집할 수 있죠.
00:13:32그래프가 보여주는 것은 순수 VLA 및 제어 정책만 학습시킬 때의 성능 범위입니다.
00:13:39스케일링 법칙이 여전히 적용되므로 원격 조작 데이터가 늘어날수록 이점이 있지만,
00:13:43통합된 체화형 파운데이션 모델을 학습시킬 때만큼 성능 향상이 크지는 않습니다.
00:13:48그래프 하단이 바로 그 차이를 보여줍니다.
00:13:55여기서 얻는 매우 멋진 이점은, 비디오 사전 학습 데이터가 10배 더 있다면
00:14:03원격 조작 데이터를 10분의 1로 줄여서 대체할 수 있다는 점입니다.
00:14:09현재 저희 회사의 연산 자원 규모 내에서는 이 법칙이 유효하게 성립하고 있으며,
00:14:16체화형 파운데이션 모델의 한계를 계속해서 확장해 나갈 계획입니다.
00:14:28몇 주 안에 소형 모델 중 하나를 오픈소스로 공개하길 기대하며,
00:14:33작업 파악을 위한 체화형 추론 능력을 갖춘 단일 모델 내부에서
00:14:38모든 프로세스가 네이티브로 실행되는 정책 영상 몇 개를 보여드리겠습니다.
00:14:43모델이 제어 토큰을 출력하고 있는데 약간 떨림이 있지만 스케일을 키우면 해결될 것입니다.
00:14:48기존의 순수 VLA 모델로는 처리하기 힘들었던 매우 복잡한 작업들을 확인할 수 있습니다.
00:14:54오른쪽 영상을 보시면 모델이 책 제목을 읽고 어떤 종류의 책인지 파악한 뒤,
00:14:58알맞은 수거함에 올바르게 분류해야 합니다. 이 작업은 인지와 제어가 결합된 다단계 작업으로,
00:15:04수행해야 할 시각 인지 과제를 제대로 인식하지 못하는
00:15:09순수 엔드투엔드 제어 모델로는 완수하기가 정말 극도로 어렵습니다.
00:15:23네, 아주 훌륭합니다. 사전에 학습되지 않은 제로샷(Zero-shot) 환경에서도 상당히 잘 작동하죠.
00:15:287월 중, 몇 주 안으로 여러분께 이 모델을 선보이게 되어 기대가 큽니다.
00:15:33질문받을 시간을 몇 분 남겨두겠습니다. 관심 있는 분들은 언제든 연락해 주세요.
00:15:41저희 회사는 제한된 일부 파트너를 대상으로 Mark 1 가중치(Weights) 접근 권한을 제공합니다.
00:15:47더 큰 규모의 체화형 파운데이션 모델 가중치에 접근하실 수 있으니 이메일이나 트위터 DM 중 편하신 쪽으로 연락 주세요.
00:15:58남은 몇 분 동안 질의응답 시간을 갖겠습니다.
00:16:02감사합니다.
00:16:03감사합니다.
00:16:05감사합니다.
00:16:05감사합니다.
00:16:09감사합니다.
00:16:11감사합니다.
00:16:13감사합니다.
00:16:24네, 질문은 시계열/시간적 이해를 어떻게 이 정도로 완벽하게 처리할 수 있었냐는 것이군요.
00:16:31좋은 질문입니다. 솔직히 말씀드리면 완벽하지는 않습니다. 실제 현장에 안정적으로 배포하기까지는 아직 많은 과제가 남아있죠.
00:16:37핵심은 컨텍스트 관리 방식입니다. 컨텍스트 길이가 제한되어 있으니까요. 여기서 사용된 모델은 100만 토큰 컨텍스트를 지원하지만 높은 FPS의 비디오를 담기에는 금방 차버립니다.
00:17:06따라서 어떤 창의적인 방식을 적용할지 고민해야 합니다. 과거에 썼다 지금은 넘어선 방식을 예로 들면, 키 프레임과 델타 프레임을 어떻게 다룰 것인가 하는 점입니다.
00:17:19이 둘의 밸런스를 맞춰 학습시킴으로써 컨텍스트를 관리하고, 사전 학습 과정에서 로보틱스 작업에 유용한 요소를 어떻게 자연스럽게 주입할지 고민하게 됩니다.
00:17:32예를 들어, 제미나이 모델조차 어려워했던 아주 기본적인 것, 지금 신규 모델들은 꽤 잘하지만 방위나 위치 관계를 구분하는 일 말이죠.
00:17:40인터넷 크롤링 데이터에서는 '이 물체가 왼쪽이나 아래에 있다'고 라벨링해두지 않기 때문에 좌우 구분이 매우 어렵습니다.
00:17:51초기 단계부터 데이터 분포를 제대로 고민하면 이러한 역량을 신속하게 확보할 수 있습니다. 또한 체화형 추론(ER)에 명확히 집중했기에 적은 연산 자원으로 Gemini ER을 능가할 수 있었습니다.
00:18:07저희가 확인한 가장 뛰어난 견고성(Robustness) 사례를 말씀드리자면, 기존 VLA 모델들, 예를 들어 중국산 모델을 가져와서
00:18:35특정 정책에 맞게 파인튜닝할 때, 테이블 배경만 조금 바꾸어도 제어 정책이 실패하고 맙니다.
00:18:47흥미로운 점은 시각 인지와 제어를 결합해 모델링하면 이러한 환경 변화나 조명 차이에 훨씬 견고해진다는 것입니다.
00:18:56기존 모델들이 가지지 못한 '배경 변화에 대한 견고성'을 확보했다고 볼 수 있습니다.
00:19:03그렇다고 과장하려는 것은 아닙니다. 여전히 해결하기 어려운 문제들이 많으니까요.
00:19:07로봇 암 카메라에 손전등을 직접 비춘다면 제대로 작동하지 않을 것입니다.
00:19:12하지만 두 요소를 결합해 모델링하는 방식이 성능 향상에 상당한 도움을 줍니다.
00:19:16또한 실시간 데이터 증강(Online Augmentation)을 수행하여, 한쪽 로봇 암 카메라가 꺼진 상황을 가상으로 연출하거나
00:19:27특정 방향에서 햇빛이 비추는 상황 등을 가상으로 만들어 적용합니다.
00:19:31학습 과정에서 이러한 작업들을 수행하여 견고성을 향상시킵니다.
00:19:35하지만 가장 큰 성능 향상은 이 조기 융합(Early Fusion) 패러다임을 로보틱스 영역에 적용하는 데서 옵니다.
00:19:43좋습니다.
00:19:44.
00:19:50아, 지식 베이스(Knowledge bases) 말씀이신가요?
00:19:52이미지나 비디오의 캡션을 작성하는 데 꽤 유용하게 쓰입니다.
00:19:57저희는 이러한 복잡한 1인칭 데이터 주석 작업을 위해 로보틱스 파트너들과 협력하고 있습니다.
00:20:02온톨로지 구축과는 조금 다르지만, 깊이 있고 구조화된 정보 추출 작업에
00:20:07저희 모델이 매우 뛰어난 성능을 발휘합니다.
00:20:10네.
00:20:11참고로 오늘 보여드린 모든 기능은 공개 API로 제공되고 있어 직접 사용해 보실 수 있습니다.
00:20:15벤치마크 결과도 공개되어 있습니다.
00:20:17주어진 시간이 다 된 것 같네요.
00:20:19마무리를 요청하셔서, 추가 문의는 밖에서 도와드리겠습니다.
00:20:22모두 감사합니다.
00:20:27감사합니다.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기