최고의 모델도 여전히 유아처럼 추론한다 — 앤드류 다이, 일로리안

한국어English

Transcript

00:00:00안녕하세요, 와주신 여러분 감사합니다. 저는 엘로리움(Elorium)의 공동 창립자이자 CEO이며, 오늘 이 자리에서
00:00:22클로드, 챗GPT, 제미나이 등 현재 프론티어 모델의 문제점과 이들이 시각적 문제를 처리하는 방식에 대해 이야기하고자 합니다. 시각 분야에서 일하지 않는 분들께는 생소할 수 있지만, 사실 이들 모델이 시각적 추론을 다루는 방식과 인간이 다루는 방식 사이에는 상당한 격차가 있으며, 우리가 시각적 추론 영역에서
00:00:52어떤 정의로든 AGI와는 아직 거리가 멀다는 것을 알게 되실 겁니다. 모델의 한계가 어디서 드러나는지 쉽게 찾아볼 수 있는 몇 가지 예시가 있으며, 여러분도 몇 분만 투자하면 직접 확인하실 수 있습니다.
00:01:09첫 번째 예시로 체스판 환각(환각 현상)이 있습니다. 모델에 이 사진을 보여주고 이미지에 흰색 칸이 몇 개 있는지 물어보면, 환각을 겪지 않는 일반적인 사람이라면 32개라고 답하지 않을 것입니다.
00:01:2932개요. 물론 모델들이 이렇게 답하는 이유는 체스판의 일부만 보고 전체 체스판을 환각으로 만들어내어 결국 잘못된 숫자를 내놓기 때문입니다.
00:01:40현재 모델들이 패턴 매칭에 크게 의존하는 모습을 자주 볼 수 있습니다. 그것이 모델들로 하여금 현실 세계의 식물, 동물, 꽃을 아주 잘 식별하게 해주는 요인입니다.
00:01:52하지만 복잡한 질문에 도달하면 그 부분이 오히려 방해가 됩니다. 이 경우 패턴 매칭이 시각적 추론을 저해하고 있는 것이죠. 모델의 추론 과정을 보면 '이것은 체스판이다. 체스판은 모두 32개의 칸이 있다. 따라서 이것도 32개의 흰색 칸이 있을 것이다'라고 생각하는 것입니다.
00:02:11오른쪽 예시를 보면, 저는 보드게임을 아주 좋아해서 수집품이 제법 많습니다. 그래서 보드게임이라는 주제가 이어지고 있는 것을 보실 수 있는데요. 사실 강연장 밖의 보드게임 구역에 가보셔도 이를 똑같이 재현해보실 수 있습니다. 거기 체스판들이 있거든요.
00:02:30단언컨대 체스말을 임의의 위치에 배치한다면, 그 모든 말들이 정확히 어디에 위치해 있는지 말할 수 있는 프론티어 모델은 단 하나도 없을 것입니다.
00:02:42또 다른 예로 카탄(Catan)이 있습니다. 여기 아주 간단한 질문이 있습니다. '파란색 플레이어의 길(row)은 몇 개인가?' 프론티어 모델들은 이 문제에 대해 광범위하게 고민합니다.
00:02:54제가 본 답변 중 하나는 '아, 보드판 옆에 파란색 길 기물이 10개 있네요. 따라서 카탄 보드판 위에는 5개의 파란색 길이가 있을 것입니다'라는 것이었습니다. 하지만 당연히 사실이 아닙니다. 직접 세어보면 7개가 있죠.
00:03:11이처럼 최신 모델들은 다시 말해 추측과 패턴 매칭에는 능하지만, 공간적 인지 기반이 약하며 세부적인 질문에는 전혀 대응하지 못합니다.
00:03:23그리고 마지막으로, 실제 로봇 공학에 영향을 미치는 예시입니다. 로봇 팔이 컵과 조리기구를 조작하고 있는데요. 오늘날의 최고 수준(SOTA) 모델들은 로봇 팔이 뚜껑을 들어 올렸다는 사실을 놓칩니다.
00:03:48그리고 마지막에는 로봇이 지금 가스레인지를 켜고 있다는 사실도 놓칩니다. 근본적으로 '맥락 기억상실'이 일어나는 것이죠. 이는 모델들이 긴 영상에 걸쳐 일관성을 유지하지 못하고 무슨 일이 일어나는지 아주 쉽게 놓치기 때문입니다.
00:04:07그리고 자주 받는 질문 중 하나는 시각적 추론 문제와 시각적 이해 문제를 어떻게 구분하느냐는 것입니다. 시각적 사고와 시각적 이해의 비교라고도 할 수 있죠. 매우 간단한 방법은 자신에게 같은 질문을 던져보는 것입니다. 이미지나 영상을 보았을 때 질문에 답하는 데 얼마나 걸릴까요? 예를 들어 이 두 경우 모두, 여러분은 무슨 일이 일어나는지 알고 계실 겁니다. 무슨 일이 일어나는지 알고 계시죠? 그리고 자주 받는 질문은 시각적 추론 문제 대 시각적 이해 문제를 어떻게 정의하느냐입니다. 시각적 사고와 시각적 이해의 비교라고 할 수 있죠.
00:04:19아주 간단한 기준은 스스로에게 물어보는 것입니다. 이미지나 영상을 본 뒤 답변을 내놓기까지 얼마나 걸릴까요? 이 두 가지 경우 모두, 단 1초만 이미지를 보도록 허용된다면 이 방에 계신 누구도 답을 내놓지 못할 것입니다. 1초라는 시간은 다니엘 카너먼의 저서에 나오는 시스템 2와 같은
00:04:37복잡한 사고를 하기엔 부족합니다. 하지만 제가 “이것은 무슨 게임인가요?” 혹은 “이것은 무슨 꽃인가요?”라고 묻거나, 체스판 위에 말이 3개만 있을 때 “말이 몇 개 있나요?”라고 묻는다면, 그런 질문들은 여러분 모두
00:05:071초 안에 답하실 수 있을 겁니다. 마찬가지로 모든 프론티어 모델 역시 그런 종류의 질문은 맞힐 것입니다. 이것이 바로 단순 패턴 인식이 중심인 '이해'와, 사진을 상세히 들여다보고 여러 요소를 살펴봐야 하는 '추론' 간의 차이점입니다. 그리고 바로 이 지점이 오늘날 프론티어 모델들이 무너지는 부분입니다. 따라서 여러분이 자체 시스템을 설계하실 때 염두에 두셔야 합니다. 시각적 작업은 매우 단순하게 유지하십시오.
00:05:37그렇지 않으면 엄청나게 많은 환각 현상을 겪게 될 것입니다. 이는 자연스럽게 평가(Evals) 문제로 연결됩니다. 이미 다중모드 추론이나 시각적 추론 평가 지표가 여럿 존재합니다. 들어보셨을 법한 것 중 하나가 Arc AGI입니다. 사람들은 종종 프론티어 모델이 Arc AGI에서 85%나 90%를 기록한다고 말합니다.
00:06:07따라서 우리가 AGI 자체에 90% 도달했다고 말이죠. 하지만 그런 사람들은 벤치마크 데이터를 실제로 제대로 보지 않은 것입니다. 실제 데이터를 확인해보면 이미지가 32x32 또는 64x64 픽셀에 불과하다는 것을 알 수 있습니다.
00:06:2432x32 픽셀 문제로 단순화될 수 있는 현실 세계의 복잡한 과제를 하나라도 제시해 보라고 도전하고 싶습니다. 거의 그 어떤 의미 있는 과제도 그런 해상도로 축소될 수 없음을 금방 깨달으실 겁니다.
00:06:41사람들이 흔히 언급하는 또 다른 평가 지표는 MMMU입니다. 대규모 다학제 다중모드 이해 벤치마크죠. 이는 단순 텍스트 과학 질문이 아닌 이미지를 포함하고 있어 MMLU보다 한 단계 발전된 형태입니다. 이미지에 기반한 과학 질문이지만, 여전히 이미지 자체는 많은 질문에서 부차적인 요소일 뿐입니다. 대부분의 질문은 이미지를 보지 않고도, 혹은 대략적인 개요만 파악하는 수준의 패턴 인식만으로도 맞힐 수 있습니다.
00:07:11따라서 업계에 정말 필요한 것은 기하학적 정렬, 공간 지능, 물체 영속성 등 사람들이 실제로 중요하게 생각하는 요소들을 겨냥한 새로운 시각적 추론 벤치마크입니다.
00:07:25이러한 요소들은 시각적 사용 사례에 AI를 도입하는 데 정말 결정적입니다. 그리고 여러분도 느끼셨겠지만, 주로 시각 요소 중심인 여러 산업 분야에서는 아직 AI 도입이 그다지 활발하지 않습니다.
00:07:41그렇죠? AI 도입은 주로 소프트웨어 공학, 수학, 문서 처리 등의 분야에 집중되어 왔습니다. 하지만 현재 코딩에 대한 관심에 가려져 간과되고 있는 거대한 격차이자 기회가 시각 분야에 존재합니다.
00:08:01시각 AI에서 빠져 있는 패러다임은 바로 '사고(Thinking)'입니다. 우리에게는 바이트댄스의 씨댄스(C-Dance) 모델처럼 매우 고품질의 생성 모델들이 있습니다. 이러한 고정밀 모델들은 겉보기엔 훌륭하지만, 실제 물리적 기반과 인과적 논리가 부족합니다. 아마 이런 모델에 폭발 장면이나
00:08:06AI의 핵심은 사고 능력입니다. 우리에게는 다음과 같은 고품질 생성 모델들이 있습니다.
00:08:13바이트댄스의 씨댄스 모델처럼 말이죠. 대단히 정교한 모델들이고 시각적으로 우수하지만,
00:08:20실제 물리적 법칙과 인과적 논리가 결여되어 있습니다. 여러분도 느끼셨겠지만
00:08:26이러한 모델에 뭔가가 폭발하거나 하는 사진이나 영상을 만들어 달라고 요청해보면,
00:08:33건물이 무너지는 등의 모습이 매우 만화처럼 보입니다. 할리우드 영화 스타일처럼
00:08:38보이죠. 그 이유는 단순히 학습 데이터에 있던 내용을 그대로 출력하기
00:08:43때문입니다. 인터넷에 있는 수많은 재난 영상이나 액션 영상의 상당수는
00:08:49결국 할리우드 영화나 게임 엔진에서 나온 것이라, 모델들은 이를 재현하려 작동합니다.
00:08:54이는 근본적인 문제인데, 모델이 그런 영상 수준을 넘어설 수 없음을 의미하기 때문입니다.
00:08:58현재 우리의 위치를 이해해 보자면, 픽셀을 의미론적 라벨에 매핑하는 많은 도구가 있습니다.
00:09:05구글 렌즈가 대표적인 예입니다. 식물과 꽃을 식별하는 데 매우 유용해서 저도 자주 씁니다.
00:09:10세그멘테이션을 위한 SAM3, 객체 인지 및 탐지를 위한 YOLO, Mask R-CNN도 있죠.
00:09:17이들은 매우 견고하며 업계 곳곳에서 쓰이고 있지만, 근본적으로 수동적입니다.
00:09:22따라서 자체적인 추론 능력이 없습니다. 복잡한 질문에는 답할 수가 없죠.
00:09:27기술의 최전선은 바로 '사고', 즉 시각적 사고 모델에 있습니다.
00:09:33이 모델들은 능동적인 공간 및 시간적 지능을 갖추게 될 것입니다.
00:09:38계획 수립, 에이전트 워크플로우, 실제 물리적 실행을 위한 논리를 추출할 수 있습니다.
00:09:45따라서 저희의 접근법은 4단계로 나뉩니다. 먼저 시각적 추론에 특화된 다중모드 데이터를 직접 수집 및 생성하고 있습니다.
00:09:57이러한 종류의 데이터는 온라인에서 그냥 얻을 수 없다는 것을 깨달았습니다.
00:10:03저희는 모델 개선을 위해 평가, 에이전트, SFT, 강화학습(RL)을 활용한 합성 데이터 플라이휠을 구축했습니다.
00:10:09또한 트랜스포머 기반 아키텍처 위에서 다양한 개선을 이루어내어
00:10:18아키텍처 진보를 만들어냈으며, 시각적 생각의 사슬(Visual Chain of Thought) 추론도 구현하고 있습니다.
00:10:23이는 인간은 가지고 있지만 오늘날 프론티어 모델에는 전혀 없는 핵심적인 능력 중 하나입니다.
00:10:28현재 프론티어 모델들은 텍스트 기반 생각의 사슬에만 의존하고 있기 때문이죠.
00:10:32이것이 바로 시각적 생각의 사슬에 대한 한 예시입니다. 질문은 다음과 같습니다.
00:10:36“이 사진에 빨간색 호텔이 몇 개 지어져 있는가?”
00:10:40그러면 모델은 “아, 먼저 모든 호텔을 식별해야겠구나”라고 인식합니다.
00:10:45그래서 호텔과 다른 물체 주위에 상자를 그립니다.
00:10:50그런 다음 이를 빨간색 호텔로 범위를 좁힙니다.
00:10:54즉 시각적 공간 자체에서 이런 다단계 프로세스가 자연스럽게 일어나는 것입니다.
00:10:59이제 저희 회사에 대해 말씀드리자면, 저는 공동 창업자이자 CEO입니다.
00:11:06지난 12년 동안 구글 브레인과 딥마인드에서 근무했습니다.
00:11:09현대 대형 언어 모델(LLM)을 위한 여러 기초 기술을 개발했습니다.
00:11:1411년 전, 사전 학습과 미세 조정을 도입한 논문의 제1저자였습니다.
00:11:19그 연구가 2017년 트랜스포머 논문과 결합되어 GPT 시리즈 모델의 탄생으로 이어졌습니다.
00:11:25따라서 모든 GPT 논문이 저희 논문을 인용하고 있습니다.
00:11:28저는 초기 MOE 모델이자 최초의 SOTA 모델이었던 GLAM 프로젝트를 공동 이끌었습니다.
00:11:33그리고 보다 최근에는 PaLM 2의 사전 학습 및 아키텍처 개발을 공동 총괄했습니다.
00:11:38또한 제미나이(Gemini) 데이터 부문의 공동 리더였습니다.
00:11:41공동 창립자인 인페이(Yin Fei)는 애플과 구글 리서치에 몸담았습니다.
00:11:45그는 애플의 첫 공개 다중모드 모델인 MM1의 연구를 이끌었습니다.
00:11:50언어 전반에 걸친 시각적 추론 분야에서도 풍부한 경험을 가지고 있습니다.
00:11:58이쪽이 저희 팀입니다.
00:12:00현재 약 20명 정도의 인원으로 구성되어 있습니다.
00:12:03또한 최고의 추론 아키텍트인 더스틴 트란(Dustin Tran)도 함께하고 있습니다.
00:12:07그는 이전 xAI에서 사후 학습(post-training) 리드를 맡았습니다.
00:12:10저희는 애플, xAI, 딥마인드, 아마존 등 다양한 기업 출신의 세계적인 수준의 팀을 영입했습니다.
00:12:24제가 언급했던 활용 사례 측면에서, 로봇 공학이 주요 분야 중 하나입니다.
00:12:30이러한 동적인 환경에서 로봇이 복잡한 실시간 물리적 작업을 수행하는 데 심각한 병목 현상이 존재합니다.
00:12:39하지만 기존 비전 모델들은 아시다시피 정적인 이미지와 연출된 비디오로만 학습되었습니다.
00:12:47능동적인 물리적 상호작용 능력이 부족하죠.
00:12:50따라서 기존 방식들은 지나치게 공학적으로 치우쳐 있고 취약합니다.
00:12:55저희는 올해 말까지 사용 가능한 모델 API를 출시할 계획입니다.
00:13:02그 시점이 되면 이 API를 활용하여 로봇의 기존 계획 및 제어 시스템에 작업 관련 상황 이해 능력을 더해줄 수 있습니다.
00:13:17시각적 추론의 또 다른 중요한 사용 사례는 건설 분야입니다.
00:13:22건설 현장에는 구역별로 매우 복잡한 안전 규칙이 적용됩니다.
00:13:29기존 컴퓨터 비전은 수시로 바뀌는 안전 규칙에 충분히 빠르게 적응하지 못합니다.
00:13:34또한 OSHA(직업안전보건청) 규정 문구를 해석하고 이를 현장에서 실제 벌어지는 상황과 매칭하지도 못합니다.
00:13:44현장에서 중요한 공간적 관계를 이해하는 것도 불가능하죠.
00:13:47예를 들어 “작업자 중 몇 명이 안전모를 쓰고 있는가?” 라든가
00:13:51“이 시공이 사전에 정의된 설계도대로 진행되고 있는가?” 같은 것들입니다.
00:13:59현재 이러한 규칙을 적용하려면 유즈케이스마다 별도의 모델을 학습시켜야 합니다.
00:14:06앞서 말씀드렸듯 이러한 모델들은 매우 취약하기 때문입니다.
00:14:09따라서 끊임없이 재학습을 시켜야만 합니다.
00:14:12저희가 모델에 구축 중인 비디오 이해 기능을 통한 접근 방식은 이러한 비디오 스트림을 안전 규정에 결합(ground)할 수 있게 해줍니다.
00:14:26그리고 물론 안전 규정은 텍스트로 되어 있습니다.
00:14:28언어로 되어 있죠.
00:14:29그래서 모델이 언어와 비전 모두를 매우 잘 다룰 수 있어야 합니다.
00:14:35이를 통해 모델은 기존 카메라 인프라를 활용해 현장 규정을 해석할 수 있게 됩니다.
00:14:44마지막으로 건축 및 설계 부문 역시 매우 유망한 유즈케이스라고 생각합니다.
00:14:54이 분야야말로 세부적인 사항에 대단히 신경 써야 하는 분야입니다.
00:14:58아까 보드게임 예시에서 말씀드린 개수 세기나 공간 관계처럼 말이죠.
00:15:03이런 작업은 건축과 설계에서 정말 많이 활용됩니다.
00:15:06방 3개짜리 집 대신 4개짜리로 설계해 버리면 집주인이 엄청 화를 내겠죠.
00:15:13그렇죠?
00:15:14그러니까 개수를 정확히 세는 게 실제로 매우 중요합니다.
00:15:18또한 이러한 공간적 제약과 현실의 제약 조건들을 파악하는 건 요즘 상당 부분 수작업으로 이루어집니다.
00:15:28몇 주 전에 한 기계공학 기업과 이야기를 나눴는데, 로봇 테스트 플랫폼의 아주 작은 부품 하나를 설계하는 데에도
00:15:38100~200시간이 걸리고, 테스트 플랫폼 전체를 설계하는 데는
00:15:452,000~3,000시간의 작업 시간이 들어간다고 합니다.
00:15:51네.
00:15:52그리고 많은 곳에서 최첨단 프론티어 모델들을 시도해 봤지만, 이런 용도에는 잘 맞지 않았습니다.
00:15:58건축 도면이나 3D CAD/CAM 파일 전체에 걸친 시각적 맥락을 이해하는 데 큰 어려움을 겪습니다.
00:16:07그래서 수많은 오류가 발생하죠.
00:16:09저희는 이 기술이 다른 형태의 디자인 분야에도 유용하게 쓰일 수 있다고 믿습니다.
00:16:15건축과 공학뿐만 아니라 웹 디자인, 패션 등의 분야에서도 말이죠.
00:16:23저희의 접근 방식은 멀티모달 추론을 활용하여 중요한 기하학적 로직을 추출해 내는 것입니다.
00:16:33프로그래밍 방식의 검증이나 시뮬레이션 검증을 지원하고 있죠.
00:16:38코드 작성 시 유닛 테스트로 코드를 검증하는 것처럼 말입니다.
00:16:42지멘스나 기타 여러 기업이 개발한 시뮬레이터를 통해 기계 장치가 실제 현실에서 잘 작동할지 테스트해 볼 수도 있습니다.
00:16:53사실 이런 기계 설계 분야와 소프트웨어 코딩 자체에는 매우 많은 유사점이 존재합니다.
00:16:59하지만 기계 설계는 아직 AI의 손길이 비교적 미치지 않은 영역입니다.
00:17:04네, CAD/CAM 품질 관리 역시 잠재적인 유즈케이스 중 하나입니다.
00:17:08궁극적으로 저희는 이것이 기계 설계의 미래에 핵심적인 단계가 될 것이라 믿습니다.
00:17:15AI가 더 빠른 자동차, 더 효율적인 로켓, 더 뛰어난 배터리를 만들 수 있는 미래 말이죠.
00:17:22이 모든 일은 단순히 코딩만으로는 해결할 수 없습니다.
00:17:25차세대 아이폰이나 차세대 스페이스X 로켓을 그냥 코딩으로 짜서 만드는 건 아니니까요.
00:17:30근본적으로 대단히 시각적인 작업입니다.
00:17:35웹사이트 Lauren.ai, 트위터 페이지 x.com/laurienai, 또는 링크드인 페이지를 통해 저희에 대해 더 자세히 알아보실 수 있습니다.
00:17:48네, 어떤 질문이든 감사히 받겠습니다.
00:17:51잠시 동안 이 주변에 서 있을 테니까요.
00:17:54감사합니다.

Key Takeaway

현재 최첨단 멀티모달 모델들은 공간 인지와 세부 추론 능력이 부족하여 환각 현상을 일으키므로, 이를 극복하기 위해 '시각적 생각의 사슬' 기반의 사고 능력을 갖춘 새로운 시각 추론 패러다임이 필요하다.

Highlights

  • 최첨단 AI 모델은 단순 패턴 매칭에 의존하여 체스판의 흰색 칸 개수나 카탄 보드 위 기물 수를 잘못 계산하는 등 심각한 시각적 환각 현상을 보인다.

  • Arc AGI, MMMU 등 기존 벤치마크는 32x32 픽셀 수준의 지나치게 단순화된 이미지를 사용하거나 이미지 없이도 답을 맞힐 수 있어 실제 공간 추론 능력을 측정하지 못한다.

  • 시각 AI 발전의 핵심은 단순 이해를 넘어 공간 및 시간적 지능을 활용하는 '시각적 생각의 사슬(Visual Chain of Thought)' 추론 능력이다.

  • 기계 공학 및 건축 분야에서 로봇 테스트 플랫폼 부품 하나를 설계하는 데 100~200시간, 전체 시스템 설계에는 2,000~3,000시간의 작업 시간이 소요된다.

Timeline

프론티어 모델의 시각적 환각과 한계

  • 클로드, 챗GPT, 제미나이 등 최신 AI 모델들은 단순 패턴 매칭에 과도하게 의존하여 시각적 추론에서 심각한 오류를 발생시킨다.
  • 체스판의 일부만 보고 전체를 암묵적으로 가정하여 흰색 칸 수를 잘못 답하거나 보드게임 기물 위치를 정확히 파악하지 못한다.
  • 카탄 게임이나 로봇 팔 조작 비디오에서 뚜껑을 들거나 가스레인지를 켜는 핵심 세부 동작을 놓치는 '맥락 기억상실' 현상이 나타난다.

최신 프론티어 모델들은 시각 데이터 인식 시 겉보기 패턴에만 의존하는 경향이 있다. 체스판 위에 임의로 배치를 바꾸거나 카탄 보드판의 특정 색상 길 기물 개수를 세는 문제에서 엉뚱한 추측을 출력한다. 비디오 스트림에서도 연속적인 사건 변화를 추적하지 못하고 주요 동작을 잊어버리는 한계를 보인다.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video