Transcript
00:00:00안녕하세요, 와주신 여러분 감사합니다. 저는 엘로리움(Elorium)의 공동 창립자이자 CEO이며, 오늘 이 자리에서
00:00:22클로드, 챗GPT, 제미나이 등 현재 프론티어 모델의 문제점과 이들이 시각적 문제를 처리하는 방식에 대해 이야기하고자 합니다. 시각 분야에서 일하지 않는 분들께는 생소할 수 있지만, 사실 이들 모델이 시각적 추론을 다루는 방식과 인간이 다루는 방식 사이에는 상당한 격차가 있으며, 우리가 시각적 추론 영역에서
00:00:52어떤 정의로든 AGI와는 아직 거리가 멀다는 것을 알게 되실 겁니다. 모델의 한계가 어디서 드러나는지 쉽게 찾아볼 수 있는 몇 가지 예시가 있으며, 여러분도 몇 분만 투자하면 직접 확인하실 수 있습니다.
00:01:09첫 번째 예시로 체스판 환각(환각 현상)이 있습니다. 모델에 이 사진을 보여주고 이미지에 흰색 칸이 몇 개 있는지 물어보면, 환각을 겪지 않는 일반적인 사람이라면 32개라고 답하지 않을 것입니다.
00:01:2932개요. 물론 모델들이 이렇게 답하는 이유는 체스판의 일부만 보고 전체 체스판을 환각으로 만들어내어 결국 잘못된 숫자를 내놓기 때문입니다.
00:01:40현재 모델들이 패턴 매칭에 크게 의존하는 모습을 자주 볼 수 있습니다. 그것이 모델들로 하여금 현실 세계의 식물, 동물, 꽃을 아주 잘 식별하게 해주는 요인입니다.
00:01:52하지만 복잡한 질문에 도달하면 그 부분이 오히려 방해가 됩니다. 이 경우 패턴 매칭이 시각적 추론을 저해하고 있는 것이죠. 모델의 추론 과정을 보면 '이것은 체스판이다. 체스판은 모두 32개의 칸이 있다. 따라서 이것도 32개의 흰색 칸이 있을 것이다'라고 생각하는 것입니다.
00:02:11오른쪽 예시를 보면, 저는 보드게임을 아주 좋아해서 수집품이 제법 많습니다. 그래서 보드게임이라는 주제가 이어지고 있는 것을 보실 수 있는데요. 사실 강연장 밖의 보드게임 구역에 가보셔도 이를 똑같이 재현해보실 수 있습니다. 거기 체스판들이 있거든요.
00:02:30단언컨대 체스말을 임의의 위치에 배치한다면, 그 모든 말들이 정확히 어디에 위치해 있는지 말할 수 있는 프론티어 모델은 단 하나도 없을 것입니다.
00:02:42또 다른 예로 카탄(Catan)이 있습니다. 여기 아주 간단한 질문이 있습니다. '파란색 플레이어의 길(row)은 몇 개인가?' 프론티어 모델들은 이 문제에 대해 광범위하게 고민합니다.
00:02:54제가 본 답변 중 하나는 '아, 보드판 옆에 파란색 길 기물이 10개 있네요. 따라서 카탄 보드판 위에는 5개의 파란색 길이가 있을 것입니다'라는 것이었습니다. 하지만 당연히 사실이 아닙니다. 직접 세어보면 7개가 있죠.
00:03:11이처럼 최신 모델들은 다시 말해 추측과 패턴 매칭에는 능하지만, 공간적 인지 기반이 약하며 세부적인 질문에는 전혀 대응하지 못합니다.
00:03:23그리고 마지막으로, 실제 로봇 공학에 영향을 미치는 예시입니다. 로봇 팔이 컵과 조리기구를 조작하고 있는데요. 오늘날의 최고 수준(SOTA) 모델들은 로봇 팔이 뚜껑을 들어 올렸다는 사실을 놓칩니다.
00:03:48그리고 마지막에는 로봇이 지금 가스레인지를 켜고 있다는 사실도 놓칩니다. 근본적으로 '맥락 기억상실'이 일어나는 것이죠. 이는 모델들이 긴 영상에 걸쳐 일관성을 유지하지 못하고 무슨 일이 일어나는지 아주 쉽게 놓치기 때문입니다.
00:04:07그리고 자주 받는 질문 중 하나는 시각적 추론 문제와 시각적 이해 문제를 어떻게 구분하느냐는 것입니다. 시각적 사고와 시각적 이해의 비교라고도 할 수 있죠. 매우 간단한 방법은 자신에게 같은 질문을 던져보는 것입니다. 이미지나 영상을 보았을 때 질문에 답하는 데 얼마나 걸릴까요? 예를 들어 이 두 경우 모두, 여러분은 무슨 일이 일어나는지 알고 계실 겁니다. 무슨 일이 일어나는지 알고 계시죠? 그리고 자주 받는 질문은 시각적 추론 문제 대 시각적 이해 문제를 어떻게 정의하느냐입니다. 시각적 사고와 시각적 이해의 비교라고 할 수 있죠.
00:04:19아주 간단한 기준은 스스로에게 물어보는 것입니다. 이미지나 영상을 본 뒤 답변을 내놓기까지 얼마나 걸릴까요? 이 두 가지 경우 모두, 단 1초만 이미지를 보도록 허용된다면 이 방에 계신 누구도 답을 내놓지 못할 것입니다. 1초라는 시간은 다니엘 카너먼의 저서에 나오는 시스템 2와 같은
00:04:37복잡한 사고를 하기엔 부족합니다. 하지만 제가 “이것은 무슨 게임인가요?” 혹은 “이것은 무슨 꽃인가요?”라고 묻거나, 체스판 위에 말이 3개만 있을 때 “말이 몇 개 있나요?”라고 묻는다면, 그런 질문들은 여러분 모두
00:05:071초 안에 답하실 수 있을 겁니다. 마찬가지로 모든 프론티어 모델 역시 그런 종류의 질문은 맞힐 것입니다. 이것이 바로 단순 패턴 인식이 중심인 '이해'와, 사진을 상세히 들여다보고 여러 요소를 살펴봐야 하는 '추론' 간의 차이점입니다. 그리고 바로 이 지점이 오늘날 프론티어 모델들이 무너지는 부분입니다. 따라서 여러분이 자체 시스템을 설계하실 때 염두에 두셔야 합니다. 시각적 작업은 매우 단순하게 유지하십시오.
00:05:37그렇지 않으면 엄청나게 많은 환각 현상을 겪게 될 것입니다. 이는 자연스럽게 평가(Evals) 문제로 연결됩니다. 이미 다중모드 추론이나 시각적 추론 평가 지표가 여럿 존재합니다. 들어보셨을 법한 것 중 하나가 Arc AGI입니다. 사람들은 종종 프론티어 모델이 Arc AGI에서 85%나 90%를 기록한다고 말합니다.
00:06:07따라서 우리가 AGI 자체에 90% 도달했다고 말이죠. 하지만 그런 사람들은 벤치마크 데이터를 실제로 제대로 보지 않은 것입니다. 실제 데이터를 확인해보면 이미지가 32x32 또는 64x64 픽셀에 불과하다는 것을 알 수 있습니다.
00:06:2432x32 픽셀 문제로 단순화될 수 있는 현실 세계의 복잡한 과제를 하나라도 제시해 보라고 도전하고 싶습니다. 거의 그 어떤 의미 있는 과제도 그런 해상도로 축소될 수 없음을 금방 깨달으실 겁니다.
00:06:41사람들이 흔히 언급하는 또 다른 평가 지표는 MMMU입니다. 대규모 다학제 다중모드 이해 벤치마크죠. 이는 단순 텍스트 과학 질문이 아닌 이미지를 포함하고 있어 MMLU보다 한 단계 발전된 형태입니다. 이미지에 기반한 과학 질문이지만, 여전히 이미지 자체는 많은 질문에서 부차적인 요소일 뿐입니다. 대부분의 질문은 이미지를 보지 않고도, 혹은 대략적인 개요만 파악하는 수준의 패턴 인식만으로도 맞힐 수 있습니다.
00:07:11따라서 업계에 정말 필요한 것은 기하학적 정렬, 공간 지능, 물체 영속성 등 사람들이 실제로 중요하게 생각하는 요소들을 겨냥한 새로운 시각적 추론 벤치마크입니다.
00:07:25이러한 요소들은 시각적 사용 사례에 AI를 도입하는 데 정말 결정적입니다. 그리고 여러분도 느끼셨겠지만, 주로 시각 요소 중심인 여러 산업 분야에서는 아직 AI 도입이 그다지 활발하지 않습니다.
00:07:41그렇죠? AI 도입은 주로 소프트웨어 공학, 수학, 문서 처리 등의 분야에 집중되어 왔습니다. 하지만 현재 코딩에 대한 관심에 가려져 간과되고 있는 거대한 격차이자 기회가 시각 분야에 존재합니다.
00:08:01시각 AI에서 빠져 있는 패러다임은 바로 '사고(Thinking)'입니다. 우리에게는 바이트댄스의 씨댄스(C-Dance) 모델처럼 매우 고품질의 생성 모델들이 있습니다. 이러한 고정밀 모델들은 겉보기엔 훌륭하지만, 실제 물리적 기반과 인과적 논리가 부족합니다. 아마 이런 모델에 폭발 장면이나
00:08:06AI의 핵심은 사고 능력입니다. 우리에게는 다음과 같은 고품질 생성 모델들이 있습니다.
00:08:13바이트댄스의 씨댄스 모델처럼 말이죠. 대단히 정교한 모델들이고 시각적으로 우수하지만,
00:08:20실제 물리적 법칙과 인과적 논리가 결여되어 있습니다. 여러분도 느끼셨겠지만
00:08:26이러한 모델에 뭔가가 폭발하거나 하는 사진이나 영상을 만들어 달라고 요청해보면,
00:08:33건물이 무너지는 등의 모습이 매우 만화처럼 보입니다. 할리우드 영화 스타일처럼
00:08:38보이죠. 그 이유는 단순히 학습 데이터에 있던 내용을 그대로 출력하기
00:08:43때문입니다. 인터넷에 있는 수많은 재난 영상이나 액션 영상의 상당수는
00:08:49결국 할리우드 영화나 게임 엔진에서 나온 것이라, 모델들은 이를 재현하려 작동합니다.
00:08:54이는 근본적인 문제인데, 모델이 그런 영상 수준을 넘어설 수 없음을 의미하기 때문입니다.
00:08:58현재 우리의 위치를 이해해 보자면, 픽셀을 의미론적 라벨에 매핑하는 많은 도구가 있습니다.
00:09:05구글 렌즈가 대표적인 예입니다. 식물과 꽃을 식별하는 데 매우 유용해서 저도 자주 씁니다.
00:09:10세그멘테이션을 위한 SAM3, 객체 인지 및 탐지를 위한 YOLO, Mask R-CNN도 있죠.
00:09:17이들은 매우 견고하며 업계 곳곳에서 쓰이고 있지만, 근본적으로 수동적입니다.
00:09:22따라서 자체적인 추론 능력이 없습니다. 복잡한 질문에는 답할 수가 없죠.
00:09:27기술의 최전선은 바로 '사고', 즉 시각적 사고 모델에 있습니다.
00:09:33이 모델들은 능동적인 공간 및 시간적 지능을 갖추게 될 것입니다.
00:09:38계획 수립, 에이전트 워크플로우, 실제 물리적 실행을 위한 논리를 추출할 수 있습니다.
00:09:45따라서 저희의 접근법은 4단계로 나뉩니다. 먼저 시각적 추론에 특화된 다중모드 데이터를 직접 수집 및 생성하고 있습니다.
00:09:57이러한 종류의 데이터는 온라인에서 그냥 얻을 수 없다는 것을 깨달았습니다.
00:10:03저희는 모델 개선을 위해 평가, 에이전트, SFT, 강화학습(RL)을 활용한 합성 데이터 플라이휠을 구축했습니다.
00:10:09또한 트랜스포머 기반 아키텍처 위에서 다양한 개선을 이루어내어
00:10:18아키텍처 진보를 만들어냈으며, 시각적 생각의 사슬(Visual Chain of Thought) 추론도 구현하고 있습니다.
00:10:23이는 인간은 가지고 있지만 오늘날 프론티어 모델에는 전혀 없는 핵심적인 능력 중 하나입니다.
00:10:28현재 프론티어 모델들은 텍스트 기반 생각의 사슬에만 의존하고 있기 때문이죠.
00:10:32이것이 바로 시각적 생각의 사슬에 대한 한 예시입니다. 질문은 다음과 같습니다.
00:10:36“이 사진에 빨간색 호텔이 몇 개 지어져 있는가?”
00:10:40그러면 모델은 “아, 먼저 모든 호텔을 식별해야겠구나”라고 인식합니다.
00:10:45그래서 호텔과 다른 물체 주위에 상자를 그립니다.
00:10:50그런 다음 이를 빨간색 호텔로 범위를 좁힙니다.
00:10:54즉 시각적 공간 자체에서 이런 다단계 프로세스가 자연스럽게 일어나는 것입니다.
00:10:59이제 저희 회사에 대해 말씀드리자면, 저는 공동 창업자이자 CEO입니다.
00:11:06지난 12년 동안 구글 브레인과 딥마인드에서 근무했습니다.
00:11:09현대 대형 언어 모델(LLM)을 위한 여러 기초 기술을 개발했습니다.
00:11:1411년 전, 사전 학습과 미세 조정을 도입한 논문의 제1저자였습니다.
00:11:19그 연구가 2017년 트랜스포머 논문과 결합되어 GPT 시리즈 모델의 탄생으로 이어졌습니다.
00:11:25따라서 모든 GPT 논문이 저희 논문을 인용하고 있습니다.
00:11:28저는 초기 MOE 모델이자 최초의 SOTA 모델이었던 GLAM 프로젝트를 공동 이끌었습니다.
00:11:33그리고 보다 최근에는 PaLM 2의 사전 학습 및 아키텍처 개발을 공동 총괄했습니다.
00:11:38또한 제미나이(Gemini) 데이터 부문의 공동 리더였습니다.
00:11:41공동 창립자인 인페이(Yin Fei)는 애플과 구글 리서치에 몸담았습니다.
00:11:45그는 애플의 첫 공개 다중모드 모델인 MM1의 연구를 이끌었습니다.
00:11:50언어 전반에 걸친 시각적 추론 분야에서도 풍부한 경험을 가지고 있습니다.
00:11:58이쪽이 저희 팀입니다.
00:12:00현재 약 20명 정도의 인원으로 구성되어 있습니다.
00:12:03또한 최고의 추론 아키텍트인 더스틴 트란(Dustin Tran)도 함께하고 있습니다.
00:12:07그는 이전 xAI에서 사후 학습(post-training) 리드를 맡았습니다.
00:12:10저희는 애플, xAI, 딥마인드, 아마존 등 다양한 기업 출신의 세계적인 수준의 팀을 영입했습니다.
00:12:24제가 언급했던 활용 사례 측면에서, 로봇 공학이 주요 분야 중 하나입니다.
00:12:30이러한 동적인 환경에서 로봇이 복잡한 실시간 물리적 작업을 수행하는 데 심각한 병목 현상이 존재합니다.
00:12:39하지만 기존 비전 모델들은 아시다시피 정적인 이미지와 연출된 비디오로만 학습되었습니다.
00:12:47능동적인 물리적 상호작용 능력이 부족하죠.
00:12:50따라서 기존 방식들은 지나치게 공학적으로 치우쳐 있고 취약합니다.
00:12:55저희는 올해 말까지 사용 가능한 모델 API를 출시할 계획입니다.
00:13:02그 시점이 되면 이 API를 활용하여 로봇의 기존 계획 및 제어 시스템에 작업 관련 상황 이해 능력을 더해줄 수 있습니다.
00:13:17시각적 추론의 또 다른 중요한 사용 사례는 건설 분야입니다.
00:13:22건설 현장에는 구역별로 매우 복잡한 안전 규칙이 적용됩니다.
00:13:29기존 컴퓨터 비전은 수시로 바뀌는 안전 규칙에 충분히 빠르게 적응하지 못합니다.
00:13:34또한 OSHA(직업안전보건청) 규정 문구를 해석하고 이를 현장에서 실제 벌어지는 상황과 매칭하지도 못합니다.
00:13:44현장에서 중요한 공간적 관계를 이해하는 것도 불가능하죠.
00:13:47예를 들어 “작업자 중 몇 명이 안전모를 쓰고 있는가?” 라든가
00:13:51“이 시공이 사전에 정의된 설계도대로 진행되고 있는가?” 같은 것들입니다.
00:13:59현재 이러한 규칙을 적용하려면 유즈케이스마다 별도의 모델을 학습시켜야 합니다.
00:14:06앞서 말씀드렸듯 이러한 모델들은 매우 취약하기 때문입니다.
00:14:09따라서 끊임없이 재학습을 시켜야만 합니다.
00:14:12저희가 모델에 구축 중인 비디오 이해 기능을 통한 접근 방식은 이러한 비디오 스트림을 안전 규정에 결합(ground)할 수 있게 해줍니다.
00:14:26그리고 물론 안전 규정은 텍스트로 되어 있습니다.
00:14:28언어로 되어 있죠.
00:14:29그래서 모델이 언어와 비전 모두를 매우 잘 다룰 수 있어야 합니다.
00:14:35이를 통해 모델은 기존 카메라 인프라를 활용해 현장 규정을 해석할 수 있게 됩니다.
00:14:44마지막으로 건축 및 설계 부문 역시 매우 유망한 유즈케이스라고 생각합니다.
00:14:54이 분야야말로 세부적인 사항에 대단히 신경 써야 하는 분야입니다.
00:14:58아까 보드게임 예시에서 말씀드린 개수 세기나 공간 관계처럼 말이죠.
00:15:03이런 작업은 건축과 설계에서 정말 많이 활용됩니다.
00:15:06방 3개짜리 집 대신 4개짜리로 설계해 버리면 집주인이 엄청 화를 내겠죠.
00:15:13그렇죠?
00:15:14그러니까 개수를 정확히 세는 게 실제로 매우 중요합니다.
00:15:18또한 이러한 공간적 제약과 현실의 제약 조건들을 파악하는 건 요즘 상당 부분 수작업으로 이루어집니다.
00:15:28몇 주 전에 한 기계공학 기업과 이야기를 나눴는데, 로봇 테스트 플랫폼의 아주 작은 부품 하나를 설계하는 데에도
00:15:38100~200시간이 걸리고, 테스트 플랫폼 전체를 설계하는 데는
00:15:452,000~3,000시간의 작업 시간이 들어간다고 합니다.
00:15:51네.
00:15:52그리고 많은 곳에서 최첨단 프론티어 모델들을 시도해 봤지만, 이런 용도에는 잘 맞지 않았습니다.
00:15:58건축 도면이나 3D CAD/CAM 파일 전체에 걸친 시각적 맥락을 이해하는 데 큰 어려움을 겪습니다.
00:16:07그래서 수많은 오류가 발생하죠.
00:16:09저희는 이 기술이 다른 형태의 디자인 분야에도 유용하게 쓰일 수 있다고 믿습니다.
00:16:15건축과 공학뿐만 아니라 웹 디자인, 패션 등의 분야에서도 말이죠.
00:16:23저희의 접근 방식은 멀티모달 추론을 활용하여 중요한 기하학적 로직을 추출해 내는 것입니다.
00:16:33프로그래밍 방식의 검증이나 시뮬레이션 검증을 지원하고 있죠.
00:16:38코드 작성 시 유닛 테스트로 코드를 검증하는 것처럼 말입니다.
00:16:42지멘스나 기타 여러 기업이 개발한 시뮬레이터를 통해 기계 장치가 실제 현실에서 잘 작동할지 테스트해 볼 수도 있습니다.
00:16:53사실 이런 기계 설계 분야와 소프트웨어 코딩 자체에는 매우 많은 유사점이 존재합니다.
00:16:59하지만 기계 설계는 아직 AI의 손길이 비교적 미치지 않은 영역입니다.
00:17:04네, CAD/CAM 품질 관리 역시 잠재적인 유즈케이스 중 하나입니다.
00:17:08궁극적으로 저희는 이것이 기계 설계의 미래에 핵심적인 단계가 될 것이라 믿습니다.
00:17:15AI가 더 빠른 자동차, 더 효율적인 로켓, 더 뛰어난 배터리를 만들 수 있는 미래 말이죠.
00:17:22이 모든 일은 단순히 코딩만으로는 해결할 수 없습니다.
00:17:25차세대 아이폰이나 차세대 스페이스X 로켓을 그냥 코딩으로 짜서 만드는 건 아니니까요.
00:17:30근본적으로 대단히 시각적인 작업입니다.
00:17:35웹사이트 Lauren.ai, 트위터 페이지 x.com/laurienai, 또는 링크드인 페이지를 통해 저희에 대해 더 자세히 알아보실 수 있습니다.
00:17:48네, 어떤 질문이든 감사히 받겠습니다.
00:17:51잠시 동안 이 주변에 서 있을 테니까요.
00:17:54감사합니다.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video