AI 에이전트에게 100만 토큰 컨텍스트가 필요한 이유 — 토마스 울프 & 올리브 송, 미니맥스

AAI Engineer
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00무대 위에 허깅 페이스의 공동 창립자이자 최고 과학 책임자이신 토마스 울프가 나와 계십니다.
00:00:30안녕하세요 여러분. 올리브 님, 안녕하세요. 무대에 모시게 되어 반갑습니다. 초대해 주셔서 감사합니다. 오늘 아주 흥미로운 시간을 보내게 되실 겁니다. 방금 인공 분석(Artificial Analysis)에서 현재 2위를 차지한 GLM을 보셨을 테니까요. 물론 사용할 수 있는 사람이 없어서 그 모델은 제외하고, 이제 4위 모델을 소개합니다. 기본적으로 최고의 모델들, 최소한 최고의 오픈소스 모델들을 연속으로 만나보실 수 있습니다.
00:00:57그리고 정말 운 좋게도 아주 놀라운 여정을 걸어온 올리브 님을 모셨습니다. 올리브 님은 미국 펜실베이니아로 건너가 NYU의 얀 르쿤 교수 연구실에서 JPA를 연구하며 박사 과정을 밟으셨죠. 하지만 오늘은 JPA에 대해 이야기하지 않기로 했죠? 다른 날을 위해 아껴두고요. 그리고 당시 뉴욕에 있던 허깅 페이스에 합류하는 대신, 미니맥스(Minimax)에 합류하기로 결정하셨습니다.
00:01:26전 세계의 수많은 AI 랩실을 잘 모르시는 분들이 계실 텐데요—현재 64개 정도의 AI 랩실이 있다고 하니 모르셔도 괜찮습니다—미니맥스는 중국 내에서 이른바 AI '네 소위 드래곤즈' 중 최고로 꼽히는 곳입니다. 요즘 아주 유명해진 딥시크, 키미를 개발한 문샷, 지아, 그리고 방금 보신 GLM 같은 신흥 강자들이 있죠.
00:01:51자, 새로운 모델이 나왔고, 이제 미니맥스가 있습니다. 이들은 모두 1위를 차지하기 위해 경쟁하는 극도로 훌륭하고 재능 있는 팀들입니다.
00:01:58미니맥스의 최신 모델은 지난 6초에 공개된 M3로, 당시 최고의 오픈소스 모델이었습니다.
00:02:08정말 인상적입니다. 이 모델에 관해 아주 흥미로운 점들이 많으니 빠르게 살펴보고, 미니맥스만의 차별점과 뛰어난 부분에 대해 이야기해 보겠습니다.
00:02:20네. 올리브 님, 먼저 M3에 대한 전반적인 견해와 이 모델의 어떤 점을 좋아하시는지, 그리고 출시 과정이 어땠는지 간단히 말씀해 주시겠어요?
00:02:32네, M3는 이달 초에 출시했습니다. 총 파라미터가 약 4,000억 개이고 활성화 파라미터는 200억 개인 비교적 작은 모델입니다.
00:02:45하지만 코딩 성능뿐만 아니라 시각적 이해도 측면에서도 매우 뛰어난 능력을 갖추고 있습니다.
00:02:52기존 오픈소스 모델들이 보통 갖추지 못한 부분인데, 이 모델은 코딩뿐만 아니라 비디오와 이미지도 이해할 수 있으며, 100만 토큰이라는 초대형 컨텍스트를 지원합니다.
00:03:09우리의 새로운 아키텍처인 MSA(Minimax Sparse Attention) 덕분입니다. 미래의 AI 애플리케이션에서 코딩 능력, 에이전트 능력, 긴 컨텍스트, 멀티모달 이해가 매우 중요해질 것을 잘 알고 있었기에 이 세 가지 요소를 확실하게 결합했습니다.
00:03:26네, 그 점이 이 모델의 아주 흥미로운 부분이 될 것이라고 생각합니다.
00:03:35그렇군요. 이 모델에는 파고들 부분이 정말 많습니다. 여전히 상위 5개 오픈소스 모델 중 실제로 멀티모달을 지원하는 유일한 모델이기도 하니, 그에 대해 이야기해 봐야겠네요.
00:03:45하지만 먼저 긴 컨텍스트에 대해 이야기하자면, 실제 100만 토큰의 긴 컨텍스트를 진정으로 구현해 낸 최초의 모델이기도 하죠.
00:03:54그리고 이를 효율적으로 만들기 위한 기술인 미니맥스 스파스 어텐션(Minimax Sparse Attention)을 개발하여 널리 공개하고 공유하셨는데요,
00:04:04이 기술과 어텐션 메커니즘을 통해 어떻게 긴 컨텍스트를 구현하게 되었는지 프로젝트 과정에 대해 조금 말씀해 주시겠어요?
00:04:11긴 컨텍스트에 대한 이야기는 미니맥스 M1이나 미니맥스 01 시절까지 거슬러 올라간다고 볼 수 있습니다. 당시 모델도 1,000만 토큰 컨텍스트 작업을 처리할 수 있었죠.
00:04:251,000만 토큰이요. 네, 1,000만 토큰이었습니다. 하지만 그때는 에이전트 모델이 아니었죠. 예를 들어 책 한 권을 통째로 넣으면 그에 대한 리뷰를 제공하는 등의 작업만 가능했습니다.
00:04:37그래서 우리가 깨달은 것은 더 긴 컨텍스트가 특히 사용자와 상호작용할 때 엄청난 잠재력을 열어준다는 점이었습니다.
00:04:47이제 에이전트가 전체 환경과 상호작용하고 모든 도구 응답을 받아오며 여러 차례 대화를 거듭할 때, 짧은 컨텍스트로는 복잡한 작업을 수행하기에 충분하지 않습니다.
00:05:03그래서 이번 버전에서는 반드시 더 긴 컨텍스트를 부활시켜야겠다고 다짐했습니다.
00:05:09그래서 저희가 추구한 것은 확장 가능하고 단순한 구조를 가진 미니맥스 스파스 어텐션(Sparse Attention)이었습니다.
00:05:23조금 더 높은 관점에서 말씀드리면, 문맥에서 무엇이 더 중요한지를 상위 수준에서 선택해 주는 인덱스 분기가 있고요.
00:05:36그다음에 선택된 블록을 대상으로 실제 연산을 수행하는 Sparse Attention 분기가 있습니다.
00:05:44이런 식으로 길이를 확장하고 향후 모델 크기까지 함께 확장할 수 있는 우아한 아키텍처를 설계했습니다.
00:05:57정말 멋지네요. 이 분야에 꽤 오래 몸담았던 분들이라면 공감하시겠지만, 과거에는 어텐션 연구가 정말 많았습니다.
00:06:03이 $N^2$ 문제와 수많은 선형 어텐션 연구들 말이죠.
00:06:06맞습니다.
00:06:06그러다 어느 순간 이 모든 게 자취를 감췄죠.
00:06:09플래시 어텐션(Flash Attention)이 등장하면서 더 효율적인 커널만 있으면 된다는 사실을 깨달았습니다.
00:06:13그리고 이제 다시 제1원칙으로 돌아가 '어텐션이란 무엇인가?', '어떻게 하면 더 효율적으로 만들 수 있는가?'를 고민하게 된 점이 참 마음에 듭니다.
00:06:18어떻게 효율성을 높일 수 있을까요?
00:06:20100만 토큰은 정말 엄청나죠. GPT-2는 1,024 토큰이었고 모두가 “와, 정말 크다. 이 이상은 절대 필요 없을 거야”라고 생각했었는데요.
00:06:28앞으로 이 기술이 어디까지 발전할 거라고 보시나요? 제프 딘(Jeff Dean)은 언젠가 저에게 1조 토큰 어텐션 이야기를 하더군요.
00:06:351조 토큰 어텐션으로 나아 가야 한다고 생각하시나요?
00:06:38초장문 컨텍스트를 향해 분명 탐구해 볼 수 있는 방향입니다.
00:06:45매우 흥미로운 탐구 주제이며, 아키텍처 설계와 하드웨어가 결합되어 많은 연구가 필요한 영역입니다.
00:06:54그렇군요.
00:06:55아직도 쉽게 달성할 수 있는 목표들이 많이 남아 있다고 보시나요?
00:06:57오늘날 오픈AI가 어텐션 주변의 더 효율적인 처리를 통해 추론 비용을 절반으로 줄인 것처럼 말입니다. 구체적인 방법은 알 수 없지만요.
00:07:08처리 방식을 개선함으로써 얻을 수 있는 저효율 고성과의 기회가 아직도 많이 남아 있다고 생각하시나요?
00:07:14M3에 대해 여전히 매우 흥미로운 점 중 하나는 특히 이 스파스 어텐션 덕분에, 혹은 모델 자체가 작으면서도 매우 효율적이기 때문에 비용이 무척 저렴하다는 것입니다.
00:07:22맞습니다.
00:07:23훨씬 더 멀리 나아갈 수 있을까요?
00:07:25미니맥스 스파스 어텐션은 어떻게 발명하게 되었나요?
00:07:29AI 에이전트가 아이디어를 냈나요?
00:07:31아니면 여전히 사람이 직접 생각해 낸 것인가요?
00:07:33이와 관련해 조금 이야기해 주세요.
00:07:35네.
00:07:36모델을 더욱 효율적으로 만들기 위해 아키텍처와 추론 최적화 분야에는 아직도 투입할 수 있는 작업이 많다고 생각합니다. 특히 작업 민감도가 높으면서도 강력한 능력이 요구되는 작업의 경우 모델이 효율적으로 작동하기를 원하니까요.
00:07:52그러한 종류의 작업에서는 모델이 반드시 효율적이어야 합니다.
00:07:56그럼 이 부분은 누가 생각해 낸 건가요?
00:07:59사실 저희 팀의 인턴 분이 작업했습니다.
00:08:02저도요.
00:08:03아직 인턴은 아니지만요.
00:08:04일부 연구소에서는 인턴들이 데이터나 핵심 업무 등에 접근할 권한이 없는 경우가 많기 때문에 그런 일은 잘 일어나지 않죠.
00:08:15하지만 저희는 모델에 기여하고 싶은 사람이라면 누구에게나 열려 있습니다.
00:08:20따라서 해당 아키텍처는 실제로 인턴이 설계한 것입니다.
00:08:23정말 좋네요.
00:08:24인턴들에게도 여전히 기회가 있는 곳이군요.
00:08:26좋은 소식이네요.
00:08:27이는 미니맥스가 내부적으로 어떻게 일하는지와도 잘 연결되는 대목입니다.
00:08:32무대 위에 오르기 전에도 누구나 프로젝트를 제안할 수 있다고 이야기 나눴었죠.
00:08:37조직이 어떻게 구성되어 있고 연구를 어떻게 진행하시는지 조금 말씀해 주시겠어요?
00:08:41학교나 기존의 테크 기업들과는 사뭇 다른 방식인 것 같습니다.
00:08:49꽤 많이 다르죠.
00:08:51꽤 다릅니다.
00:08:53저희가 확실히 챙기는 부분은 누구나 모델을 가지고 놀아볼 수 있고 모델의 어떤 점을 개선할 수 있을지 고민해 볼 수 있도록 튼튼한 기반과 인프라를 제공하는 것입니다.
00:09:04그리고 모델 출시가 끝난 후 여유가 생기면 자유롭게 모델을 다뤄보죠.
00:09:07자체적으로 평가를 진행해 볼 수도 있고요.
00:09:13스스로 약점을 찾아내어 모델에서 개선하고 싶은 부분을 제안할 수 있습니다.
00:09:15그러면 그 아이디어에 관심 있는 다른 사람들이 프로젝트 참여를 제안하게 됩니다.
00:09:21그렇게 몇 주 혹은 몇 달 동안 함께 일하게 되죠.
00:09:26결과물이 완성되면 최종적으로 우리 모델에 탑재됩니다.
00:09:29최종 훈련 과정에 반영되어 사용자들에게 배포되는 식이죠.
00:09:33흥미롭네요.
00:09:39그렇다면 프로젝트에 꽤 오랜 시간 동안 매달리는 사람들도 있겠군요.
00:09:39몇 달이라고 하면 가능성에 대한 정말 깊이 있는 탐구가 이루어질 수 있겠어요.
00:09:42네, 맞습니다.
00:09:46예를 들어 아키텍처 연구 같은 경우는 조사, 연구, 실험, 심지어 사전 훈련 평가를 다시 수행하는 과정까지 포함하여 더 긴 시간이 소요될 수 있습니다.
00:09:47그렇죠.
00:09:53따라서 더 오랜 시간이 걸릴 수 있습니다.
00:09:57정말 멋진 방식이네요.
00:09:58네.
00:10:00그리고 평가(Evaluation) 분야에도 매우 공을 들이고 계신 것으로 알고 있습니다.
00:10:01동의합니다.
00:10:02그 점에 대해서도 이야기 나눌 수 있겠네요.
00:10:03그와 아마 관련이 있을 법한 한 가지 특징은 M3와 팀이 지닌 멀티모달리티의 독보적인 특성입니다.
00:10:04멀티모달리티요.
00:10:05즉 텍스트뿐만 아니라 이 모델은 이미지와 비디오도 이해할 수 있다는 점이죠.
00:10:11제가 이해하기로는(더 잘 설명해 주시겠지만), 허깅 페이스의 모델 카드를 읽어보면
00:10:12사후에 멀티모달을 덧붙인 게 아니라 첫 단계부터 멀티모달로 훈련되었다고 나와 있습니다.
00:10:16제가 이해하기로는, 허깅 페이스의 모델 카드를 읽어보면—더 잘 설명해 주시겠지만—
00:10:21이 모델은 단순히 나중에 기능을 붙인 게 아니라, 첫 단계부터 멀티모달로 학습되었다고 나와 있거든요.
00:10:26그 점에 대해 조금 더 자세히 설명해 주시겠어요? 왜 그것이 중요하며, 왜 사후 훈련이 아니라 첫 단계부터 멀티모달 훈련을 시작하게 되었는지 말씀해 주세요.
00:10:27저희는 이를 네이티브 멀티모달리티(Native Multimodality)라고 부릅니다.
00:10:28대개의 모델 랩에서는 텍스트 사전 훈련을 마친 후에 비디오 이해 같은 멀티모달 능력을 훈련하는 것이 일반적입니다.
00:10:33어댑터를 부착하고 해당 부분을 훈련하는 식이죠.
00:10:37하지만 저희가 발견한 것은 그런 방식이 오히려 텍스트 성능을 저해한다는 점이었습니다.
00:10:41모델이 텍스트 이해 쪽으로만 수렴하려 하기 때문에 비디오 이해 성능도 그다지 잘 수렴하지 않았습니다.
00:10:50가장 최적의 방법도 아니고 확장 가능성이 높은 방법도 아닙니다.
00:10:54생각해 보면 우리는 데이터를 확장하고 싶어 하니까요.
00:10:57또한 일부 랩에서는 사전 훈련을 절반쯤 진행한 시점에 이러한 능력을 훈련하기도 합니다.
00:11:02예를 들어 연속 사전 훈련(Continued pre-training) 같은 방식이죠.
00:11:08하지만 저희가 발견한 바로는 이 방법 역시 레시피에 매우 민감합니다.
00:11:11아키텍처가 다르고, 데이터 혼합 비율이 다르고, 학습률이 다르면 레시피도 달라져야 합니다.
00:11:17통제하기 어렵고 실험 결과와 결론을 더 큰 모델로 확장하기가 쉽지 않습니다.
00:11:20그래서 저희가 생각한 것은 '그냥 처음 단계부터 훈련하면 어떨까?'였습니다.
00:11:27그게 가장 자연스러운 방법이니까요.
00:11:29많은 랩들이 그렇게 하다가 문제에 봉착한다는 것을 알고 있습니다.
00:11:35텍스트와 비디오 이해 모두 훈련을 몇 단계 거치고 나면 모델이 붕괴해 버리죠.
00:11:41하지만 저희는 그 문제를 해결해 냈습니다.
00:11:43IT 분야에서 많은 작업을 수행했고, 실제로 훈련하는 데이터 측면에서도 많은 노력을 기울였습니다.
00:11:52예를 들어 인터리브 데이터(Interleaved data)라고 부르는 데이터를 활용합니다.
00:11:54실제 자연 데이터이되, 이미징과 비디오를 마스킹 처리하여 지우는 대신 그대로 유지합니다.
00:12:01그리고 데이터에 대해 매우 훌륭한 정제와 마스킹 작업을 거칩니다.
00:12:03또한 매우 우수한 리워드 모델링을 수행하여 첫 단계부터 훈련을 시작하고 규모를 대폭 확장할 수 있었습니다.
00:12:07네, 모델이 붕괴하지 않죠.
00:12:15정말 인상적이네요.
00:12:18인상적입니다.
00:12:26앞으로 훨씬 더 큰 모델을 기대해도 될까요?
00:12:30이 모델은 여전히 꽤 작은 편이니까요.
00:12:38데이터에 대해 꽤 훌륭한 정제 및 마스킹 작업을 거치고,
00:12:42첫 단계부터 모델을 학습시키고 크게 확장할 수 있도록 매우 뛰어난 보상 모델링을 수행합니다.
00:12:50네, 붕괴 현상이 일어나지 않죠.
00:12:52정말 인상적이네요.
00:12:53인상적이에요.
00:12:54앞으로 훨씬 더 큰 모델을 기대해도 될까요?
00:12:57이 모델은 아직 비교적 작은 편이죠?
00:12:59총 4,280억 파라미터에 활성 파라미터는 230억 개입니다.
00:13:04그럼 1조 파라미터를 넘어설 것으로 보시나요?
00:13:08당연합니다.
00:13:09네, 미래에는 분명 그렇게 될 겁니다.
00:13:12더 작은 파라미터로는 모델이 아주 잘 수행해내지 못하는 작업들이 여전히 많거든요.
00:13:21확실히 지금보다 더 원대한 목표를 향해 나아가고 있습니다.
00:13:25정말 좋네요.
00:13:26기대되네요.
00:13:27그리고 미니맥스에 대해 제가 항상 매력적으로 느끼는 또 다른 흥미로운 점은 다양한 앱과 제품군도 함께 보유하고 계시다는 것인데요, 맞죠?
00:13:36기억하기로 미니맥스는 작년 1월에 이미 허깅 페이스 플랫폼에서 오픈소스 공개를 시작했습니다.
00:13:43그러니까 18개월 전이네요.
00:13:45팀과 조금 이야기를 나누면서 어떤 작업을 하고 계시는지 파악해 보기도 했고요.
00:13:48기억에, 이러한 앱 중 일부는 이미 엄청난 사용량을 기록하고 계셨습니다.
00:13:54이 일이 어떻게 시작되었는지 조금 말씀해 주실 수 있나요?
00:13:57기본적으로 앱이 아주 많았고, 그러다 '우리에게 이 모든 데이터가 있네,' 하고 생각하신 건가요?
00:14:02'모델을 학습시키는 건 어떨까?' 하구요.
00:14:03그러고 나서 연구 팀을 꾸리신 건지요.
00:14:05거기엔 어떤 이야기가 담겨 있나요?
00:14:07저희의 이야기는 첫날부터 모델 중심이었습니다.
00:14:11멀티모달 모델, 즉 모든 비전을 이해하고 모든 양식으로 출력할 수 있는 모델이야말로,
00:14:19회사가 시작되기도 전인 첫날에 CEO께서 계획하셨던 첫 번째 목표였습니다.
00:14:25즉 그것이 AGI라는 꿈이었죠.
00:14:27ChatGPT가 나오기도 전인 아주아주 이른 시기였다고 생각합니다.
00:14:30와.
00:14:31네.
00:14:32그리고 앱은 자연스럽게 따라오게 된 것입니다.
00:14:35모델 역량이 갖춰지면 사람들에게 이를 잘 경험하게 해주고 싶어지니까요.
00:14:40API로 모델을 사용할 수 있는 사람은 그리 많지 않잖아요, 그렇죠?
00:14:43모두가 API로 경험할 거라고 기대할 수는 없습니다.
00:14:46그래서 좋은 사용자 상호작용 인터페이스, 훌륭한 앱, 그리고 사람들이 모델을 경험할 수 있는 좋은 시나리오들이 필요합니다.
00:14:57실제로 그러한 앱들이 전 세계 200여 개국의 3억 명이 넘는 사람들에게 서비스되었다고 생각합니다.
00:15:06그리고 100만 개가 넘는 기업에서도 쓰이고 있고요.
00:15:09네.
00:15:10그 규모를 전해 들었을 때 정말 놀라웠습니다.
00:15:12이러한 유형의 사용 규모가 얼마나 큰지 우리는 종종 실감하지 못하죠.
00:15:17그러다 보니 자연스럽게 오픈소스 비즈니스 모델 등에 대한 질문으로 이어지게 되는데요, 항상 존재하는 의문이기도 하죠. 당장은 모델을 오픈소스화하는 게 좋지만, 어느 정도 수익원도 확보해야 하잖아요?
00:15:33그래서 M3 같은 모델은 무료로 제공하기로 결정하셨던 것 같고요.
00:15:38세상에 아주 훌륭한 일이라고 생각합니다.
00:15:41이 부분을 어떻게 보시나요?
00:15:42앱을 위해 사용하는 특정한 모델도 따로 갖고 계신가요?
00:15:45앞으로도 모델을 계속 오픈소스화할 거라고 생각하시나요? 확실하게 단언하기는 어렵겠지만요.
00:15:52현재 오픈소스 생태계의 분위기는 어떤가요?
00:15:55개인적으로나 모델 연구 팀의 입장에서도, 저희는 항상 모델을 오픈소스화하기를 희망합니다.
00:16:01그것이 저희 계획입니다. 오픈소스 커뮤니티가 힘을 모아 모델을 더 훌륭하게 만드는 데 어떻게 기여할 수 있는지 진심으로 목격하고 있기 때문이죠.
00:16:09예를 들어, 훌륭한 커뮤니티로부터 모델 성능에 대한 피드백을 많이 받고, 저희가 오픈소스화한 것들에 대해 풀 리퀘스트(PR)도 받습니다, 그쵸?
00:16:20그 내용들은 정말 소중하며 이후 버전에 반영됩니다.
00:16:24그러므로 오픈소스화는 분명 훌륭한 일입니다.
00:16:27정말 좋네요.
00:16:28혹시 M3나 미니맥스를 사용하는 청중들에게 특별히 바라는 점이 있으신가요?
00:16:33피드백으로 꼭 보내주었으면 하는 부분이 있으신가요?
00:16:37예를 들어 사람들이 모델을 수정하거나 이것저것 만져보고 조율할 때 그런 내용을 읽어보시나요?
00:16:43아니면 향후 모델을 위해 커뮤니티로부터 얻을 수 있는 가장 좋은 점은 무엇이라고 생각하시나요?
00:16:51사람들이 마주치는 문제점들이라면 무엇이든 좋다고 말하고 싶습니다. 특히 멀티모달리티와 관련된 부분이요.
00:16:57여러 요소를 함께 결합하는 것은 이번이 처음입니다.
00:16:59앞으로 이 분야에서 훨씬 더 원대한 목표를 향해 나아갈 것입니다.
00:17:03지금은 일부 결함이 있을 수도 있지만 계속 개선해 나가는 중입니다.
00:17:06따라서 모델 성능이 그리 좋지 않다는 피드백이 있다면 향후 버전에서 반드시 개선하겠습니다.
00:17:13그리고 사용자들이 원하는 기능도 마찬가지입니다.
00:17:17예를 들어, '추론 노력(thinking effort)' 같은 기능 말이죠.
00:17:21어떤 분들은 그런 것을 요구하기도 합니다.
00:17:23누구나 요청할 수 있으며, 향후 모델에서는 이를 구현하기 위해 노력할 것입니다.
00:17:28네.
00:17:29코딩 에이전트 측면에서 멀티모달리티를 이미 활용하는 사용자가 많다고 보시나요?
00:17:33아직 조금은 탐구 단계에 머물러 있는 느낌입니다.
00:17:37맞습니다.
00:17:38정말 그렇습니다.
00:17:39하지만 실제로 많은 역량과 다양한 에이전트 애플리케이션을 끌어낼 수 있습니다.
00:17:47예를 들어, 모델이 파워포인트를 읽기를 원한다고 해봅시다.
00:17:51혹은 구조화되지 않은 몇 가지 보고서를 읽게 하고 싶을 수도 있겠죠.
00:17:55그리고 아주 긴 영상을 이해하기를 원할 수도 있구요.
00:17:58가령 긴 재생 영상 시청을 마친 뒤, 모델이 내용을 이해하고 어떤 도구들을 사용해 행동하기를 원할 수 있습니다.
00:18:07그렇게 되면 매우 다양한 에이전트 사용 사례가 열리게 됩니다.
00:18:12그럼 에이전트가 마침내 제 유튜브 튜토리얼을 시청하고 코딩 도구 사용법이나 제 설명 방식을 이해할 수 있게 된다는 뜻인가요?
00:18:18대략 그런 식인가요?
00:18:19어?
00:18:20에이전트가 마침내 유튜브 튜토리얼을 시청하고 그로부터 무언가를 이해할 수 있게 될까요?
00:18:24네.
00:18:25네.
00:18:26그렇다고 생각합니다.
00:18:27내부적으로 에이전트 코딩 도구를 많이 사용하시나요?
00:18:30코딩은 당연하겠지만, 연구 측면에서도 이미 도입되어 있나요?
00:18:34자동화되어 있나요?
00:18:35네.
00:18:36어느 정도는요?
00:18:37아니면 아닌가요?
00:18:38이게 어떻게 작동하는 건가요?
00:18:39네.
00:18:40저희만의 연구 하네스를 가지고 있습니다.
00:18:42워크플로를 자동화하는 자체 연구 하네스를 구축해 사용하죠.
00:18:46워크플로의 상당 부분이 자동화되어 있다고 말씀드릴 수 있습니다.
00:18:49최신 프런티어 모델들이 모두 기능 없는 커널 최적화를 추구하는 방식을 보면 아실 수 있을 겁니다, 그렇죠?
00:18:57모델이 다른 모델을 평가하도록 두는 것처럼 말이죠.
00:19:00모델이 데이터를 구축하고, 자동 데이터를 만들게 하는 식입니다.
00:19:05M3를 포함하여 점점 더 많은 모델들이 그러한 작업을 수행할 수 있게 되는 것을 보실 수 있습니다.
00:19:10실제로 저희는 그러한 사례들, 즉 더 긴 호흡의 작업과 커널 최적화에 매우 능숙했습니다.
00:19:16그래서 이러한 모델 역량을 활용하고 함께 결합하여 일상적인 루틴을 돕고,
00:19:24반복 주기를 훨씬 더 빠르게 만들 수 있습니다.
00:19:26그럼 M3 팀은 벌써 M4를 만들고 있나요?
00:19:30M3.1을 만들고 있습니다.
00:19:31M3.1이요?
00:19:32네.
00:19:33알겠습니다.
00:19:34아직 거기는 아니군요.
00:19:35벌써부터요.
00:19:36다가올 몇 달 동안 어떤 점이 기대되는지 이야기하며 마무리하고 싶습니다.
00:19:41어떻게 생각하시나요?
00:19:42기능적인 측면이나 AI 분야에서 일어나기를 바라는 변화, 혹은 더 넓은 의미에서
00:19:49정말 마음속에 가장 크게 자리 잡고 있어서 일어날 것 같은 일들이라면 무엇이든 좋습니다.
00:19:54흥미로운 일이 아주 많죠.
00:19:58하지만 최근에 가장 흥미롭게 느끼는 점은 멀티 에이전트입니다. 많은
00:20:04AI 애플리케이션이 모델 라우팅과 멀티 에이전트를 활용하고 있으며, 그것이 훨씬 더 많은 역량과
00:20:11더욱 복잡한 작업을 가능하게 해주기 때문입니다.
00:20:13또한 모델이 할 수 있는 일과 할 수 없는 일이 무엇인지 알려주기도 하죠.
00:20:19그 덕분에 정말 다양한 일들을 해낼 수 있습니다.
00:20:22상당히 흥미진진합니다.
00:20:24앨라이브, 정말 감사합니다.
00:20:25모시게 되어 기뻤습니다.
00:20:26초대해 주셔서 감사합니다.
00:20:27모두 감사드립니다.
00:20:28모두 감사드립니다.
00:20:29모두 감사드립니다.
00:20:29감사합니다.
00:20:29모두 감사드립니다.

핵심 요약

미니맥스는 100만 토큰 컨텍스트와 네이티브 멀티모달 능력을 갖춘 4,000억 파라미터 모델 M3를 통해 에이전트 성능을 확장하고 있다.

하이라이트

  • 미니맥스의 최신 모델 M3는 4,000억 개의 총 파라미터와 200억 개의 활성화 파라미터를 탑재하고 있다.

  • M3는 미니맥스 스파스 어텐션(MSA) 아키텍처를 적용하여 100만 토큰의 초대형 컨텍스트를 지원한다.

  • M3는 텍스트뿐만 아니라 비디오와 이미지까지 처음 단계부터 학습된 네이티브 멀티모달 모델이다.

  • 미니맥스의 애플리케이션은 전 세계 200여 개국의 3억 명이 넘는 사용자에게 서비스되고 있다.

  • 인턴 연구원이 직접 미니맥스 스파스 어텐션 아키텍처를 설계했다.

타임라인

미니맥스 M3 모델의 구조와 특징

  • M3는 총 파라미터 4,000억 개와 활성화 파라미터 200억 개로 구성된다.
  • 이 모델은 코딩 능력뿐만 아니라 비디오와 이미지 이해 능력을 동시에 제공한다.
  • 미니맥스 스파스 어텐션(MSA) 기술을 통해 100만 토큰의 초대형 컨텍스트를 효율적으로 처리한다.

이 모델은 기존 오픈소스 모델들이 갖추지 못한 시각적 이해와 코딩 능력을 결합했다. 새로운 아키텍처인 미니맥스 스파스 어텐션을 도입하여 복잡한 에이전트 작업에 필요한 긴 컨텍스트 처리를 구현했다.

스파스 어텐션 아키텍처의 개발과 조직 문화

  • 이전 모델인 M1 시절부터 1,000만 토큰 컨텍스트 작업을 처리한 경험이 아키텍처 개발의 기반이 되었다.
  • 인덱스 분기와 스파스 어텐션 분기를 결합한 단순하고 확장 가능한 구조를 설계했다.
  • 미니맥스에서는 인턴 연구원이 직접 이 스파스 어텐션 아키텍처를 설계했다.

에이전트가 전체 환경과 상호작용하고 도구 응답을 처리하려면 긴 컨텍스트가 필수적이다. 미니맥스는 누구나 모델 개선에 기여할 수 있는 열린 연구 환경을 제공하여 인턴이 핵심 아키텍처를 설계할 수 있도록 지원했다.

네이티브 멀티모달리티와 사전 훈련 방식

  • M3는 사후에 멀티모달 기능을 덧붙인 것이 아니라 처음 단계부터 멀티모달로 학습되었다.
  • 사후 어댑터 부착 방식은 텍스트 성능을 저해하고 모델 붕괴를 유발한다.
  • 인터리브 데이터와 우수한 리워드 모델링을 활용하여 모델 붕괴 없이 대규모 확장을 달성했다.

대다수의 랩에서 사용하는 연속 사전 훈련 방식은 레시피에 매우 민감하고 붕괴 현상을 일으킨다. 미니맥스는 비디오와 이미지를 지우지 않고 유지하는 자연스러운 인터리브 데이터와 정제 작업을 통해 첫 단계부터 멀티모달 학습을 성공시켰다.

제품 생태계와 오픈소스 전략

  • 미니맥스의 애플리케이션은 전 세계 200여 개국 3억 명의 사용자와 100만 개 이상의 기업에서 사용된다.
  • 오픈소스 커뮤니티로부터 받은 피드백과 풀 리퀘스트는 모델의 후속 버전을 개선하는 데 핵심적인 역할을 한다.
  • 향후 연구에서는 멀티 에이전트와 모델 라우팅을 결합하여 더욱 복잡한 작업을 수행할 예정이다.

회사의 첫날부터 AGI를 목표로 멀티모달 모델 중심의 계획을 세웠으며, 사용자가 모델을 직접 경험할 수 있도록 다양한 앱을 함께 제공하고 있다. 커뮤니티와의 협력을 통해 모델 성능을 지속적으로 보완하고 다음 버전인 M3.1 개발을 진행 중이다.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기