스크립트
00:00:00전직 OpenAI CTO인 미라 모레티가 설립한 120억 달러 규모의 스타트업 Thinking Machines가
00:00:05첫 번째 모델을 출시했습니다. 9,750억 개의 매개변수를 갖추고 있으며 아파치 2.0 라이선스로 제공되고, 가중치는 모두
00:00:12허깅 페이스에 공개되어 누구나 다운로드할 수 있습니다. 앤스로픽 같은 프런티어
00:00:17랩스 제품들과 경쟁하는 것은 아니며, 실제 목표는 자사 플랫폼인
00:00:22Tinker를 통해 특정 목적에 맞게 세밀하게 조정(파인튜닝)되는 것입니다.
00:00:25따라서 매우 특정한 작업에 특화된 모델이 필요하다면
00:00:29이 모델이 정확히 찾던 것일 수 있습니다. 오늘은 이 모델을 특별히 사용해야 하는 이유와
00:00:35파인튜닝이 필요한 모든 이유를 다뤄보겠습니다. 그리고 이 모델이 오디오와 시각 정보를 처리하는
00:00:40매우 흥미로운 방식이 있는데, 이는 전에 본 적 없는 방식입니다. 계속 시청해 주시면
00:00:44이 영상에서 그 부분도 다루겠습니다. 저희 채널에서는 AI 관련 소식을 지속적으로 다루고 있으니
00:00:52Thinking Machines는 신규 모델이 시중의 일반적인 범용 모델만큼 강력하지는 않다는 사실을
00:00:57출시 게시글에서 매우 솔직하게 밝혔습니다. 즉, 기대치를 조절하고 있는 것이며
00:01:01벤치마크 결과에서 그 이유를 확인할 수 있습니다. 지시 이행 능력 부문에서는 GLM 5.2를 상회하지만
00:01:07(79.8점 대 73.3점), 에이전트가 직접 작업을 수행하는 터미널 벤치에서는 63.8점 대 82.7점으로
00:01:14큰 차이로 뒤처집니다. 즉, 지시를 따르는 것은 잘하지만 스스로 문제를 해결하는 능력은 다소 약합니다.
00:01:21하지만 파인튜닝을 염두에 두고 있다면 훌륭한 출발점입니다. 내부 구조는 전문가 혼합(MoE) 방식으로 되어 있습니다.
00:01:27총 9,750억 개의 파라미터가 있지만, 각 레이어에는 256개의 고유 전문가가 존재하며 각 토큰은
00:01:35그중 6개에만 전달됩니다. 즉, 어떤 시점이든 약 410억 개의 파라미터만 실제로 작동하게 됩니다.
00:01:41또한 멀티모달 모델입니다. 이미지, 텍스트, 오디오가 모두 입력되며 처리 방식은
00:01:47기존에 보았던 어떤 모델과도 크게 다릅니다. 일반적으로 모델이 오디오를 처리할 때는
00:01:52언어 모델 앞에 별도의 음성 모델이 있어서 텍스트로 변환한 다음
00:01:56그 텍스트를 언어 모델에 전달합니다. 이미지도 마찬가지 방식으로 작동합니다. 비전 인코더가 사진을 보고
00:02:02이미지에 대한 설명을 생성한 뒤 이를 언어 모델에 전달하는 식입니다.
00:02:07물론 이 과정에서 어느 정도 데이터 손실이 발생할 수밖에 없습니다.
00:02:11반면 Inkling은 그런 과정을 거치지 않습니다. 오디오는 스펙트로그램 형태로 곧바로 입력되어
00:02:16소리의 원시 주파수 대역이 여러 구간으로 나뉩니다. 이미지 역시 40x40 픽셀 패치로 직접 입력됩니다. 두 데이터 모두
00:02:23텍스트 토큰이 존재하는 동일한 공간에 직접 배치되며 모델이 이들을 함께 처리합니다. 따라서 어떤 정보도
00:02:28텍스트로 압축되어 뭉개지지 않습니다. 이론적으로 오디오와 시각 자료를 처리할 때
00:02:35Inkling 모델을 사용하면 데이터 손실과 압축을 훨씬 줄일 수 있습니다. 실제로 원시 오디오를
00:02:40지원하지 않는 대부분의 일반적인 범용 모델과 비교할 때 Inkling은 확실히 차별화됩니다. 이제 파인튜닝을
00:02:46해야 하는지 여부는 사용자의 구체적인 목표에 따라 결정됩니다. 일반적인 경험 법칙에 따르면
00:02:50파인튜닝은 무엇을 알아야 하는지가 아니라 어떻게 대답해야 하는지를 모델에 가르치는 것입니다.
00:02:57예를 들어, 어조나 엄격한 구조화된 출력의 경우 프롬프트에 수천 개의 예시를 넣는 것은 비현실적이므로
00:03:02모델의 출력을 유도하기 위해 수천 개의 예시가 필요할 때 유용합니다. 또한 비용 및 지연 시간 측면에서
00:03:08범용 모델로 좁은 범주의 작업을 수행하는 것보다 더 작은 모델을 파인튜닝하는 것이 비용 면에서 훨씬 유리합니다.
00:03:13기본적으로 적절한 출력을 얻기 위해 수천 개의 예시가 필요한 상황이라면
00:03:18파인튜닝을 통해 이점을 얻을 수 있습니다. 하지만 모델이 모르는 정보를 알게 해야 한다면 파인튜닝을 하지 마세요.
00:03:23실제로 검색(RAG)과 파인튜닝을 비교한 유명 논문이 있는데, 검색 방식이 일관되게 우수한 결과를 보였습니다.
00:03:28그리고 더 나은 추론 능력을 원한다면 파인튜닝이 오히려 모델의 사고 과정을 저하시켜 역효과를 낼 수 있습니다.
00:03:34흥미롭게도 더 작은 모델일수록 이 피해가 가장 큽니다. 하지만 특정한 좁은 업무의 경우 파인튜닝의 결과가 훌륭할 수 있습니다.
00:03:40로펌을 위한 AI 도구를 만드는 Harvey의 사례를 보면, 법률 문서에서 인용구를 추출하도록 소형 모델을 학습시켰습니다.
00:03:46그들은 분류 모델의 성능을 평가하는 지표인 F1 점수를 측정했습니다.
00:03:52파인튜닝을 거친 후 점수가 0.56에서 0.68로 상승했습니다.
00:03:58GPT-4o와의 맞대결에서는 소형 모델이 93%의 확률로 승리하거나 동률을 기록했으며 실행 속도도 더 빨랐습니다.
00:04:07Thinking Machines는 Inkling이 알파벳 'E'를 절대 사용하지 않도록 강제하는 데모도 보여줍니다.
00:04:12Tinker를 통해 모델이 스스로를 파인튜닝하도록 지시할 수 있습니다. 그러면 모델이 직접 학습 데이터셋을 만들고
00:04:18완전 자동화된 방식으로 전체 파인튜닝 프로세스를 실행할 수 있습니다.
00:04:24그 결과로 심각한 'E' 공포증이 생긴 모델이 탄생하지만, 신기하게도 응답은 여전히 말이 됩니다.
00:04:29하지만 여기서 모델 전체를 다시 학습시키는 것은 아닙니다. LoRa라는 기술을 사용하는데,
00:04:32이는 저랭크 적응(Low-Rank Adaptation)을 의미합니다. 모델 전체를 학습시키는 대신, LoRa는 기존 가중치를 고정하고
00:04:38가볍고 작은 행렬을 주입하여 새로운 특정 데이터를 학습합니다.
00:04:44이는 모델 전체를 파인튜닝하는 것에 비해 사후 학습 비용과 속도 측면에서 큰 이점을 제공하며,
00:04:49그렇지 않았다면 비현실적이었을 작업을 가능하게 합니다. 현재 Tinker는 Qwen, Kimi, DeepSeek, NVIDIA의
00:04:55NemoTron, OpenAI의 GPT OSS 같은 여러 오픈 모델을 지원합니다. 그중 Inkling은 가격이 꽤 비싼 편인데, 왜 굳이 이걸 써야 할까요?
00:05:02이유는 두 가지가 있으며, 이미 앞서 조금 다루었습니다. 첫 번째는 오디오입니다.
00:05:06플랫폼 상의 모든 모델 중에서 Inkling만이 유일하게 오디오를 직접 입력받습니다. 많은 모델이 이미지를 처리할 수 있고,
00:05:11Kimi와 대부분의 Qwen 모델이 비전 처리를 잘 해내지만, 원시 사운드를 실제로 처리할 수 있는 모델은
00:05:16단 하나도 없습니다. 또한 음성 인식 및 말하기 스타일 분류 같은
00:05:20세 가지 쿡북 레시피도 함께 제공됩니다. 덕분에 모델은 단순히 무엇이 말해졌는가뿐만 아니라 어떻게 말해졌는지까지 알려줄 수 있습니다.
00:05:26또한 구술 처방을 학습하여 다른 모델이라면 엉망으로 처리했을 약물 이름을 인식하는 의료 분야 예시도 있습니다.
00:05:31두 번째는 사고 강도(Thinking Effort)입니다. Inkling은 모델이 얼마나 깊게 생각할지 0에서 1 사이의 숫자로 설정할 수 있게 해줍니다.
00:05:36대부분의 모델은 2~3개의 설정 스위치만 제공합니다. 예를 들어 GPT OSS는 낮음, 중간, 높음을 제공하지만
00:05:42Inkling은 전체 슬라이더를 제공합니다. 그렇다면 가장 중요한 질문은 과연 이 모델을 실제로 사용해야 할까 하는 점입니다.
00:05:47글쎄요, 모델을 순정 상태 그대로 실행하고 싶다면 아마 이 모델이 아닐 것입니다.
00:05:52그 점에 대해서는 개발사들도 명확히 밝히고 있습니다. 하지만 좁고 대량인 업무를 맡고 있고,
00:05:56실제 라벨링된 데이터와 출력을 평가할 수 있는 방법이 있다면, 작고 오픈된 모델을 파인튜닝하는 것은
00:06:02현재 가장 저평가된 작업 방식 중 하나입니다. 그리고 Tinker 같은 플랫폼이 있어서 훨씬 더 수월해졌습니다.
00:06:07Inkling이 여러분에게 적합한 모델인지는 결국 무엇을 입력하느냐에 달려 있습니다.
00:06:11오디오를 입력해야 한다면 Inkling이 강력한 선택지이며, 현재 Tinker에서 원시 오디오를 지원하는 모델은 이것뿐입니다.
00:06:16그리고 현재 최고의 오픈 소스 범용 모델을 찾고 계신다면, 저희가 방금 Kimi K3에 대한 영상을 업로드했으니
00:06:21그 영상을 시청하시면 놀라운 결과를 확인하실 수 있을 것입니다. 그 외에는
00:06:26시청해 주셔서 감사합니다. BetterStack의 워렌이었으며 다음 영상에서 뵙겠습니다.