Inkling: 파인튜닝을 위해 태어난 오픈 웨이트 모델

BBetter Stack
컴퓨터/소프트웨어창업/스타트업AI/미래기술

스크립트

00:00:00전직 OpenAI CTO인 미라 모레티가 설립한 120억 달러 규모의 스타트업 Thinking Machines가
00:00:05첫 번째 모델을 출시했습니다. 9,750억 개의 매개변수를 갖추고 있으며 아파치 2.0 라이선스로 제공되고, 가중치는 모두
00:00:12허깅 페이스에 공개되어 누구나 다운로드할 수 있습니다. 앤스로픽 같은 프런티어
00:00:17랩스 제품들과 경쟁하는 것은 아니며, 실제 목표는 자사 플랫폼인
00:00:22Tinker를 통해 특정 목적에 맞게 세밀하게 조정(파인튜닝)되는 것입니다.
00:00:25따라서 매우 특정한 작업에 특화된 모델이 필요하다면
00:00:29이 모델이 정확히 찾던 것일 수 있습니다. 오늘은 이 모델을 특별히 사용해야 하는 이유와
00:00:35파인튜닝이 필요한 모든 이유를 다뤄보겠습니다. 그리고 이 모델이 오디오와 시각 정보를 처리하는
00:00:40매우 흥미로운 방식이 있는데, 이는 전에 본 적 없는 방식입니다. 계속 시청해 주시면
00:00:44이 영상에서 그 부분도 다루겠습니다. 저희 채널에서는 AI 관련 소식을 지속적으로 다루고 있으니
00:00:52Thinking Machines는 신규 모델이 시중의 일반적인 범용 모델만큼 강력하지는 않다는 사실을
00:00:57출시 게시글에서 매우 솔직하게 밝혔습니다. 즉, 기대치를 조절하고 있는 것이며
00:01:01벤치마크 결과에서 그 이유를 확인할 수 있습니다. 지시 이행 능력 부문에서는 GLM 5.2를 상회하지만
00:01:07(79.8점 대 73.3점), 에이전트가 직접 작업을 수행하는 터미널 벤치에서는 63.8점 대 82.7점으로
00:01:14큰 차이로 뒤처집니다. 즉, 지시를 따르는 것은 잘하지만 스스로 문제를 해결하는 능력은 다소 약합니다.
00:01:21하지만 파인튜닝을 염두에 두고 있다면 훌륭한 출발점입니다. 내부 구조는 전문가 혼합(MoE) 방식으로 되어 있습니다.
00:01:27총 9,750억 개의 파라미터가 있지만, 각 레이어에는 256개의 고유 전문가가 존재하며 각 토큰은
00:01:35그중 6개에만 전달됩니다. 즉, 어떤 시점이든 약 410억 개의 파라미터만 실제로 작동하게 됩니다.
00:01:41또한 멀티모달 모델입니다. 이미지, 텍스트, 오디오가 모두 입력되며 처리 방식은
00:01:47기존에 보았던 어떤 모델과도 크게 다릅니다. 일반적으로 모델이 오디오를 처리할 때는
00:01:52언어 모델 앞에 별도의 음성 모델이 있어서 텍스트로 변환한 다음
00:01:56그 텍스트를 언어 모델에 전달합니다. 이미지도 마찬가지 방식으로 작동합니다. 비전 인코더가 사진을 보고
00:02:02이미지에 대한 설명을 생성한 뒤 이를 언어 모델에 전달하는 식입니다.
00:02:07물론 이 과정에서 어느 정도 데이터 손실이 발생할 수밖에 없습니다.
00:02:11반면 Inkling은 그런 과정을 거치지 않습니다. 오디오는 스펙트로그램 형태로 곧바로 입력되어
00:02:16소리의 원시 주파수 대역이 여러 구간으로 나뉩니다. 이미지 역시 40x40 픽셀 패치로 직접 입력됩니다. 두 데이터 모두
00:02:23텍스트 토큰이 존재하는 동일한 공간에 직접 배치되며 모델이 이들을 함께 처리합니다. 따라서 어떤 정보도
00:02:28텍스트로 압축되어 뭉개지지 않습니다. 이론적으로 오디오와 시각 자료를 처리할 때
00:02:35Inkling 모델을 사용하면 데이터 손실과 압축을 훨씬 줄일 수 있습니다. 실제로 원시 오디오를
00:02:40지원하지 않는 대부분의 일반적인 범용 모델과 비교할 때 Inkling은 확실히 차별화됩니다. 이제 파인튜닝을
00:02:46해야 하는지 여부는 사용자의 구체적인 목표에 따라 결정됩니다. 일반적인 경험 법칙에 따르면
00:02:50파인튜닝은 무엇을 알아야 하는지가 아니라 어떻게 대답해야 하는지를 모델에 가르치는 것입니다.
00:02:57예를 들어, 어조나 엄격한 구조화된 출력의 경우 프롬프트에 수천 개의 예시를 넣는 것은 비현실적이므로
00:03:02모델의 출력을 유도하기 위해 수천 개의 예시가 필요할 때 유용합니다. 또한 비용 및 지연 시간 측면에서
00:03:08범용 모델로 좁은 범주의 작업을 수행하는 것보다 더 작은 모델을 파인튜닝하는 것이 비용 면에서 훨씬 유리합니다.
00:03:13기본적으로 적절한 출력을 얻기 위해 수천 개의 예시가 필요한 상황이라면
00:03:18파인튜닝을 통해 이점을 얻을 수 있습니다. 하지만 모델이 모르는 정보를 알게 해야 한다면 파인튜닝을 하지 마세요.
00:03:23실제로 검색(RAG)과 파인튜닝을 비교한 유명 논문이 있는데, 검색 방식이 일관되게 우수한 결과를 보였습니다.
00:03:28그리고 더 나은 추론 능력을 원한다면 파인튜닝이 오히려 모델의 사고 과정을 저하시켜 역효과를 낼 수 있습니다.
00:03:34흥미롭게도 더 작은 모델일수록 이 피해가 가장 큽니다. 하지만 특정한 좁은 업무의 경우 파인튜닝의 결과가 훌륭할 수 있습니다.
00:03:40로펌을 위한 AI 도구를 만드는 Harvey의 사례를 보면, 법률 문서에서 인용구를 추출하도록 소형 모델을 학습시켰습니다.
00:03:46그들은 분류 모델의 성능을 평가하는 지표인 F1 점수를 측정했습니다.
00:03:52파인튜닝을 거친 후 점수가 0.56에서 0.68로 상승했습니다.
00:03:58GPT-4o와의 맞대결에서는 소형 모델이 93%의 확률로 승리하거나 동률을 기록했으며 실행 속도도 더 빨랐습니다.
00:04:07Thinking Machines는 Inkling이 알파벳 'E'를 절대 사용하지 않도록 강제하는 데모도 보여줍니다.
00:04:12Tinker를 통해 모델이 스스로를 파인튜닝하도록 지시할 수 있습니다. 그러면 모델이 직접 학습 데이터셋을 만들고
00:04:18완전 자동화된 방식으로 전체 파인튜닝 프로세스를 실행할 수 있습니다.
00:04:24그 결과로 심각한 'E' 공포증이 생긴 모델이 탄생하지만, 신기하게도 응답은 여전히 말이 됩니다.
00:04:29하지만 여기서 모델 전체를 다시 학습시키는 것은 아닙니다. LoRa라는 기술을 사용하는데,
00:04:32이는 저랭크 적응(Low-Rank Adaptation)을 의미합니다. 모델 전체를 학습시키는 대신, LoRa는 기존 가중치를 고정하고
00:04:38가볍고 작은 행렬을 주입하여 새로운 특정 데이터를 학습합니다.
00:04:44이는 모델 전체를 파인튜닝하는 것에 비해 사후 학습 비용과 속도 측면에서 큰 이점을 제공하며,
00:04:49그렇지 않았다면 비현실적이었을 작업을 가능하게 합니다. 현재 Tinker는 Qwen, Kimi, DeepSeek, NVIDIA의
00:04:55NemoTron, OpenAI의 GPT OSS 같은 여러 오픈 모델을 지원합니다. 그중 Inkling은 가격이 꽤 비싼 편인데, 왜 굳이 이걸 써야 할까요?
00:05:02이유는 두 가지가 있으며, 이미 앞서 조금 다루었습니다. 첫 번째는 오디오입니다.
00:05:06플랫폼 상의 모든 모델 중에서 Inkling만이 유일하게 오디오를 직접 입력받습니다. 많은 모델이 이미지를 처리할 수 있고,
00:05:11Kimi와 대부분의 Qwen 모델이 비전 처리를 잘 해내지만, 원시 사운드를 실제로 처리할 수 있는 모델은
00:05:16단 하나도 없습니다. 또한 음성 인식 및 말하기 스타일 분류 같은
00:05:20세 가지 쿡북 레시피도 함께 제공됩니다. 덕분에 모델은 단순히 무엇이 말해졌는가뿐만 아니라 어떻게 말해졌는지까지 알려줄 수 있습니다.
00:05:26또한 구술 처방을 학습하여 다른 모델이라면 엉망으로 처리했을 약물 이름을 인식하는 의료 분야 예시도 있습니다.
00:05:31두 번째는 사고 강도(Thinking Effort)입니다. Inkling은 모델이 얼마나 깊게 생각할지 0에서 1 사이의 숫자로 설정할 수 있게 해줍니다.
00:05:36대부분의 모델은 2~3개의 설정 스위치만 제공합니다. 예를 들어 GPT OSS는 낮음, 중간, 높음을 제공하지만
00:05:42Inkling은 전체 슬라이더를 제공합니다. 그렇다면 가장 중요한 질문은 과연 이 모델을 실제로 사용해야 할까 하는 점입니다.
00:05:47글쎄요, 모델을 순정 상태 그대로 실행하고 싶다면 아마 이 모델이 아닐 것입니다.
00:05:52그 점에 대해서는 개발사들도 명확히 밝히고 있습니다. 하지만 좁고 대량인 업무를 맡고 있고,
00:05:56실제 라벨링된 데이터와 출력을 평가할 수 있는 방법이 있다면, 작고 오픈된 모델을 파인튜닝하는 것은
00:06:02현재 가장 저평가된 작업 방식 중 하나입니다. 그리고 Tinker 같은 플랫폼이 있어서 훨씬 더 수월해졌습니다.
00:06:07Inkling이 여러분에게 적합한 모델인지는 결국 무엇을 입력하느냐에 달려 있습니다.
00:06:11오디오를 입력해야 한다면 Inkling이 강력한 선택지이며, 현재 Tinker에서 원시 오디오를 지원하는 모델은 이것뿐입니다.
00:06:16그리고 현재 최고의 오픈 소스 범용 모델을 찾고 계신다면, 저희가 방금 Kimi K3에 대한 영상을 업로드했으니
00:06:21그 영상을 시청하시면 놀라운 결과를 확인하실 수 있을 것입니다. 그 외에는
00:06:26시청해 주셔서 감사합니다. BetterStack의 워렌이었으며 다음 영상에서 뵙겠습니다.

핵심 요약

Inkling은 원시 오디오와 시각 정보를 손실 없이 직접 처리하며 9,750억 파라미터 구조와 Tinker 플랫폼을 통한 파인튜닝으로 특정 좁은 업무에서 범용 모델을 능가하는 성능을 발휘합니다.

하이라이트

  • Thinking Machines가 출시한 9,750억 파라미터 규모의 오픈 웨이트 모델 Inkling은 허깅 페이스에서 아파치 2.0 라이선스로 제공됩니다.

  • Inkling은 텍스트 변환 과정 없이 오디오를 스펙트로그램 형태로, 이미지를 40x40 픽셀 패치로 직접 입력받아 데이터 손실을 최소화합니다.

  • LoRa 기술을 사용하여 모델 전체를 재학습하지 않고 가볍고 작은 행렬을 주입하는 방식으로 사후 학습 비용과 속도를 대폭 개선합니다.

  • Harvey의 법률 문서 인용구 추출 작업에서 소형 파인튜닝 모델은 F1 점수가 0.56에서 0.68로 상승했으며 GPT-4o와의 맞대결에서 93%의 확률로 우세하거나 동등한 결과를 기록했습니다.

  • Inkling은 Tinker 플랫폼에서 0에서 1 사이의 전체 슬라이더를 통해 사고 강도를 정밀하게 설정할 수 있는 기능을 제공합니다.

타임라인

Inkling 모델 개요와 구조

  • Thinking Machines는 첫 번째 모델인 9,750억 파라미터 규모의 Inkling을 아파치 2.0 라이선스로 허깅 페이스에 공개했습니다.
  • 일반 범용 모델만큼 강력하지는 않으며 지시 이행 능력은 우수하지만 스스로 문제를 해결하는 터미널 벤치에서는 다소 뒤처집니다.
  • 총 9,750억 개의 파라미터 중 각 토큰은 256개의 전문가 중 6개에만 전달되어 어떤 시점이든 약 410억 개만 실제로 작동합니다.

전직 OpenAI CTO 미라 모레티가 설립한 스타트업이 출시한 이 모델은 특정 목적에 맞게 세밀하게 조정되는 파인튜닝에 최적화되어 있습니다. 출시 게시글을 통해 범용 모델보다 강력하지 않다는 점을 솔직히 밝히며 기대치를 조절했습니다. 내부 구조는 전문가 혼합(MoE) 방식을 채택하여 효율성을 높였습니다.

멀티모달 데이터 처리 방식

  • Inkling은 기존 모델들과 달리 텍스트 변환 과정을 거치지 않고 오디오를 스펙트로그램 형태로 직접 입력받습니다.
  • 이미지 역시 40x40 픽셀 패치로 직접 입력되어 텍스트 토큰과 동일한 공간에 배치됩니다.
  • 데이터가 압축되거나 뭉개지지 않아 오디오와 시각 자료 처리 과정에서 발생하는 데이터 손실을 크게 줄입니다.

기존 모델들은 오디오나 이미지를 처리할 때 별도의 인코더를 거쳐 텍스트로 변환한 뒤 언어 모델에 전달하는 방식을 사용합니다. 이 과정에서 피할 수 없는 데이터 손실이 발생합니다. 반면 Inkling은 원시 주파수 대역과 이미지 패치를 직접 처리하여 차별화된 멀티모달 성능을 제공합니다.

파인튜닝의 효용성과 활용 사례

  • 파인튜닝은 새로운 지식을 주입하는 것이 아니라 대답하는 방식, 어조, 엄격한 구조화된 출력을 가르치는 데 유용합니다.
  • 법률 AI 도구를 만드는 Harvey는 소형 모델 파인튜닝을 통해 F1 점수가 0.56에서 0.68로 상승했습니다.
  • LoRa 기술을 활용해 기존 가중치를 고정하고 작은 행렬만 주입함으로써 파인튜닝 비용과 속도 문제를 해결합니다.

새로운 정보를 학습시키는 용도로는 검색(RAG) 방식이 더 우수하며 추론 능력을 원할 때는 파인튜닝이 역효과를 낼 수 있습니다. 그러나 좁은 업무 영역에서는 훌륭한 결과를 냅니다. Tinker 플랫폼을 통해 완전 자동화된 방식으로 파인튜닝 프로세스를 실행할 수 있으며 모델 전체를 다시 학습시키는 대신 효율적인 저랭크 적응 방식을 사용합니다.

Inkling의 차별점과 활용 가이드

  • Inkling은 Tinker 상의 여러 오픈 모델 중 유일하게 원시 사운드를 직접 처리할 수 있는 모델입니다.
  • Inkling은 0에서 1 사이의 슬라이더를 제공하여 모델의 사고 강도를 정밀하게 설정할 수 있습니다.
  • 순정 상태 그대로 사용하기보다는 좁고 대량인 업무를 처리하고 평가 방법이 있는 경우 파인튜닝용으로 강력한 선택지입니다.

Inkling은 음성 인식과 말하기 스타일을 분류하는 쿡북 레시피를 제공하여 말의 내용뿐만 아니라 전달 방식까지 파악합니다. 사고 강도를 미세하게 조절할 수 있는 기능을 통해 작업 성격에 맞춘 최적화가 가능합니다. 오디오 입력이 필수적인 특정 작업 환경에서 매우 유용한 도구로 기능합니다.

커뮤니티 글

모든 글 보기