AI의 가장 큰 결점을 해결하는 오픈소스 모델 (ThinkingCap)

BBetter Stack
Computing/SoftwareSmall Business/Startups

Transcript

00:00:00동일한 기본 모델에 똑같은 질문을 던졌습니다.
00:00:03여기 토큰 카운터들을 주목해 보세요.
00:00:05한쪽은 질문에 대해 추론하는 데 상당한 시간을 쏟고 있지만,
00:00:09다른 쪽은 이미 작업을 완료했습니다.
00:00:12양쪽의 출력 결과를 확인해 보면 질문에 대한 답변은 기본적으로 같습니다.
00:00:16하지만 오른쪽에 있는 모델은 동일한 결론을 도출하는 데 훨씬 더 많은 토큰을 낭비했습니다.
00:00:21정말 흥미로운 점은 두 모델 사이의 유일한 차이점이
00:00:24왼쪽에 있는 모델은 '띵킹 캡(Thinking Cap)'을 실행 중이라는 점입니다.
00:00:27동일한 모델을 커스텀 미세 조정(Fine-tuning)한 버전이죠.
00:00:31이 모델은 동일한 품질의 출력 결과를 보장하면서도
00:00:34토큰 소모를 줄이고 답변 도출 속도를 두 배 더 빠르게 만드는 것을 목표로 합니다.
00:00:39이번 영상에서는 Thinking Cap을 살펴보고
00:00:42어떻게 작동하는지 확인한 다음, 직접 테스트해 보며
00:00:45이것이 정말 AI 모델 미세 조정의 새로운 접근 방식인지 알아보겠습니다.
00:00:50정말 흥미로운 시간이 될 테니 바로 시작해 보죠.
00:00:57Thinking Cap에 대해 이야기하기 전에, 우리가 어떻게 여기까지 오게 되었는지 잠시 시간을 되돌아보겠습니다.
00:01:03최초로 대중에게 널리 공개된 모델인 GPT-3는 2020년에 출시되었고,
00:01:092022년 말에는
00:01:11ChatGPT가 대중 앞에 처음으로 GPT-3.5를 선보였습니다.
00:01:17대부분의 사람들이 AI와 관계를 맺기 시작한 것도 바로 그때였죠.
00:01:212023년에는 GPT-4가 뒤를 이어 또 한 번의 성능 도약을 이루었지만,
00:01:25근본적인 아이디어는 여전히 동일했습니다.
00:01:28다음 토큰을 예측하고 즉시 답변하는 것이었죠.
00:01:31하지만 2024년 9월, OpenAI가 o1을 출시하면서
00:01:37이것은 답변 전에 '사고 모드'를 사용하는 최초의 모델이 되었습니다.
00:01:42따라서 응답을 즉시 내뱉는 대신,
00:01:45먼저 추가 시간과 토큰을 들여 문제를 추론하는 과정을 거쳤습니다.
00:01:49그 구조적 변화 하나가 추론 모델의 시대를 열었습니다.
00:01:54몇 달 후 딥시크 R1(DeepSeek-R1)이 등장해
00:01:56오픈소스 진영에도 동일한 개념을 가져왔습니다.
00:02:00그리고 금방이라도,
00:02:01추론은 모든 주요 AI 모델 제작사들이 선보이는 핵심 기능이 되었습니다.
00:02:05하지만 그로부터 불과 1년이 조금 지난 지금,
00:02:08우리는 정반대의 트렌드가 나타나는 것을 보고 있습니다.
00:02:11더 많이 생각하는 것이 아니라, 오히려 '덜 생각하도록' 특별히 미세 조정된 모델들이죠.
00:02:15어찌 보면 추론 시대에 배운 모든 것을 녹여낸 채
00:02:17다시 기본으로 돌아가는 셈입니다.
00:02:21하지만 문제가 있습니다.
00:02:22더 많은 사고를 하도록 한 그 변화는 하나의 문제를 해결하는 동시에 조용히 새로운 문제를 만들어 냈습니다.
00:02:28아무도 이 모델들에게 언제 생각을 멈춰야 하는지 실제로 가르쳐주지 않은 것입니다.
00:02:31추론 모델에게 진정으로 간단한 것을 물어보면
00:02:34여전히 수천 개의 토큰을 낭비하게 됩니다.
00:02:37이미 세 문장 전에 파악한 내용을 다시 유도해 내거나,
00:02:41똑같은 요점을 약간 다른 단어로 반복해서 말하고,
00:02:44최악의 경우엔 무한 루프에 빠지기 시작합니다.
00:02:48거의 말 그대로 그렇다는 뜻입니다.
00:02:50제가 겪었던 가장 터무니없는 예시 중 하나를 보여드리겠습니다.
00:02:54이것은 Step 3.5 Flash입니다.
00:02:56이 추론 모델을 테스트하고 있을 때,
00:02:58저는 단 한 단어, '안녕하세요(hello)'만 보냈습니다.
00:03:01그것을 가지고 모델이 무엇을 하는지 보십시오.
00:03:03자신의 정확한 모델 이름으로 자신을 소개해야 하는지 여부를 두고 여러 문단에 걸쳐 토론합니다.
00:03:09소개할 때 항상 정확한 이름을 사용해야 한다는 것이 매번 자신을 소개해야 한다는 뜻인지, 아니면 원할 때만 소개해야 한다는 뜻인지 고민하죠.
00:03:19그러고는 오늘 날짜를 언급하는 것이 적절한지 따져봅니다.
00:03:22그러다 결국 그 모든 과정을 거쳐 우리 중 누군가라면 2초 만에 쳤을 답변을 내놓습니다.
00:03:28안녕하세요, 저는 Step 3.5 Flash입니다.
00:03:31오늘 어떻게 도와드릴까요?
00:03:33따라서 이건 진정한 의미의 추론이 아닙니다.
00:03:35생각하도록 훈련되었지만 언제 생각이 끝났는지 아는 법은 전혀 배우지 못한 모델인 것이죠.
00:03:41자, 보틀캡 AI(BottleCap AI)는 추론을 더 효율적으로 만드는 데 특화된 유럽의 스타트업입니다.
00:03:47그리고 이들이 띵킹 캡으로 해낸 일은 솔직히 정말 영리합니다.
00:03:51이들은 Qwen 3.6 모델, 즉 270억 개 파라미터 버전을 가져왔습니다.
00:03:55모델을 더 똑똑하게 만들려고 한 것도 아니고, 새로운 기술을 가르치거나 성격을 바꾸거나 안전 관련 행동을 건드린 것도 아니었습니다.
00:04:04이들이 바꾸고 싶었던 유일한 점은 이미 제공할 능력이 있는 답변에 도달하는 데 소모되는 연산량뿐이었습니다.
00:04:11말로는 간단해 보이지만 실제로 해보면 생각보다 훨씬 어렵습니다.
00:04:15모델을 더 빠르게 만드는 게으른 방법은 그저 추론 과정을 중간에 끊어버리는 것입니다.
00:04:20실제로 완료되었든 아니든 정해진 토큰 수 이후에는 무조건 멈추도록 강제하는 것이죠.
00:04:25그렇게 하면 토큰 수는 확실히 줄어들 것입니다.
00:04:27하지만 가끔은 정말로 추가 단계가 필요하기 때문에 모델이 오답을 내는 빈도도 더 높아질 것입니다.
00:04:34따라서 여기서 진정한 엔지니어링 과제는 답변을 짧게 만드는 것이 아닙니다.
00:04:38모르는 사이에 모델을 멍청하게 만들지 않으면서 짧게 만드는 것입니다.
00:04:42그리고 그들이 실제로 해낸 방법은 다음과 같습니다.
00:04:44Qwen 3.6, 270억 개 파라미터 모델의 기본 체크포인트에서 출발해
00:04:48다양한 도메인과 난이도에 걸쳐 엄선된 문제 세트로 모델을 훈련시켰습니다.
00:04:55그리고 모델이 정답을 맞힌 것에 대해 보상하는 대신,
00:04:58'효율적으로' 정답을 맞힌 것에 대해 보상했습니다.
00:05:02모델이 오직 정답 여부로만 보상받는다면 장황하게 떠드는 것은 아무런 비용도 발생시키지 않으니까요.
00:05:08일찍 생각을 멈출 유인(incentive)이 전혀 없는 것입니다.
00:05:10하지만 정확성과 함께 효율성에 대해서도 명시적으로 보상함으로써
00:05:14모델은 답변을 확정하기에 이미 충분한 정보를 가지고 있는 시점을 인식하는 법을 배우게 됩니다.
00:05:19그 결과, 원본과 거의 동일하게 작동하는 모델을 얻게 되었습니다.
00:05:23이제 숫자를 실제로 살펴보겠습니다. 흥미로운 부분이 바로 여기니까요.
00:05:27학습 데이터에 포함되지 않은 문제인 12개의 도메인 외 벤치마크에서
00:05:33띵킹 캡은 추론 토큰을 평균 45.8% 줄였습니다.
00:05:37그리고 정확도는 거의 변하지 않았습니다.
00:05:40평균적으로 1퍼센트 미만으로 움직였죠.
00:05:43또한 학습 도메인에 포함되었던 벤치마크에서는
00:05:46토큰 감소 폭이 거의 58%로 훨씬 더 컸습니다.
00:05:49특히 GSM 8K의 경우 정확도가 실제로 93.3%에서 96.5%로 상승했습니다.
00:05:58또한 '루프 비율(looping rate)'이라는 것도 추적했습니다.
00:06:00앞서 Step 3.5 Flash 예시에서 본 것처럼, 모델이 수렴하지 못한 채 동일한 추론을 반복해서 재phrasing하는 데 갇히는 빈도를 말합니다.
00:06:06이 수치도 대부분의 벤치마크에서 떨어졌습니다.
00:06:10이는 이 모델들이 수행했던 추가 추론 중 상당수가
00:06:12처음부터 애초에 생산적이지 않았다는 것을 말해줍니다.
00:06:18그저 노력하는 것처럼 보이는 소음에 불과했던 것이죠.
00:06:21좋습니다, 서류상의 수치는 그렇다 치고 직접 테스트를 해보죠.
00:06:26저는 이 테스트를 64GB RAM이 탑재된 RTX 5090 머신에서 실행하고 있습니다.
00:06:32그리고 두 모델 모두에게 똑같은 질문을 던져볼 것입니다.
00:06:35n 팩토리얼이 정확히 100개의 끝자리 0을 가지도록 하는 가장 작은 양의 정수 n은 무엇인가요?
00:06:42이 질문의 답에 도달하려면 르장드르 공식(Legendre's formula)을 사용해야 하며,
00:06:47이 특정 질문의 경우 그 결과값은 405가 됩니다.
00:06:51정답은 오직 하나뿐입니다.
00:06:53중간 지점은 없습니다.
00:06:55따라서 405가 나온다면 모델이 올바르게 답변했다는 것을 알 수 있죠.
00:07:00좋습니다, 먼저 표준 270억 개 파라미터 양자화된 Qwen 3.6 모델을 실행해서
00:07:05어떻게 성능을 내는지 보겠습니다.
00:07:07보시다시피 시작하자마자 토큰 생성 속도는 그리 나쁘지 않습니다.
00:07:12초당 약 60토큰 정도를 기록하고 있죠.
00:07:14하지만 이 모델이 얼마나 많은 생각을 하고 있는지 보십시오.
00:07:17정말 터무니없을 지경입니다.
00:07:20이미 1분이 훌쩍 지났는데도 추론 과정만으로 여전히 토큰을 뱉어내고 있습니다.
00:07:26총 소요 시간이 2분을 넘었기 때문에 여기서 미리보기 배속을 높여야 했습니다.
00:07:30하지만 그럼에도 불구하고 결국 올바른 결과인 405를 얻었습니다. 다행이네요.
00:07:37하지만 총 소요 시간을 보십시오.
00:07:39140초입니다.
00:07:41그리고 토큰 소모량을 보세요.
00:07:43추론에만 7,000개가 넘는 토큰이 소모되었고, 답을 출력하는 데는 겨우 900개의 토큰만이 사용되었습니다.
00:07:52따라서 이 예시는 Qwen이 모든 요청에 대해 얼마나 과도하고 터무니없이 추론하는지 명확하게 보여줍니다.
00:07:59이제 동일한 모델의 띵킹 캡 버전으로 전환해 보겠습니다.
00:08:02참고로, 우리는 동일한 양자화가 적용된 동일한 270억 개 파라미터 모델을 사용하고 있습니다.
00:08:08여기서 보시는 바와 같이 20초가 지난 시점에 이미 추론이 끝났습니다.
00:08:13그리고 불과 9초 후에 답변을 얻었으며, 이 경우 역시 정답인 405입니다.
00:08:19얼마나 극명한 차이인지 보십시오.
00:08:21총 토큰 수도 2,000개 미만으로 사용했을 뿐더러, 그중 추론에 할당된 것은 불과 1,100개에 불과했습니다.
00:08:30뿐만 아니라 초당 62토큰이라는 약간 더 빠른 생성 속도를 얻었습니다.
00:08:36따라서 모든 지표에서 이 모델은 기본 Qwen 3.6 모델을 압도합니다.
00:08:42더 빠르고, 더 효율적이며, 토큰이 덜 들고, 동일한 정답을 제시하죠.
00:08:48정말 인상적인 개선이 아닐 수 없습니다.
00:08:51그리고 그들의 설명서에 나온 세부 사항 중 꼭 언급해야 할 재미있는 해프닝이 있습니다.
00:08:57원래 목표는 추론 과정인 사고 흔적(thinking trace)만 줄이고,
00:09:02최종 답변은 이전과 정확히 같은 길이로 유지하는 것이었습니다.
00:09:06하지만 버그가 있었습니다.
00:09:07사고 과정뿐만 아니라 최종 답변에도 단축 기능이 실수로 적용된 것입니다.
00:09:12그래서 버그를 고쳤지만, 내부적으로는 다들 그 버그가 있던 버전을 훨씬 더 좋아했다고 합니다.
00:09:18이유인즉슨 인간은 긴 답변을 쓰면 지치기 때문에 우리가 말하는 내용을 자연스럽게 압축한다는 추측입니다.
00:09:25그리고 이 모델들에는 지금까지 그런 종류의 피로가 내장되어 있지 않았던 것이죠.
00:09:29결국 그들은 고장 난 간결한 버전을 그대로 출시하고, 기술적으로 올바른 버전은 향후 릴리스를 위해 아껴두기로 했습니다.
00:09:37자, 이렇게 해서 여러분께 소개해 드렸습니다.
00:09:38즉 싱킹 캡의 핵심은 바로 이런 겁니다.
00:09:40이 모든 것에서 얻을 수 있는 가장 큰 교훈은, 우리는 그동안 모델이 많이 생각할수록 더 지능적이라고 믿어왔다는 점입니다.
00:09:48반면 띵킹 캡은 꼭 그렇지만은 않다는 것을 증명해 보였습니다.
00:09:53실제로 이에 맞춰 훈련하기만 하면 포기하는 것 거의 없이, 적은 비용으로 동일한 품질의 출력 결과를 얻을 수 있습니다.
00:10:01직접 모델을 사용해보고 싶다면 허깅 페이스(Hugging Face)에 아파치 2.0 라이선스로 무료 공개되어 있습니다.
00:10:08이제 여러분의 의견을 듣고 싶습니다.
00:10:10이 새로운 접근 방식에 대해 어떻게 생각하시나요?
00:10:12이 기술의 장단점이 뭐라고 보시나요?
00:10:15아래 댓글란에 남겨주세요.
00:10:17여러분, 이런 기술 분석 영상이 마음에 드신다면 영상 아래의 좋아요 버튼을 눌러 알려주세요.
00:10:23그리고 저희 채널 구독도 잊지 마시고요.
00:10:26BetterStack의 안드레스(Andres)였습니다. 다음 영상에서 뵙겠습니다.

Key Takeaway

띵킹 캡은 추론 모델의 과도한 토큰 낭비 문제를 해결하기 위해 효율성 중심의 미세 조정을 거쳐, 정확도를 떨어뜨리지 않고도 연산량을 절반 가까이 줄인 새로운 오픈소스 모델입니다.

Highlights

  • 보틀캡 AI가 개발한 띵킹 캡은 Qwen 3.6 270억 파라미터 모델을 기반으로 추론 토큰 소모량을 줄이도록 미세 조정된 오픈소스 모델입니다.

  • 띵킹 캡은 무작위로 추론을 끊는 방식이 아니라 효율성에 대해 명시적으로 보상하는 훈련을 거쳐 정확도를 유지합니다.

  • 도메인 외 벤치마크 테스트에서 띵킹 캡은 평균 45.8% 적은 추론 토큰을 소모하면서 정확도는 1퍼센트 미만으로 유지했습니다.

  • GSM 8K 벤치마크에서는 정확도가 기존 93.3%에서 96.5%로 오히려 상승했습니다.

  • 수학 문제(n 팩토리얼 끝자리 0이 100개가 되게 하는 n) 테스트에서 기본 모델은 140초가 소요된 반면, 띵킹 캡은 훨씬 적은 시간과 2,000개 미만의 토큰으로 정답 405를 도출했습니다.

  • 허깅 페이스에 아파치 2.0 라이선스로 무료 공개되어 있습니다.

Timeline

추론 모델의 토큰 낭비 문제

  • 기존의 대규모 언어 모델들은 즉시 답변을 내놓는 구조였으나, 2024년 9월 OpenAI o1 이후 사고 모드를 거치는 추론 모델 시대로 전환되었습니다.
  • 추론 모델들은 언제 생각을 멈춰야 하는지 학습하지 못해 간단한 질문에도 수천 개의 토큰을 낭비하거나 무한 루프에 빠집니다.
  • Step 3.5 Flash 모델에 단 한 단어인 '안녕하세요'를 입력했을 경우, 자기 소개와 날짜 언급 여부를 두고 여러 문단에 걸쳐 불필요한 토큰을 소모합니다.

동일한 질문을 던졌을 때 한쪽은 이미 작업을 완료했음에도 다른 쪽은 불필요하게 긴 추론 과정을 거치며 토큰을 소모합니다. 2020년 GPT-3를 시작으로 발전해 온 언어 모델들은 2024년 o1의 등장으로 답변 전 사고 모드를 도입했습니다. 그러나 이 변화는 모델이 스스로 사고를 중단하는 시점을 알지 못해 생기는 새로운 비효율성을 낳았습니다. 단순한 인사말에도 수많은 토큰을 소비하며 동일한 논리를 반복하는 현상은 기존 추론 모델의 구조적 결함을 보여줍니다.

띵킹 캡의 작동 원리와 미세 조정 방식

  • 유럽의 스타트업 보틀캡 AI는 270억 개 파라미터를 가진 Qwen 3.6 모델을 기반으로 띵킹 캡을 개발했습니다.
  • 정답 여부뿐만 아니라 효율성에 대해서도 명시적으로 보상하여 모델이 충분한 정보를 인식한 시점에서 일찍 멈추도록 훈련했습니다.
  • 단순히 정해진 토큰 수 이후에 무조건 끊어버리는 방식은 오답률을 높이기 때문에, 엔지니어링의 핵심은 정확도를 유지하면서 답변을 단축하는 것입니다.

추론 과정을 강제로 중간에 끊어버리면 토큰 수는 줄어들지만 오답률이 높아집니다. 보틀캡 AI는 이 문제를 해결하기 위해 다양한 난이도의 문제 세트로 모델을 훈련하면서 '효율적으로 정답을 맞힌 것'에 보상을 부여했습니다. 이 방식을 통해 모델은 장황하게 떠드는 대신 답변 확정에 필요한 정보를 얻은 시점을 스스로 인식하게 됩니다. 모델의 성격이나 안전 관련 행동을 건드리지 않고 오직 연산 소모량만 최적화하는 데 집중했습니다.

성능 벤치마크 결과 및 실전 테스트

  • 학습 데이터에 포함되지 않은 도메인 외 벤치마크에서 띵킹 캡은 추론 토큰을 평균 45.8% 줄였고, 정확도는 1퍼센트 미만으로 유지했습니다.
  • RTX 5090 머신에서 진행된 수학 문제 테스트에서 기본 Qwen 3.6은 140초 동안 7,000개가 넘는 토큰을 소모한 반면, 띵킹 캡은 2,000개 미만의 토큰으로 정답을 도출했습니다.
  • 현재 띵킹 캡은 허깅 페이스에 아파치 2.0 라이선스로 무료 공개되어 있습니다.

숫자로 증명된 성능은 매우 명확합니다. 도메인 외 벤치마크에서는 토큰이 45.8% 감소했으며, 학습 도메인에서는 58% 가까이 줄었습니다. GSM 8K 벤치마크에서는 정확도가 93.3%에서 96.5%로 상승하기도 했습니다. 실제 하드웨어 테스트에서 수학 문제의 정답인 405를 도출할 때, 기본 모델은 2분이 넘는 시간과 과도한 추론 토큰을 소모한 반면 띵킹 캡은 훨씬 빠른 속도와 적은 토큰으로 동일한 정답을 기록했습니다. 버그로 인해 최종 답변까지 짧아진 버전이 우연히 출시되었으나 인간의 압축 성향과 맞아떨어져 좋은 반응을 얻었습니다.

Community Posts

View all posts