스크립트
00:00:00동일한 기본 모델에 똑같은 질문을 던졌습니다.
00:00:03여기 토큰 카운터들을 주목해 보세요.
00:00:05한쪽은 질문에 대해 추론하는 데 상당한 시간을 쏟고 있지만,
00:00:09다른 쪽은 이미 작업을 완료했습니다.
00:00:12양쪽의 출력 결과를 확인해 보면 질문에 대한 답변은 기본적으로 같습니다.
00:00:16하지만 오른쪽에 있는 모델은 동일한 결론을 도출하는 데 훨씬 더 많은 토큰을 낭비했습니다.
00:00:21정말 흥미로운 점은 두 모델 사이의 유일한 차이점이
00:00:24왼쪽에 있는 모델은 '띵킹 캡(Thinking Cap)'을 실행 중이라는 점입니다.
00:00:27동일한 모델을 커스텀 미세 조정(Fine-tuning)한 버전이죠.
00:00:31이 모델은 동일한 품질의 출력 결과를 보장하면서도
00:00:34토큰 소모를 줄이고 답변 도출 속도를 두 배 더 빠르게 만드는 것을 목표로 합니다.
00:00:39이번 영상에서는 Thinking Cap을 살펴보고
00:00:42어떻게 작동하는지 확인한 다음, 직접 테스트해 보며
00:00:45이것이 정말 AI 모델 미세 조정의 새로운 접근 방식인지 알아보겠습니다.
00:00:50정말 흥미로운 시간이 될 테니 바로 시작해 보죠.
00:00:57Thinking Cap에 대해 이야기하기 전에, 우리가 어떻게 여기까지 오게 되었는지 잠시 시간을 되돌아보겠습니다.
00:01:03최초로 대중에게 널리 공개된 모델인 GPT-3는 2020년에 출시되었고,
00:01:092022년 말에는
00:01:11ChatGPT가 대중 앞에 처음으로 GPT-3.5를 선보였습니다.
00:01:17대부분의 사람들이 AI와 관계를 맺기 시작한 것도 바로 그때였죠.
00:01:212023년에는 GPT-4가 뒤를 이어 또 한 번의 성능 도약을 이루었지만,
00:01:25근본적인 아이디어는 여전히 동일했습니다.
00:01:28다음 토큰을 예측하고 즉시 답변하는 것이었죠.
00:01:31하지만 2024년 9월, OpenAI가 o1을 출시하면서
00:01:37이것은 답변 전에 '사고 모드'를 사용하는 최초의 모델이 되었습니다.
00:01:42따라서 응답을 즉시 내뱉는 대신,
00:01:45먼저 추가 시간과 토큰을 들여 문제를 추론하는 과정을 거쳤습니다.
00:01:49그 구조적 변화 하나가 추론 모델의 시대를 열었습니다.
00:01:54몇 달 후 딥시크 R1(DeepSeek-R1)이 등장해
00:01:56오픈소스 진영에도 동일한 개념을 가져왔습니다.
00:02:00그리고 금방이라도,
00:02:01추론은 모든 주요 AI 모델 제작사들이 선보이는 핵심 기능이 되었습니다.
00:02:05하지만 그로부터 불과 1년이 조금 지난 지금,
00:02:08우리는 정반대의 트렌드가 나타나는 것을 보고 있습니다.
00:02:11더 많이 생각하는 것이 아니라, 오히려 '덜 생각하도록' 특별히 미세 조정된 모델들이죠.
00:02:15어찌 보면 추론 시대에 배운 모든 것을 녹여낸 채
00:02:17다시 기본으로 돌아가는 셈입니다.
00:02:21하지만 문제가 있습니다.
00:02:22더 많은 사고를 하도록 한 그 변화는 하나의 문제를 해결하는 동시에 조용히 새로운 문제를 만들어 냈습니다.
00:02:28아무도 이 모델들에게 언제 생각을 멈춰야 하는지 실제로 가르쳐주지 않은 것입니다.
00:02:31추론 모델에게 진정으로 간단한 것을 물어보면
00:02:34여전히 수천 개의 토큰을 낭비하게 됩니다.
00:02:37이미 세 문장 전에 파악한 내용을 다시 유도해 내거나,
00:02:41똑같은 요점을 약간 다른 단어로 반복해서 말하고,
00:02:44최악의 경우엔 무한 루프에 빠지기 시작합니다.
00:02:48거의 말 그대로 그렇다는 뜻입니다.
00:02:50제가 겪었던 가장 터무니없는 예시 중 하나를 보여드리겠습니다.
00:02:54이것은 Step 3.5 Flash입니다.
00:02:56이 추론 모델을 테스트하고 있을 때,
00:02:58저는 단 한 단어, '안녕하세요(hello)'만 보냈습니다.
00:03:01그것을 가지고 모델이 무엇을 하는지 보십시오.
00:03:03자신의 정확한 모델 이름으로 자신을 소개해야 하는지 여부를 두고 여러 문단에 걸쳐 토론합니다.
00:03:09소개할 때 항상 정확한 이름을 사용해야 한다는 것이 매번 자신을 소개해야 한다는 뜻인지, 아니면 원할 때만 소개해야 한다는 뜻인지 고민하죠.
00:03:19그러고는 오늘 날짜를 언급하는 것이 적절한지 따져봅니다.
00:03:22그러다 결국 그 모든 과정을 거쳐 우리 중 누군가라면 2초 만에 쳤을 답변을 내놓습니다.
00:03:28안녕하세요, 저는 Step 3.5 Flash입니다.
00:03:31오늘 어떻게 도와드릴까요?
00:03:33따라서 이건 진정한 의미의 추론이 아닙니다.
00:03:35생각하도록 훈련되었지만 언제 생각이 끝났는지 아는 법은 전혀 배우지 못한 모델인 것이죠.
00:03:41자, 보틀캡 AI(BottleCap AI)는 추론을 더 효율적으로 만드는 데 특화된 유럽의 스타트업입니다.
00:03:47그리고 이들이 띵킹 캡으로 해낸 일은 솔직히 정말 영리합니다.
00:03:51이들은 Qwen 3.6 모델, 즉 270억 개 파라미터 버전을 가져왔습니다.
00:03:55모델을 더 똑똑하게 만들려고 한 것도 아니고, 새로운 기술을 가르치거나 성격을 바꾸거나 안전 관련 행동을 건드린 것도 아니었습니다.
00:04:04이들이 바꾸고 싶었던 유일한 점은 이미 제공할 능력이 있는 답변에 도달하는 데 소모되는 연산량뿐이었습니다.
00:04:11말로는 간단해 보이지만 실제로 해보면 생각보다 훨씬 어렵습니다.
00:04:15모델을 더 빠르게 만드는 게으른 방법은 그저 추론 과정을 중간에 끊어버리는 것입니다.
00:04:20실제로 완료되었든 아니든 정해진 토큰 수 이후에는 무조건 멈추도록 강제하는 것이죠.
00:04:25그렇게 하면 토큰 수는 확실히 줄어들 것입니다.
00:04:27하지만 가끔은 정말로 추가 단계가 필요하기 때문에 모델이 오답을 내는 빈도도 더 높아질 것입니다.
00:04:34따라서 여기서 진정한 엔지니어링 과제는 답변을 짧게 만드는 것이 아닙니다.
00:04:38모르는 사이에 모델을 멍청하게 만들지 않으면서 짧게 만드는 것입니다.
00:04:42그리고 그들이 실제로 해낸 방법은 다음과 같습니다.
00:04:44Qwen 3.6, 270억 개 파라미터 모델의 기본 체크포인트에서 출발해
00:04:48다양한 도메인과 난이도에 걸쳐 엄선된 문제 세트로 모델을 훈련시켰습니다.
00:04:55그리고 모델이 정답을 맞힌 것에 대해 보상하는 대신,
00:04:58'효율적으로' 정답을 맞힌 것에 대해 보상했습니다.
00:05:02모델이 오직 정답 여부로만 보상받는다면 장황하게 떠드는 것은 아무런 비용도 발생시키지 않으니까요.
00:05:08일찍 생각을 멈출 유인(incentive)이 전혀 없는 것입니다.
00:05:10하지만 정확성과 함께 효율성에 대해서도 명시적으로 보상함으로써
00:05:14모델은 답변을 확정하기에 이미 충분한 정보를 가지고 있는 시점을 인식하는 법을 배우게 됩니다.
00:05:19그 결과, 원본과 거의 동일하게 작동하는 모델을 얻게 되었습니다.
00:05:23이제 숫자를 실제로 살펴보겠습니다. 흥미로운 부분이 바로 여기니까요.
00:05:27학습 데이터에 포함되지 않은 문제인 12개의 도메인 외 벤치마크에서
00:05:33띵킹 캡은 추론 토큰을 평균 45.8% 줄였습니다.
00:05:37그리고 정확도는 거의 변하지 않았습니다.
00:05:40평균적으로 1퍼센트 미만으로 움직였죠.
00:05:43또한 학습 도메인에 포함되었던 벤치마크에서는
00:05:46토큰 감소 폭이 거의 58%로 훨씬 더 컸습니다.
00:05:49특히 GSM 8K의 경우 정확도가 실제로 93.3%에서 96.5%로 상승했습니다.
00:05:58또한 '루프 비율(looping rate)'이라는 것도 추적했습니다.
00:06:00앞서 Step 3.5 Flash 예시에서 본 것처럼, 모델이 수렴하지 못한 채 동일한 추론을 반복해서 재phrasing하는 데 갇히는 빈도를 말합니다.
00:06:06이 수치도 대부분의 벤치마크에서 떨어졌습니다.
00:06:10이는 이 모델들이 수행했던 추가 추론 중 상당수가
00:06:12처음부터 애초에 생산적이지 않았다는 것을 말해줍니다.
00:06:18그저 노력하는 것처럼 보이는 소음에 불과했던 것이죠.
00:06:21좋습니다, 서류상의 수치는 그렇다 치고 직접 테스트를 해보죠.
00:06:26저는 이 테스트를 64GB RAM이 탑재된 RTX 5090 머신에서 실행하고 있습니다.
00:06:32그리고 두 모델 모두에게 똑같은 질문을 던져볼 것입니다.
00:06:35n 팩토리얼이 정확히 100개의 끝자리 0을 가지도록 하는 가장 작은 양의 정수 n은 무엇인가요?
00:06:42이 질문의 답에 도달하려면 르장드르 공식(Legendre's formula)을 사용해야 하며,
00:06:47이 특정 질문의 경우 그 결과값은 405가 됩니다.
00:06:51정답은 오직 하나뿐입니다.
00:06:53중간 지점은 없습니다.
00:06:55따라서 405가 나온다면 모델이 올바르게 답변했다는 것을 알 수 있죠.
00:07:00좋습니다, 먼저 표준 270억 개 파라미터 양자화된 Qwen 3.6 모델을 실행해서
00:07:05어떻게 성능을 내는지 보겠습니다.
00:07:07보시다시피 시작하자마자 토큰 생성 속도는 그리 나쁘지 않습니다.
00:07:12초당 약 60토큰 정도를 기록하고 있죠.
00:07:14하지만 이 모델이 얼마나 많은 생각을 하고 있는지 보십시오.
00:07:17정말 터무니없을 지경입니다.
00:07:20이미 1분이 훌쩍 지났는데도 추론 과정만으로 여전히 토큰을 뱉어내고 있습니다.
00:07:26총 소요 시간이 2분을 넘었기 때문에 여기서 미리보기 배속을 높여야 했습니다.
00:07:30하지만 그럼에도 불구하고 결국 올바른 결과인 405를 얻었습니다. 다행이네요.
00:07:37하지만 총 소요 시간을 보십시오.
00:07:39140초입니다.
00:07:41그리고 토큰 소모량을 보세요.
00:07:43추론에만 7,000개가 넘는 토큰이 소모되었고, 답을 출력하는 데는 겨우 900개의 토큰만이 사용되었습니다.
00:07:52따라서 이 예시는 Qwen이 모든 요청에 대해 얼마나 과도하고 터무니없이 추론하는지 명확하게 보여줍니다.
00:07:59이제 동일한 모델의 띵킹 캡 버전으로 전환해 보겠습니다.
00:08:02참고로, 우리는 동일한 양자화가 적용된 동일한 270억 개 파라미터 모델을 사용하고 있습니다.
00:08:08여기서 보시는 바와 같이 20초가 지난 시점에 이미 추론이 끝났습니다.
00:08:13그리고 불과 9초 후에 답변을 얻었으며, 이 경우 역시 정답인 405입니다.
00:08:19얼마나 극명한 차이인지 보십시오.
00:08:21총 토큰 수도 2,000개 미만으로 사용했을 뿐더러, 그중 추론에 할당된 것은 불과 1,100개에 불과했습니다.
00:08:30뿐만 아니라 초당 62토큰이라는 약간 더 빠른 생성 속도를 얻었습니다.
00:08:36따라서 모든 지표에서 이 모델은 기본 Qwen 3.6 모델을 압도합니다.
00:08:42더 빠르고, 더 효율적이며, 토큰이 덜 들고, 동일한 정답을 제시하죠.
00:08:48정말 인상적인 개선이 아닐 수 없습니다.
00:08:51그리고 그들의 설명서에 나온 세부 사항 중 꼭 언급해야 할 재미있는 해프닝이 있습니다.
00:08:57원래 목표는 추론 과정인 사고 흔적(thinking trace)만 줄이고,
00:09:02최종 답변은 이전과 정확히 같은 길이로 유지하는 것이었습니다.
00:09:06하지만 버그가 있었습니다.
00:09:07사고 과정뿐만 아니라 최종 답변에도 단축 기능이 실수로 적용된 것입니다.
00:09:12그래서 버그를 고쳤지만, 내부적으로는 다들 그 버그가 있던 버전을 훨씬 더 좋아했다고 합니다.
00:09:18이유인즉슨 인간은 긴 답변을 쓰면 지치기 때문에 우리가 말하는 내용을 자연스럽게 압축한다는 추측입니다.
00:09:25그리고 이 모델들에는 지금까지 그런 종류의 피로가 내장되어 있지 않았던 것이죠.
00:09:29결국 그들은 고장 난 간결한 버전을 그대로 출시하고, 기술적으로 올바른 버전은 향후 릴리스를 위해 아껴두기로 했습니다.
00:09:37자, 이렇게 해서 여러분께 소개해 드렸습니다.
00:09:38즉 싱킹 캡의 핵심은 바로 이런 겁니다.
00:09:40이 모든 것에서 얻을 수 있는 가장 큰 교훈은, 우리는 그동안 모델이 많이 생각할수록 더 지능적이라고 믿어왔다는 점입니다.
00:09:48반면 띵킹 캡은 꼭 그렇지만은 않다는 것을 증명해 보였습니다.
00:09:53실제로 이에 맞춰 훈련하기만 하면 포기하는 것 거의 없이, 적은 비용으로 동일한 품질의 출력 결과를 얻을 수 있습니다.
00:10:01직접 모델을 사용해보고 싶다면 허깅 페이스(Hugging Face)에 아파치 2.0 라이선스로 무료 공개되어 있습니다.
00:10:08이제 여러분의 의견을 듣고 싶습니다.
00:10:10이 새로운 접근 방식에 대해 어떻게 생각하시나요?
00:10:12이 기술의 장단점이 뭐라고 보시나요?
00:10:15아래 댓글란에 남겨주세요.
00:10:17여러분, 이런 기술 분석 영상이 마음에 드신다면 영상 아래의 좋아요 버튼을 눌러 알려주세요.
00:10:23그리고 저희 채널 구독도 잊지 마시고요.
00:10:26BetterStack의 안드레스(Andres)였습니다. 다음 영상에서 뵙겠습니다.