스크립트
00:00:00Kimi K3가 출시되었는데 솔직히 꽤 충격적입니다. 단순히 Opus와
00:00:04GPT 5.5를 따라잡은 수준이 아니라, Fable이나 GPT 5.6과 대등한 수준입니다. 오픈 모델들이 우리가 생각했던 것보다
00:00:10뒤처져 있지 않았던 거죠. 한번 살펴보겠습니다. 먼저 발표 내용부터 시작하죠. Kimi K3는 2조 8천억 개의
00:00:19파라미터를 가진 모델로, Kimi Delta의 Retention 및 Attention Residual 기술을 기반으로 하며 네이티브 비전
00:00:24기능과 100만 토큰의 컨텍스트 윈도우를 갖췄습니다. 세계 최초의 3조 파라미터급 오픈 모델로서
00:00:29장기 프로젝트 코딩, 지식 작업, 추론 등 프런티어 인텔리전스를 위해 설계되었습니다.
00:00:34블로그에 공개된 모든 벤치마크에서 Kimi K3는 Fable
00:00:38이나 GPT 5.6 Soul을 거의 따라잡았거나 몇몇 분야에서는 오히려 앞서고 있습니다. 이건 정말 놀라운 도약이라
00:00:43예상한 사람이 거의 없었을 겁니다. 물론 이건 그들의 자체 벤치마크이니
00:00:47인공지능 및 타사 벤치마크를 한번 살펴보겠습니다. 다행히 결과는 거의 일치하더군요.
00:00:52현재 벤치마크를 보면 시청자분들의 약 80%가 아직 구독하지 않으셨더군요.
00:00:56소프트웨어 개발과 AI 관련 최신 소식을 계속 받아보고 싶으시다면 구독 버튼을 눌러주세요.
00:01:00본격적인 벤치마크로 들어가서, 코딩 인덱스 점수는 76.2점으로
00:01:06Fable 5보다 0.3점 뒤처지지만, GPT 5.5, Opus의 4.8점보다는 높고,
00:01:12GPT 5.6 Luna보다 높으며 GPT 5.6 Soul이나 Terra에 아주 약간 뒤질 뿐입니다. 이전 모델에서 이 정도로 도약했다는 게 놀랍죠.
00:01:19에이전틱 인덱스를 봐도 마찬가지입니다.
00:01:23여기서도 Fable과 Soul 다음으로 3위지만 여전히 굉장히 인상적입니다. 여러분도 이제 익숙하시겠지만
00:01:29지능 인덱스에서도 결과는 똑같습니다. 타사 벤치마크들도 이 모델이 최고라는 걸 확인해주고 있죠.
00:01:32안타깝게도 이 영상을 찍는 시점에는 Deep SWE 결과가 아직 나오지 않았지만
00:01:38저희 자체 벤치마크를 보면 여기서도 다시 3위를 기록했습니다.
00:01:42이 모델은 너무 완벽해서 사실인가 싶을 정도네요. 유일한 단점이라면
00:01:46가격이 좀 비싸다는 점입니다. 집에 슈퍼컴퓨터가 있는 게 아니라면
00:01:50로컬에서 실행하기는 어려울 겁니다. API를 사용하면 입력 토큰 100만 개당 3달러,
00:01:54출력 토큰 100만 개당 15달러입니다. Kimi K 2.6보다는 확실히 비싸졌고,
00:02:00Sonic 5가 할인을 종료했을 때와 비슷한 수준이지만 Fable 5, Opus, GPT 5.6보다는 저렴합니다.
00:02:06API 가격이 전부는 아니니 비용 대비 실성능을 따져보면
00:02:12작업당 비용이 GPT 5.6 Soul과 비슷하고 Opus 4.8보다는 절반 정도 저렴합니다.
00:02:17물론 Fable이나 Sonic 5보다는 싸죠. 프런티어 폐쇄형 모델들과 경쟁할 만한 수준이지만
00:02:22조금이라도 저렴한 오픈 모델을 찾는 분들에게는 이 모델이 아마
00:02:26맞지 않을 수 있습니다. GLM 5.2가 차선책인데 가격은 절반입니다. 엄청나게 빠른
00:02:31모델은 아니지만 지능 수준을 고려하면 충분히 경쟁력 있습니다.
00:02:36전반적으로 이 모델에 대해 부정적인 의견을 찾기가 정말 어렵네요. 바로
00:02:40로컬 테스트 결과들을 확인해보죠. 첫 번째 테스트는 3.js를 사용하여
00:02:44index.html 하나로 완성되는 F1 레이싱 게임을 만드는 것이었습니다. 지금 보시는 건 Open Router를 통한 Kimi K3의 결과물입니다.
00:02:50환경이 결과에 영향을 주는지 확인하기 위해 Kimi Code CLI에서도 테스트해봤습니다.
00:02:56보시다시피 시작 전에 14분 동안 생각했고, 전체적으로 웹 앱을 만드는 데
00:03:0035분이 걸렸으며 API 비용은 1.24달러가 들었습니다. 결과물은
00:03:06꽤 인상적입니다. 외부 에셋을 사용할 수 없었으니 모델이 할 수 있는 최선을 다해
00:03:11모델을 생성했습니다. 하지만 트랙은 작동합니다. AI 레이서들이 트랙을 주행하고,
00:03:16장벽도 잘 구현되어 통과할 수 없습니다. 위치값도 업데이트되고 있죠.
00:03:21맵도 업데이트되고 있고, 현재 시간과 랩 타임도 잘 나옵니다. 한 바퀴를
00:03:25돌아봤는데 모두 정상적으로 작동했습니다. Kimi K3가 보여준 훌륭한 결과입니다.
00:03:30아까 말했듯 여러 환경에서도 테스트했습니다. 이건 Kimi Code에서의 Kimi K3 결과입니다.
00:03:35개인적으로 이쪽이 조금 더 보기 좋은 것 같습니다. 에셋 처리가 더 나았지만 이건 순전히
00:03:39스타일 차이일 수도 있습니다. 모델 실행 시 약간의 지연은 있지만 조작감은 조금 더 좋네요.
00:03:43조작 방식은 여전히 반전되어 있더군요. 3.js 애플리케이션들에서 공통적으로 보이는 특징 같습니다.
00:03:48하지만 전반적인 조작감은 매우 좋고, 트랙을 벗어나면
00:03:52속도가 줄어드는 기능까지 구현되었습니다. 인상적인 작업이었어요. 이제
00:03:57프런티어 모델들과 비교해봅시다. Claude Code에서 최대 설정으로 Fable 5를 실행했고
00:04:013.js 앱을 만드는 데 44분이 걸렸습니다. GPT 5.6 Soul도 최대 설정으로
00:04:0718분이 걸렸습니다. Fable의 결과물입니다. 약간 더 보기 좋긴 한데
00:04:12다시 말하지만 스타일 선택일 뿐입니다. 컨트롤이
00:04:17이 모델에서는 반전되어 있지 않군요. 카메라 흔들림 효과가 있는데 꽤 괜찮은 스타일입니다.
00:04:22마찬가지로 모든 기능이 작동합니다. 한 바퀴를 돌아보며
00:04:26충돌 테스트도 해봤습니다. 잘 작동하고 Kimi K3의 결과물과 견줄 만합니다.
00:04:31GPT 5.6 Soul도 비슷한 결과였습니다. 게임은 잘 실행되지만
00:04:35도로에 잔디가 표현되지 않았더군요. 전반적으로 다 잘 작동합니다.
00:04:40컨트롤은 반전되어 있고 에셋 몇 개가 거꾸로 뒤집혀 있습니다.
00:04:44왜 모델들이 그런 걸 좋아하는지 모르겠네요. Fable만 빼고요.
00:04:48트랙 모양이 조금 이상하게 꼬여서 제대로 작동하는 트랙을 만든 유일한 실패작이 되었네요.
00:04:53최종 비교를 위해 차선책인 GLM 5.2 결과도 확인해보겠습니다.
00:04:57이 모델은 5분 58초 동안 생각했지만,
00:05:02한 번의 프롬프트로 끝내지 못했습니다. 여러 버그가 발생해서
00:05:07추가 프롬프트를 입력해야 했습니다. 게임을 실행했을 때
00:05:11버그가 너무 많았습니다. 우선 트랙 시작 지점이 엉망입니다.
00:05:15트랙이라고 부를 만한 것도 없고 디자인도 다른 모델보다 훨씬 떨어집니다.
00:05:20Kimi K3로 업그레이드할 가치가 있겠네요. 두 번째 테스트로 넘어가서,
00:05:25개인 자산 관리 대시보드를 요청했습니다. 프런트엔드와 백엔드를 모두 갖춘 풀스택 앱이죠.
00:05:29인증 기능은 빼달라고 했고 초기 데이터도 시드해달라고 했습니다.
00:05:33이번에도 K3를 사용해 Open Router와 Kimi Code에서 각각 테스트했습니다.
00:05:38Open Router에서는 56분이 걸렸고 1.30달러가 들었습니다.
00:05:43결과물은 불만이 없을 정도로 훌륭합니다.
00:05:48딱 요청한 대로 개인 자산 관리 대시보드가 나왔습니다. 디자인도
00:05:53정말 깔끔하네요. 추가 페이지 기능도 잘 구현되었습니다.
00:05:57자금 추가 및 송금 기능도 완벽합니다. 정말 잘 만들었습니다. 어떤 도구를
00:06:01사용했는지도 항상 궁금합니다. 프롬프트에 구체적인 기술 스택을
00:06:05지정하지 않았거든요. 프런트엔드로는 React와 React DOM을 사용했네요.
00:06:09라우터 같은 라이브러리 없이 직접 뷰 시스템을 구축했습니다.
00:06:12차라리 React Router나 TanStack 또는 Next.js를 썼으면 더 좋았겠지만요.
00:06:16백엔드도 자체 서버를 구축했습니다. 보시다시피 Express.js를 사용했네요.
00:06:21데이터베이스는 JSON 파일로 간단하게 처리했습니다.
00:06:26SQLite나 Drizzle을 썼으면 확장성을 고려하기 좋았을 텐데 말이죠.
00:06:31물론 프롬프트에 적어주지 않은 제 탓이겠죠. 어쨌든 모델의 기본 선택을 보는 것도 재밌습니다.
00:06:35이건 Kimi Code를 통한 K3 결과물인데 조금 더 심플합니다.
00:06:38한 페이지로 구성되어 있고 사이드바가 없네요.
00:06:43기능은 잘 작동하고 Open Router 결과와 비슷한 디자인을 보여줍니다.
00:06:47코드를 살펴보니
00:06:51Kimi Code가 준 결과가 더 마음에 듭니다. React를 쓴 건 똑같지만
00:06:55서버에서 실제 데이터베이스를 사용했거든요.
00:06:59Express로 구축되었고 finance 데이터베이스에 Node SQLite를 썼습니다.
00:07:04이제 프런티어 모델들과 비교해보죠. Claude Code의 Fable 5 결과입니다.
00:07:08최대 노력 설정으로 56분이 걸렸습니다. GPT 5.6 Soul도
00:07:1331분 정도 걸렸네요. Fable 5의 결과물을 보면
00:07:17디자인이 거의 똑같습니다. 사실 자산 관리 대시보드에서 더 바랄 게 없죠.
00:07:21모든 기능이 작동합니다. 폰트 스타일이
00:07:25조금 다르네요. 최근 Fable과 Opus에서 자주 보이는 스타일입니다.
00:07:29이전의 AI 느낌에서 벗어나 새로운 AI 디자인 스타일을 구축하려는 것 같습니다.
00:07:34이게 그들이 선택한 새로운 모습인가 봅니다. 차트 디자인은
00:07:38Kimi K3 결과물보다 조금 아쉽지만 전반적으로 비슷하고 잘 작동합니다.
00:07:43코드도 매우 비슷합니다. 프런트엔드에 React를 사용했고
00:07:47라우터 없이 직접 구현했습니다. 데이터베이스는
00:07:51Node SQL을 올바르게 사용했습니다. 서버는
00:07:57Express 2 기반입니다. GPT 5.6 Soul로 넘어가죠.
00:08:02좀 독특합니다. 디자인은 단연 최고네요. 기능도
00:08:06모두 잘 작동합니다. 여러분도 그렇게 생각하시나요? 이상한 점은 코드에 있습니다.
00:08:11지금까지 본 예시 중 가장 완성도 높은 코드입니다.
00:08:15완전한 Next.js 앱을 만들었고 제가 선호하는 Drizzle을 사용했더군요.
00:08:20프런트엔드와 서버에 Next.js를 사용한 건 좋지만
00:08:24Cloudflare 호스팅을 선택한 점이 좀 의외입니다.
00:08:29추천하지 않는다는 건 아니지만 아직 검증되지 않은 느낌이라서요.
00:08:33GPT 5.6 Soul이 이렇게 하도록 밀어붙이는 것 같습니다. 추측하자면
00:08:38ChatGPT 사이트들이 그렇게 돌아가기 때문일 겁니다. 보시다시피
00:08:42제가 요청하지 않았는데도 ChatGPT 사이트 기능으로 호스팅해버리더군요.
00:08:47개인적으로 코딩 중에 호스팅까지 자동으로 되는 건 선호하지 않습니다.
00:08:50제가 직접 관리하는 걸 원하거든요. 프롬프트에 적었어야 했나 봅니다.
00:08:54요청했을 때만 해줬으면 좋겠는데 말이죠.
00:08:58마지막으로 GLM 5.2 결과입니다. Kimi K3와 비슷하게
00:09:04Kimi Code에서 보여준 것처럼 단일 페이지로만 만들었죠. 하지만 이번에도 모든 기능은 정상 작동했고 디자인도 꽤 마음에 듭니다.
00:09:08디자인도 꽤 괜찮습니다. GLM 5.2는 15분이 걸렸고 1.11달러가 들었습니다.
00:09:13코드를 보니 GLM 5.2는 Next.js를 선택했는데 마음에 듭니다.
00:09:19하지만 데이터베이스 대신 메모리 내에 스토어를 구축했네요.
00:09:24제 테스트 결과, Kimi K3는 Fable과
00:09:29GPT 5.6 Soul과 견줄 만한 성능을 보여주며 벤치마크 기대치를 충분히 충족합니다.
00:09:33모델들이 얼마나 강력한지 영상으로 다 보여주기는 정말 어렵네요.
00:09:38실제 프로덕션 코드베이스에서 일주일 정도 사용해봐야 코드 퀄리티를 제대로 알 수 있으니까요.
00:09:42모델을 확실하게 테스트할 수 있는 아이디어가 있다면
00:09:46댓글로 알려주세요. 기술 블로그에 있던 예시들도 좀 보여드리고 싶네요.
00:09:50기술 블로그에 소개된 몇 가지 예시도 보여드리고 싶네요. 여기 Kimi
00:09:53K3가 이 게임을 만들었지만, 에셋 생성에는 다른 도구를 사용했습니다. 그래서 카우보이와
00:09:58말은 K3가 직접 생성한 게 아닙니다. 어쨌든 3.js로
00:10:03매우 훌륭한 결과물을 냈습니다. 칩 설계 사례도 놀랍습니다.
00:10:08Kimi K3는 자기 아키텍처 기반의 나노 모델을 구동하기 위한 칩을 설계했습니다.
00:10:1348시간의 자율 실행을 통해 오픈 소스 도구로 칩을 구축, 최적화, 검증까지 마쳤습니다.
00:10:19이 모델이 얼마나 대단한지 아시겠죠. 프런티어 폐쇄형 모델들에게는
00:10:23위협이 될 겁니다. 가중치가 공개되면 더 확실해지겠죠.
00:10:27아직 공개되진 않았지만 곧 나올 겁니다. 여러분은 어떻게 생각하시나요?
00:10:32중국 연구소가 이렇게 빨리 따라잡을 줄 예상하셨나요? 관심이 생기시나요?
00:10:36댓글로 알려주세요. 영상 끝까지 보셨다면 구독도 부탁드립니다. 항상 감사합니다.