Kimi K3는 가히 전설급이다... (경쟁사들이 긴장해야 할 듯)

BBetter Stack
컴퓨터/소프트웨어창업/스타트업AI/미래기술

스크립트

00:00:00Kimi K3가 출시되었는데 솔직히 꽤 충격적입니다. 단순히 Opus와
00:00:04GPT 5.5를 따라잡은 수준이 아니라, Fable이나 GPT 5.6과 대등한 수준입니다. 오픈 모델들이 우리가 생각했던 것보다
00:00:10뒤처져 있지 않았던 거죠. 한번 살펴보겠습니다. 먼저 발표 내용부터 시작하죠. Kimi K3는 2조 8천억 개의
00:00:19파라미터를 가진 모델로, Kimi Delta의 Retention 및 Attention Residual 기술을 기반으로 하며 네이티브 비전
00:00:24기능과 100만 토큰의 컨텍스트 윈도우를 갖췄습니다. 세계 최초의 3조 파라미터급 오픈 모델로서
00:00:29장기 프로젝트 코딩, 지식 작업, 추론 등 프런티어 인텔리전스를 위해 설계되었습니다.
00:00:34블로그에 공개된 모든 벤치마크에서 Kimi K3는 Fable
00:00:38이나 GPT 5.6 Soul을 거의 따라잡았거나 몇몇 분야에서는 오히려 앞서고 있습니다. 이건 정말 놀라운 도약이라
00:00:43예상한 사람이 거의 없었을 겁니다. 물론 이건 그들의 자체 벤치마크이니
00:00:47인공지능 및 타사 벤치마크를 한번 살펴보겠습니다. 다행히 결과는 거의 일치하더군요.
00:00:52현재 벤치마크를 보면 시청자분들의 약 80%가 아직 구독하지 않으셨더군요.
00:00:56소프트웨어 개발과 AI 관련 최신 소식을 계속 받아보고 싶으시다면 구독 버튼을 눌러주세요.
00:01:00본격적인 벤치마크로 들어가서, 코딩 인덱스 점수는 76.2점으로
00:01:06Fable 5보다 0.3점 뒤처지지만, GPT 5.5, Opus의 4.8점보다는 높고,
00:01:12GPT 5.6 Luna보다 높으며 GPT 5.6 Soul이나 Terra에 아주 약간 뒤질 뿐입니다. 이전 모델에서 이 정도로 도약했다는 게 놀랍죠.
00:01:19에이전틱 인덱스를 봐도 마찬가지입니다.
00:01:23여기서도 Fable과 Soul 다음으로 3위지만 여전히 굉장히 인상적입니다. 여러분도 이제 익숙하시겠지만
00:01:29지능 인덱스에서도 결과는 똑같습니다. 타사 벤치마크들도 이 모델이 최고라는 걸 확인해주고 있죠.
00:01:32안타깝게도 이 영상을 찍는 시점에는 Deep SWE 결과가 아직 나오지 않았지만
00:01:38저희 자체 벤치마크를 보면 여기서도 다시 3위를 기록했습니다.
00:01:42이 모델은 너무 완벽해서 사실인가 싶을 정도네요. 유일한 단점이라면
00:01:46가격이 좀 비싸다는 점입니다. 집에 슈퍼컴퓨터가 있는 게 아니라면
00:01:50로컬에서 실행하기는 어려울 겁니다. API를 사용하면 입력 토큰 100만 개당 3달러,
00:01:54출력 토큰 100만 개당 15달러입니다. Kimi K 2.6보다는 확실히 비싸졌고,
00:02:00Sonic 5가 할인을 종료했을 때와 비슷한 수준이지만 Fable 5, Opus, GPT 5.6보다는 저렴합니다.
00:02:06API 가격이 전부는 아니니 비용 대비 실성능을 따져보면
00:02:12작업당 비용이 GPT 5.6 Soul과 비슷하고 Opus 4.8보다는 절반 정도 저렴합니다.
00:02:17물론 Fable이나 Sonic 5보다는 싸죠. 프런티어 폐쇄형 모델들과 경쟁할 만한 수준이지만
00:02:22조금이라도 저렴한 오픈 모델을 찾는 분들에게는 이 모델이 아마
00:02:26맞지 않을 수 있습니다. GLM 5.2가 차선책인데 가격은 절반입니다. 엄청나게 빠른
00:02:31모델은 아니지만 지능 수준을 고려하면 충분히 경쟁력 있습니다.
00:02:36전반적으로 이 모델에 대해 부정적인 의견을 찾기가 정말 어렵네요. 바로
00:02:40로컬 테스트 결과들을 확인해보죠. 첫 번째 테스트는 3.js를 사용하여
00:02:44index.html 하나로 완성되는 F1 레이싱 게임을 만드는 것이었습니다. 지금 보시는 건 Open Router를 통한 Kimi K3의 결과물입니다.
00:02:50환경이 결과에 영향을 주는지 확인하기 위해 Kimi Code CLI에서도 테스트해봤습니다.
00:02:56보시다시피 시작 전에 14분 동안 생각했고, 전체적으로 웹 앱을 만드는 데
00:03:0035분이 걸렸으며 API 비용은 1.24달러가 들었습니다. 결과물은
00:03:06꽤 인상적입니다. 외부 에셋을 사용할 수 없었으니 모델이 할 수 있는 최선을 다해
00:03:11모델을 생성했습니다. 하지만 트랙은 작동합니다. AI 레이서들이 트랙을 주행하고,
00:03:16장벽도 잘 구현되어 통과할 수 없습니다. 위치값도 업데이트되고 있죠.
00:03:21맵도 업데이트되고 있고, 현재 시간과 랩 타임도 잘 나옵니다. 한 바퀴를
00:03:25돌아봤는데 모두 정상적으로 작동했습니다. Kimi K3가 보여준 훌륭한 결과입니다.
00:03:30아까 말했듯 여러 환경에서도 테스트했습니다. 이건 Kimi Code에서의 Kimi K3 결과입니다.
00:03:35개인적으로 이쪽이 조금 더 보기 좋은 것 같습니다. 에셋 처리가 더 나았지만 이건 순전히
00:03:39스타일 차이일 수도 있습니다. 모델 실행 시 약간의 지연은 있지만 조작감은 조금 더 좋네요.
00:03:43조작 방식은 여전히 반전되어 있더군요. 3.js 애플리케이션들에서 공통적으로 보이는 특징 같습니다.
00:03:48하지만 전반적인 조작감은 매우 좋고, 트랙을 벗어나면
00:03:52속도가 줄어드는 기능까지 구현되었습니다. 인상적인 작업이었어요. 이제
00:03:57프런티어 모델들과 비교해봅시다. Claude Code에서 최대 설정으로 Fable 5를 실행했고
00:04:013.js 앱을 만드는 데 44분이 걸렸습니다. GPT 5.6 Soul도 최대 설정으로
00:04:0718분이 걸렸습니다. Fable의 결과물입니다. 약간 더 보기 좋긴 한데
00:04:12다시 말하지만 스타일 선택일 뿐입니다. 컨트롤이
00:04:17이 모델에서는 반전되어 있지 않군요. 카메라 흔들림 효과가 있는데 꽤 괜찮은 스타일입니다.
00:04:22마찬가지로 모든 기능이 작동합니다. 한 바퀴를 돌아보며
00:04:26충돌 테스트도 해봤습니다. 잘 작동하고 Kimi K3의 결과물과 견줄 만합니다.
00:04:31GPT 5.6 Soul도 비슷한 결과였습니다. 게임은 잘 실행되지만
00:04:35도로에 잔디가 표현되지 않았더군요. 전반적으로 다 잘 작동합니다.
00:04:40컨트롤은 반전되어 있고 에셋 몇 개가 거꾸로 뒤집혀 있습니다.
00:04:44왜 모델들이 그런 걸 좋아하는지 모르겠네요. Fable만 빼고요.
00:04:48트랙 모양이 조금 이상하게 꼬여서 제대로 작동하는 트랙을 만든 유일한 실패작이 되었네요.
00:04:53최종 비교를 위해 차선책인 GLM 5.2 결과도 확인해보겠습니다.
00:04:57이 모델은 5분 58초 동안 생각했지만,
00:05:02한 번의 프롬프트로 끝내지 못했습니다. 여러 버그가 발생해서
00:05:07추가 프롬프트를 입력해야 했습니다. 게임을 실행했을 때
00:05:11버그가 너무 많았습니다. 우선 트랙 시작 지점이 엉망입니다.
00:05:15트랙이라고 부를 만한 것도 없고 디자인도 다른 모델보다 훨씬 떨어집니다.
00:05:20Kimi K3로 업그레이드할 가치가 있겠네요. 두 번째 테스트로 넘어가서,
00:05:25개인 자산 관리 대시보드를 요청했습니다. 프런트엔드와 백엔드를 모두 갖춘 풀스택 앱이죠.
00:05:29인증 기능은 빼달라고 했고 초기 데이터도 시드해달라고 했습니다.
00:05:33이번에도 K3를 사용해 Open Router와 Kimi Code에서 각각 테스트했습니다.
00:05:38Open Router에서는 56분이 걸렸고 1.30달러가 들었습니다.
00:05:43결과물은 불만이 없을 정도로 훌륭합니다.
00:05:48딱 요청한 대로 개인 자산 관리 대시보드가 나왔습니다. 디자인도
00:05:53정말 깔끔하네요. 추가 페이지 기능도 잘 구현되었습니다.
00:05:57자금 추가 및 송금 기능도 완벽합니다. 정말 잘 만들었습니다. 어떤 도구를
00:06:01사용했는지도 항상 궁금합니다. 프롬프트에 구체적인 기술 스택을
00:06:05지정하지 않았거든요. 프런트엔드로는 React와 React DOM을 사용했네요.
00:06:09라우터 같은 라이브러리 없이 직접 뷰 시스템을 구축했습니다.
00:06:12차라리 React Router나 TanStack 또는 Next.js를 썼으면 더 좋았겠지만요.
00:06:16백엔드도 자체 서버를 구축했습니다. 보시다시피 Express.js를 사용했네요.
00:06:21데이터베이스는 JSON 파일로 간단하게 처리했습니다.
00:06:26SQLite나 Drizzle을 썼으면 확장성을 고려하기 좋았을 텐데 말이죠.
00:06:31물론 프롬프트에 적어주지 않은 제 탓이겠죠. 어쨌든 모델의 기본 선택을 보는 것도 재밌습니다.
00:06:35이건 Kimi Code를 통한 K3 결과물인데 조금 더 심플합니다.
00:06:38한 페이지로 구성되어 있고 사이드바가 없네요.
00:06:43기능은 잘 작동하고 Open Router 결과와 비슷한 디자인을 보여줍니다.
00:06:47코드를 살펴보니
00:06:51Kimi Code가 준 결과가 더 마음에 듭니다. React를 쓴 건 똑같지만
00:06:55서버에서 실제 데이터베이스를 사용했거든요.
00:06:59Express로 구축되었고 finance 데이터베이스에 Node SQLite를 썼습니다.
00:07:04이제 프런티어 모델들과 비교해보죠. Claude Code의 Fable 5 결과입니다.
00:07:08최대 노력 설정으로 56분이 걸렸습니다. GPT 5.6 Soul도
00:07:1331분 정도 걸렸네요. Fable 5의 결과물을 보면
00:07:17디자인이 거의 똑같습니다. 사실 자산 관리 대시보드에서 더 바랄 게 없죠.
00:07:21모든 기능이 작동합니다. 폰트 스타일이
00:07:25조금 다르네요. 최근 Fable과 Opus에서 자주 보이는 스타일입니다.
00:07:29이전의 AI 느낌에서 벗어나 새로운 AI 디자인 스타일을 구축하려는 것 같습니다.
00:07:34이게 그들이 선택한 새로운 모습인가 봅니다. 차트 디자인은
00:07:38Kimi K3 결과물보다 조금 아쉽지만 전반적으로 비슷하고 잘 작동합니다.
00:07:43코드도 매우 비슷합니다. 프런트엔드에 React를 사용했고
00:07:47라우터 없이 직접 구현했습니다. 데이터베이스는
00:07:51Node SQL을 올바르게 사용했습니다. 서버는
00:07:57Express 2 기반입니다. GPT 5.6 Soul로 넘어가죠.
00:08:02좀 독특합니다. 디자인은 단연 최고네요. 기능도
00:08:06모두 잘 작동합니다. 여러분도 그렇게 생각하시나요? 이상한 점은 코드에 있습니다.
00:08:11지금까지 본 예시 중 가장 완성도 높은 코드입니다.
00:08:15완전한 Next.js 앱을 만들었고 제가 선호하는 Drizzle을 사용했더군요.
00:08:20프런트엔드와 서버에 Next.js를 사용한 건 좋지만
00:08:24Cloudflare 호스팅을 선택한 점이 좀 의외입니다.
00:08:29추천하지 않는다는 건 아니지만 아직 검증되지 않은 느낌이라서요.
00:08:33GPT 5.6 Soul이 이렇게 하도록 밀어붙이는 것 같습니다. 추측하자면
00:08:38ChatGPT 사이트들이 그렇게 돌아가기 때문일 겁니다. 보시다시피
00:08:42제가 요청하지 않았는데도 ChatGPT 사이트 기능으로 호스팅해버리더군요.
00:08:47개인적으로 코딩 중에 호스팅까지 자동으로 되는 건 선호하지 않습니다.
00:08:50제가 직접 관리하는 걸 원하거든요. 프롬프트에 적었어야 했나 봅니다.
00:08:54요청했을 때만 해줬으면 좋겠는데 말이죠.
00:08:58마지막으로 GLM 5.2 결과입니다. Kimi K3와 비슷하게
00:09:04Kimi Code에서 보여준 것처럼 단일 페이지로만 만들었죠. 하지만 이번에도 모든 기능은 정상 작동했고 디자인도 꽤 마음에 듭니다.
00:09:08디자인도 꽤 괜찮습니다. GLM 5.2는 15분이 걸렸고 1.11달러가 들었습니다.
00:09:13코드를 보니 GLM 5.2는 Next.js를 선택했는데 마음에 듭니다.
00:09:19하지만 데이터베이스 대신 메모리 내에 스토어를 구축했네요.
00:09:24제 테스트 결과, Kimi K3는 Fable과
00:09:29GPT 5.6 Soul과 견줄 만한 성능을 보여주며 벤치마크 기대치를 충분히 충족합니다.
00:09:33모델들이 얼마나 강력한지 영상으로 다 보여주기는 정말 어렵네요.
00:09:38실제 프로덕션 코드베이스에서 일주일 정도 사용해봐야 코드 퀄리티를 제대로 알 수 있으니까요.
00:09:42모델을 확실하게 테스트할 수 있는 아이디어가 있다면
00:09:46댓글로 알려주세요. 기술 블로그에 있던 예시들도 좀 보여드리고 싶네요.
00:09:50기술 블로그에 소개된 몇 가지 예시도 보여드리고 싶네요. 여기 Kimi
00:09:53K3가 이 게임을 만들었지만, 에셋 생성에는 다른 도구를 사용했습니다. 그래서 카우보이와
00:09:58말은 K3가 직접 생성한 게 아닙니다. 어쨌든 3.js로
00:10:03매우 훌륭한 결과물을 냈습니다. 칩 설계 사례도 놀랍습니다.
00:10:08Kimi K3는 자기 아키텍처 기반의 나노 모델을 구동하기 위한 칩을 설계했습니다.
00:10:1348시간의 자율 실행을 통해 오픈 소스 도구로 칩을 구축, 최적화, 검증까지 마쳤습니다.
00:10:19이 모델이 얼마나 대단한지 아시겠죠. 프런티어 폐쇄형 모델들에게는
00:10:23위협이 될 겁니다. 가중치가 공개되면 더 확실해지겠죠.
00:10:27아직 공개되진 않았지만 곧 나올 겁니다. 여러분은 어떻게 생각하시나요?
00:10:32중국 연구소가 이렇게 빨리 따라잡을 줄 예상하셨나요? 관심이 생기시나요?
00:10:36댓글로 알려주세요. 영상 끝까지 보셨다면 구독도 부탁드립니다. 항상 감사합니다.

핵심 요약

Kimi K3는 2조 8천억 파라미터 기반의 강력한 오픈 모델로서 코딩과 시스템 아키텍처 설계 영역에서 Fable이나 GPT 5.6과 대등한 수준의 프런티어 인텔리전스를 입증했다.

하이라이트

  • Kimi K3는 2조 8천억 개의 파라미터를 가진 모델로 100만 토큰의 컨텍스트 윈도우와 네이티브 비전 기능을 갖추고 있다.

  • 코딩 인덱스 벤치마크 점수는 76.2점으로 Fable 5와 근접한 성능을 보이며 GPT 5.5 및 Opus를 상회한다.

  • API 비용은 입력 토큰 100만 개당 3달러, 출력 토큰 100만 개당 15달러로 프런티어 폐쇄형 모델보다 저렴한 수준이다.

  • 웹 앱 개발 테스트에서 Kimi K3는 3.js 기반 F1 레이싱 게임을 35분 만에 완성했으며 충돌 및 속도 조절 등 주요 기능을 구현했다.

  • 자산 관리 대시보드 구축 시 프런트엔드와 백엔드를 모두 구성하며 Express.js 기반의 서버 환경을 스스로 선택하여 구현했다.

  • 48시간의 자율 실행을 통해 오픈 소스 도구로 칩을 설계, 최적화 및 검증하는 지식 작업 수행 능력을 증명했다.

타임라인

Kimi K3의 기술적 사양과 벤치마크 결과

  • Kimi K3는 2조 8천억 파라미터와 100만 토큰 컨텍스트를 제공하는 최초의 대형 오픈 모델이다.
  • 벤치마크상 코딩 인덱스는 76.2점으로 Fable 5에 근접하며 GPT 5.6 및 Opus를 앞서거나 경쟁하는 수준이다.
  • 비용 효율성 측면에서 Opus 4.8 대비 작업당 비용이 절반 정도로 경제적이다.

Kimi Delta의 기술을 기반으로 설계된 이 모델은 프런티어 인텔리전스를 목표로 한다. 벤치마크 결과 에이전틱 인덱스와 지능 인덱스 모두에서 최상위권 모델들과 어깨를 나란히 한다. 로컬 구동은 어렵지만 API 사용 시 강력한 성능 대비 경쟁력 있는 가격대를 형성한다.

웹 애플리케이션 및 시스템 구축 테스트

  • 3.js를 활용한 레이싱 게임 구현 시 장애물 충돌과 위치 업데이트 기능을 성공적으로 구현했다.
  • 풀스택 자산 관리 대시보드 요청 시 Express.js 서버와 SQLite 데이터베이스를 사용하여 자체적인 시스템을 구축했다.
  • Fable 5나 GPT 5.6 Soul과 비교해도 완성도 면에서 대등하거나 특정 기능 구현에서 효율적인 모습을 보인다.

다양한 개발 환경 테스트 결과, 모델은 사용자의 구체적인 기술 스택 지정 없이도 합리적인 라이브러리와 서버 아키텍처를 스스로 선택한다. 게임 개발 시 에셋 처리와 조작감 구현에서 프런티어 모델들과 비교해도 손색없는 결과물을 생성했다.

기술적 활용 가능성과 향후 전망

  • 복잡한 칩 설계 및 검증 작업에서 48시간 동안 자율 실행으로 성과를 증명했다.
  • 가중치가 공개될 경우 폐쇄형 프런티어 모델들에게 실질적인 위협이 될 전망이다.

단순 코딩을 넘어 칩 아키텍처 설계와 같은 고도의 지식 작업에서도 자율적인 문제 해결 능력을 보여주었다. 가중치 공개 시 오픈 소스 생태계 내에서 대형 모델들의 경쟁 구도가 크게 바뀔 가능성이 존재한다.

커뮤니티 글

모든 글 보기