Claude 3.5 Sonnet을 뛰어넘은 오픈소스 모델 등장

CChase AI
컴퓨터/소프트웨어경제 뉴스AI/미래기술

스크립트

00:00:00중국산 오픈 웨이트 모델이 GPT 5.6과 Fable 5를 방금 압도했을까요?
00:00:05지난 24시간 동안 유튜브나 트위터를 조금이라도 보셨다면,
00:00:08KimiK3가 Anthropic과 OpenAI의 최고 모델들과 대등하거나,
00:00:13오히려 그보다 더 나은 성능을 보인다는 차트들을 많이 보셨을 겁니다.
00:00:17게다가 훨씬 저렴한 가격으로 말이죠.
00:00:20하지만 이 과장된 광고를 믿어야 할까요?
00:00:22오늘 영상에서 바로 그 답을 찾아보려 합니다.
00:00:24벤치마크가 실제로 무엇을 의미하는지 깊이 파헤쳐 보고,
00:00:28GPT 5.6, Fable 5, 그리고 K3를 정면으로 비교 테스트할 것입니다.
00:00:34KimiK3가 다른 모든 모델보다 뛰어난 수치를 보여주는 분야인 프론트엔드 디자인에서 말이죠.
00:00:40영상 끝에는 KimiK3가 새로운 왕좌의 주인공인지 확실히 알게 되실 겁니다.
00:00:46그럼 KimiK3의 수치와 벤치마크부터 시작해 보겠습니다.
00:00:49여기서 뽑아낼 수 있는 정보가 많거든요.
00:00:51여러 곳에서 떠도는 이 차트들 이면에는
00:00:53더 자세한 맥락이 숨어 있습니다. 이 두 가지가 가장 유명하죠.
00:00:57KimiK3는 2.8조 개의 매개변수를 가진 오픈 웨이트 모델입니다.
00:01:02오픈 웨이트라고 하면 오픈 소스를 의미하는데,
00:01:05이걸 여러분의 컴퓨터에서 직접 돌릴 수 있다는 뜻은 아닙니다.
00:01:07이런 모델을 실행하려면 수백만 달러 규모의 하드웨어가 필요하거든요.
00:01:11그래도 오픈 웨이트라는 점은 여전히 훌륭합니다.
00:01:12매개변수가 어떻게 튜닝되었는지 실제로 확인할 수 있으니까요.
00:01:15내부를 알 수 없는 Fable 5나 GPT 5.6과는 다르죠.
00:01:20그럼 수치상으로는 어떻게 나올까요?
00:01:23이 자료는 Kimi와 그들의 Moonshot Lab에서 제공한 것인데,
00:01:27주요 프로그래밍 벤치마크에서 Fable 5 및 GPT 5.6과
00:01:31경쟁하고 있다는 것을 보여줍니다.
00:01:34또 하나 떠도는 차트는 이것입니다.
00:01:36arena.ai에서 가져온 것으로, 프론트엔드 코드 능력을 측정합니다.
00:01:40이 벤치마크는 arena.ai에 접속해 “랜딩 페이지 하나 만들어 줘”라고 요청하면,
00:01:44두 가지 다른 모델의 응답을 보여주는데,
00:01:45어떤 모델인지 알 수 없게 되어 있습니다.
00:01:49펩시 챌린지 같은 방식이죠. 마음에 드는 걸 고르면 됩니다.
00:01:50시간이 지나면 어떤 모델이 경쟁 모델보다 더 많은 선택을 받았는지 알 수 있죠.
00:01:53현재 Kimi K3는 이 분야의 다른 모든 모델보다 더 나은 평가를 받고 있습니다.
00:01:57하지만 이건 매우 주관적인 결과라는 점을 이해해야 합니다.
00:02:01이 두 차트를 보고,
00:02:03모델 간의 가격을 비교해 보면,
00:02:05Kimi K3가 극도로 저렴하다는 것을 알 수 있습니다.
00:02:08입력 비용은 토큰 100만 개당 3달러로, 10달러인 Fable이나
00:02:135달러인 5.6에 비해 매우 낮습니다.
00:02:17즉 5.6 가격의 60% 수준이고,
00:02:20Fable 5 입력 비용의 30% 수준입니다.
00:02:23출력 비용은 5.6의 절반이며,
00:02:26Fable 5 가격의 30% 수준입니다.
00:02:29훨씬 저렴하면서 성능은 거의 비슷하거나 더 좋죠.
00:02:32그러니 무엇이 부족하겠어요?
00:02:35하지만 여기서 비용과 속도에 대해 조금 더 깊이 파고들어야 합니다.
00:02:36토큰당 3달러와 10달러라는 것은 한 가지 측면일 뿐이니까요.
00:02:38실제로 얼마나 많은 토큰을 사용하는지가 중요합니다.
00:02:40모든 모델이 토큰 효율성 측면에서 동일하지 않거든요.
00:02:43사실 이런 오픈 소스 중국 모델들은 토큰을 많이 잡아먹는 경향이 있습니다.
00:02:45즉, 이론적으로는 매우 저렴해 보이지만,
00:02:46실제로는 어떤 의미일까요? GPT 5.6처럼 토큰 효율성이 매우 뛰어난 모델들과 비교하면 어떨까요?
00:02:49독립적인 벤치마크인 Artificial Analysis를 보면,
00:02:53지능 지수 작업당 비용을 측정합니다.
00:02:56작업을 완료하는 데 얼마가 드는가 하는 것이죠.
00:02:57Kimi K3는 0.95달러입니다.
00:02:58GPT 5.6은 1.04달러이죠.
00:03:01약간 더 비싼 수준입니다.
00:03:035.5 엑스트라 하이는 여기 있고,
00:03:05GPT 5.6 맥스 버전인 Terra를 보면 Kimi K3 가격의 절반입니다.
00:03:09Claude는 훨씬 비싸고요.
00:03:11Fable 5는 2.75달러입니다.
00:03:15Fable을 Kimi K3와 비교하면 확실히 비용 절감 효과가 있지만,
00:03:205.6과 비교하면 큰 차이는 없습니다. 10% 미만이죠.
00:03:23사실 5.6 영역의 일부 작은 모델들은 Kimi K3 비용의 절반이기도 합니다.
00:03:26시간 또한 주의해야 할 화폐와 같습니다.
00:03:29중국의 오픈 소스 모델들은 역사적으로 속도가 느렸습니다.
00:03:30여기서도 볼 수 있듯이 가장 느린 모델은 이전 모델인 Kimi K2.6이었고,
00:03:35Kimi K3는 상당히 나아졌습니다.
00:03:38이 차트에서는 6분이 걸리네요.
00:03:40Fable 5는 5분, 5.6은 4.7분이 걸립니다.
00:03:42토큰 효율은 떨어지고 속도는 더 느린 셈이죠.
00:03:46하지만 전반적으로 Fable 5보다는 훨씬 저렴하고 5.6과는 비슷합니다.
00:03:49마지막으로 살펴볼 벤치마크는 '전지전능 지수(Omniscience Index)'입니다.
00:03:51환각 현상을 측정하는 지표죠.
00:03:54모델에게 답을 알기 어려운 아주 어려운 질문들을 던져서,
00:03:56맞혔는지, 틀렸는지, 아니면 '모르겠다'고 하는지를 평가합니다.
00:03:58정답이면 1점, 오답이면 -1점,
00:03:59'모르겠다'고 하면 0점입니다.
00:04:01100점 만점에 Fable 5가 40점으로 가장 우수하고,
00:04:045.6은 22점,
00:04:05Kimi K3는 18점입니다.
00:04:09이 벤치마크는 뉘앙스가 중요하고
00:04:12회색 지대가 많은 상황에서 에이전트를 사용할 때 정말 중요합니다.
00:04:14결론적으로, Kimi K3는 이론적으로 매우 강력합니다.
00:04:17하지만 토큰 효율성이 높은 GPT 모델과 비교하면 저렴하다는 말은 다소 과장된 측면이 있습니다.
00:04:21게다가 Kimi K3는 약간 더 느리기도 합니다.
00:04:27성능, 비용, 속도 중에서 무엇이 가장 중요한지 선택해야 할 문제이죠.
00:04:32이제 프론트엔드 테스트를 진행해 보겠습니다.
00:04:34왼쪽에는 Fable 5를 Claude Code에서 실행하고,
00:04:35오른쪽에는 Kimi K3를 실행합니다.
00:04:37뒤쪽에는 Codex가 있고요.
00:04:39프롬프트로 SF 영화의 한 장면처럼 느껴지는
00:04:423D 지구본 여행 대시보드를 만들어 달라고 했습니다.
00:04:44단순한 웹사이트가 아닌 시각적 장관을 원했죠.
00:04:46창의적으로 해달라고 요청했고,
00:04:47한 번도 본 적 없는 아이디어를 보여달라고 했습니다.
00:04:49너무 구체적이지 않게 프롬프트를 짠 것은
00:04:50각 모델이 어떻게 다르게 해석하고 결과물을 만드는지 보고 싶었기 때문입니다.
00:04:52이제 테스트를 시작하겠습니다.
00:04:54여기 결과를 보시면, 이건 100점 만점인데
00:04:57이제 모두 살펴보고 마지막에 비용, 토큰 사용량, 시간을 비교하겠습니다.
00:05:00Kimi K3부터 보시죠.
00:05:033D 지구본이 나왔습니다. 확대/축소와 이동이 가능하네요.
00:05:06초고해상도는 아니지만 괜찮습니다.
00:05:08멕시코 시티 같은 곳을 클릭해도 특별한 일은 일어나지 않네요.
00:05:10다른 곳도 볼까요?
00:05:11케이프타운 같은 지점들도 표시되어 있습니다.
00:05:13왼쪽에는 활성 경로가 보입니다.
00:05:14도쿄 같은 경로를 클릭하니 이동하네요.
00:05:16오른쪽에는 비행 시간, 날씨,
00:05:19최적의 여행 시기, 입국 정보,
00:05:21현재 비용 등을 보여줍니다.
00:05:23왼쪽에서 항목을 클릭할 때마다
00:05:25해당 도시와 통계 정보로 연결됩니다.
00:05:27전반적으로 꽤 훌륭합니다.
00:05:30지구본도 낮과 밤 영역으로 나누어 보여줍니다.
00:05:32전체적으로 아주 괜찮네요.
00:05:34이제 Fable 5를 보겠습니다.
00:05:38일단 그래픽이 조금 더 깔끔해 보입니다.
00:05:39두 모델을 비교하면 좀 더 선명한 느낌이죠.
00:05:40조명 효과도 멋지고요.
00:05:42왼쪽에는 Claude Code에서 실행 중인 Fable 5가 있습니다.
00:05:45그리고 오른쪽에는 Kimi K3가 있는데,
00:05:46이 역시 Claude Code에서 실행 중입니다.
00:05:49정말 멋지네요.
00:05:51줌인 거리는 짧지만,
00:05:54더 많은 도시를 볼 수 있고 해상도도 좀 더 높아 보입니다.
00:05:55하나를 클릭해 보면
00:05:57이전처럼 통계 정보가 나타납니다.
00:05:59위도, 경도와 환경 조건도 보여주네요.
00:06:01이번 테스트에서 알 수 있듯,
00:06:02성능의 세부 사항에는 큰 차이가 있습니다.
00:06:04어떤 모델이 귀하의 요구에 맞을지 고민해 보시기 바랍니다.
00:06:06오늘 영상이 유익했다면 구독과 좋아요 부탁드려요.
00:06:08다음에도 더 깊이 있는 분석으로 찾아오겠습니다.
00:06:10시청해 주셔서 감사합니다.
00:06:13다음에 뵙겠습니다.
00:06:14건강 조심하세요.
00:06:15안녕히 계세요.
00:06:16궁금한 점은 언제든 댓글로 남겨주세요.
00:06:20여러분의 피드백은 큰 힘이 됩니다.
00:06:22이번 비교는 어떠셨나요?
00:06:23어떤 모델이 가장 마음에 드시나요?
00:06:24직접 써보시는 것도 추천드립니다.
00:06:25기술은 빠르게 발전하고 있으니까요.
00:06:28함께 계속 공부하죠.
00:06:30더 나은 결과물을 위해 노력하겠습니다.
00:06:34계속해서 정진하겠습니다.
00:06:35오늘의 결론입니다.
00:06:37Kimi K3는 가성비 모델로,
00:06:38특정 작업에 아주 유리합니다.
00:06:41하지만 상황에 따라,
00:06:43더 뛰어난 성능의 모델이 필요할 수도 있습니다.
00:06:43잘 비교해 보고 선택하세요.
00:06:46현명한 선택을 돕겠습니다.
00:06:51도움이 되었다면,
00:06:51다시 한번 강조하지만,
00:06:53구독을 꼭 눌러주세요.
00:06:55다음에 다른 주제로 돌아오겠습니다.
00:06:56끝까지 시청해 주셔서 감사합니다.
00:06:58오늘 영상에서 중요한 점들을 꼭 기억해 주세요.
00:07:01모델 간의 차이를 이해하는 것이 중요합니다.
00:07:02기술적인 발전은 매우 빠르니까요.
00:07:04최신 트렌드를 따라가 봅시다.
00:07:05성능 테스트는 계속됩니다.
00:07:07다음 테스트가 기대되시나요?
00:07:08곧 공개할게요.
00:07:09모두 고생 많으셨습니다.
00:07:10편안한 밤 되세요.
00:07:11감사합니다.
00:07:12또 봐요.
00:07:16오늘 배운 내용을 잘 활용해 보세요.
00:07:19준비가 되었습니다.
00:07:20많은 도움이 되었길 바랍니다.
00:07:21다음 영상에서 만나요.
00:07:23계속 지켜봐 주세요.
00:07:24함께 성장합시다.
00:07:24여러분의 성공을 응원합니다.
00:07:26질문은 언제나 환영입니다.
00:07:29감사해요.
00:07:29좋은 하루 보내세요.
00:07:31바이바이.
00:07:31영상 마무리합니다.
00:07:32끝까지 봐주셔서 다시 한번 감사드립니다.
00:07:34정말 유익한 시간이었길 바랍니다.
00:07:36열심히 준비했습니다.
00:07:38다음에 더 나은 퀄리티로 올게요.
00:07:39감사합니다.
00:07:39수고하셨습니다.
00:07:40이제 정말 끝낼게요.
00:07:43기다려주셔서 감사합니다.
00:07:44정말 고맙습니다.
00:07:45안녕히 가세요.
00:07:46좋은 시간 되세요.
00:07:46성공적인 하루 되세요.
00:07:47모두 행복하세요.
00:07:49감사합니다.
00:07:51다음에 또 만나요.
00:07:52낮과 밤을 전환할 수 있는
00:07:55작은 기능이 있는데, 정말 멋지네요.
00:07:57줌인할 수 있는 거리는 짧지만,
00:08:00이런 종류의 도시들을 더 많이 볼 수 있고
00:08:02충실도가 좀 더 높아 보입니다.
00:08:04그래서 그중 하나를 클릭하면,
00:08:06그렇죠,
00:08:06전과 똑같이
00:08:08통계 자료가 나타납니다.
00:08:09위도와 경도는 날씨와 시간,
00:08:11그리고 어떤 운임인지에 대한
00:08:12조건들을 보여줍니다.
00:08:15왕복 요금을 보여주는데,
00:08:16이 정보가 정확히
00:08:17어디서 나오는지는 확실하지 않네요.
00:08:19왼쪽에 있는 여기를 클릭하면,
00:08:21비슷하게,
00:08:22해당 도시로 이동합니다.
00:08:24몇 가지 통계와 함께
00:08:25비용도 확인할 수 있습니다.
00:08:27전반적으로,
00:08:29이 두 가지 UI의 완성도를 따져봤을 때,
00:08:33저는 Fable 5 쪽을
00:08:34더 선호하는 것 같습니다.
00:08:36특히 이런 식의,
00:08:38뭐랄까,
00:08:40있잖아요,
00:08:41낮과 밤이 교차하는
00:08:42그런 연출이 마음에 드네요.
00:08:44흥미로운 점은,
00:08:45낮 시간대 중
00:08:46언제인지 설정을 바꾸면
00:08:48그에 맞춰서
00:08:48오른쪽에 있는 비용도
00:08:50업데이트된다는 겁니다.
00:08:51실제로 그곳에 도착할 시간이
00:08:52언제인지에 따라서요.
00:08:53그래서 상당히 괜찮네요.
00:08:55자, 이제 GPT 5.6을 봅시다.
00:08:56첫인상은,
00:08:59지구본 자체만 봤을 때
00:09:01Kimmy K3나 Fable에서
00:09:02본 것들에 비하면
00:09:03한 단계 후퇴한 느낌입니다.
00:09:04이 지구본들은
00:09:04분명 더 많은 정보가 담겨 있고
00:09:06훨씬 더 시각적인
00:09:07볼거리를 제공했거든요.
00:09:09이건,
00:09:09좀 더 SF 영화 같은
00:09:11느낌을 추구한 것 같아요.
00:09:11무작위로 표시되는 것들,
00:09:12이건 뭐죠?
00:09:15여기를 클릭하면 나타나야 하는 건가요?
00:09:17알겠습니다.
00:09:17싱가포르 같은 특정 도시를 클릭하면
00:09:19똑같이 팝업이 뜨긴 하는데,
00:09:20지구본 자체를 가려버리고
00:09:21글씨도 너무 작아서
00:09:23읽기도 힘드네요.
00:09:24하단에 보면
00:09:24낮과 밤을 전환하는
00:09:26슬라이더 같은 게 있긴 한데
00:09:27Fable 5처럼 부드럽지 않아요.
00:09:29밤이 되면 대륙 자체가
00:09:31거의 보이지도 않고요.
00:09:33저 불빛들이 아마
00:09:35도시들을 의미하는 것 같습니다.
00:09:36왼쪽을 클릭해보면,
00:09:37네,
00:09:39아까처럼 해당 도시들로 이동합니다.
00:09:42하지만 다시 말하지만,
00:09:43앞서 본 두 모델에 비해
00:09:44확실히 수준이 낮아 보입니다.
00:09:45종합적으로 봤을 때,
00:09:46이 셋을 비교하자면
00:09:47Fable 5를 1위로 꼽겠습니다.
00:09:49그 뒤를 이어
00:09:50Kimi K3를,
00:09:51마지막 3위에는
00:09:53GPT 5.6을 놓겠습니다.
00:09:53이제 토큰과 시간,
00:09:54비용을 비교해봅시다.
00:09:56최종 결과물은 확인했지만,
00:09:56실제 비용은 어느 정도였을까요?
00:09:57Kimi,
00:10:00Fable,
00:10:02그리고 Codex(X라고 부르겠습니다)를
00:10:04비교해 보겠습니다.
00:10:05토큰 사용량 면에서는,
00:10:07Kimi가 압도적으로
00:10:09가장 많이 사용했습니다.
00:10:10결과물을 만드는 데
00:10:11무려 2,150만 토큰이
00:10:13사용되었습니다.
00:10:15시간으로 치면,
00:10:161시간 33분이 걸렸네요.
00:10:17결과를 얻는 데
00:10:1990분 이상 소요되었고,
00:10:212,150만 토큰이 소비된 거죠.
00:10:24비용은 Open Router 기준으로
00:10:268.66달러였습니다.
00:10:30다음은 Fable입니다.
00:10:31토큰 사용량은
00:10:33350만 토큰입니다.
00:10:35시간으로 보면,
00:10:37불과 17분밖에 안 걸렸고,
00:10:39총비용은
00:10:3911.64달러였습니다.
00:10:42다시 말하지만,
00:10:42제가 처음에
00:10:43오픈 라우터를 통해서였죠,
00:10:44속도와 토큰 효율성이었죠.
00:10:47Kimi K3는 그 측면에서,
00:10:49특히 시간 면에서
00:10:50Fable보다 확실히 뒤처집니다.
00:10:53토큰당 비용을 봤을 때
00:10:55얼핏 보면 Kimi가
00:10:56Fable 비용의 3분의 1 수준이라
00:10:58효율적일 것 같지만,
00:11:00실제로는 그렇지 않습니다.
00:11:02Fable보다 저렴한 건 맞지만,
00:11:02효율성은 떨어지죠.
00:11:03그다음은 Codex인데,
00:11:04솔직히 결과물은 좀 실망스러웠습니다.
00:11:06560만 토큰을 사용했고,
00:11:07시간은 25분,
00:11:09총비용은 5.66달러였습니다.
00:11:09토큰과 비용이 왜 광고된 수치와
00:11:11딱 들어맞지 않는지
00:11:11궁금하실 텐데요,
00:11:12세 모델 모두 캐싱 작업이
00:11:14많이 들어갔기 때문입니다.
00:11:15결국 무슨 뜻일까요?
00:11:16핵심은 Kimi입니다.
00:11:16토큰 소모가 매우 심하고,
00:11:17너무 오래 걸려요.
00:11:181시간 반이라니,
00:11:19영상을 제작할 때는
00:11:20예시를 3~4개 정도
00:11:20만들까 고민했지만,
00:11:22이 작업을 하는 데 20시간을
00:11:23다 쓸 수는 없죠.
00:11:25프런티어 모델들과 비교하면
00:11:26확실히 뒤처지지만,
00:11:27결과물 자체는 괜찮았습니다.
00:11:28모든 것을 고려했을 때,
00:11:28꽤 잘 해냈다고 생각해요.
00:11:29가장 비싼 모델은 당연히 Fable이었고,
00:11:32가장 저렴한 건 Codex였습니다.
00:11:33그럼 여기서 우리가 알 수 있는 건 뭘까요?
00:11:35최소한 프런트엔드 측면에서,
00:11:36그리고 코딩 작업에서도
00:11:38비슷하게 적용될 것 같네요.
00:11:39...
00:11:40...
00:11:42왜 그게
00:11:42정확히 일치하지 않는지
00:11:43입력값이나
00:11:44출력값,
00:11:44그리고 광고와 비교했을 때 말이죠,
00:11:46그 세 가지 모두
00:11:47캐싱이 많이 일어나고 있다는 점을
00:11:48이해해야 합니다.
00:11:49그럼 이건
00:11:51무슨 의미일까요?
00:11:52...
00:11:52...
00:11:53...
00:11:55...
00:11:56토큰 소모가 매우 많았고
00:11:57시간이 엄청 오래 걸렸어요.
00:11:59한 시간 반이나
00:12:00...
00:12:00솔직히 말씀드리면,
00:12:01이 영상을 만들 때
00:12:01...
00:12:02...
00:12:02...
00:12:03...
00:12:03...
00:12:04...
00:12:05...
00:12:06여기에 앉아서
00:12:0720시간 동안 작업할 순 없어요.
00:12:09...
00:12:09...
00:12:10두 곳 모두 너무 뒤처져서
00:12:11그 두 영역에서
00:12:12프론티어 모델과 비교하면요,
00:12:13...
00:12:14...
00:12:15...
00:12:15전반적으로
00:12:16아주 잘했다고 생각해요.
00:12:17모든 걸 고려했을 때 말이죠.
00:12:18그리고 가장 비싼
00:12:19모델은 당연히
00:12:20...
00:12:20...
00:12:21코덱스가
00:12:22가장 저렴했죠.
00:12:24그럼 이 결과들로부터
00:12:26무엇을 알 수 있을까요?
00:12:27글쎄요,
00:12:27제가 생각하기에 우리가
00:12:29적어도 여기
00:12:29프론트엔드 측면에서,
00:12:31그리고 아마도
00:12:32코딩 쪽에도
00:12:32동일하게 적용될,
00:12:33벤치마크를
00:12:33액면 그대로 본다면,
00:12:34키미가
00:12:36경쟁할 수 있다는 겁니다.
00:12:37키미 K3는
00:12:38오픈 소스 모델로서
00:12:39경쟁이 가능합니다.
00:12:405.6 버전의 페이블과 말이죠.
00:12:42하지만,
00:12:43생각만큼
00:12:45저렴하진 않습니다.
00:12:46경우에 따라서는,
00:12:47오히려 더 비싸죠.
00:12:49그리고 정말 느립니다.
00:12:51정말 너무 느려요.
00:12:54이건 어떤 면에서
00:12:55많은 사람들에게
00:12:55결정적인
00:12:56단점이 될 수 있습니다.
00:12:58하지만,
00:12:58그런 부분이 괜찮다면,
00:13:01있잖아요,
00:13:02그다지 큰
00:13:03단점이 아닐 수도 있죠.
00:13:03하지만 제가 생각하기에
00:13:04벤치마크와 수치들 속에서
00:13:05종종 간과되는
00:13:06중요한 점은
00:13:06바로 비용입니다.
00:13:07그렇지 않나요?
00:13:08왜냐하면,
00:13:09토큰 사용의
00:13:09비효율성 때문에
00:13:10생각했던 것만큼
00:13:11저렴하지
00:13:12않기 때문이죠.
00:13:12실제 토큰을 사용할 때
00:13:14말이죠.
00:13:15그럼 이제
00:13:16마무리하도록 하죠.
00:13:16키미 K3에 대해
00:13:17더 자세히 알려드릴
00:13:18수 있었길 바랍니다.
00:13:19정말 대단하다고 생각해요.
00:13:20경쟁할 수 있는
00:13:21오픈 소스 모델이 있다는 건
00:13:22하지만 너무 앞서
00:13:23나가지 말자고요,
00:13:23그 모델의
00:13:24순수한 성능이나
00:13:25특히
00:13:26비용 면에서는요.
00:13:27돈과 시간,
00:13:28양쪽 모두 말이죠.
00:13:29그럼,
00:13:30어떻게 생각하셨는지 댓글로
00:13:31알려주세요.
00:13:31제 클라우드 코드 마스터클래스를
00:13:32수강하고 싶으시다면
00:13:32체이스 AI 플러스도
00:13:33확인해보세요.
00:13:34요즘에는
00:13:35코덱스 마스터클래스도
00:13:36포함되어 있습니다.
00:13:37그럼 다음 영상에서,
00:13:39다시 뵙겠습니다.

핵심 요약

Kimi K3는 이론적으로 저렴한 단가를 제공하지만, 실제 코딩 작업 시 토큰 효율성이 낮고 작업 속도가 현저히 느려 GPT 5.6이나 Fable 5 대비 실질적인 경제성 이점은 크지 않다.

하이라이트

  • Kimi K3는 2.8조 개의 매개변수를 가진 오픈 웨이트 모델이며 일반적인 개인용 컴퓨터에서는 실행이 불가능하다.

  • Kimi K3의 입력 비용은 토큰 100만 개당 3달러로 GPT 5.6의 60%, Fable 5의 30% 수준이다.

  • 실제 지능 작업당 비용을 측정하면 Kimi K3는 0.95달러인 반면 GPT 5.6은 1.04달러로 실제 운영 시 비용 차이는 10% 미만이다.

  • 3D 대시보드 생성 테스트에서 Kimi K3는 2,150만 토큰을 소모하며 1시간 33분이 소요되었으나 Fable 5는 350만 토큰으로 17분 만에 완료했다.

  • 환각 현상을 측정하는 전지전능 지수에서 Fable 5가 40점, GPT 5.6이 22점, Kimi K3가 18점을 기록했다.

타임라인

모델 벤치마크와 비용 구조 분석

  • Kimi K3는 2.8조 개의 매개변수를 가진 오픈 웨이트 모델이다.
  • 이론적 토큰 단가는 경쟁 모델 대비 최저가 수준이다.
  • 실제 작업 완료 비용은 GPT 5.6과 10% 미만의 차이를 보인다.
  • 중국 오픈 소스 모델은 역사적으로 벤치마크 대비 속도가 느리다.

Kimi K3가 프로그래밍 벤치마크에서 우수한 성적을 거뒀다는 평가 이면의 맥락을 분석한다. 오픈 웨이트 모델이라는 장점이 있으나 개인이 로컬에서 실행하기엔 대규모 하드웨어가 필요하다. 토큰당 가격은 낮지만 실제 작업을 완료하기까지 소모되는 토큰 효율성이 낮아 지능 작업당 실제 비용은 GPT 5.6과 큰 차이가 없다.

프론트엔드 코드 실습 비교

  • 3D 지구본 대시보드 생성 테스트 결과 Fable 5가 시각적 완성도와 성능 면에서 가장 우수하다.
  • Kimi K3는 기능적으로 작동하나 그래픽 해상도와 세밀한 상호작용 면에서 Fable 5에 뒤처진다.
  • GPT 5.6은 지구본 시각화와 팝업 가독성 면에서 가장 낮은 완성도를 보인다.

세 가지 모델에 3D 지구본 여행 대시보드 생성을 요청하여 직접 비교한다. Fable 5는 깔끔한 조명 효과와 부드러운 낮/밤 전환 UI를 제공하는 반면, Kimi K3는 기본 기능은 충실하나 정교함이 부족하다. GPT 5.6은 지구본이 데이터를 가리는 등 SF적인 연출에 치중하여 실사용 측면에서 가장 불편했다.

비용 효율성과 속도 종합 평가

  • Kimi K3는 2,150만 토큰 소모와 93분의 작업 시간이 소요되어 토큰 효율이 가장 낮다.
  • Fable 5는 350만 토큰과 17분 만에 작업을 완료하여 압도적인 효율을 보였다.
  • 데이터 캐싱 작업으로 인해 실제 소모된 비용은 광고된 단순 단가와 큰 차이가 있다.

실제 코드 생성 작업에 들어간 시간과 비용을 정밀하게 측정했다. Kimi K3는 광고된 저렴한 단가와 달리 극심한 토큰 소모와 긴 처리 시간으로 인해 실제 대규모 프로젝트 적용 시 불리하다. 속도와 효율성을 중시한다면 Fable 5가 실질적으로 더 합리적인 선택이 될 수 있음을 결론짓는다.

커뮤니티 글

모든 글 보기