가장 뛰어난 가성비 모델 (DeepSeek V4 Flash)

BBetter Stack
컴퓨터/소프트웨어

스크립트

00:00:00지난주에 DeepSeq에서 V4 Flash를 출시했는데, 저는 대충 넘겨버렸습니다. 왜냐하면
00:00:04Artificial Analysis 인텔리전스 지수에서 52점밖에 받지 못했기 때문이죠. 이는 Kimi K3보다 8점 낮고,
00:00:09GLM 5.2와 Gemini 3.6 Flash 사이에 위치합니다. 하지만 제가 완전히 놓쳤던 부분은 바로 비용이었습니다. 전체 테스트 스위트를 실행하는 데
00:00:15Artificial Analysis에서 이 모델을 사용하면 72달러가 듭니다. 이는 동일한 지능 점수를 가진 모델들보다
00:00:2110배 더 저렴하고, Kimi K3보다는 33배 더 저렴합니다. 따라서 이 모델은 확실히
00:00:26한 번 살펴볼 만한 아주 흥미로운 모델이므로, 자세히 알아보겠습니다.
00:00:34모델 이름은 DeepSeq V4 Flash 0731이며, 요약하자면 3,000억 개의
00:00:39파라미터 중 130억 개가 활성화되며, 백만 토큰 컨텍스트 창을 지원하고,
00:00:44가중치는 이미 MIT 라이선스로 Hugging Face에 공개되어 있습니다. 곧바로 벤치마크로 넘어가서,
00:00:48인트로에서 말씀드린 것처럼 인텔리전스 지수에서 52점을 기록했으므로 최고 성능 모델은 아닙니다.
00:00:53하지만 여기 있는 21개 모델과 같은 주변 모델들의 맥락에서 살펴보면, 보시다시피
00:00:58Gemini 3.6 및 3.5 Flash, 최고 성능 설정의 GPT 5.6 Lunar, 최고 성능의 GLM 5.2,
00:01:05낮은 설정의 Opus 5와 잘 어울리며, 낮은 설정의 Kimi K3보다 4점 앞섭니다. 이를
00:01:11에이전트 지수로 전환해 보면, 동일한 모델들 중에서 DeepSeq가 실제로 세 번째로 좋은 모델임을 알 수 있습니다. 즉 최첨단은 아니지만,
00:01:15가격 면에서 압도적입니다. 동일한 21개 모델을 대상으로
00:01:20작업당 비용을 살펴보면, DeepSeq V4 Flash가 모든 모델 중에서
00:01:24가장 저렴하다는 것을 알 수 있으며, 비용이 같은 GPT 5.6 Lunar는 인텔리전스 지수에서
00:01:29실제로 2점 뒤처져 있습니다. 지능 면에서는 여전히 떨어지지만 낮은 설정의 Kimi K3 같은 다른 오픈 모델과 비교하면
00:01:34실제로 8배 더 저렴하며, GLM 5.2도 마찬가지입니다. Gemini 모델보다는 약 18배
00:01:39더 저렴하면서도 동일한 점수를 얻고, 당연히 Sonic 5보다 훨씬 저렴합니다.
00:01:44이 모든 것은 모든 모델의 이 모든 작업에서 세 번째로 많은 출력 토큰을 사용한다는 사실에도 불구하고 이뤄낸 결과로, 꽤 놀라운 결과입니다.
00:01:49지능 대 비용 그래프를 살펴보면, 가장 매력적인 사분면에 엄청나게 가까운 것을 볼 수 있습니다.
00:01:53GLM 5.2, GPT 5.6 Terra, Muse Spark 같은 모델들이 그곳에 있지만,
00:01:58실제로 DeepSeq V4 Flash보다 단 1점 앞서 있을 뿐이며,
00:02:03그 1점 차이를 얻으려면 9배의 가격을 지불해야 하므로 아마 그럴 가치는 없을 것입니다. RKGI 같은 벤치마크에서도 이 모델이 독보적인 위치에 있다는 것을
00:02:09확인할 수 있습니다.
00:02:13성능 수준에 비해 다른 어떤 모델보다 훨씬 저렴하기 때문입니다. 덧붙여서 이 벤치마크에서는
00:02:17최고 성능 설정의 Kimi K3를 실제로 이기며 20배나 더 저렴합니다. 토큰 자체의 순수 비용의 경우,
00:02:23DeepSeq는 백만 입력 토큰당 14센트, 백만 출력 토큰당 28센트를 광고하지만,
00:02:28Open Router로 가보면 다른 제공업체들이 더 저렴하게 제공하고 있으며, 평균은
00:02:33백만 입력 토큰당 약 8센트, 백만 출력 토큰당 25센트 정도입니다. 이를 비슷한 지능 수준의 다른 모델과 비교하면
00:02:38정말 훨씬 저렴합니다. 하지만 실제 사용에서는 얼마나 잘 작동할까요?
00:02:42저는 DeepSeq V4 Flash와 유사한 비교 모델 7개를 가져와 open code에서 정확히 동일한 프롬프트로 테스트하여
00:02:47개인 자산 관리 대시보드를 만들어 달라고 요청했습니다. 프론트엔드와 백엔드를 모두 포함하는
00:02:52풀스택 애플리케이션을 만들도록 빈 폴더를 제공했기 때문에,
00:02:56완전히 처음부터 시작하게 됩니다. 이것이 DeepSeq V4 Flash로부터 받은 결과입니다.
00:03:01실제로 두 번째로 저렴했고 속도는 여섯 번째로 빨라서 약간 느린 편이었는데,
00:03:05이 모델들이 어떻게 비교되는지에 대한 전체 차트는 마지막에 보여드리겠습니다. 하지만 우리가 볼 수 있는 것은
00:03:09어느 정도 작동하는 CRUD 앱이 있다는 점입니다. 반응성과 카드 크기 조절에
00:03:13무언가 문제가 좀 있지만 그 외의 기능은 모두 작동하며, 차트도 꽤 멋지게 잘 작동합니다. 자금 추가와 송금 같은 기능도
00:03:18테스트해 보았는데 잘 작동했고, 계좌, 거래 내역, 목표 페이지도
00:03:23정상적으로 작동하는 것을 볼 수 있습니다. UI 디자인의 경우, AI 모델들로부터 기대할 수 있는
00:03:28매우 표준적인 수준이라고 말할 수 있겠습니다. 요즘 최고 성능 모델들은 약간 다른 디자인을 사용하고 있을지도 모르지만,
00:03:33이것은 딱 전형적인 AI CRUD 앱 느낌입니다. 보여주는 기술 스택에도 꽤 만족하는데,
00:03:37React를 사용하고 있습니다. 19가 아니라 React 18을 사용하고 있긴 하지만요. 차트용으로는
00:03:42합리적인 선택인 recharts를 사용했고, 프론트엔드에는 V를 사용했습니다.
00:03:47서버의 경우 Express와 Cors를 사용했으며, Node SQLite를 사용해 실제
00:03:52데이터베이스를 실제로 사용했기 때문에 보너스 점수를 줄 수 있겠습니다. 다음으로, 최고 성능 설정의 GPT 5.6 Luna에서 얻은 결과를 살펴보겠습니다.
00:03:57말씀드리건대, 이 UI가 Deep Seek에서 얻은 것보다 훨씬 뛰어나서
00:04:01제가 올바른 모델을 선택했는지 두 번이나 확인해야 했습니다. 비용은 단 6센트밖에 들지 않았고
00:04:06만드는 데 6분이 걸렸습니다. 한 가지 알아둘 점은 Open Router가 현재
00:04:10GPT 5.6 Luna에 50% 할인 혜택을 제공하고 있어서, 할인이 없었다면 12센트가 들었을 것이라는 점입니다.
00:04:15따라서 Deep Seek보다 고작 몇 센트 더 비싼 셈인데, 이 UI 디자인이라면 그 가격 차이를 충분히 감수할 가치가 있다고 생각합니다.
00:04:20기능의 경우, 자금 추가와 송금은 테스트해 보았지만 계좌, 거래 내역, 목표 페이지로는 이동할 수 없습니다.
00:04:25모든 기능이 메인 페이지에만 있어야 합니다. 그러한 탭들을 실제로 구현하지는 않은 것이죠.
00:04:29하지만 선택한 기술 스택 면에서는 점수가 조금 깎입니다. React
00:04:3319, V, 그리고 서버용 Express를 선택했으니까요. 실제 데이터베이스와 관련해서는 이 파일 안에서
00:04:38모든 것을 인메모리 방식으로 처리해 버렸습니다. 물론 이는 원래 프롬프트를 수정하여
00:04:42실제 데이터베이스를 포함하라고 지시하면 해결할 수 있는 부분입니다. 자, 두 모델 모두 비용은 10센트 미만으로 들었는데요.
00:04:47이제 스펙트럼의 반대편으로 넘어가서 낮은 설정의 Opus 5가 우리에게 무엇을 주었는지 살펴보겠습니다. 비용은
00:04:529.65달러가 들었는데, 이는 다른 모델들보다 160배 이상 비싼 금액입니다. 여기서 보시다시피 꽤 괜찮은
00:04:59UI를 가지고 있습니다. 우리가 보아온 것과 비슷한 꽤 표준적인 CRUD 앱으로, GPT 5.6보다는
00:05:03Deep Seek의 것과 더 유사합니다. 그리고 Opus가 정말 잘 해낸 부분은 일부 기능 내부의 UI입니다.
00:05:09따라서 자금을 이체하거나 보낼 때, 이는 정말 잘 만들어진 UI라고 생각하며 이러한 모든 기능도
00:05:14잘 작동합니다. 계좌, 거래 내역, 예산, 목표, 투자 페이지가 모두 있죠. 실제
00:05:19코드와 관련해서는 여기서 볼 수 있듯이 꽤 표준적인 React 스택을 보여주지만,
00:05:23마이너스 점수를 받는 부분은 데이터베이스입니다. 이번에도 Express 데이터베이스를 사용하긴 했지만,
00:05:28실제 데이터베이스가 아닌 인메모리 데이터 저장소를 사용했기 때문입니다. 이제 나머지 5개 모델을 조금 더 빠르게 살펴보겠습니다.
00:05:31이 모델은 매우 높음 설정의 GLM 5.2입니다. 실제로 두 번째로 비쌌으며,
00:05:37비용은 3.68달러가 들었고, 47분으로 가장 오랜 시간이 걸렸습니다. 그래도 꽤 훌륭한 일을 해냈다고 말할 수 있겠네요.
00:05:43이것은 많은 모델들이 만들어내고 있는 표준적인 CRUD 앱처럼 보이며,
00:05:46대시보드, 계좌, 거래 내역, 목표 같은 모든 기능이 있고, 심지어
00:05:50이것들을 클릭하면 모든 것이 작동합니다. 백엔드를 위해 꽤 좋은 스택을 선택하기도 했습니다.
00:05:54실제로 Next.js를 사용하기로 선택한 유일한 모델이며, Prisma와 연결된 실제 데이터베이스를 사용했습니다.
00:05:59다음은 Gemini 3.6 flash인데, 여섯 번째로 비쌌고 비용은 1.69달러가 들었습니다.
00:06:05또한 11분으로 다섯 번째로 빨랐습니다. 이 모델이 해낸 작업에 대해 말하자면, 그렇게 훌륭하다고는 할 수 없겠습니다.
00:06:09모든 차트와 정보가 들어 있고 다른 앱들과 꽤 비슷한 외관을 가지고는 있지만요.
00:06:14상단에 상단 내비게이션 바를 선택했고, 전반적으로 우리가 보아온 다른 예시들보다 모든 것이 좀 더
00:06:19조잡해 보이는 감이 있어 다소 아쉽습니다. Gemini는
00:06:23예전에 UI 우위를 점하고 있었지만, 지금은 정말 OpenAI 쪽으로 넘어갔습니다. 이 모델도 꽤 평범한
00:06:27스택을 사용하여 React와 Express를 선택했지만, 데이터를 JSON 파일에 저장하고 있습니다.
00:06:32그다음으로는 중간 설정의 GPT 5.5가 있으며, 비용은 1.15달러로 다섯 번째로 비쌌지만
00:06:37단 7분 만에 완료하여 세 번째로 빨랐습니다. 자, 이 모델은 나머지 모델들과 비교했을 때 약간 이상한 작업을 해냈습니다.
00:06:42모든 것을 단일 페이지로 만들었습니다. UI 디자인은 꽤 괜찮은 편이라고 할 수 있겠네요.
00:06:47우리가 이미 보아온 많은 앱들이 가지고 있는 그 OpenAI UI 디자인이며, 모든 것이 잘 작동합니다.
00:06:52다만 진정한 풀스택 애플리케이션이라기보다는 단일 페이지 앱에 가깝습니다. 스택으로는 React와
00:06:57Express를 사용하긴 했지만, 인메모리 데이터 저장소를 선택했습니다. 이것이 제가 테스트한
00:07:01마지막 GPT 모델인 낮은 설정의 GPT 5.6 sold입니다. 이 모델은 네 번째로 저렴하며
00:07:05비용은 단 90센트밖에 들지 않았고, 단 3분 42초 만에 완료되어 가장 빨랐습니다. 보시다시피
00:07:11Luna와 꽤 유사한 UI 디자인이며, 제 생각에는 이것이 제가 테스트한 모든 모델 중에서 얻은 최고의 UI입니다.
00:07:15그리고 여기 있는 자금 추가 같은 모든 기능이 잘 작동하지만,
00:07:20계좌, 거래 내역, 예산, 목표 페이지는 없습니다. 그 탭들 중 어느 것도 작동하지 않습니다.
00:07:24또한 React와 Express라는 꽤 표준적인 스택을 골랐지만, 인메모리
00:07:28데이터 저장소를 가지고 있습니다. 마지막으로 제가 테스트한 모델은 낮은 설정의 Kimi K3였습니다. 세 번째로
00:07:32저렴하며 58센트를 기록했고, 8분이 걸려 네 번째로 빨랐습니다.
00:07:37하지만 여기서 제공하는 UI 디자인에 감탄하지는 않았다고 말씀드려야겠네요. 기술적으로는 모두 기능하지만
00:07:41DeepSeq의 것과 약간 비슷해 보이며, 그와 같은 수준이라고 할 수 있겠습니다. 하지만 모든
00:07:45기능이 잘 작동하고, 스택에 대해선 꽤 독특한 접근 방식을 취했습니다. 프레임워크를 전혀 사용하지 않고
00:07:50VanillaJS를 선택했으며, Express를 사용하고 데이터베이스로는 JSON 파일을 사용했습니다.
00:07:55여기서 제가 수행한 테스트 숫자가 약간 과했나 싶기도 하지만, 비슷한 점수를 가진 모델들이
00:07:58어떻게 비교되는지 정말로 확인하고 싶었습니다. 실행당 비용으로 얻은
00:08:02순위를 살펴보면, GPT 5.6 Luna가 확실히 여기서 승자라고 생각합니다. 아주 멋진
00:08:07UI 디자인을 6센트에 얻었으니까요. 다시 말씀드리지만, 할인이 없다면 12센트가 들었을 것이므로 DeepSeq보다 약간 더 비싸고
00:08:1250% 더 비싸지만, 그 UI 디자인 차이를 생각하면 확실히 승자입니다.
00:08:17Opus 5의 경우, 저는 이 작업 중 어떤 것에도 그것을 사용하지 않을 것입니다. 낮은 설정의 Opus 5는 9.65달러가 들었는데,
00:08:231달러 미만의 비용으로 GPT 5.6 Sol처럼 아주 인상적인 결과를 주는 모델들이 있으니 말입니다.
00:08:27하지만 한 가지 말씀드리고 싶은 것은 DeepSeq V4 Flash의 코드베이스에 관한 것입니다. 실제
00:08:32백엔드와 코드는 실제 데이터베이스를 선택했던 GPT 5.6 Luna 같은 것에 비해 정말 훌륭했습니다.
00:08:37그러므로 UI 디자인에는 OpenAI 모델을 사용하고 백엔드 코드 일부에는 DeepSeq V4 Flash를 사용한다면
00:08:43양쪽의 장점을 모두 취할 수 있을 것입니다. 각 모델이 실제로 실행된
00:08:46시간을 살펴보면, DeepSeq는 여기서 꽤 안 좋았습니다. 23분이 걸렸으니까요. 그에 비해
00:08:51그토록 인상적인 결과를 만들어내는 데 단 3분 42초밖에 걸리지 않은 5.6 Sol 같은 것과 비교하면
00:08:56속도면에서 약간의 개선이 필요하다고 생각하지만, 거듭 말하듯 비용이 워낙 저렴하니
00:09:00그게 정말 중요할까요? 전반적으로 DeepSeq V4 Flash는 꽤 유능한 모델이며, 단지 UI 디자인에 아주 뛰어나지는 않을 뿐입니다.
00:09:05제가 하고 싶었던 말은 거의 이게 다입니다. 중국 연구실들이 진입해서
00:09:09미국 연구실들의 가격을 낮추고 성능도 맞추는 이러한 트렌드는 정말 즐겁고,
00:09:13우리 모두에게 이득이 되는 가격 전쟁을 촉발할지도 모릅니다. 우리는 이미 OpenAI에서 그것을 목격했다고 생각합니다.
00:09:17그들은 아주 유능한 일부 모델들에 대해 정말 저렴한 가격 정책을 가지고 있습니다. 여러분은
00:09:21어떻게 생각하시나요? 이 모델을 사용해 보실 의향이 있다면 아래 댓글로 남겨주시고, 잠깐,
00:09:25구독해 주시며 언제나 그렇듯 다음 영상에서 뵙겠습니다.

핵심 요약

DeepSeek V4 Flash는 백만 입력 토큰당 8센트 수준의 압도적인 가격 경쟁력을 지니며, UI 디자인에서는 GPT 5.6 Luna가 더 우수한 결과물을 제공한다.

하이라이트

  • DeepSeek V4 Flash는 3,000억 개의 파라미터 중 130억 개가 활성화되며 백만 토큰 컨텍스트 창을 지원한다.

  • Artificial Analysis 테스트 스위트 실행 비용이 72달러로 동일 지능 점수 모델들보다 10배 저렴하다.

  • 백만 입력 토큰당 약 8센트, 백만 출력 토큰당 25센트의 평균 비용을 기록한다.

  • 풀스택 개인 자산 관리 대시보드 제작 테스트에서 DeepSeek V4 Flash는 23분이 걸렸으며 2번째로 저렴한 비용을 기록했다.

  • GPT 5.6 Luna는 6센트의 비용과 6분의 소요 시간으로 뛰어난 UI 디자인의 대시보드를 생성했다.

타임라인

DeepSeek V4 Flash 개요 및 비용 분석

  • Artificial Analysis 인텔리전스 지수에서 52점을 기록했다.
  • 전체 테스트 스위트 실행 비용이 72달러로 동급 모델 대비 10배 저렴하다.

초기에는 인텔리전스 지수 점수만 보고 지나쳤으나 압도적인 비용 효율성 측면에서 주목할 만한 가치를 지닌다. 동일한 지능 점수를 가진 모델들보다 10배, Kimi K3보다는 33배 더 낮은 비용으로 작동한다.

모델 스펙 및 벤치마크 성능

  • 3,000억 개의 파라미터 중 130억 개가 활성화되는 구조를 가졌다.
  • 백만 토큰 컨텍스트 창을 지원하며 가중치는 Hugging Face에 MIT 라이선스로 공개되었다.
  • 에이전트 지수에서 동일 모델군 중 3번째로 높은 성능을 기록했다.

최첨단 성능은 아니지만 가격 대비 성능 면에서 독보적인 위치를 차지한다. 백만 입력 토큰당 14센트, 백만 출력 토큰당 28센트로 광고되며 Open Router 평균가는 입력 8센트, 출력 25센트 수준이다.

풀스택 애플리케이션 제작 테스트

  • 개인 자산 관리 대시보드 제작 테스트에서 React 18, recharts, Express, Node SQLite 백엔드를 사용했다.
  • GPT 5.6 Luna는 6센트의 비용으로 훨씬 뛰어난 UI 디자인을 구현했다.
  • 낮은 설정의 Opus 5는 9.65달러가 소요되어 가장 높은 비용을 기록했다.

빈 폴더 상태에서 프론트엔드와 백엔드를 포함한 풀스택 애플리케이션 제작을 요청한 결과, DeepSeek V4 Flash는 실제 SQLite 데이터베이스를 연동한 CRUD 앱을 완성했다. 반면 GPT 5.6 Luna는 더 뛰어난 UI를 훨씬 적은 비용과 빠른 속도로 생성했다.

모델별 결과 비교 및 최종 평가

  • GLM 5.2는 Next.js와 Prisma 연동 실제 데이터베이스를 사용하여 3.68달러의 비용이 들었다.
  • GPT 5.6 Luna가 뛰어난 UI 디자인과 6센트라는 비용으로 가장 우수한 승자로 평가받았다.
  • 중국 연구실들의 저렴한 가격 정책이 미국 연구실들과의 가격 경쟁을 촉발하고 있다.

다양한 모델들을 테스트한 결과 UI 디자인에는 OpenAI 모델을 활용하고 백엔드 코드에는 DeepSeek V4 Flash를 조합하는 방식이 효과적이다. 중국 연구실의 진입으로 인한 가격 경쟁은 전체 사용자에게 이점으로 작용한다.

커뮤니티 글

모든 글 보기