스크립트
00:00:00지난주에 DeepSeq에서 V4 Flash를 출시했는데, 저는 대충 넘겨버렸습니다. 왜냐하면
00:00:04Artificial Analysis 인텔리전스 지수에서 52점밖에 받지 못했기 때문이죠. 이는 Kimi K3보다 8점 낮고,
00:00:09GLM 5.2와 Gemini 3.6 Flash 사이에 위치합니다. 하지만 제가 완전히 놓쳤던 부분은 바로 비용이었습니다. 전체 테스트 스위트를 실행하는 데
00:00:15Artificial Analysis에서 이 모델을 사용하면 72달러가 듭니다. 이는 동일한 지능 점수를 가진 모델들보다
00:00:2110배 더 저렴하고, Kimi K3보다는 33배 더 저렴합니다. 따라서 이 모델은 확실히
00:00:26한 번 살펴볼 만한 아주 흥미로운 모델이므로, 자세히 알아보겠습니다.
00:00:34모델 이름은 DeepSeq V4 Flash 0731이며, 요약하자면 3,000억 개의
00:00:39파라미터 중 130억 개가 활성화되며, 백만 토큰 컨텍스트 창을 지원하고,
00:00:44가중치는 이미 MIT 라이선스로 Hugging Face에 공개되어 있습니다. 곧바로 벤치마크로 넘어가서,
00:00:48인트로에서 말씀드린 것처럼 인텔리전스 지수에서 52점을 기록했으므로 최고 성능 모델은 아닙니다.
00:00:53하지만 여기 있는 21개 모델과 같은 주변 모델들의 맥락에서 살펴보면, 보시다시피
00:00:58Gemini 3.6 및 3.5 Flash, 최고 성능 설정의 GPT 5.6 Lunar, 최고 성능의 GLM 5.2,
00:01:05낮은 설정의 Opus 5와 잘 어울리며, 낮은 설정의 Kimi K3보다 4점 앞섭니다. 이를
00:01:11에이전트 지수로 전환해 보면, 동일한 모델들 중에서 DeepSeq가 실제로 세 번째로 좋은 모델임을 알 수 있습니다. 즉 최첨단은 아니지만,
00:01:15가격 면에서 압도적입니다. 동일한 21개 모델을 대상으로
00:01:20작업당 비용을 살펴보면, DeepSeq V4 Flash가 모든 모델 중에서
00:01:24가장 저렴하다는 것을 알 수 있으며, 비용이 같은 GPT 5.6 Lunar는 인텔리전스 지수에서
00:01:29실제로 2점 뒤처져 있습니다. 지능 면에서는 여전히 떨어지지만 낮은 설정의 Kimi K3 같은 다른 오픈 모델과 비교하면
00:01:34실제로 8배 더 저렴하며, GLM 5.2도 마찬가지입니다. Gemini 모델보다는 약 18배
00:01:39더 저렴하면서도 동일한 점수를 얻고, 당연히 Sonic 5보다 훨씬 저렴합니다.
00:01:44이 모든 것은 모든 모델의 이 모든 작업에서 세 번째로 많은 출력 토큰을 사용한다는 사실에도 불구하고 이뤄낸 결과로, 꽤 놀라운 결과입니다.
00:01:49지능 대 비용 그래프를 살펴보면, 가장 매력적인 사분면에 엄청나게 가까운 것을 볼 수 있습니다.
00:01:53GLM 5.2, GPT 5.6 Terra, Muse Spark 같은 모델들이 그곳에 있지만,
00:01:58실제로 DeepSeq V4 Flash보다 단 1점 앞서 있을 뿐이며,
00:02:03그 1점 차이를 얻으려면 9배의 가격을 지불해야 하므로 아마 그럴 가치는 없을 것입니다. RKGI 같은 벤치마크에서도 이 모델이 독보적인 위치에 있다는 것을
00:02:09확인할 수 있습니다.
00:02:13성능 수준에 비해 다른 어떤 모델보다 훨씬 저렴하기 때문입니다. 덧붙여서 이 벤치마크에서는
00:02:17최고 성능 설정의 Kimi K3를 실제로 이기며 20배나 더 저렴합니다. 토큰 자체의 순수 비용의 경우,
00:02:23DeepSeq는 백만 입력 토큰당 14센트, 백만 출력 토큰당 28센트를 광고하지만,
00:02:28Open Router로 가보면 다른 제공업체들이 더 저렴하게 제공하고 있으며, 평균은
00:02:33백만 입력 토큰당 약 8센트, 백만 출력 토큰당 25센트 정도입니다. 이를 비슷한 지능 수준의 다른 모델과 비교하면
00:02:38정말 훨씬 저렴합니다. 하지만 실제 사용에서는 얼마나 잘 작동할까요?
00:02:42저는 DeepSeq V4 Flash와 유사한 비교 모델 7개를 가져와 open code에서 정확히 동일한 프롬프트로 테스트하여
00:02:47개인 자산 관리 대시보드를 만들어 달라고 요청했습니다. 프론트엔드와 백엔드를 모두 포함하는
00:02:52풀스택 애플리케이션을 만들도록 빈 폴더를 제공했기 때문에,
00:02:56완전히 처음부터 시작하게 됩니다. 이것이 DeepSeq V4 Flash로부터 받은 결과입니다.
00:03:01실제로 두 번째로 저렴했고 속도는 여섯 번째로 빨라서 약간 느린 편이었는데,
00:03:05이 모델들이 어떻게 비교되는지에 대한 전체 차트는 마지막에 보여드리겠습니다. 하지만 우리가 볼 수 있는 것은
00:03:09어느 정도 작동하는 CRUD 앱이 있다는 점입니다. 반응성과 카드 크기 조절에
00:03:13무언가 문제가 좀 있지만 그 외의 기능은 모두 작동하며, 차트도 꽤 멋지게 잘 작동합니다. 자금 추가와 송금 같은 기능도
00:03:18테스트해 보았는데 잘 작동했고, 계좌, 거래 내역, 목표 페이지도
00:03:23정상적으로 작동하는 것을 볼 수 있습니다. UI 디자인의 경우, AI 모델들로부터 기대할 수 있는
00:03:28매우 표준적인 수준이라고 말할 수 있겠습니다. 요즘 최고 성능 모델들은 약간 다른 디자인을 사용하고 있을지도 모르지만,
00:03:33이것은 딱 전형적인 AI CRUD 앱 느낌입니다. 보여주는 기술 스택에도 꽤 만족하는데,
00:03:37React를 사용하고 있습니다. 19가 아니라 React 18을 사용하고 있긴 하지만요. 차트용으로는
00:03:42합리적인 선택인 recharts를 사용했고, 프론트엔드에는 V를 사용했습니다.
00:03:47서버의 경우 Express와 Cors를 사용했으며, Node SQLite를 사용해 실제
00:03:52데이터베이스를 실제로 사용했기 때문에 보너스 점수를 줄 수 있겠습니다. 다음으로, 최고 성능 설정의 GPT 5.6 Luna에서 얻은 결과를 살펴보겠습니다.
00:03:57말씀드리건대, 이 UI가 Deep Seek에서 얻은 것보다 훨씬 뛰어나서
00:04:01제가 올바른 모델을 선택했는지 두 번이나 확인해야 했습니다. 비용은 단 6센트밖에 들지 않았고
00:04:06만드는 데 6분이 걸렸습니다. 한 가지 알아둘 점은 Open Router가 현재
00:04:10GPT 5.6 Luna에 50% 할인 혜택을 제공하고 있어서, 할인이 없었다면 12센트가 들었을 것이라는 점입니다.
00:04:15따라서 Deep Seek보다 고작 몇 센트 더 비싼 셈인데, 이 UI 디자인이라면 그 가격 차이를 충분히 감수할 가치가 있다고 생각합니다.
00:04:20기능의 경우, 자금 추가와 송금은 테스트해 보았지만 계좌, 거래 내역, 목표 페이지로는 이동할 수 없습니다.
00:04:25모든 기능이 메인 페이지에만 있어야 합니다. 그러한 탭들을 실제로 구현하지는 않은 것이죠.
00:04:29하지만 선택한 기술 스택 면에서는 점수가 조금 깎입니다. React
00:04:3319, V, 그리고 서버용 Express를 선택했으니까요. 실제 데이터베이스와 관련해서는 이 파일 안에서
00:04:38모든 것을 인메모리 방식으로 처리해 버렸습니다. 물론 이는 원래 프롬프트를 수정하여
00:04:42실제 데이터베이스를 포함하라고 지시하면 해결할 수 있는 부분입니다. 자, 두 모델 모두 비용은 10센트 미만으로 들었는데요.
00:04:47이제 스펙트럼의 반대편으로 넘어가서 낮은 설정의 Opus 5가 우리에게 무엇을 주었는지 살펴보겠습니다. 비용은
00:04:529.65달러가 들었는데, 이는 다른 모델들보다 160배 이상 비싼 금액입니다. 여기서 보시다시피 꽤 괜찮은
00:04:59UI를 가지고 있습니다. 우리가 보아온 것과 비슷한 꽤 표준적인 CRUD 앱으로, GPT 5.6보다는
00:05:03Deep Seek의 것과 더 유사합니다. 그리고 Opus가 정말 잘 해낸 부분은 일부 기능 내부의 UI입니다.
00:05:09따라서 자금을 이체하거나 보낼 때, 이는 정말 잘 만들어진 UI라고 생각하며 이러한 모든 기능도
00:05:14잘 작동합니다. 계좌, 거래 내역, 예산, 목표, 투자 페이지가 모두 있죠. 실제
00:05:19코드와 관련해서는 여기서 볼 수 있듯이 꽤 표준적인 React 스택을 보여주지만,
00:05:23마이너스 점수를 받는 부분은 데이터베이스입니다. 이번에도 Express 데이터베이스를 사용하긴 했지만,
00:05:28실제 데이터베이스가 아닌 인메모리 데이터 저장소를 사용했기 때문입니다. 이제 나머지 5개 모델을 조금 더 빠르게 살펴보겠습니다.
00:05:31이 모델은 매우 높음 설정의 GLM 5.2입니다. 실제로 두 번째로 비쌌으며,
00:05:37비용은 3.68달러가 들었고, 47분으로 가장 오랜 시간이 걸렸습니다. 그래도 꽤 훌륭한 일을 해냈다고 말할 수 있겠네요.
00:05:43이것은 많은 모델들이 만들어내고 있는 표준적인 CRUD 앱처럼 보이며,
00:05:46대시보드, 계좌, 거래 내역, 목표 같은 모든 기능이 있고, 심지어
00:05:50이것들을 클릭하면 모든 것이 작동합니다. 백엔드를 위해 꽤 좋은 스택을 선택하기도 했습니다.
00:05:54실제로 Next.js를 사용하기로 선택한 유일한 모델이며, Prisma와 연결된 실제 데이터베이스를 사용했습니다.
00:05:59다음은 Gemini 3.6 flash인데, 여섯 번째로 비쌌고 비용은 1.69달러가 들었습니다.
00:06:05또한 11분으로 다섯 번째로 빨랐습니다. 이 모델이 해낸 작업에 대해 말하자면, 그렇게 훌륭하다고는 할 수 없겠습니다.
00:06:09모든 차트와 정보가 들어 있고 다른 앱들과 꽤 비슷한 외관을 가지고는 있지만요.
00:06:14상단에 상단 내비게이션 바를 선택했고, 전반적으로 우리가 보아온 다른 예시들보다 모든 것이 좀 더
00:06:19조잡해 보이는 감이 있어 다소 아쉽습니다. Gemini는
00:06:23예전에 UI 우위를 점하고 있었지만, 지금은 정말 OpenAI 쪽으로 넘어갔습니다. 이 모델도 꽤 평범한
00:06:27스택을 사용하여 React와 Express를 선택했지만, 데이터를 JSON 파일에 저장하고 있습니다.
00:06:32그다음으로는 중간 설정의 GPT 5.5가 있으며, 비용은 1.15달러로 다섯 번째로 비쌌지만
00:06:37단 7분 만에 완료하여 세 번째로 빨랐습니다. 자, 이 모델은 나머지 모델들과 비교했을 때 약간 이상한 작업을 해냈습니다.
00:06:42모든 것을 단일 페이지로 만들었습니다. UI 디자인은 꽤 괜찮은 편이라고 할 수 있겠네요.
00:06:47우리가 이미 보아온 많은 앱들이 가지고 있는 그 OpenAI UI 디자인이며, 모든 것이 잘 작동합니다.
00:06:52다만 진정한 풀스택 애플리케이션이라기보다는 단일 페이지 앱에 가깝습니다. 스택으로는 React와
00:06:57Express를 사용하긴 했지만, 인메모리 데이터 저장소를 선택했습니다. 이것이 제가 테스트한
00:07:01마지막 GPT 모델인 낮은 설정의 GPT 5.6 sold입니다. 이 모델은 네 번째로 저렴하며
00:07:05비용은 단 90센트밖에 들지 않았고, 단 3분 42초 만에 완료되어 가장 빨랐습니다. 보시다시피
00:07:11Luna와 꽤 유사한 UI 디자인이며, 제 생각에는 이것이 제가 테스트한 모든 모델 중에서 얻은 최고의 UI입니다.
00:07:15그리고 여기 있는 자금 추가 같은 모든 기능이 잘 작동하지만,
00:07:20계좌, 거래 내역, 예산, 목표 페이지는 없습니다. 그 탭들 중 어느 것도 작동하지 않습니다.
00:07:24또한 React와 Express라는 꽤 표준적인 스택을 골랐지만, 인메모리
00:07:28데이터 저장소를 가지고 있습니다. 마지막으로 제가 테스트한 모델은 낮은 설정의 Kimi K3였습니다. 세 번째로
00:07:32저렴하며 58센트를 기록했고, 8분이 걸려 네 번째로 빨랐습니다.
00:07:37하지만 여기서 제공하는 UI 디자인에 감탄하지는 않았다고 말씀드려야겠네요. 기술적으로는 모두 기능하지만
00:07:41DeepSeq의 것과 약간 비슷해 보이며, 그와 같은 수준이라고 할 수 있겠습니다. 하지만 모든
00:07:45기능이 잘 작동하고, 스택에 대해선 꽤 독특한 접근 방식을 취했습니다. 프레임워크를 전혀 사용하지 않고
00:07:50VanillaJS를 선택했으며, Express를 사용하고 데이터베이스로는 JSON 파일을 사용했습니다.
00:07:55여기서 제가 수행한 테스트 숫자가 약간 과했나 싶기도 하지만, 비슷한 점수를 가진 모델들이
00:07:58어떻게 비교되는지 정말로 확인하고 싶었습니다. 실행당 비용으로 얻은
00:08:02순위를 살펴보면, GPT 5.6 Luna가 확실히 여기서 승자라고 생각합니다. 아주 멋진
00:08:07UI 디자인을 6센트에 얻었으니까요. 다시 말씀드리지만, 할인이 없다면 12센트가 들었을 것이므로 DeepSeq보다 약간 더 비싸고
00:08:1250% 더 비싸지만, 그 UI 디자인 차이를 생각하면 확실히 승자입니다.
00:08:17Opus 5의 경우, 저는 이 작업 중 어떤 것에도 그것을 사용하지 않을 것입니다. 낮은 설정의 Opus 5는 9.65달러가 들었는데,
00:08:231달러 미만의 비용으로 GPT 5.6 Sol처럼 아주 인상적인 결과를 주는 모델들이 있으니 말입니다.
00:08:27하지만 한 가지 말씀드리고 싶은 것은 DeepSeq V4 Flash의 코드베이스에 관한 것입니다. 실제
00:08:32백엔드와 코드는 실제 데이터베이스를 선택했던 GPT 5.6 Luna 같은 것에 비해 정말 훌륭했습니다.
00:08:37그러므로 UI 디자인에는 OpenAI 모델을 사용하고 백엔드 코드 일부에는 DeepSeq V4 Flash를 사용한다면
00:08:43양쪽의 장점을 모두 취할 수 있을 것입니다. 각 모델이 실제로 실행된
00:08:46시간을 살펴보면, DeepSeq는 여기서 꽤 안 좋았습니다. 23분이 걸렸으니까요. 그에 비해
00:08:51그토록 인상적인 결과를 만들어내는 데 단 3분 42초밖에 걸리지 않은 5.6 Sol 같은 것과 비교하면
00:08:56속도면에서 약간의 개선이 필요하다고 생각하지만, 거듭 말하듯 비용이 워낙 저렴하니
00:09:00그게 정말 중요할까요? 전반적으로 DeepSeq V4 Flash는 꽤 유능한 모델이며, 단지 UI 디자인에 아주 뛰어나지는 않을 뿐입니다.
00:09:05제가 하고 싶었던 말은 거의 이게 다입니다. 중국 연구실들이 진입해서
00:09:09미국 연구실들의 가격을 낮추고 성능도 맞추는 이러한 트렌드는 정말 즐겁고,
00:09:13우리 모두에게 이득이 되는 가격 전쟁을 촉발할지도 모릅니다. 우리는 이미 OpenAI에서 그것을 목격했다고 생각합니다.
00:09:17그들은 아주 유능한 일부 모델들에 대해 정말 저렴한 가격 정책을 가지고 있습니다. 여러분은
00:09:21어떻게 생각하시나요? 이 모델을 사용해 보실 의향이 있다면 아래 댓글로 남겨주시고, 잠깐,
00:09:25구독해 주시며 언제나 그렇듯 다음 영상에서 뵙겠습니다.