스크립트
00:00:00현재 완전히 무료로 사용할 수 있는 최고급 모델이 있는데, 아무도 그 정체를 모릅니다.
00:00:04옥스알파(oxalpha)라고 불리며 open router, open code klein 및 news portal에서 무료로 제공되고 있습니다.
00:00:08100만 토큰의 컨텍스트 윈도우를 가지고 있으며 텍스트, 이미지, 비디오를 처리하고 정말
00:00:13인상적인 결과를 보여줍니다. 아무도 그 정체를 밝히지 않지만 꽤 좋은 단서들은 가지고 있죠.
00:00:22이 모든 것은 open code가 '옥스알파 스텔스 모델 향후 일주일간 무료'라고 트윗하면서 시작되었습니다.
00:00:26100만 컨텍스트 멀티모달, 제로 데이터 보존이며 하루에 100조 개의
00:00:31토큰을 처리할 수 있는 용량을 가지고 있다고 했습니다. 이에 이어 open router도 동일한 발표를 했고, news research는
00:00:36하루에 1경 개의 토큰을 처리할 수 있는 용량이 있다고 밝혔습니다. 정말 엄청나게 큰
00:00:40스텔스 런칭입니다. 본격적으로 탐정 놀이를 시작하기 전에, 과연 그럴 가치가
00:00:44있는지 물어볼 필요가 있습니다. 이 모델이 실제로 좋을까요? 대답은 복합적입니다. klein은 다음과 같은 벤치마크를 트윗했습니다.
00:00:49deep swe bench에서 fable과 soul을 상당한 차이로 이기는 것을 보여주지만, 제 생각에는 이것이 오해의 소지가 있습니다.
00:00:54이것이 fable보다 낫다고 말하는 사람은 클릭베이트를 유도하거나 과장하는 것입니다. 저는
00:00:58그러려고 여기에 있는 게 아니니, 이에 공감하신다면 구독해 주세요. 이것의 출처는 실제로는 벤의 트윗이었습니다.
00:01:03그가 deep swe의 10가지 작업에서 테스트를 실행한 결과죠. 그래요, 그 작업들에서는 gpt 5.6을 이겼지만, 더 완벽한
00:01:08실행에서는 63%에 가까운 모습을 보여주며 grok, deep seek, gemini 혹은 fable
00:01:14그리고 중간 노력 수준의 5.6 soul과 비슷한 수준을 보입니다. 비교할 때 이 점을 명심하세요. 또 다른
00:01:18흥미로운 점은 평균 47,000개의 출력 토큰을 기록했다는 점인데, 이는 폐쇄형
00:01:23모델에 더 가깝습니다. 하지만 제 생각에는 폐쇄형 모델이 아닌 것 같습니다. 현재 트위터에는 너무나 많은 억측이 난무하고 있으므로,
00:01:28이러한 경쟁 벤치마크들을 모두 비교하는 대신, 직접 사용해 봅시다. 그리하여
00:01:32이러한 모델들이 출시될 때마다 제가 실행하는 평소의 테스트들을 진행했습니다. 첫 번째는
00:01:36다양한 기능이 포함된 개인 재무 관리 대시보드 테스트인데, 사용할
00:01:40기술 스택은 알려주지 않습니다. 단지 풀스택 애플리케이션을 원할 뿐이죠. 이 모델들이 실제로 어떤 기술 스택을 선택할지 꽤 궁금하기 때문입니다.
00:01:44여기서 볼 수 있듯이 저는 옥스알파를 사용했고 84,000개의 토큰이 사용되었으며, 실제로 45분 동안 실행되었습니다.
00:01:50다행히도 이 모델은 완전 무료입니다. 또한 fable medium, soul
00:01:55medium, deep seek, glm 5.3, gemini 3.7 flash 및 kimmy k3와도 비교했습니다. 이것이 오픈 모델이라고 확신하기 때문에
00:02:01그들과 비교해보고 싶었지만, 최첨단 모델들과 비교했을 때 성능이 어떨지도 궁금했습니다.
00:02:05단일 프롬프트로 옥스알파로부터 받아낸 결과는 다음과 같습니다. 정말
00:02:09인상적이라고 말할 수밖에 없네요. 대단히 유용한 앱입니다. UI가 마음에 들고 꽤 shadcn 스타일로 코딩되어 있으며 이 모든
00:02:15페이지들이 작동합니다. 기능이 작동하는지 확인해 보았는데, 전체적으로 말씀드린 대로 유용한 앱입니다. 혼자서
00:02:20개인용 소프트웨어를 만든다면 이와 같은 모습이어도 전혀 불만스럽지 않을 것입니다.
00:02:24실제 코드 측면에서도 꽤 합리적인 스택을 선택했습니다. 굳이 불평할 수 없는 Next.js를 사용했고,
00:02:28Drizzle과 Better SQLite를 사용했는데 아주 훌륭한 선택입니다. 일부 모델들은 사용하지 않는
00:02:33실제 데이터베이스를 사용했습니다. 전반적으로 이 개인 재무 대시보드 앱 작업에서 정말 훌륭한 일을 해냈다고 말하고 싶습니다.
00:02:37좋은 스택을 선택했고 앱도 유용합니다. 다음으로는
00:02:42deep seek v4 pro가 준 결과입니다. 처음 이것을 보았을 때 옥스알파가 deep seek 모델 중 하나일 수도 있겠다고 생각했습니다.
00:02:46이 UI들이 엄청나게 유사하기 때문이죠. 하지만 이 역시
00:02:50매우 유용한 UI이며 불평할 수 없습니다. 매우 shad cn 앱 같은 모습이고 이 모든 계정,
00:02:55트랜잭션, 목표 탭들이 실제로 작동합니다. 다만 실제 탭이라기보다는 페이지 내의 다른
00:02:59지점으로 이동하는 방식이라는 점에서 옥스알파와는 약간의 차이가 있습니다. 하지만 UI는
00:03:03믿을 수 없을 정도로 유사하며 코드도 그렇습니다. 선택한 스택을 살펴보면, 이 역시 Next
00:03:08JS와 Better SQLite를 선택했습니다. 유일한 차이점은 Drizzle을 사용하지 않고
00:03:12데이터베이스를 직접 사용하는 방식을 택했다는 점입니다. Drizzle 레이어가 있었으면 더 좋았을 텐데요. deep seek은 실제로 이 작업에 15분이 걸렸고
00:03:1619센트가 들었습니다. 옥스알파와 유사한 점이 많지만 옥스알파는 아니라고 생각하며, 그 이유는 잠시 후에 알게 될 것입니다.
00:03:21오픈 모델들을 계속 살펴보면, 이것은
00:03:25많은 사람들이 현재 최고의 오픈 모델이라고 생각하는 kimmy k3가 준 결과입니다. 이 모델은
00:03:29실제로 38분이 걸렸고 1달러 92센트가 들었습니다. 가격이 꽤 많이 올랐죠. 이 역시
00:03:34옥스알파와 꽤 비슷합니다. 옥스알파는 분명 중국산 오픈 모델이거나, 적어도 베이스는 그렇습니다. 모두 같은 종류의 동일한 UI 디자인을 사용하고 있으니까요.
00:03:39모두 잘 작동하는 것을 볼 수 있습니다. 멋진 대시보드가 있고 계정 페이지, 트랜잭션, 목표 기능이 있습니다.
00:03:44이 모델은 옥스알파와 좀 더 유사하게 그것들을 위해 실제로 별도의 페이지를 만들었습니다. 하지만 이 역시 모든 것이 꽤 표준적이며 유용합니다.
00:03:48다만 kimmy가 상당히 다른 점은 코드에 있습니다. 순수 React 프론트엔드를 사용했고,
00:03:52라우팅 같은 것은 전혀 없습니다. 백엔드의 경우
00:03:56Express 서버를 선택했고 데이터베이스로는 node sqlite를 사용했습니다. 데이터베이스는 있지만, 솔직히
00:04:001달러 92센트라는 가격을 생각하면 저는 옥스알파와 deep seek이 제공한 결과가 더 좋습니다.
00:04:05향후 확장할 수 있는 완전한 Next.js 앱이었으니까요. 이제 오픈 모델에서 잠시 벗어나
00:04:10폐쇄형 모델들에 초점을 맞춰보겠습니다. 이것은 fable medium이 준 결과입니다.
00:04:14미디엄 수준이기 때문에 오래 생각하고 싶어 하지 않아서
00:04:193분 42초밖에 걸리지 않았지만, 비용은 2달러 60센트가 들었습니다. 이 모든 것들 중에서 가장 비쌌죠.
00:04:23그리고 결과는 꽤 실망스럽습니다. 단일 페이지일 뿐이며 기능은 수행합니다. 돈을 보낼 수 있고
00:04:27자금을 추가할 수 있으며 이 모든 것이 작동하지만, Express 백엔드가 포함된 순수 React 앱일 뿐이고
00:04:32실제 데이터베이스조차 사용하지 않습니다. 이 모든 것을 자바스크립트에 저장하므로 페이지를 새로 고치면
00:04:36모든 것이 사라집니다. 여기서 얻을 수 있는 교훈은, 고차원적 사고를 위해 이러한 오픈 모델 중 일부로 전환하여 비용을 절약하지 않는다면
00:04:41정말 큰 손해를 보고 있다는 것입니다.
00:04:45중간 노력 수준의 GPT 5.6 soul의 경우도 꽤 비슷합니다. 상당히 멋진 UI이며,
00:04:49매우 GPT스러운 코딩 방식입니다. 모노스페이스 아이브로우와 이러한 사이드 테두리들을 아주 좋아하죠.
00:04:54하지만 UI 외관에 대해서는 크게 불평할 수 없습니다. 다만 기능들이 실제로 작동하지는 않습니다. 계정,
00:04:58트랜잭션, 투자 또는 목표 탭으로 이동할 수 없으며 구현되어 있지 않습니다.
00:05:03송금과 자금 추가는 할 수 있지만, Next.js 앱 기반으로 구축해놓고 실제 데이터베이스를 사용하지 않았습니다.
00:05:08이번에도 모든 것을 자바스크립트에 저장하고 있을 뿐입니다. 아마도 여기에 4분밖에 쓰지 않았고
00:05:12비용이 33센트밖에 들지 않았기 때문이겠죠. 제가 시도해본 마지막 폐쇄형 모델은 Gemini 3.7 flash였으며,
00:05:16벤치마크와 일치하도록 높은 수준으로 설정했습니다. 보시다시피 오픈 모델들이
00:05:21우리에게 제공해 준 것과 매우 유사한 UI입니다. 저는 이것을 일종의 지난 세대 AI UI라고 부르는데,
00:05:26항상 비슷한 외관을 가지고 있습니다. fable과 OpenAI는 이 방식에서 벗어나고 있는 것 같지만,
00:05:31여기 있는 모든 기능은 실제로 작동하며 모든 탭도 실제로 작동하고 그 안에 내용도 들어있습니다. 따라서 Gemini 3.7
00:05:36flash에게 보너스 점수를 줍니다. 이 작업은 실제로 약 10분이 걸렸고 50센트가 들었습니다. 선택한 스택의
00:05:41경우, 실제로 Next.js 애플리케이션이지만 실제 데이터베이스를 사용하지 않았습니다.
00:05:46따라서 GPT 5.6과 꽤 비슷합니다. 이제 마지막 비교 대상인
00:05:50GLM 5.3으로 넘어가겠습니다. 이 모델을 마지막으로 남겨둔 이유가 있습니다. 보시다시피 UI가 꽤 멋지고,
00:05:56다른 모델들과는 다른 스타일을 취했습니다. 여전히 다른 모델들이 사용하는
00:06:00초록색 계열의 느낌이 있지만, 이 모델은 라이트 모드를 선택했습니다. 기능 면에서는
00:06:04우리가 가졌던 다른 모든 모델들과 꽤 유사하며 이 모든 기능들이
00:06:08작동합니다. 이 모델은 생성하는 데 실제로 약 50분이 걸렸고 결과적으로 5달러가 들었습니다.
00:06:13따라서 실제로 가장 비싼 모델입니다. 하지만 흥미로운 부분은 선택한 스택에 있습니다.
00:06:17Next.js 애플리케이션을 선택했고 Better SQLite를 사용했으며 Drizzle도 사용했습니다. 즉, 옥스알파가 사용했던 것과 정확히 같은
00:06:23설정입니다. 그것을 보고 나서 저는 Claude에게 이 모든 코드베이스들을 비교해달라고 요청하기로 결정했습니다.
00:06:28공통점이 있는지 확인하고 스텔스 모델이 무엇이라고 생각하는지 알아보기 위해서죠. 이것은
00:06:32Claude의 조사 결과 요약입니다. 보시다시피 Claude는 스텔스 모델이 GLM 모델일 것이라고 생각합니다. 테스트들을 살펴보면
00:06:36Claude가 수행한 작업 중 하나는 구조적 패턴을 비교하는 것이었습니다. 즉 컴포넌트가 어떻게 조립되는지 같은 것들이죠.
00:06:40GLM 5.3이 스텔스 모델과 22.4%의 공통점을 가지고 있음을 발견했으며, 이는 다른 모든 모델들보다 높은 수치입니다. 유일하게
00:06:46근접한 것은 19%를 기록한 deep seek입니다. 실제로 이 점은 허위 양일 수 있다고 언급하는데,
00:06:50옥스알파와 GLM 5.3 모두에서 Drizzle이 사용되었고 두 모델만 그것을 사용했기 때문입니다.
00:06:55실제로 Drizzle을 제외하고 보면 deep seek이 우리 스텔스 모델과 가장 공통점이 많습니다.
00:07:00그렇다면 이것이 정말 deep seek 모델일까요? 대답은 아마 아닐 것입니다. 다음으로
00:07:04일부 희귀 마커들을 살펴보았기 때문입니다. 이들은 각 코드베이스에서 당연하지 않은 선택들인데, 스텔스와
00:07:08GLM 5.3이 많은 부분을 공유하고 있음을 발견했습니다. 둘 다 pass amount to sense 함수를 사용했고 그 함수는
00:07:14거의 동일했습니다. 둘 다 drizzle orm을 사용했고 또한 둘 다 readme를 다시 작성했습니다. 다른 프로젝트 중에는
00:07:18이 작업을 한 곳이 없습니다. 이들만이 readme를 다시 작성했으며 readme 자체도 동일한
00:07:23구조를 가지고 있습니다. 따라서 이 모든 분석으로 볼 때 이것이 GLM 모델이거나, 적어도 GLM을 베이스로 사용했을 가능성이 매우 높습니다.
00:07:29제 말만 믿을 필요는 없습니다. 다른 많은 사람들이 이를 조사했으며, 토크나이저가
00:07:33GLM의 것과 거의 동일하고, GLM 모델들과 동일한 오류 메시지를 출력한다는 것을 발견했습니다.
00:07:38어쩌면 가장 강력한 단서는 이 모델의 비디오 인코더가 GLM 비전 모델과 정확히 동일한 토큰을 사용한다는 점일 것입니다.
00:07:43다른 유사성 목록이 있는 이 페이지의 링크를 아래에 남겨두겠지만, 제 생각에는
00:07:47이것이 GLM 모델이라는 점이 꽤 명확합니다. 이것은 이제 멀티모달인 GLM 5.5일 수도 있고, 어쩌면
00:07:52GLM 5.3의 사후 학습 버전일 수도 있으며, 더 흥미롭게도 플래시 버전일 수도 있습니다. GLM은 오픈 소스이므로 반드시 zai일
00:07:57필요도 없습니다. 다른 회사가 GLM을 가져와서 베이스로 사용했을 수도 있죠.
00:08:02전반적으로 매우 유능한 모델이며 이길 수 없는 가격을 가지고 있습니다.
00:08:07그리고 27일까지 지속될 예정이므로 가능할 때 이용해 보세요. 프롬프트와
00:08:11완료 결과물은 제공자에 의해 보관되지만 훈련에는 사용되지 않는다고 합니다. 여러분은
00:08:15이 모델이 무엇이라고 생각하시나요? 아래 댓글로 알려주시고 그동안 구독해 주세요.
00:08:19늘 그렇듯 다음 영상에서 뵙겠습니다.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기