스크립트
00:00:00새로운 AI 스텔스 모델이 공개되었으며, 최고 수준의
00:00:05OpenAI 및 Anthropic 모델들과 경쟁하는 벤치마크 점수를 기록하고 있습니다. 이름은 Union Alpha이며, 현재
00:00:10OpenRouter 같은 제공업체를 통해 무료로 사용해 볼 수 있습니다. 아직 어떤 AI 연구소가
00:00:16Union Alpha를 만들었는지는 알 수 없지만, 이 정도 벤치마크라면 자세히 살펴볼 가치가 충분히 있으며
00:00:21오늘 바로 그 작업을 진행해보려고 합니다. 먼저 Union Alpha를 여러분의 기기에
00:00:26설치하는 방법을 알려드리고, 주요 스펙을 분석한 뒤
00:00:31Fable, Astra, Opus 같은 모델들과 직접 정면 대결을 펼쳐보겠습니다. 정면 대결 테스트로 넘어가기 전에
00:00:37이 모델이 어떤 모델인지, 어떻게 이용할 수 있는지 조금 더 자세히 이야기해 보겠습니다. Union Alpha는 누가
00:00:43만들었는지 전혀 알려지지 않았지만, 컨텍스트 창 용량은 262,000토큰에 달하며 현재
00:00:50완전히 무료로 제공되고 있습니다. 성능에 관해서는 비공식 보고서 몇 가지가 있습니다. 바로
00:00:55이것이 DeepSuite 점수입니다. 이 그래프는 OpenRouter의 CEO가 올린 것이라 다소 이해관계의 충돌이 있을 수 있습니다.
00:01:00어쨌든 이것이 사실이라면, 여기 별표로 표시된 Union Alpha는
00:01:05Astra, Fable, Opus 5와 동일한 수준의 성능을 아주 저렴한 비용으로 내고 있다는 뜻이니 놀라울 다름입니다.
00:01:13하지만 DeepSuite의 열렬한 팬으로서 솔직히 말하자면, Gemini 3.8 Flash 같은 모델이
00:01:19이렇게 높은 점수를 기록하는 상황에서 이 지표가 얼마나 대단한 의미가 있는지는 잘 모르겠습니다. 그런 걸 보면 “이것이
00:01:25벤치마크의 절대적인 기준인가?”라는 의문이 들죠. 완벽한 벤치마크는 없습니다. 하지만 이 수치가 사실이라면 여전히 긍정적인 신호입니다.
00:01:31Alex는 이후 더 많은 통계를 게시했습니다. 마찬가지로 OpenRouter의 CEO이자 공동 창업자인 그는 이 모델이
00:01:37Terminal Bench 2.1 및 Swee Bench Verified에서 5.6 Sol 능가하며, Terminal Bench 2.1에서는
00:01:43Opus 5보다 뛰어난 성능을 보인다고 밝혔습니다. 현재는 Terminal Bench 2.1보다 훨씬 진보된 기준들이 사용되고 있으므로
00:01:50이러한 벤치마크 결과들은 거품을 감안하고 참고하시기 바랍니다. 하지만 사실이라면 매우 뛰어난 성능의 모델인 셈입니다. 그렇다면
00:01:57어떻게 이용할 수 있을까요? 가장 쉬운 방법은 OpenRouter를 이용하는 것입니다.
00:02:01OpenRouter.ai에 접속하여 계정을 생성하기만 하면 되며, 앞서 말씀드렸듯 완전히 무료이므로
00:02:06비용이 전혀 들지 않습니다. OpenRouter 계정이 준비되었다면 Union Alpha를 실행할
00:02:11인터페이스 도구가 필요합니다. 이번 시연에서는 OpenCode를 사용하고 있습니다. OpenRouter와 OpenCode의 연결은 아주 간단합니다.
00:02:18연결을 마친 후 아래쪽으로 이동하여 사용하실 모델을 선택해 주시면 됩니다. 여기서는
00:02:23Union Alpha를 선택했습니다. 이제 진행할 벤치마크 테스트 몇 가지에 대해 알아보겠습니다. 프론트엔드 디자인과 관련된
00:02:27테스트 2건을 진행했습니다. 게임 디자인도 시켜보았고, 모션 디자인도 시켜보았습니다. 그리고 마지막으로
00:02:33대용량 컨텍스트 창에서 필요한 정보를 얼마나 정확히 찾아내는지 확인하기 위해 변형된 8-needle 테스트를 실시했습니다.
00:02:39본격적인 비교 테스트에 들어가기에 앞서
00:02:42오늘의 후원자인 저 자신에 대해 잠시 소개해 드리겠습니다. Chase AI Plus를 통해 최근 최신화된
00:02:48Claude Code 마스터클래스를 출시했으며, 해당 과정에는 Codex 마스터클래스도 포함되어 있어
00:02:53기술적 배경에 상관없이 누구나 AI 개발자로 거듭날 수 있는 최고의 환경을 제공합니다. 저희는 실무 활용 사례에 집중하며, 기초 지식이 없다는
00:02:59전제로 강의를 진행합니다. 따라서 본격적으로 이 분야를 배워보고 싶지만
00:03:04어디서부터 시작해야 할지 모르겠다면 이 강의를 추천합니다. 고정 댓글의 링크에서 확인하실 수 있습니다.
00:03:09첫 번째 테스트에서는 프론트엔드 디자인 수행 능력을 살펴보려고 했습니다. 그래서 외부 스킬을
00:03:14전혀 불러오지 않고 수행할 수 있도록 매우 간단하고 지침이 적은 프롬프트를 입력했습니다.
00:03:19프롬프트는 매우 단순했습니다. “런던에 있는 가상의 부티크 호텔 랜딩 페이지를 만들어줘,
00:03:25어떠한 스킬도 사용하지 마.” 그리고 3분 37초 만에 생성된 결과물이 바로 이것입니다. 스킬은 전혀
00:03:32사용되지 않았습니다. 지극히 단순한 프롬프트였죠. 히어로 섹션은 매우 지극히 평범하고, 여기에 롤링 배너
00:03:38같은 것이 하나 들어있습니다. 아래로 스크롤해 내려가 보면, 기본적으로 만들어낸 결과물이 나쁘지 않습니다.
00:03:46보통 흔히 볼 수 있는 요소들, 이를테면
00:03:51둥근 모서리나 어디서나 보이는 규격화된 카드 디자인 같은 정형화된 AI 느낌이 별로 나지 않는다는 점이 맘에 듭니다.
00:03:58그런 면에서는 다소 독창적인 편입니다. 전반적인 색상 조합 측면에서도
00:04:02딱히 흠잡을 데가 없습니다. 너무 심플해서 눈을 사로잡을 정도는 아닌가요? 당연히 그렇겠지만, 그건
00:04:08프롬프트 탓입니다. 그리고 실제로 작업도 비교적 빠르게 끝마쳤죠. 3분 반이면
00:04:12훌륭한 편입니다. 그래서 종합적으로 볼 때 이 결과물은 괜찮은 수준이라고 말하고 싶습니다. 이번엔 Opus
00:04:185의 높은 노력(high effort) 설정에서 동일한 프롬프트를 부여했습니다. Union
00:04:23Alpha에는 별도의 노력 설정 옵션이 없습니다. 이것이 Opus가 만들어낸 결과물입니다. 일단 시작부터 예약 가능 여부를
00:04:29확인할 수 있는 기능이 들어가 있다는 점이 마음에 드네요. 저쪽 결과물과 비교해 보면, 저기는 그냥 버튼 하나가 있을 뿐이고
00:04:34누르면 제일 아래로 이동할 뿐이라 이쪽만큼 직관적이지 못하죠. 이쪽이 훨씬 더 직관적입니다.
00:04:39SVG로 추정되는 배경 요소를 활용하여 훨씬 깊이감 있게 완성했습니다.
00:04:44페이지를 아래로 스크롤할 때 보셨을 수도 있겠지만 약간의 애니메이션 효과도 들어가 있습니다.
00:04:53전반적으로 저는 Opus가 만든 디자인이 좀 더 마음에 듭니다. 성능이 약간 더 우수한 것 같습니다.
00:05:00여전히 매우 심플하긴 하지만 그건 프롬프트 자체의 한계 때문입니다. 결과적으로 Opus의 판정승을 주고 싶네요.
00:05:09모든 벤치마크 테스트에 적용되는 이야기지만, Opus가 이 모델보다 결과가 잘 나왔다고 해서
00:05:14Union Alpha가 열등하다는 의미는 아닙니다. 이 모델의 실질적인 단가를 알기 전까지는
00:05:19성급히 성패를 단정하기 어렵습니다. 만약 OpenRouter가 공개한 DeepSuite 벤치마크 수치와
00:05:25비슷한 수준의 가격대로 형성된다면, 이 정도 품질은 대단한 결과물입니다.
00:05:30다만 품질 자체로만 본다면 Opus가 살짝 앞선다고 볼 수 있습니다. 두 번째 테스트에서도 랜딩 페이지 제작을 요청하되
00:05:35이번에는 훨씬 구체적인 프롬프트를 전달했습니다. 레이아웃 구현 방식에 대해서는 모델의 자체 재량에
00:05:40맡기도록 마지막 줄에 여지를 두긴 했지만, 몇 가지 명확한 가이드라인을 부여했습니다.
00:05:45“캘리포니아 조슈아트리에 위치한 가상의 사막 부티크 호텔인 Dune House의 세련된 반응형 홈페이지를 만들어줘”라고 요청했죠.
00:05:51그리고 완성된 결과물입니다. 만들어낸 페이지를 보면, 첫 번째 테스트에 비해
00:05:56엄청나게 발전했음을 단번에 느끼실 수 있습니다. 첫 테스트는 단순 지침만 주었을 때의 결과물이었고
00:06:01이것은 약간의 세부 가이드라인을 가미한 결과물입니다. 히어로 섹션에 사용된 이미지가 정말 마음에 들며,
00:06:06아래로 스크롤해 보면 확실히 한층 더 다듬어졌다는 것을 알 수 있습니다. 다만 Opus에서
00:06:11보았던 것처럼 페이지 상단에 예약 가능 여부를 조회하는 기능이 있었으면 더 좋았겠다는 아쉬움은 남지만,
00:06:17적절한 이미지 사용만으로도 완성된 웹페이지의 수준을 완전히 끌어올렸습니다. 동일한 프롬프트로 Astra가
00:06:23만들어낸 결과물도 살펴보겠습니다. 두 모델 모두 배경 이미지를 활용한 히어로 섹션을 채택했는데,
00:06:27매우 마음에 듭니다. Astra가 보여준 방식은 Opus의 결과물과 유사하게
00:06:33예약 가능 여부를 바로 확인할 수 있는 직관적인 영역을 갖추고 있어 마음에 듭니다. 그러나 스크롤을 내려보면
00:06:40이미지 활용 방식 등에서 상당한 유사점을 찾을 수 있으며, Astra의 결과물과
00:06:45Alpha Union의 결과물 사이의 격차는 그리 크지 않습니다. 굳이 따지자면 Astra에
00:06:51아주 근소한 우세를 주고 싶지만, 의미 있는 수준의 격차는 아닙니다. 프롬프트 조정 몇 번이면 거의 동등해질 정도입니다.
00:06:56그런 점에서 Alpha Union에 큰 찬사를 보내고 싶습니다. 이제 세 번째 테스트에서는
00:07:03게임 디자인 분야를 다뤄보고자 했습니다. 이전 영상에서 Fable과 Astra를 비교하며
00:07:07포트나이트 클론 게임을 만들어보게 했던 것과 동일한 작업입니다.
00:07:11Union Alpha에도 똑같은 프롬프트와 동일한 참조 이미지를 제공했으나, 완전히 실패하고 말았습니다.
00:07:16매번 오류가 발생했습니다. 이것이 OpenRouter 시스템 자체의 문제였는지,
00:07:20아니면 과도한 요청으로 인한 모델 자체의 능력 한계였는지는 판단하기 어렵습니다.
00:07:25그래서 대신 웹브라우저용 3D 아케이드 레이싱 게임을 제작하도록 지시했습니다.
00:07:32세련된 해안 고속도로 배경으로 지정하고 구현해야 할 요소들에 대해 가이드라인을 주었습니다.
00:07:37게임 제작 과정에서 몇 가지 오류가 생겨 세션을 다시 시작해야 했습니다. 모델 자체의 불완전함인지,
00:07:41아니면 단순 라우팅 오류였는지는 확실하지 않습니다.
00:07:46이것이 만들어진 게임인데, 함께 확인해 보시죠.
00:07:57Three.js를 기반으로 구현되었습니다. 조작감이 꽤 괜찮고 부드럽게 작동합니다. 복잡한 형태는
00:08:04아니며 단순한 순환형 트랙입니다. 물체와 충돌할 때 어느 정도 물리 엔진이 작동하며
00:08:11전반적인 핸들링도 깔끔하고 그래픽 완성도 역시 나쁘지 않습니다. 다음은 Astra의 결과물입니다.
00:08:17로딩 화면부터 매우 유사한 구성이 눈에 띕니다. 한번 시작해 보겠습니다.
00:08:26소리는 들리지 않으시겠지만 약간 거슬릴 수 있어 음소거 상태로 진행하며, 두 모델 모두 완전히 동일한 오디오를 사용했습니다.
00:08:30조작감과 체감 성능 역시 부드럽게 잘 작동합니다.
00:08:37물리 효과가 적용되어 가드레일에 부딪힐 수 있으며, 주행을 더 잘할 수 있도록 돕는 힌트 기능까지 제공됩니다.
00:08:43전반적으로 훌륭한 수준이며, Union Alpha의 결과물과 완벽히 동일한 등급으로 평가하고 싶습니다.
00:08:49두 모델 사이에 큰 차이점은 없었으며 사실상 똑같은 수준의 결과물을 내놓았습니다.
00:08:54솔직히 어떠한 벤치마크 항목에서든 Union Alpha가 선두 모델들과 대등한 성능을 보여준다면
00:09:00그 자체로 성공적인 성과라고 생각합니다. 다음 테스트에서는 모션 그래픽 구현 능력을 확인해 보고자 했습니다.
00:09:05Higgsfield 모션 스킬을 사용하여, 인터넷을 통해 메시지가 전송되는 과정을 설명하는
00:09:102D 모션 설명 영상을 제작하라고 지시했습니다. 완성된 영상은 다음과 같습니다.
00:09:30정말 완성도 높은 결과물이 나왔네요. 이어서 Astra의 결과물도 시청해 보겠습니다.
00:09:49두 모델 모두 매우 뛰어난 성능을 보여주었습니다. 이 테스트는 해당 모션 스킬 프레임워크를 기반으로
00:09:55SeedDance를 사용해 MCP 서버를 호출함으로써 만들어낸 결과입니다. 하지만
00:10:00Union Alpha 같은 모델에 모션 스킬을 결합했을 때 최첨단 프론티어 모델들과
00:10:05동일한 방식으로 문제없이 원활하게 작동함을 확인할 수 있어 유의미했습니다. 이제 Union Alpha의 마지막 평가로 8-needle
00:10:10테스트를 진행했습니다. 128k 용량의 공식 버전과 컨텍스트 창에 맞춘 200k 변형 버전 두 가지로 진행했습니다.
00:10:17이 테스트의 핵심 목적은 컨텍스트 창에 방대한 정보가 주어졌을 때 모델이 질문에 얼마나 정확히
00:10:22답변할 수 있는지 평가하는 것입니다. 200k 테스트에서는 Union Alpha의 컨텍스트 용량에
00:10:2920,0000토큰 분량의 텍스트를 가득 채워 넣었습니다. 텍스트 내부에는 8개의 유사한
00:10:37답변 데이터가 포함되어 있었습니다. 즉, 문서 안에 플라밍고에 관한 시가
00:10:428개 들어있다고 가정해 봅시다. 1번 플라밍고 시, 2번 플라밍고 시,
00:10:473번, 4번 시가 각각 미세하게 다른 내용으로 포함되어 있는 형태입니다.
00:10:52그리고 마지막에 “플라밍고에 관한 두 번째 시를 정확히 찾아와달라”고 요청합니다. 우선 모델은
00:11:00무엇이 플라밍고에 관한 시인지 식별해야 하고, 8개의 시를 정확히 분리해 낸 뒤
00:11:06정확히 두 번째 시만을 추출해 내야 합니다. 128k 버전으로 진행한 테스트에서는
00:11:13100%의 정답률을 기록했으며, 200k 변형 버전에서는 99.6%를 기록했습니다. 작은 아포스트로피 5개 정도의 차이만 있었습니다.
00:11:21이 결과는 컨텍스트 용량을 최대로 채운 상태에서도 질의에 대해 정확한 답변을
00:11:25출력할 수 있음을 증명합니다. 인상적인 정밀도입니다.
00:11:30종합해 보면 모든 벤치마크 항목에 걸쳐 완성도가 매우 뛰어난 모델로 판단됩니다.
00:11:35Opus, Fable, Astra와 비교해도 손색없는 성능을 보여주었습니다.
00:11:40정식 정식 출시 시 경쟁력 있는 가격대로 나온다면, 다양한 분야에 걸쳐
00:11:45기존 작업 환경에 도입해 활용하기 좋은 선택지가 될 것입니다.
00:11:50지속적으로 주목할 가치가 있는 모델입니다. Claude Code 및 Codex 마스터클래스를 수강하고 싶으시다면
00:11:57Chase AI Plus를 확인해 보시기 바라며, 오늘 영상은 여기서 마치겠습니다.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기