미친 성능의 유니온 알파

CChase AI
컴퓨터/소프트웨어게임/e스포츠AI/미래기술

스크립트

00:00:00새로운 AI 스텔스 모델이 공개되었으며, 최고 수준의
00:00:05OpenAI 및 Anthropic 모델들과 경쟁하는 벤치마크 점수를 기록하고 있습니다. 이름은 Union Alpha이며, 현재
00:00:10OpenRouter 같은 제공업체를 통해 무료로 사용해 볼 수 있습니다. 아직 어떤 AI 연구소가
00:00:16Union Alpha를 만들었는지는 알 수 없지만, 이 정도 벤치마크라면 자세히 살펴볼 가치가 충분히 있으며
00:00:21오늘 바로 그 작업을 진행해보려고 합니다. 먼저 Union Alpha를 여러분의 기기에
00:00:26설치하는 방법을 알려드리고, 주요 스펙을 분석한 뒤
00:00:31Fable, Astra, Opus 같은 모델들과 직접 정면 대결을 펼쳐보겠습니다. 정면 대결 테스트로 넘어가기 전에
00:00:37이 모델이 어떤 모델인지, 어떻게 이용할 수 있는지 조금 더 자세히 이야기해 보겠습니다. Union Alpha는 누가
00:00:43만들었는지 전혀 알려지지 않았지만, 컨텍스트 창 용량은 262,000토큰에 달하며 현재
00:00:50완전히 무료로 제공되고 있습니다. 성능에 관해서는 비공식 보고서 몇 가지가 있습니다. 바로
00:00:55이것이 DeepSuite 점수입니다. 이 그래프는 OpenRouter의 CEO가 올린 것이라 다소 이해관계의 충돌이 있을 수 있습니다.
00:01:00어쨌든 이것이 사실이라면, 여기 별표로 표시된 Union Alpha는
00:01:05Astra, Fable, Opus 5와 동일한 수준의 성능을 아주 저렴한 비용으로 내고 있다는 뜻이니 놀라울 다름입니다.
00:01:13하지만 DeepSuite의 열렬한 팬으로서 솔직히 말하자면, Gemini 3.8 Flash 같은 모델이
00:01:19이렇게 높은 점수를 기록하는 상황에서 이 지표가 얼마나 대단한 의미가 있는지는 잘 모르겠습니다. 그런 걸 보면 “이것이
00:01:25벤치마크의 절대적인 기준인가?”라는 의문이 들죠. 완벽한 벤치마크는 없습니다. 하지만 이 수치가 사실이라면 여전히 긍정적인 신호입니다.
00:01:31Alex는 이후 더 많은 통계를 게시했습니다. 마찬가지로 OpenRouter의 CEO이자 공동 창업자인 그는 이 모델이
00:01:37Terminal Bench 2.1 및 Swee Bench Verified에서 5.6 Sol 능가하며, Terminal Bench 2.1에서는
00:01:43Opus 5보다 뛰어난 성능을 보인다고 밝혔습니다. 현재는 Terminal Bench 2.1보다 훨씬 진보된 기준들이 사용되고 있으므로
00:01:50이러한 벤치마크 결과들은 거품을 감안하고 참고하시기 바랍니다. 하지만 사실이라면 매우 뛰어난 성능의 모델인 셈입니다. 그렇다면
00:01:57어떻게 이용할 수 있을까요? 가장 쉬운 방법은 OpenRouter를 이용하는 것입니다.
00:02:01OpenRouter.ai에 접속하여 계정을 생성하기만 하면 되며, 앞서 말씀드렸듯 완전히 무료이므로
00:02:06비용이 전혀 들지 않습니다. OpenRouter 계정이 준비되었다면 Union Alpha를 실행할
00:02:11인터페이스 도구가 필요합니다. 이번 시연에서는 OpenCode를 사용하고 있습니다. OpenRouter와 OpenCode의 연결은 아주 간단합니다.
00:02:18연결을 마친 후 아래쪽으로 이동하여 사용하실 모델을 선택해 주시면 됩니다. 여기서는
00:02:23Union Alpha를 선택했습니다. 이제 진행할 벤치마크 테스트 몇 가지에 대해 알아보겠습니다. 프론트엔드 디자인과 관련된
00:02:27테스트 2건을 진행했습니다. 게임 디자인도 시켜보았고, 모션 디자인도 시켜보았습니다. 그리고 마지막으로
00:02:33대용량 컨텍스트 창에서 필요한 정보를 얼마나 정확히 찾아내는지 확인하기 위해 변형된 8-needle 테스트를 실시했습니다.
00:02:39본격적인 비교 테스트에 들어가기에 앞서
00:02:42오늘의 후원자인 저 자신에 대해 잠시 소개해 드리겠습니다. Chase AI Plus를 통해 최근 최신화된
00:02:48Claude Code 마스터클래스를 출시했으며, 해당 과정에는 Codex 마스터클래스도 포함되어 있어
00:02:53기술적 배경에 상관없이 누구나 AI 개발자로 거듭날 수 있는 최고의 환경을 제공합니다. 저희는 실무 활용 사례에 집중하며, 기초 지식이 없다는
00:02:59전제로 강의를 진행합니다. 따라서 본격적으로 이 분야를 배워보고 싶지만
00:03:04어디서부터 시작해야 할지 모르겠다면 이 강의를 추천합니다. 고정 댓글의 링크에서 확인하실 수 있습니다.
00:03:09첫 번째 테스트에서는 프론트엔드 디자인 수행 능력을 살펴보려고 했습니다. 그래서 외부 스킬을
00:03:14전혀 불러오지 않고 수행할 수 있도록 매우 간단하고 지침이 적은 프롬프트를 입력했습니다.
00:03:19프롬프트는 매우 단순했습니다. “런던에 있는 가상의 부티크 호텔 랜딩 페이지를 만들어줘,
00:03:25어떠한 스킬도 사용하지 마.” 그리고 3분 37초 만에 생성된 결과물이 바로 이것입니다. 스킬은 전혀
00:03:32사용되지 않았습니다. 지극히 단순한 프롬프트였죠. 히어로 섹션은 매우 지극히 평범하고, 여기에 롤링 배너
00:03:38같은 것이 하나 들어있습니다. 아래로 스크롤해 내려가 보면, 기본적으로 만들어낸 결과물이 나쁘지 않습니다.
00:03:46보통 흔히 볼 수 있는 요소들, 이를테면
00:03:51둥근 모서리나 어디서나 보이는 규격화된 카드 디자인 같은 정형화된 AI 느낌이 별로 나지 않는다는 점이 맘에 듭니다.
00:03:58그런 면에서는 다소 독창적인 편입니다. 전반적인 색상 조합 측면에서도
00:04:02딱히 흠잡을 데가 없습니다. 너무 심플해서 눈을 사로잡을 정도는 아닌가요? 당연히 그렇겠지만, 그건
00:04:08프롬프트 탓입니다. 그리고 실제로 작업도 비교적 빠르게 끝마쳤죠. 3분 반이면
00:04:12훌륭한 편입니다. 그래서 종합적으로 볼 때 이 결과물은 괜찮은 수준이라고 말하고 싶습니다. 이번엔 Opus
00:04:185의 높은 노력(high effort) 설정에서 동일한 프롬프트를 부여했습니다. Union
00:04:23Alpha에는 별도의 노력 설정 옵션이 없습니다. 이것이 Opus가 만들어낸 결과물입니다. 일단 시작부터 예약 가능 여부를
00:04:29확인할 수 있는 기능이 들어가 있다는 점이 마음에 드네요. 저쪽 결과물과 비교해 보면, 저기는 그냥 버튼 하나가 있을 뿐이고
00:04:34누르면 제일 아래로 이동할 뿐이라 이쪽만큼 직관적이지 못하죠. 이쪽이 훨씬 더 직관적입니다.
00:04:39SVG로 추정되는 배경 요소를 활용하여 훨씬 깊이감 있게 완성했습니다.
00:04:44페이지를 아래로 스크롤할 때 보셨을 수도 있겠지만 약간의 애니메이션 효과도 들어가 있습니다.
00:04:53전반적으로 저는 Opus가 만든 디자인이 좀 더 마음에 듭니다. 성능이 약간 더 우수한 것 같습니다.
00:05:00여전히 매우 심플하긴 하지만 그건 프롬프트 자체의 한계 때문입니다. 결과적으로 Opus의 판정승을 주고 싶네요.
00:05:09모든 벤치마크 테스트에 적용되는 이야기지만, Opus가 이 모델보다 결과가 잘 나왔다고 해서
00:05:14Union Alpha가 열등하다는 의미는 아닙니다. 이 모델의 실질적인 단가를 알기 전까지는
00:05:19성급히 성패를 단정하기 어렵습니다. 만약 OpenRouter가 공개한 DeepSuite 벤치마크 수치와
00:05:25비슷한 수준의 가격대로 형성된다면, 이 정도 품질은 대단한 결과물입니다.
00:05:30다만 품질 자체로만 본다면 Opus가 살짝 앞선다고 볼 수 있습니다. 두 번째 테스트에서도 랜딩 페이지 제작을 요청하되
00:05:35이번에는 훨씬 구체적인 프롬프트를 전달했습니다. 레이아웃 구현 방식에 대해서는 모델의 자체 재량에
00:05:40맡기도록 마지막 줄에 여지를 두긴 했지만, 몇 가지 명확한 가이드라인을 부여했습니다.
00:05:45“캘리포니아 조슈아트리에 위치한 가상의 사막 부티크 호텔인 Dune House의 세련된 반응형 홈페이지를 만들어줘”라고 요청했죠.
00:05:51그리고 완성된 결과물입니다. 만들어낸 페이지를 보면, 첫 번째 테스트에 비해
00:05:56엄청나게 발전했음을 단번에 느끼실 수 있습니다. 첫 테스트는 단순 지침만 주었을 때의 결과물이었고
00:06:01이것은 약간의 세부 가이드라인을 가미한 결과물입니다. 히어로 섹션에 사용된 이미지가 정말 마음에 들며,
00:06:06아래로 스크롤해 보면 확실히 한층 더 다듬어졌다는 것을 알 수 있습니다. 다만 Opus에서
00:06:11보았던 것처럼 페이지 상단에 예약 가능 여부를 조회하는 기능이 있었으면 더 좋았겠다는 아쉬움은 남지만,
00:06:17적절한 이미지 사용만으로도 완성된 웹페이지의 수준을 완전히 끌어올렸습니다. 동일한 프롬프트로 Astra가
00:06:23만들어낸 결과물도 살펴보겠습니다. 두 모델 모두 배경 이미지를 활용한 히어로 섹션을 채택했는데,
00:06:27매우 마음에 듭니다. Astra가 보여준 방식은 Opus의 결과물과 유사하게
00:06:33예약 가능 여부를 바로 확인할 수 있는 직관적인 영역을 갖추고 있어 마음에 듭니다. 그러나 스크롤을 내려보면
00:06:40이미지 활용 방식 등에서 상당한 유사점을 찾을 수 있으며, Astra의 결과물과
00:06:45Alpha Union의 결과물 사이의 격차는 그리 크지 않습니다. 굳이 따지자면 Astra에
00:06:51아주 근소한 우세를 주고 싶지만, 의미 있는 수준의 격차는 아닙니다. 프롬프트 조정 몇 번이면 거의 동등해질 정도입니다.
00:06:56그런 점에서 Alpha Union에 큰 찬사를 보내고 싶습니다. 이제 세 번째 테스트에서는
00:07:03게임 디자인 분야를 다뤄보고자 했습니다. 이전 영상에서 Fable과 Astra를 비교하며
00:07:07포트나이트 클론 게임을 만들어보게 했던 것과 동일한 작업입니다.
00:07:11Union Alpha에도 똑같은 프롬프트와 동일한 참조 이미지를 제공했으나, 완전히 실패하고 말았습니다.
00:07:16매번 오류가 발생했습니다. 이것이 OpenRouter 시스템 자체의 문제였는지,
00:07:20아니면 과도한 요청으로 인한 모델 자체의 능력 한계였는지는 판단하기 어렵습니다.
00:07:25그래서 대신 웹브라우저용 3D 아케이드 레이싱 게임을 제작하도록 지시했습니다.
00:07:32세련된 해안 고속도로 배경으로 지정하고 구현해야 할 요소들에 대해 가이드라인을 주었습니다.
00:07:37게임 제작 과정에서 몇 가지 오류가 생겨 세션을 다시 시작해야 했습니다. 모델 자체의 불완전함인지,
00:07:41아니면 단순 라우팅 오류였는지는 확실하지 않습니다.
00:07:46이것이 만들어진 게임인데, 함께 확인해 보시죠.
00:07:57Three.js를 기반으로 구현되었습니다. 조작감이 꽤 괜찮고 부드럽게 작동합니다. 복잡한 형태는
00:08:04아니며 단순한 순환형 트랙입니다. 물체와 충돌할 때 어느 정도 물리 엔진이 작동하며
00:08:11전반적인 핸들링도 깔끔하고 그래픽 완성도 역시 나쁘지 않습니다. 다음은 Astra의 결과물입니다.
00:08:17로딩 화면부터 매우 유사한 구성이 눈에 띕니다. 한번 시작해 보겠습니다.
00:08:26소리는 들리지 않으시겠지만 약간 거슬릴 수 있어 음소거 상태로 진행하며, 두 모델 모두 완전히 동일한 오디오를 사용했습니다.
00:08:30조작감과 체감 성능 역시 부드럽게 잘 작동합니다.
00:08:37물리 효과가 적용되어 가드레일에 부딪힐 수 있으며, 주행을 더 잘할 수 있도록 돕는 힌트 기능까지 제공됩니다.
00:08:43전반적으로 훌륭한 수준이며, Union Alpha의 결과물과 완벽히 동일한 등급으로 평가하고 싶습니다.
00:08:49두 모델 사이에 큰 차이점은 없었으며 사실상 똑같은 수준의 결과물을 내놓았습니다.
00:08:54솔직히 어떠한 벤치마크 항목에서든 Union Alpha가 선두 모델들과 대등한 성능을 보여준다면
00:09:00그 자체로 성공적인 성과라고 생각합니다. 다음 테스트에서는 모션 그래픽 구현 능력을 확인해 보고자 했습니다.
00:09:05Higgsfield 모션 스킬을 사용하여, 인터넷을 통해 메시지가 전송되는 과정을 설명하는
00:09:102D 모션 설명 영상을 제작하라고 지시했습니다. 완성된 영상은 다음과 같습니다.
00:09:30정말 완성도 높은 결과물이 나왔네요. 이어서 Astra의 결과물도 시청해 보겠습니다.
00:09:49두 모델 모두 매우 뛰어난 성능을 보여주었습니다. 이 테스트는 해당 모션 스킬 프레임워크를 기반으로
00:09:55SeedDance를 사용해 MCP 서버를 호출함으로써 만들어낸 결과입니다. 하지만
00:10:00Union Alpha 같은 모델에 모션 스킬을 결합했을 때 최첨단 프론티어 모델들과
00:10:05동일한 방식으로 문제없이 원활하게 작동함을 확인할 수 있어 유의미했습니다. 이제 Union Alpha의 마지막 평가로 8-needle
00:10:10테스트를 진행했습니다. 128k 용량의 공식 버전과 컨텍스트 창에 맞춘 200k 변형 버전 두 가지로 진행했습니다.
00:10:17이 테스트의 핵심 목적은 컨텍스트 창에 방대한 정보가 주어졌을 때 모델이 질문에 얼마나 정확히
00:10:22답변할 수 있는지 평가하는 것입니다. 200k 테스트에서는 Union Alpha의 컨텍스트 용량에
00:10:2920,0000토큰 분량의 텍스트를 가득 채워 넣었습니다. 텍스트 내부에는 8개의 유사한
00:10:37답변 데이터가 포함되어 있었습니다. 즉, 문서 안에 플라밍고에 관한 시가
00:10:428개 들어있다고 가정해 봅시다. 1번 플라밍고 시, 2번 플라밍고 시,
00:10:473번, 4번 시가 각각 미세하게 다른 내용으로 포함되어 있는 형태입니다.
00:10:52그리고 마지막에 “플라밍고에 관한 두 번째 시를 정확히 찾아와달라”고 요청합니다. 우선 모델은
00:11:00무엇이 플라밍고에 관한 시인지 식별해야 하고, 8개의 시를 정확히 분리해 낸 뒤
00:11:06정확히 두 번째 시만을 추출해 내야 합니다. 128k 버전으로 진행한 테스트에서는
00:11:13100%의 정답률을 기록했으며, 200k 변형 버전에서는 99.6%를 기록했습니다. 작은 아포스트로피 5개 정도의 차이만 있었습니다.
00:11:21이 결과는 컨텍스트 용량을 최대로 채운 상태에서도 질의에 대해 정확한 답변을
00:11:25출력할 수 있음을 증명합니다. 인상적인 정밀도입니다.
00:11:30종합해 보면 모든 벤치마크 항목에 걸쳐 완성도가 매우 뛰어난 모델로 판단됩니다.
00:11:35Opus, Fable, Astra와 비교해도 손색없는 성능을 보여주었습니다.
00:11:40정식 정식 출시 시 경쟁력 있는 가격대로 나온다면, 다양한 분야에 걸쳐
00:11:45기존 작업 환경에 도입해 활용하기 좋은 선택지가 될 것입니다.
00:11:50지속적으로 주목할 가치가 있는 모델입니다. Claude Code 및 Codex 마스터클래스를 수강하고 싶으시다면
00:11:57Chase AI Plus를 확인해 보시기 바라며, 오늘 영상은 여기서 마치겠습니다.

핵심 요약

익명의 스텔스 AI 모델 Union Alpha는 262k 컨텍스트 창과 99.6%의 니들 검색 정밀도를 바탕으로 프론트엔드 디자인, 3D 게임, 모션 그래픽 등 전 영역에서 Opus 5 및 Astra 수준의 최고급 성능을 무료로 제공한다.

하이라이트

  • Union Alpha는 개발 주체가 밝혀지지 않은 익명의 AI 스텔스 모델로, OpenRouter를 통해 무료로 사용할 수 있다.

  • 262,000토큰의 대용량 컨텍스트 창을 제공하며, 200k 토큰을 채운 8-needle 테스트에서 99.6%의 정답률을 기록했다.

  • Terminal Bench 2.1 벤치마크에서 Opus 5를 능가하고, Swee Bench Verified에서 5.6 Sol 이상의 성과를 보였다.

  • 지침이 적은 프론트엔드 디자인 요청에서는 Opus 5가 우수했으나, 상세 가이드라인이 주어진 랜딩 페이지 제작에서는 Astra와 대등한 품질을 구현했다.

  • Three.js 기반 3D 레이싱 게임 구현 및 Motion MCP를 활용한 2D 모션 그래픽 제작에서 기존 최첨단 모델들과 동일한 수준의 성능을 발휘했다.

타임라인

Union Alpha의 개요 및 주요 벤치마크 성능

  • Union Alpha는 개발사가 알려지지 않은 스텔스 AI 모델로 OpenRouter에서 무료로 제공된다.
  • 262,000토큰의 컨텍스트 창을 지원하며 Opus 5, Astra, Fable 등 최상위 모델과 유사한 수준의 점수를 기록했다.
  • Terminal Bench 2.1에서 Opus 5보다 높은 성과를 냈고 Swee Bench Verified에서 5.6 Sol을 상회했다.

DeepSuite 그래프 및 OpenRouter 통계 자료에 따르면 Union Alpha는 저렴한 비용 구조에도 불구하고 최첨단 프론티어 모델들과 경쟁할 수 있는 성능 수치를 보였다. 다함께 공개된 벤치마크 지표에는 거품이 존재할 수 있으나 기술적 경쟁력을 입증하는 긍정적 신호로 해석된다. 현재 OpenRouter 계정을 생성한 후 OpenCode 등의 인터페이스 도구를 연결하여 바로 실행할 수 있다.

단순 지침 기반 프론트엔드 디자인 비교 (vs Opus 5)

  • 스킬을 배제한 런던 부티크 호텔 랜딩 페이지 요청에서 3분 37초 만에 결과물을 생성했다.
  • 정형화된 AI 특유의 규격화된 카드 디자인을 피하고 독창적인 색상 조합을 선보였다.
  • Opus 5의 high effort 설정 결과물은 직관적인 예약 조회 기능과 배경 SVG, 스크롤 애니메이션을 포함해 판정승을 거두었다.

세부 스킬을 사용하지 않는 단순한 프롬프트 입력 환경에서 두 모델의 디자인 수행 능력을 비교했다. Union Alpha는 빠른 속도로 준수한 웹 페이지 구조를 만들어냈으나, 상단 예약 버튼이 맨 아래 페이지로 연결되는 등 단순한 상호작용에 그쳤다. Opus 5는 깊이감 있는 배경 요소와 실용적인 인터랙션을 구현하여 디자인 품질 면에서 소폭 앞선 결과를 나타냈다.

상세 프롬프트 기반 프론트엔드 디자인 비교 (vs Astra)

  • 조슈아트리 Dune House 호텔의 세련된 반응형 랜딩 페이지 제작 요청에서 완성도가 대폭 향상되었다.
  • 적절한 히어로 섹션 이미지와 다듬어진 레이아웃으로 디자인 수준을 끌어올렸다.
  • Astra가 제공한 결과물과 디테일 및 완성도 측면에서 의미 있는 격차 없이 대등한 결과를 보였다.

명확한 가이드라인을 포함한 구체적인 프롬프트를 부여했을 때 Union Alpha의 출력 결과물은 첫 번째 테스트 대비 완성도가 크게 올라갔다. 상단 히어로 섹션의 이미지 배치와 전체적인 페이지 다듬기 수준이 우수했다. 경쟁 모델인 Astra 역시 유사한 배경 이미지와 예약 영역을 갖춘 고품질 페이지를 출력했으나, 프롬프트 미세 조정으로 극복 가능한 수준의 미세한 차이에 불과했다.

3D 레이싱 게임 및 모션 그래픽 제작 능력 검증

  • Three.js 기반의 웹 브라우저용 3D 아케이드 레이싱 게임을 성공적으로 구동했다.
  • 물리 엔진 충돌 처리, 조작감, 그래픽 반응성에서 Astra의 구현 결과물과 동일한 수준을 기록했다.
  • Higgsfield 모션 스킬 및 SeedDance 기반 MCP 서버 연동을 통해 2D 설명 영상 모션 그래픽을 정상 생성했다.

포트나이트 클론 게임 생성 시도 시 오류가 발생하여 해안 고속도로 배경의 3D 레이싱 게임 생성으로 대체 검증을 진행했다. 세션 재시작 과정을 거쳐 완성된 게임은 부드러운 차량 핸들링과 가드레일 충돌 물리 효과를 올바르게 보여주었다. 모션 그래픽 테스트에서도 외부 스킬 프레임워크를 차일피일 문제없이 호출하여 기존 프론티어 모델들과 같은 수준의 워크플로우 수행력을 입증했다.

대용량 컨텍스트 창 8-needle 정밀도 테스트 및 종합 평가

  • 128k 용량 테스트에서 100% 정답률을, 200k 토큰 채움 테스트에서 99.6% 정답률을 기록했다.
  • 문서 내 유사한 8개의 플라밍고 시 중 정확히 두 번째 시를 지정하여 추출해냈다.
  • 모든 벤치마크 영역에서 Opus 5, Fable, Astra 등 최상위 모델과 대등한 완성도를 보였다.

200,000토큰 분량의 텍스트를 컨텍스트 창에 가득 채운 상태에서 특정 위치의 타깃 데이터를 정확히 찾아내는지 검증했다. 8개의 유사한 구조 속에서 지정된 항목을 분리해내는 고난도 검색 과제에서 문장부호 수준의 극미한 오차를 제외하고 거의 완벽한 정밀도를 나타냈다. 종합적으로 모든 벤치마크 항목에서 상위권 모델들에 손색없는 성능을 입증했다.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기