GPT 6 Astra와 Fable 5.1 직접 테스트해 봄 (거품 없는 진솔한 평가)

CChase AI
컴퓨터/소프트웨어게임/e스포츠AI/미래기술

스크립트

00:00:00이번 주는 그야말로 AI 거인들의 대결이었습니다. Claude Fable 5.1과 GPT-6
00:00:06Astra가 출시되었죠. 현재 모든 사람이 GPT-6 Astra를 사용할 수 있는 건 아닙니다.
00:00:11순차적으로 적용 중이지만, 저는 운 좋게도 얼리 액세스를 써볼 수 있었습니다.
00:00:15그래서 오늘은 GPT-6와 Claude Fable 5.1의 맞대결 테스트를 보여드리려고 합니다. 여러분에게 어떤 모델이
00:00:23가장 적합할지 판단하는 데 도움이 될 것입니다. 네, 수치적인 감을 잡으실 수 있도록
00:00:27시작 부분에서 벤치마크 결과부터 살펴볼 테지만, 실제 사용 사례를 보는 것이 훨씬 중요하다고 생각했습니다.
00:00:32프론트엔드 디자인 같은 분야에서 두 모델이 맞붙었을 때 얼마나 잘 해내는지
00:00:36모션 그래픽, 웹 응용 프로그램, 심지어 게임 디자인과 관련된 장기 에이전트 작업까지 살펴보겠습니다.
00:00:41이번 영상의 목표는 두 모델을 직접 비교했을 때 현재 어떤 위치에 있는지 파악할 수 있도록
00:00:46개요를 제공하여, 어디에 시간을 투자해야 할지 현명한 결정을 내리도록 돕는 것입니다.
00:00:50그럼 바로 시작하겠습니다. 먼저, 발표된 수치와 벤치마크 데이터를 아주 빠르게 짚고 넘어가죠.
00:00:55이런 수치들은 다들 어느 정도 걸러서 받아들인다는 걸 알지만, 여전히
00:00:59유용한 정보들을 얻을 수 있습니다. 아쉽게도 앤스로픽은 더 많은 데이터를
00:01:03공개하지 않았습니다. OpenAI와 비교했을 때 아예 보고조차 하지 않은 벤치마크가 꽤 많다는 걸
00:01:08눈치채셨을 겁니다. OpenAI는 원할 만한 모든 것을 제공해 주었죠. 그리고 GPT-6의
00:01:13수치를 보면, 거의 모든 면에서 Fable 5.1을 압도합니다. 글쎄요, 이 수치들만 보면 말 그대로
00:01:20모든 면에서 그렇습니다. 아주 인상적이죠. 자, 그렇다고 DeepSuite 버전 1.1에서 점수가 74.1이라고 해서
00:01:28이게 Fable 5.1보다 실제로 7.5% 더 뛰어나다는 뜻일까요? 그리고
00:01:34사실상 Gemini 3.8 Flash가 GPT-6를 제외한 나머지 전부보다 낫다는 의미일까요? 아닙니다, 이 수치들을
00:01:39맹목적으로만 볼 수는 없죠. 하지만 종합적으로 살펴봤을 때 무엇을 볼 수 있나요? 엄청난 도약이
00:01:45있었습니다. 특히 5.6 같은 모델과 비교해 보면 더욱 그렇죠. 따라서 GPT-6는 이전 GPT 모델들에서
00:01:50확실히 차원이 다른 도약을 이뤄냈습니다. 그렇다면 전반적인 Fable 5.1은 어떨까요? 음, 수치상으로 Fable 5보다
00:01:56우수한 아주 강력한 모델이라는 것을 보여줍니다. Fable 5를 써보신 분들이라면
00:02:00이 모델이 탄탄하다는 것을 확실히 아실 겁니다. 성능이 아주 훌륭하죠. 자, 수치로 볼 때 진정으로 할 수 있는 말은 무엇일까요?
00:02:06OpenAI 진영에서는 GPT-6가 엄청난 도약을 이뤄냈다는 점입니다. 그리고 Fable 5.1은
00:02:11우리가 이미 좋아하던 요소들을 더 많이 제공하고 있죠. 좋은 출발입니다. 자, 이제 수치와 실제 성능 면에서
00:02:17이러한 벤치마크 점수 비율은 방정식의 일부분일 뿐입니다. 방정식의 나머지 절반은
00:02:21바로 비용입니다. 이 모델들이 그러한 수치를 달성하는 데 몇 개의 토큰을 소모할까요?
00:02:27역사적으로 GPT 모델들이 이 측면에서 훨씬 더 뛰어났기 때문입니다. 통계를 보면
00:02:31이번에도 그런 경향이 나타납니다. 참고로 저는 이와 관련해 OpenAI의 보도 자료를 살펴보는 중입니다.
00:02:37Terminal Bench 4.0 같은 걸 보면, 별표로 표시된 Astra와
00:02:41주황색으로 표시된 Fable 5.1을 비교해 볼 때, 최고 성능일 때 두 모델이 꽤 비슷하다는 것을 알 수 있습니다.
00:02:47최대 정확도로 보면 Fable 5.1은 55.8%를 기록했고, Astra는
00:02:5556.7%입니다. 그러니까 기본적으로 거의 같습니다. 하지만 같지 않은 부분은 바로 비용입니다. 최대 성능에서
00:03:02Astra는 10.35달러인 반면, Fable 5.1은 19.50달러가 듭니다. 그리고 이러한 격차는
00:03:11여기 고성능 버전과 저쪽 고성능 버전을 비교해 보면 훨씬 더 두드러집니다. 일반적으로 다른
00:03:17어떤 벤치마크를 보더라도 마찬가지입니다. GPT-6는 5.1과 맞먹는 성능을 내면서도 비용은 훨씬 저렴한 경향이 있습니다.
00:03:23자, 이제 실제 사용 사례를 통해 두 모델을 직접 시험해 볼 시간입니다.
00:03:28그 전에 오늘의 스폰서인 저에 대한 짧은 안내 말씀이 있겠습니다. Chase AI+ 내부에는
00:03:33Cloud Code 마스터클래스를 출시했을 뿐만 아니라,
00:03:38Codex 마스터클래스도 출시했습니다. 따라서 오늘 영상에서 보시는 어떤 도구든
00:03:43마스터하고 싶으신 분들이라면 Chase AI+가 바로 여러분을 위한 곳입니다. 사전 지식이 전혀 없다고 가정하며,
00:03:48꼭 기술 전문가일 필요도 없습니다. 우리는 실제 사용 사례와
00:03:52실제 프로젝트에 집중하므로, 여러분이 개인 프로젝트에 이를 직접 적용해 볼 수 있습니다. 관심이 있으시다면
00:03:58꼭 한번 확인해 보세요. 고정 댓글에 링크가 남겨져 있을 겁니다.
00:04:02첫 번째 테스트로, Fable과 GPT-6가 '포트나이트'를 얼마나 잘 재현할 수 있는지 살펴보겠습니다.
00:04:09유튜브에서 본 이 영상을 보고 영감을 받았죠. 콜이라는 친구가 올린 'Claude Fable 5.1은 미쳤습니다'라는 영상입니다.
00:04:14구독자가 7천 명 정도밖에 안 되는 친구이니 꼭 한번 확인해 보세요. 그 친구가 Fable로 이걸 어떻게 만들었는지 보여주더라고요.
00:04:18그래서 저도 '한번 해보자'고 생각했습니다. 여기에 보시는 것처럼 프롬프트를 입력했고,
00:04:24여러 장의 참고 이미지를 주었습니다. 그리고 기본적으로 99명의 봇과 다양한 무기 등이 있는
00:04:29브라우저에서 플레이할 수 있는 포트나이트를 만들어 달라고 했죠. 그렇게 해서 만들어낸 결과물이 바로 이것입니다.
00:04:34먼저 GPT-6입니다. 보시다시피 이게 선택 화면인데요, 다양한 게임 모드를 선택할 수 있습니다.
00:04:39솔로 플레이로 진행하겠지만, 원한다면 봇 팀원을 추가할 수도 있습니다.
00:04:44이쪽으로 이동해 보면 플레이 방법 같은 설명과 여러 버튼들이 나와 있고,
00:04:49설정 변경도 가능합니다. 바로 게임으로 들어가서 어떻게 되는지 확인해 보죠. 준비 완료를 누릅니다.
00:04:55여기 배틀 버스를 기다리고 있습니다. 이제 버스 안에 탑승했네요. 이 부분은 전체적인
00:05:02폭풍 요소도 포함되어 있어야 합니다. 여기 보시는 것처럼요. 뛰어내리면서 글라이더를 펼칠 수도 있는데 꽤 괜찮네요. 그리고
00:05:09이건 한 번에 만들어낸 결과물이라는 점도 기억해 주세요. 아까 여러분께 보여드린 프롬프트를 입력했을 뿐이고,
00:05:14그게 전부였습니다. 게임이 어떻게 진행되는지 보죠. 봇들이 이리저리 떠다니는 게 보이네요.
00:05:20위쪽에 상자들이 있습니다. 어떻게 작동하는지 볼까요. 총을 집어 들 수 있고, 물약도 먹을 수 있습니다.
00:05:32왼쪽에 보호막 게이지가 차오르는 게 보이시죠. 샷건을 하나 얻은 것 같네요. 카메라는
00:05:39약간 흔들립니다. 저기 봇이 있네요. 처치했습니다. 봇들의 실력은 좋지 않습니다. 일부러
00:05:51봇들이 좀 못하도록 지시했거든요. 하지만 보시다시피 줌인도 할 수 있고, 재장전도 할 수 있으며 다른 사람에게서
00:06:01다양한 총을 주울 수도 있습니다. 맞습니다. 인벤토리에서 바꿀 수도 있죠. 탭 키를 누르면 맵 전체를 볼 수 있습니다.
00:06:09솔직히 봇들이 형편없다는 점만 빼면 나쁘지 않은 작업입니다. 무언가를 채집하려고 하면 어떤 일이 일어나는지 보죠. 벽돌을 얻었습니다.
00:06:17무언가 튀어나오는 게 눈에 띄게 보이진 않네요. 작은 먼지 조각 같은 게 흩날리긴 합니다.
00:06:22하지만 전반적으로 꽤 탄탄합니다. Codex가 이걸 만드는 데 45분 정도 걸렸습니다.
00:06:30안타깝게도 얼리 액세스 방식의 특성상 정확한 토큰 사용량은 알 수 없습니다. 사용량과 연동되어 있지 않았거든요.
00:06:37그래서 그 부분은 확인할 수 없지만, 한 번에 뽑아낸 결과물 치고는 꽤 훌륭합니다.
00:06:42실제 오디오는 아예 들리지 않겠지만, 그냥 자체적으로 생성한 오디오 같은 느낌입니다.
00:06:48아 맞다, 무언가를 건설할 수도 있습니다. 아주 멋지네요. 그 밖에 무엇을 지을 수 있는지 보죠.
00:06:55실제로 작동하는지 확인해 보겠습니다. 네, 위로 올라갈 수도 있군요. 전반적으로 한 번에 만든 것치고는 나쁘지 않습니다.
00:07:01자, 이것이 Codex였습니다. 이제 Fable이 무엇을 만들어냈는지 살펴보겠습니다.
00:07:08여기가 Fable입니다. 비교적 비슷하죠. 이걸 이쪽으로 옮겨서 더 자세히 보실 수 있게 하겠습니다.
00:07:15Codex를 볼 때는 오른쪽에 맵 기능이 있는 게 마음에 들었는데, 포트나이트 쪽에서는 그걸 볼 수가 없네요.
00:07:20그래서 조금 덜 깔끔하다는 느낌입니다. 하지만 포트나이트 로비를 보면 클릭할 수 있는 요소가 더 많습니다.
00:07:28하지만 실제로 클릭해 봐도 아무 일도 일어나지 않습니다. 자, 이제 보죠.
00:07:33출발할 준비가 되었다고 해봅시다. 로비가 채워지고 있네요. 그리고 참고로 이걸 만드는 데 Claude는
00:07:391시간 반 정도 걸렸고 약 75만 개의 토큰이 소모되었습니다. 여기 배틀 버스 구역이 있습니다.
00:07:48카메라 조작이 조금 더 엉성하지만, 그 점은 너무 탓하지 않겠습니다. 말씀드릴 건
00:07:55뛰어내릴 때 엄청나게 거슬리는 소음이 난다는 점입니다. 그리고 전반적으로 카메라가 또 좀 엉성합니다.
00:08:03제대로 움직이기가 정말 힘들어요. 그래픽 전반은 Codex가 만든 것보다
00:08:11약간 더 떨어진다고 볼 수 있습니다. 그렇다고 엄청난 차이가 나는 건 아니지만요. 자, 여기
00:08:20나무 앞에 서서 채굴을 시도해 보겠습니다. 애니메이션이 좀 어설프다고 해야겠네요.
00:08:25나무가 사라지는 방식도 꽤 이상했습니다. 여전히 무언가를 지을 수는 있군요. 독특한 방식이네요.
00:08:33직접 지은 구조물 안으로 이동하려고 하면, 엉성하게도 그냥 미끄러지듯 통과해 버립니다.
00:08:38드디어 총을 찾았습니다. 이 모델의 총격전 플레이와 관련해서는
00:08:42분명 아쉬운 부분이 있습니다. 제가 조준하는 곳과 총알이 날아가는 곳이 안 맞고 탄퍼짐이 엄청납니다.
00:08:48하지만 누군가를 해치우긴 했네요. 전체적으로 다듬어진 완성도가 조금 떨어진다는 느낌입니다.
00:08:54다시 말하지만 이것도 한 번에 만든 것이고 1시간 반이나 걸렸습니다. 따라서 엄청나게 긴 프롬프트와
00:08:59여러 참고 자료를 한 번에 주었을 때 무엇을 할 수 있는지 살펴보는 것은 흥미롭습니다.
00:09:03이런 작업을 해냈다는 점 자체는 인상적이지만, 앞서 보여드렸던 참고 영상에서 본 수준에는
00:09:08확실히 미치지 못했습니다. 이게 한 번에 만들어진 건지, 아니면 여러 번 거쳐서 만든 건지 알 수가 없네요.
00:09:13가끔은 도통 알 수가 없단 말이죠. 하지만 순수하게 한 번에 만들어낸 결과물로 본다면
00:09:17여기서는 경쟁이 안 된다고 말할 수 있겠습니다. Codex가 압승을 거둔 것 같네요.
00:09:22이제 두 번째 테스트로 프론트엔드 디자인을 살펴보겠습니다. 제가 제시한 프롬프트는 다음과 같습니다.
00:09:26AI 여행 웹사이트용 랜딩 페이지를 만들어 달라고 했습니다. 사용자가 목적지를 입력하면
00:09:32일정을 짜주거나 비교적 단순한 기능을 수행하는 페이지죠. 제가 정말로 집중했던 부분은
00:09:37실제로 어떤 모습일까 하는 점이었습니다. 필요한 어떤 리서치든 마음대로 하고,
00:09:41적절하다고 판단되는 도구나 기술을 자유롭게 가져다 쓰라고 했죠. 첫 번째 패스에서 얻은 결과물은 이렇습니다.
00:09:45이게 GPT-6가 만들어낸 결과물입니다. 이 이미지를 직접 생성했거나 찾아낸 것이죠.
00:09:51GPT-6에는 자체 내부 이미지 모델이 탑재되어 있다는 점을 기억해 두세요. 이런 작업에는 정말 유용합니다.
00:09:56히어로 섹션이 꽤 깔끔해 보입니다. 출발지와 도착지를 입력할 수 있는 작은 입력창 같은 요소도 있네요.
00:10:02출발지와 도착지를 설정할 수 있는 작은 요소가 있습니다. 기능은 크게 신경 쓰지 말라고 했으므로
00:10:06실제로 내부적으로 잘 작동하는지 테스트하려는 것은 아니었습니다. 오직 디자인의 미적인 부분에만
00:10:10집중했습니다. 아래로 내려가 보면 어떤 내용인지 대략 나옵니다. 5일 일정, 수많은 소소한 이야기들,
00:10:15그리고 이번에도 이미지가 활용되었죠. 전반적으로 이걸 살펴보면서 드는 생각은,
00:10:20이게 딱히 AI스럽다는 느낌을 주지 않는다는 점입니다. 어설픈 AI 느낌이 아니라 실제로 상당히 깔끔합니다.
00:10:27만약 제가 '이 웹사이트는 대체 뭐고 무슨 일을 하는 곳이지?'라고 묻는 사람이라면, 그 점을 꽤 잘
00:10:32설명해 준다고 생각합니다. 그래서 아래로 더 내려가 보면, 우리는 호기심을 불러일으킨다 등등의 내용과 함께 이미지가 정말 많이
00:10:38사용되었죠. 확실히 엄청난 양의 이미지를 가져왔고, 간단한 FAQ 섹션과 푸터가 있습니다. 그래서 전반적으로
00:10:45이 정도면 탄탄하다고 봅니다. 누구나 감탄할 정도는 아니고 상을 받을 만한 웹사이트는 아닙니다. 하지만
00:10:52그냥 깔끔하고 단순하게, 원하는 바를 파악해서 구현해 내는 측면에서는 말이죠. 저는 특별히 창의적인
00:10:56방향을 제시하지도 않았는데, 솔직히 꽤 깊은 인상을 받았습니다. 반면에 똑같은 프롬프트를 사용했을 때
00:11:02Fable 5.1이 보여준 결과물은 뭐랄까, 좀 애매했습니다. 맞죠? 이건 다소 매우 기초적인
00:11:10 느낌으로 다가왔습니다. 색감도 별로 영감이 없고요. 이건 왼쪽에 텍스트가 있고 오른쪽에 이미지가 있는
00:11:19아주 전형적인 히어로 섹션 형태입니다. GPT-6처럼 자체 이미지를 생성해 낼 수 있는 것과는 달라서,
00:11:25적절한 이미지를 찾아내지도 않았습니다. 그 대신에
00:11:29자체 내부 그래픽 시스템을 사용해 이걸 만들어냈죠. 여기에 작은 테두리가 들어가 있는데,
00:11:35이게 아주 AI스러운 느낌을 줍니다. 둥근 모서리를 가진 전형적인 카드 형태들이 보입니다. 심지어
00:11:42모션 같은 것도 거의 전혀 찾아볼 수 없습니다. 전반적으로 연한 파란색에서 진한 파란색으로 이어지는 느낌뿐입니다.
00:11:51솔직히 저는 Fable 5.1의 결과물을 보고 좀 실망했습니다. 왜냐하면 일반적으로
00:11:57앤트로픽 모델들이 프론트엔드 디자인 측면에서 더 뛰어났다고 느꼈기 때문입니다. 그래서 이게 그냥
00:12:03잘못된 프론트엔드 디자인 기술을 잘못 적용했거나, 뭔가 이상한 걸 참고해서 그런 것인지
00:12:08잘 모르겠습니다. 하지만 전반적으로 이 둘을 비교해 보면 하늘과 땅 차이라는 생각이 들었습니다.
00:12:14자, 프론트엔드 디자인에 관해서는 일반적으로 AI를 잘 쓰는 사람과 못 쓰는 사람 사이에 엄청난 격차가 있다고 말씀드리고 싶습니다.
00:12:19그래서 실력이 뛰어날수록 모델 자체의 중요성은 줄어듭니다. 레퍼런스 이미지를 제공하는 방법이나,
00:12:24각 컴포넌트가 어떻게 생겨야 하는지 지시하는 법, 그리고 인터넷상에서 이런 모델들 외의 외부 공간으로 나가
00:12:29훌륭한 컴포넌트 라이브러리를 찾아내는 방법을 잘 알고 있기 때문입니다. 따라서 여기에 관여하는 기술적 역량이 엄청납니다.
00:12:34그리고 모델이 프론트엔드 디자인 기본 실력이 얼마나 뛰어난지가 내가 어느 정도 코칭해 줄 수 있다면
00:12:38얼마나 중요하겠느냐는 논쟁을 할 수도 있겠죠. 하지만 현실은 대부분의 사람들이 그렇지 않다는 점입니다. 대부분의 사람들은 그냥
00:12:43“이것 좀 만들어줘”라고 요구하고 나오는 결과를 보게 됩니다. 그리고 제 생각에는 이것이
00:12:48평균적인 결과물이며, 우리가 지금 평가하고 있는 기준입니다. 만약 여러분이 프롬프트를 잘 다루지 못한다면 고민할 여지가 없죠.
00:12:55이번에도 저는 Astra의 손을 들어주고 싶습니다. 자, 그럼 다음 테스트로 넘어가서
00:13:02모션 그래픽을 살펴보겠습니다. 그래서 두 모델 모두 Higgs field MCP에 연결하고
00:13:07제가 만든 동일한 모션 그래픽 기술을 호출하도록 했습니다. 제가 원했던 것은
00:13:13인터넷 메시징의 작동 원리에 대한 15초짜리 2D 설명 영상을 만드는 것이었습니다. 즉, 여러분이 휴대폰으로 다른 사람에게 문자를 보낼 때
00:13:19도대체 그 과정이 어떻게 작동하는지 보여주는 것이죠. 자, 이것이 코덱스가 만들어낸 결과물입니다.
00:13:37솔직히 꽤 좋습니다. 자, 다음은 Fable이 보여준 결과물입니다. 한 번의 탭으로, 지구 반 바퀴를 돌아 패킷으로 쪼개집니다.
00:13:50수십 번의 홉, 수밀리초의 시간, 모든 메시지가 매번 그렇게 전달됩니다.
00:13:57전반적으로 이 두 모델 모두 정말 잘 해냈다고 생각하며, 무승부라고 볼 수 있겠습니다. 두 모델 모두
00:14:01Higgs field MCP 같은 외부 도구를 호출하여 Seed Dance 2.5 같은 곳으로 프롬프트를 라우팅하고
00:14:06탄탄한 모션 그래픽을 만들어내는 데 정말 뛰어납니다. 자, 이제 마지막 테스트를 위해 두 모델 모두에게
00:14:12이 프롬프트를 실행하도록 했습니다. 이것도 어느 정도 프론트엔드 디자인과 관련이 있지만, 앞서 랜딩 페이지 디자인과 비교했을 때
00:14:17창의성의 한계를 얼마나 밀어붙일 수 있는지 정말 확인하고 싶었습니다. 랜딩 페이지의 경우 매개변수 중 하나가
00:14:22그저 기능적이어야 한다는 점이었죠. 즉, 제품을 판매하려는 목적이므로 누구나 우리가 누구이고,
00:14:26어떤 가치를 지니며 어떻게 사용하는지 매우 명확하게 이해할 수 있어야 했습니다. 반면 이 테스트는
00:14:31시각적 화려함을 보여줄 여지가 좀 있었습니다. 그래서 우리는 3D 지구본 대시보드 형태의 웹 앱을 만들고자 했습니다.
00:14:38이것은 Orbit이며, GPT-6가 생성한 결과물입니다. 출발지를 입력해 보겠습니다. 예를 들어 뉴욕에서 출발한다고 해보고,
00:14:45도착지도 설정해 보겠습니다. 케이프타운으로 간다고 해죠. 그러면
00:14:52지도에 표시되는 것을 볼 수 있습니다. 원하는 곳을 클릭할 수도 있는데 꽤 멋집니다. 이걸
00:14:57이쪽으로 옮기면 하단에 정보가 나타나는 것을 볼 수 있습니다. 즉, 케이프타운으로 향하며
00:15:02SFO에서 CPT로 1회 경유, 22시간 소요, 현지 기온은 19도입니다. 샘플 왕복 항공편의 경우
00:15:081인당 864달러 정도입니다. 여기서 '케이프타운 탐색'을 클릭하면 왼쪽에
00:15:14이런 정보가 표시됩니다. 멋진 사진도 나오고 해당 지역에 대한 몇 가지
00:15:18정보도 제공합니다. 라이언스 헤드 하이킹 같은 즐길 거리 추천도 나옵니다. 여정을
00:15:24저장할 수도 있습니다. 또한 '골든 아워에 케이프타운 만나기' 같은 기능도 있었습니다. 추가된 기능 중 하나는
00:15:28'태양 쫓기' 기능인데, 지구본 상에서 언제 어느 때 골든 아워가 비치는 곳이 어디인지 보여줍니다. 꽤 멋진 기능이죠.
00:15:35창의성을 발휘할 여지를 주었더니 이런 결과물이 나왔습니다. 꽤 괜찮습니다.
00:15:39다시 말하지만, 제가 GPT-6에서 정말 마음에 드는 점은 디자인이 그냥 깔끔하고 아주 깔끔하다는 것입니다. 그래서
00:15:45마음에 듭니다. 다음은 Fable 5.1이 만든 Arclight입니다. 시작하자마자 확실히
00:15:53로딩 화면뿐만 아니라 시각적인 화려함을 정조준합니다. 다만 이건 너무나도
00:15:58밝고, 너무 많은 요소가 한 번에 일어납니다. 텍스트가 경로를 따라
00:16:04움직이기도 합니다. 여러 갈래의 선들이 있고, 여기서는 요금 정보와
00:16:09실시간 요금과 관련된 온갖 정신없는 일들이 벌어집니다. 최근 들어 요금이 몇 퍼센트 올랐는지도 확인할 수 있습니다.
00:16:14솔직히 처음 봤을 때는 정신없지만 정말 멋져 보입니다. 하지만 이걸 Astra의 디자인과 바로
00:16:21비교해보면 그리 깔끔하지는 않고, 과하다는 느낌마저 듭니다. 멋지긴 하지만요. 그리고 이
00:16:28부분은 분명 깔끔하게 다듬어질 수 있을 겁니다. 물론 이 모든 건 원샷으로 생성된 것입니다. 자, Astra에서 보았던 것과 유사하게
00:16:32일종의 태양시계 같은 기능이 있습니다. 제가 이리저리 움직이며 시간을 바꾸면 요금도
00:16:39그에 맞춰 업데이트되고, 추세가 있는 항목들도 확인할 수 있습니다. 여기서 아무 항목이나 클릭하면,
00:16:44예를 들어 헬싱키를 클릭하면 헬싱키로 화면이 이동하는 멋진 애니메이션이 나타나며
00:16:51현지 시간, 날씨, 바람, 시정 등 온갖 정보가 제공됩니다.
00:16:54요금을 유지할 수도 있고 애니메이션도 정말 멋집니다. 대강 알아볼 수는 있지만
00:17:02사실 보기에는 좀 어렵습니다. 배경이 너무 밝아서 약간 흐리게 보입니다.
00:17:06그래서 Fable 5.1에서는 기능성보다 시각적인 화려함이 최우선 순위가 된 듯한 느낌을 줍니다.
00:17:12물론 이 전체 애니메이션처럼 보기는 좋습니다. 하지만 이런 모습을 보면, '음, 이런 화려한 요소들 중 일부를 가져와서
00:17:19Astra가 구현해 낸 것과 결합해 절제시키면 어떨까' 하는 생각이 듭니다.
00:17:23전반적으로 솔직히 말씀드리자면, 이것도 Astra의 승리라고 봅니다.
00:17:30특히 왼쪽에 보시는 것처럼 케이프타운 탐색 같은 기능을 매끄럽게 처리할 수 있을 때 더욱 그렇습니다.
00:17:35그런 점은 다른 어떤 장소에도 잘 적용되며, 매우 전문적으로 보입니다.
00:17:38여기에 비해 수정 작업을 그다지 많이 거치지 않아도 될 것 같은 느낌입니다.
00:17:45Fable 5.1의 경우는, 제 생각에 이걸 실제로 쓸 만한 수준으로 만들려면 프롬프트를 훨씬 더 많이 입력해야 할 것 같습니다.
00:17:52그렇다면 결국 결론은 어떻게 날까요? 음,
00:17:57제가 보여드린 테스트를 바탕으로 보면, 총 4개의 테스트를 진행했는데 Astra가 그중 3개를 이겼습니다. Fable 5.1은
00:18:03모션 그래픽 부문에서는 동등했다고 볼 수 있겠네요. 그리고 원시 벤치마크를 살펴보면,
00:18:07수치상으로도 GPT-6가 경쟁 상대를 살짝 앞지르는 것을 볼 수 있습니다. 게다가 토큰 비용 측면에서도 실제로 더 저렴하죠.
00:18:13하지만 이건 단지 4개의 테스트였고, 단발성 원샷 테스트였습니다. 이미지 생성 기능이 내장된 모델을 사용하는 것이 여러분에게 얼마나 중요할까요?
00:18:22앤트로픽 플랫폼과 비교했을 때 코덱스 데스크톱 플랫폼 같은 환경은 얼마나 편안하게 느껴지시나요?
00:18:27애초에 이 둘 중에서 선택해야 하는 사람이 맞으신가요? 아니면 둘 다 실제로 사용하고 계시는가요?
00:18:31이런 영상을 보시고 무언가 얻어가는 것이 있으셨기를 바랍니다. 그리고 실제로 얻어가셔야 할 점은
00:18:36이 두 모델 모두 정말 훌륭하다는 사실입니다. 지난 3일 동안 Fable 5.1을 엄청나게 많이 사용해 온 사람으로서,
00:18:41제가 이 모델에 거치게 한 이러한 테스트들이 오히려 그 역량을 과소평가하게 만드는 것 같다는 느낌마저 듭니다.
00:18:45“Fable 5.1 별로야, 이건 아니야”라고 말하는 사람을 실제로 거의 본 적이 없기 때문입니다.
00:18:50동시에 Astra도 아주 훌륭하게 느껴집니다. 정말로요. 생성되는 모든 결과물이
00:18:54매우 매끄러웠습니다. AGI라고까지는 말하지 않겠습니다. AGI의 정의는 날마다 바뀌니까요.
00:19:02하지만 더 중요한 점은 이제 Astra와 5.1 사이에 의문이 제기된다는 것입니다.
00:19:09지난 한 달 정도 동안 “헤이, 5.6이 사실 Fable 5와 경쟁하고 있어”라고 주장하던 소수의 사람들이 확실히 존재했습니다.
00:19:14하지만 그것은 아주 작은 커뮤니티였다고 생각합니다. 그리고 앤트로픽이 사용자 기반을
00:19:19어떻게 대해왔는지 고려해보면 말이죠. 예를 들어, 사용량 한도를 낮춰놓고는
00:19:25마치 한도를 늘려주는 척 포장했던 훌륭한 사례를 떠올려 보세요. 지난 한 달 동안 실제로는 사용량이 줄어들었음에도 말입니다.
00:19:31그런 행태는 사용자 입장에서 씁쓸한 뒷맛을 남깁니다.
00:19:35Fable 5.1의 경우 여전히 주간 사용량의 50% 정도밖에 받지 못하고 있으며, 20x 플랜도 실질적으로는 20x가 아닙니다.
00:19:40반면에 방정식의 다른 한쪽에는 오픈AI가 있습니다. 이들은 3일마다 사용량을 리셋해 주는 정책을 펴고 있죠.
00:19:46반면에 OpenAI 쪽을 보면, 3일마다 사용량을 리셋해 주는
00:19:50방식을 쓰고 있죠 (일부 누적 리셋이 사라지긴 했지만요). 전반적으로 볼 때
00:19:54앤트로픽보다 더 많은 혜택을 주는 느낌입니다. 따라서 Astra와 Fable 5.1 사이에
00:20:02엄청난 차이가 있는 건 아니라서, 앤트로픽이 좋다면 무조건 다 버리고 해지할 필요는 없습니다.
00:20:06하지만 이제는 진지하게 고민해 볼 문제입니다. 20배 Fable 플랜을 쓰면서
00:20:12알게 된 게 있죠? 20배라는 게 실제로 20배를 의미하지 않는다는 겁니다. 이제는 정말로
00:20:16OpenAI 5배 플랜과 앤트로픽 5배 플랜을 당분간 병행해서 쓰는 걸 고려해 볼 시점입니다.
00:20:24그리고 제 프로젝트를 위해 일상 업무 속에서 직접 테스트해 볼 수 있게 되겠죠.
00:20:28어떤 영상이나 테스트, 벤치마크도 직접 들어가서 자신의 프로젝트에 직접 써보는 것만큼 정확할 수는 없으니까요.
00:20:32이번 이야기는 여기서 마치도록 하겠습니다.
00:20:39언제나 그렇듯 클라우드 코드(Cloud Code)와 코덱스를 마스터하는 방법에 대해 더 알고 싶으시다면,
00:20:43Chase AI+ 내에 두 기술 모두에 대한 마스터클래스가 준비되어 있습니다. 그 외에도 여러분의 생각이 어떠신지 알려주세요.
00:20:47Astra가 오늘부터 모든 사용자에게 순차적으로 배포되기 시작했으니, 여러분이 Astra로 어떤 멋진 결과물을 만들어내실지 정말 기대됩니다.
00:20:52관련 게시글들도 몇 개 보았는데요. 그럼 다들 좋은 하루 보내시고 다음에 뵙겠습니다.

핵심 요약

GPT-6 Astra는 Fable 5.1과의 직접 비교에서 더 저렴한 토큰 비용과 뛰어난 원샷 결과물을 보여주며 전반적인 우위를 차지한다.

하이라이트

  • GPT-6 Astra는 벤치마크 수치와 실제 테스트 전반에서 Fable 5.1을 압도한다.

  • 최대 성능 기준 Terminal Bench 4.0에서 Astra는 10.35달러, Fable 5.1은 19.50달러의 비용이 소요된다.

  • 한 번의 프롬프트로 생성한 포트나이트 재현 테스트에서 Codex는 45분이 걸렸고 Fable은 1시간 반 동안 75만 개의 토큰을 소모했다.

  • 여행 웹사이트 랜딩 페이지 및 3D 지구본 대시보드 구현 테스트에서 GPT-6는 자체 내장 이미지 모델을 활용하여 깔끔한 디자인을 생성했다.

  • 총 4가지 실전 테스트 중 GPT-6 Astra가 3개를 승리하고 모션 그래픽 부문에서 1개를 무승부를 기록했다.

타임라인

모델 성능 및 벤치마크 데이터 비교

  • GPT-6 Astra와 Claude Fable 5.1이 동시에 출시되어 성능 경쟁을 벌인다.
  • 수치상으로 GPT-6는 거의 모든 벤치마크에서 Fable 5.1을 앞선다.
  • 최대 성능에서 Astra는 10.35달러, Fable 5.1은 19.50달러의 비용이 든다.

앤스로픽은 OpenAI에 비해 공개한 벤치마크 데이터가 적지만, 수치상 Fable 5.1도 강력한 성능을 보여준다. 그러나 토큰 비용 측면에서 Astra가 훨씬 경제적이며, 동일한 최고 성능을 내면서도 비용 격차는 뚜렷하게 나타난다.

포트나이트 게임 재현 테스트

  • 두 모델에게 99명의 봇과 무기가 포함된 브라우저 게임 제작을 요청했다.
  • Codex 기반 GPT-6는 45분 만에 깔끔한 로비와 맵 기능을 갖춘 결과물을 완성했다.
  • Claude 기반 Fable은 1시간 반 동안 75만 개의 토큰을 소모했으나 완성도가 떨어진다.

참고 영상을 바탕으로 동일한 프롬프트를 입력했을 때, GPT-6는 맵 전체 보기와 직관적인 조작감을 지닌 게임을 한 번에 생성했다. 반면 Fable은 카메라 조작이 엉성하고 총알 탄퍼짐과 애니메이션 완성도 측면에서 아쉬움을 남겼다.

프론트엔드 및 모션 그래픽 테스트

  • AI 여행 웹사이트 랜딩 페이지 디자인에서 Astra는 내장 이미지 모델을 활용해 깔끔한 결과물을 도출했다.
  • Fable 5.1의 프론트엔드 결과물은 다소 기초적이고 전형적인 카드 형태에 머물렀다.
  • 외부 MCP를 활용한 모션 그래픽 제작에서는 두 모델 모두 뛰어난 역량을 보여주어 무승부를 기록했다.

기능적이면서도 시각적인 매력이 필요한 랜딩 페이지 테스트에서 GPT-6는 완성도 높은 이미지를 자동으로 배치했다. 반면 모션 그래픽 영역에서는 외부 도구를 안정적으로 호출하며 두 모델 모두 준수한 성과를 거두었다.

3D 지구본 대시보드 및 최종 평가

  • 3D 지구본 대시보드 테스트에서 GPT-6는 직관적인 정보와 깔끔한 UI를 선보였다.
  • Fable 5.1은 시각적 화려함을 강조했으나 정보 가독성이 떨어진다.
  • 4번의 테스트 중 3승 1무를 거둔 Astra가 실용성과 비용 면에서 우세하다.

항공편 조회 및 태양 쫓기 기능이 포함된 대시보드 구현에서 Astra는 정돈된 레이아웃을 유지했다. 앤스로픽의 사용량 제한 정책에 대한 아쉬움과 함께, 실제 프로젝트에서는 두 모델을 병행하여 검증하는 과정이 필요하다.

커뮤니티 글

모든 글 보기