스크립트
00:00:00앤스로픽이 페이블 5.1(Fable 5.1)을 출시하자마자, 오픈에이아이(OpenAI)가 이에 반격하여 GPT-6 아스트라(Astra)를 출시했습니다.
00:00:07먼저 GPT-6 아스트라의 벤치마크 몇 가지를 살펴보며 시작하겠습니다. 그리고
00:00:10앤스로픽이 페이블 5.1에서 보여준 것보다 훨씬 더 많은 벤치마크 데이터를 제공해 준
00:00:14오픈에이아이 측에 감사를 표합니다. 컴퓨터 사용(computer use) 측면에서는 거의 모든 분야를 압도합니다.
00:00:19페이블 5.1의 경우 이와 관련해 데이터가 많지조차 않습니다. 전문가용 벤치마크를 살펴보면, BenchCAD나
00:00:24browse comp 같은 항목에서도 GPT-6는 정말 놀라운 성능을 보여줍니다. 이기지 못한 유일한 곳은
00:00:31인공 분석 인텔리전스 지수(artificial analysis intelligence index)인데, 여기서는 페이블 5.1의 65.7점에 비해 61.2점을 기록했습니다.
00:00:38다음은 코딩입니다. 역시 비슷한 양상인데요. 페이블 5.1을 압도하거나
00:00:43호접지거의 접전을 벌이고 있습니다. 특히 TerminalBench 4.0을 보면, GPT 5.6 솔로의
00:00:4937.3점에서 57.7점으로 엄청난 도약을 이뤄냈음을 알 수 있습니다. 그리고 제가 가장 좋아하는 코딩
00:00:55벤치마크일 DeepSuite를 보면, 장기 실행 에이전틱 작업에 초점을 맞추어 74.1%를 기록했는데, 이 역시
00:01:02시중에 나와 있는 그 어떤 모델보다 뛰어납니다. GPT-6는 학술 벤치마크뿐만 아니라 과학 및 보건 분야
00:01:08벤치마크에서도 압도적인 성적을 거둡니다. 사이버 보안 벤치마크를 살펴보면, 이번에도 저는 5.6 솔로에
00:01:13주목하게 됩니다. 78.5%에서 100%로의 엄청난 도약, 익스플로잇 벤치(exploit bench)에서의 55.9%에서 무려 88.5%까지의 상승을 보여줍니다.
00:01:22익스플로잇 벤치마크는 39%까지 치솟았습니다. 따라서 이는 5 시리즈 모델에서 완전히 차원이 다른 도약입니다.
00:01:27긴 컨텍스트 측면에서도 GPT-6는 대단합니다. 256k에서 512k 토큰 범위의 8개의 바늘 찾기(needle) 테스트에서 100점 만점을 기록했습니다.
00:01:34즉, 컨텍스트 윈도우의 4분의 1부터 완전히 가득 찬 상태까지 모두 소화합니다. 그리고 해당 윈도우가 512,000
00:01:41토큰에서 100만 토큰에 달할 때도 여전히 96.3%의 점수를 기록합니다. 따라서 평소에 선호하는 AI 모델에
00:01:46방대한 양의 컨텍스트를 자주 입력하는 분이라면, GPT-6가 그러한 시나리오에서 정말 뛰어난 성능을 발휘할 것입니다. 하지만 원시
00:01:51벤치마크 점수만으로는 충분하지 않습니다. 이러한 점수를 달성하는 데 실제로 비용이 얼마나 드는지 알아야 합니다.
00:01:55아스트라가 세상에서 가장 높은 점수를 가졌다고 해도, 다른 모델보다 비용이 10배나 든다면 무슨 소용이겠습니까?
00:01:59다행히도 GPT 모델들은 역사적으로 토큰 효율성이 매우 뛰어났습니다. 따라서 여기
00:02:04터미널 벤치 4.0 점수를 살펴보면, 그 점이 그대로 드러납니다. 별표가 표시된 GPT-6 아스트라의 경우,
00:02:11먼저 주목하고 싶은 점은 많은 모델들처럼 노력 수준(effort level) 체계가 올라갈수록
00:02:16효율성이 다소 떨어지는 현상이 나타난다는 것입니다. '낮음(low)'에서 '중간(medium)', '높음(high)'으로 갈수록
00:02:23비용이 다소 선형적으로 증가하면서 더 나은 점수를 계속 얻을 수 있습니다. 하지만 '높음'에서 '아주 높음(extra high)'으로, 그리고 '최대(max)'로 가면
00:02:30실제로 비용은 더 들면서 오히려 더 낮은 점수를 얻게 됩니다. 즉, '높음' 단계에서는 7달러 21센트로
00:02:3957.9%의 정확도를 얻습니다. 이를 바로 옆에 있는 페이블 5.1의 '높음' 단계와 비교해 보면, 10달러 50센트에 49.4%의
00:02:49정확도를 얻게 됩니다. 즉, 더 비싸면서도 점수는 더 낮습니다. 물론 페이블의 경우 노력 수준을 최대치인 55.8까지 올리면
00:02:57상당히 높은 점수를 얻을 수 있지만, 비용이 19달러 50센트나 듭니다. 따라서 비슷한 점수인
00:03:06약 55%를 얻는 데 페이블 5는 거의 20달러가 드는 반면, GPT-6 아스트라는 7달러 20센트가 듭니다. 실질적으로 동일한 정확도를
00:03:16훨씬 더 저렴하게 얻을 수 있는 것입니다. 그리고 프론티어 코드 1.1(Frontier Code 1.1)을 보면 비슷한 양상을 볼 수 있는데,
00:03:22고성능 구간에서는 비슷한 점수가 나옵니다. GPT-6와 페이블 5.1 또는
00:03:29페이블 5를 비교해 보면 그렇습니다. 이 경우 페이블 5가 실제로 더 높은 점수를 기록하기도 했습니다. 하지만 GPT-6 아스트라의 뛰어난 토큰 효율성 덕분에
00:03:34이러한 클라우드 모델을 실행하는 데 드는 비용이 훨씬 더 저렴합니다. 자, 이제 오픈에이아이 가 벤치마크 외에도
00:03:39OpenAI가 GPT-6와 관련해 벤치마크 외에 특별히 언급하는 기능들이 몇 가지 있습니다. 첫 번째는 이를
00:03:43세계 최고의 컴퓨터 사용 모델이라고 부르고 있다는 점입니다. 이러한 종류의 기능을 테스트하는 벤치마크가 몇 가지 있는데, 에이전트의 마지막 시험(agent's last exam) 같은 것들이 그렇습니다.
00:03:48다른 벤치마크에서 보아왔듯이, 결과는 무엇을 보여줄까요? 아스트라가 정확도 측면에서나
00:03:52결코 무시할 수 없는 API 비용 측면 모두에서 압도적인 모습을 보여준다는 것을 보여줍니다. 하지만 정확도보다 어쩌면 더 중요한 것은 속도일 것입니다.
00:03:57코덱스(Codex)는 실제로 컴퓨터 사용 능력이 매우 뛰어난데, 특히 음성 모드와 함께 사용할 때 더욱 그렇습니다. 그리고 아스트라는
00:04:01GPT-5.6보다 1.9배 더 빠르다고 합니다. 지난 한 달 정도 동안 해당 모델을
00:04:06많이 사용해 오셨던 분들에게는 아주 반가운 소식입니다. 그들이 강조하는 또 다른 점은 템플릿 준수 능력입니다. 만약 슬라이드 덱 같은
00:04:11어떤 템플릿을 (여기 왼쪽에서 보시는 것처럼) 주고, 이와 동일한 방식으로 다른 주제에 대한
00:04:15슬라이드 덱을 만들어 달라고 요청하면, 오른쪽에 보이는 것과 같은 결과물을 얻게 됩니다.
00:04:20스타일을 매우 정확하게 준수하는 결과물이 나오는 것이죠. 따라서 슬라이드 덱이든 웹사이트든
00:04:25반복해서 사용하는 템플릿이 있다면, 그 어떤 형태의 출력물에 대해서든 디자인 시스템처럼 활용할 수 있으며, GPT-6는 이 용도로 아주 훌륭합니다.
00:04:31엑셀 문서나 일반적인 문서 스타일링에서도 이러한 장점이 다시 한번 드러납니다. 이것이 기본적으로 제공된 레퍼런스 이미지였다면,
00:04:35이전에는 이런 결과물을 얻었을 것입니다. 그리고 레퍼런스 이미지를 참고한 이후의 결과가 오른쪽에 나타나 있습니다.
00:04:41또 다른 흥미로운 점은 웹사이트, 게임, 애플리케이션 및 렌더링 결과물에 대해 GPT-6 아스트라가
00:04:46더 강력한 시각적 판단력을 제공한다고 언급한 대목입니다. 즉, GPT-6가 더 뛰어난 미적 감각을
00:04:51갖추고 있다는 뜻입니다. AI에게는 미적 감각이 없다는 말을 귀에지가 박히도록 들으셨을 겁니다. 하지만 오픈에이아이는 GPT-6는 그렇지 않다고 말합니다.
00:04:55물론 솔직히 말해, AI의 미적 감각에는 언제나 문제가 있기 마련입니다. 왜냐하면 잘못된 프롬프트를 입력하면 어떤 경우든 평균으로의 회귀가 발생하기 때문입니다.
00:05:00그리고 그 평균이 무엇이든 간에, 실제 성능이 아무리 뛰어나도 사람들은 그것을 저질 AI 산출물(AI slop)과 연관시키기 마련입니다.
00:05:05하지만 여기서는 언리얼 엔진 워크스루(walkthrough), 블렌더 모델링, 그리고 몇 가지 정지 이미지를 통해 몇 가지 예시를 보여줍니다.
00:05:10아스트라에 추가된 정말 멋진 기능 중 하나는 컨텍스트 윈도우가 가득 찼을 때 자동 압축(auto compaction)이 작동하는 방식의 변화입니다.
00:05:15보통은 컨텍스트 윈도우가 가득 차면 자동으로 압축되면서 마지막 세션에서 나누었던 모든 대화의 요약을
00:05:20생성하고 새로운 세션을 시작하게 됩니다. 글쎄요, 그렇게 하면 문제가 발생하며 세부 사항이 누락되기도 합니다.
00:05:25하지만 이제 아스트라는 단순한 단일 요약본을 갖는 대신, 컨텍스트 윈도우 전반에 걸쳐 메모를 유지합니다.
00:05:31하나의 문서만 갖는 것이 아니라, 중요하다고 생각되는 내용에 대한 여러 장의 다양한 메모지(sticky notes)를 갖는 셈입니다.
00:05:37그리고 단순히 '여기 요약본이 있으니 우리가 필요한 모든 것이 들어 있기를 바란다'는 식의 단발성 처리에 의존하는 것과 달리, 언제든지 이 메모들을 참조할 수 있습니다.
00:05:41실제로 이전 컨텍스트 윈도우들도 계속 검색 가능한 상태로 유지됩니다.
00:05:46따라서 요약본 형태의 문서가 이것 하나뿐이어서 여기에 내용이 없으면 망한다는 식의 상황은 더 이상 발생하지 않습니다.
00:05:52더 이상 그런 일은 없습니다. 다만 이는 실험적인 기능입니다.
00:05:57따라서 코덱스 설정에서 직접 활성화해야 하지만, 몇 주 후에는 기본값으로 적용될 예정입니다.
00:06:01사이버 보안과 관련해서는, 아스트라 역시 앤스로픽이 페이블을 다루는 방식과 유사한 방침을 취하고 있습니다.
00:06:06즉, 이 모델이 너무 강력해서 수많은 익스플로잇을 만들어낼 수 있기 때문에,
00:06:12어떤 종류의 익스플로잇을 만들려고 하는 것으로 판단되면 아예 허용하지 않겠다는 것입니다.
00:06:16요청에 따르지 않고, 문제에 대한 답변을 제공하지 않습니다. 5 시리즈에 비해 GPT-6에서 이루어진 또 하나의 멋진 개선 사항은
00:06:20더 낮은 환각(hallucination) 발생률입니다.
00:06:24GPT-5.6 솔 및 일반적인 5.6 모델들은 다른 프론티어 모델들에 비해 실제로 환각 현상이 꽤 잦았습니다.
00:06:28하지만 정면으로 비교해 보면, 환각률이 약 9.4%에서
00:06:332%까지 낮아진 것을 볼 수 있습니다. 그렇다면 아스트라는 이용 가능한가요?
00:06:37현재 일부 제한된 조직에만 개방되어 있습니다. 그리고 앞으로 며칠 내에 사실상
00:06:42모든 이에게 공개될 예정입니다. API의 경우 개발자들을 위해 이용 가능합니다.
00:06:48그리고 가격 측면에서도 역시 페이블의 가격 정책과 일치합니다.
00:06:54입력 토큰 100만 개당 10달러, 출력 토큰 100만 개당 50달러 수준입니다.
00:07:01따라서 수치를 바탕으로 볼 때, 오픈에이아이는 앤스로픽의 최고 모델과 완전히 경쟁할 수 있는
00:07:06매우 탄탄한 모델을 내놓았습니다. 게다가 더 저렴한 가격대로 이를 제공하고 있습니다.
00:07:11따라서 저는 이 모델을 직접 써보게 되어 매우 기대가 큽니다.
00:07:17최고의 플레이어들 사이에 경쟁이 존재하는 것은 궁극적으로 우리 같은 최종 사용자에게 큰 이득이라고 생각합니다.