GPT 6 Astra 출시 (Fable 5.1보다 더 뛰어날까?)

CChase AI
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00앤스로픽이 페이블 5.1(Fable 5.1)을 출시하자마자, 오픈에이아이(OpenAI)가 이에 반격하여 GPT-6 아스트라(Astra)를 출시했습니다.
00:00:07먼저 GPT-6 아스트라의 벤치마크 몇 가지를 살펴보며 시작하겠습니다. 그리고
00:00:10앤스로픽이 페이블 5.1에서 보여준 것보다 훨씬 더 많은 벤치마크 데이터를 제공해 준
00:00:14오픈에이아이 측에 감사를 표합니다. 컴퓨터 사용(computer use) 측면에서는 거의 모든 분야를 압도합니다.
00:00:19페이블 5.1의 경우 이와 관련해 데이터가 많지조차 않습니다. 전문가용 벤치마크를 살펴보면, BenchCAD나
00:00:24browse comp 같은 항목에서도 GPT-6는 정말 놀라운 성능을 보여줍니다. 이기지 못한 유일한 곳은
00:00:31인공 분석 인텔리전스 지수(artificial analysis intelligence index)인데, 여기서는 페이블 5.1의 65.7점에 비해 61.2점을 기록했습니다.
00:00:38다음은 코딩입니다. 역시 비슷한 양상인데요. 페이블 5.1을 압도하거나
00:00:43호접지거의 접전을 벌이고 있습니다. 특히 TerminalBench 4.0을 보면, GPT 5.6 솔로의
00:00:4937.3점에서 57.7점으로 엄청난 도약을 이뤄냈음을 알 수 있습니다. 그리고 제가 가장 좋아하는 코딩
00:00:55벤치마크일 DeepSuite를 보면, 장기 실행 에이전틱 작업에 초점을 맞추어 74.1%를 기록했는데, 이 역시
00:01:02시중에 나와 있는 그 어떤 모델보다 뛰어납니다. GPT-6는 학술 벤치마크뿐만 아니라 과학 및 보건 분야
00:01:08벤치마크에서도 압도적인 성적을 거둡니다. 사이버 보안 벤치마크를 살펴보면, 이번에도 저는 5.6 솔로에
00:01:13주목하게 됩니다. 78.5%에서 100%로의 엄청난 도약, 익스플로잇 벤치(exploit bench)에서의 55.9%에서 무려 88.5%까지의 상승을 보여줍니다.
00:01:22익스플로잇 벤치마크는 39%까지 치솟았습니다. 따라서 이는 5 시리즈 모델에서 완전히 차원이 다른 도약입니다.
00:01:27긴 컨텍스트 측면에서도 GPT-6는 대단합니다. 256k에서 512k 토큰 범위의 8개의 바늘 찾기(needle) 테스트에서 100점 만점을 기록했습니다.
00:01:34즉, 컨텍스트 윈도우의 4분의 1부터 완전히 가득 찬 상태까지 모두 소화합니다. 그리고 해당 윈도우가 512,000
00:01:41토큰에서 100만 토큰에 달할 때도 여전히 96.3%의 점수를 기록합니다. 따라서 평소에 선호하는 AI 모델에
00:01:46방대한 양의 컨텍스트를 자주 입력하는 분이라면, GPT-6가 그러한 시나리오에서 정말 뛰어난 성능을 발휘할 것입니다. 하지만 원시
00:01:51벤치마크 점수만으로는 충분하지 않습니다. 이러한 점수를 달성하는 데 실제로 비용이 얼마나 드는지 알아야 합니다.
00:01:55아스트라가 세상에서 가장 높은 점수를 가졌다고 해도, 다른 모델보다 비용이 10배나 든다면 무슨 소용이겠습니까?
00:01:59다행히도 GPT 모델들은 역사적으로 토큰 효율성이 매우 뛰어났습니다. 따라서 여기
00:02:04터미널 벤치 4.0 점수를 살펴보면, 그 점이 그대로 드러납니다. 별표가 표시된 GPT-6 아스트라의 경우,
00:02:11먼저 주목하고 싶은 점은 많은 모델들처럼 노력 수준(effort level) 체계가 올라갈수록
00:02:16효율성이 다소 떨어지는 현상이 나타난다는 것입니다. '낮음(low)'에서 '중간(medium)', '높음(high)'으로 갈수록
00:02:23비용이 다소 선형적으로 증가하면서 더 나은 점수를 계속 얻을 수 있습니다. 하지만 '높음'에서 '아주 높음(extra high)'으로, 그리고 '최대(max)'로 가면
00:02:30실제로 비용은 더 들면서 오히려 더 낮은 점수를 얻게 됩니다. 즉, '높음' 단계에서는 7달러 21센트로
00:02:3957.9%의 정확도를 얻습니다. 이를 바로 옆에 있는 페이블 5.1의 '높음' 단계와 비교해 보면, 10달러 50센트에 49.4%의
00:02:49정확도를 얻게 됩니다. 즉, 더 비싸면서도 점수는 더 낮습니다. 물론 페이블의 경우 노력 수준을 최대치인 55.8까지 올리면
00:02:57상당히 높은 점수를 얻을 수 있지만, 비용이 19달러 50센트나 듭니다. 따라서 비슷한 점수인
00:03:06약 55%를 얻는 데 페이블 5는 거의 20달러가 드는 반면, GPT-6 아스트라는 7달러 20센트가 듭니다. 실질적으로 동일한 정확도를
00:03:16훨씬 더 저렴하게 얻을 수 있는 것입니다. 그리고 프론티어 코드 1.1(Frontier Code 1.1)을 보면 비슷한 양상을 볼 수 있는데,
00:03:22고성능 구간에서는 비슷한 점수가 나옵니다. GPT-6와 페이블 5.1 또는
00:03:29페이블 5를 비교해 보면 그렇습니다. 이 경우 페이블 5가 실제로 더 높은 점수를 기록하기도 했습니다. 하지만 GPT-6 아스트라의 뛰어난 토큰 효율성 덕분에
00:03:34이러한 클라우드 모델을 실행하는 데 드는 비용이 훨씬 더 저렴합니다. 자, 이제 오픈에이아이 가 벤치마크 외에도
00:03:39OpenAI가 GPT-6와 관련해 벤치마크 외에 특별히 언급하는 기능들이 몇 가지 있습니다. 첫 번째는 이를
00:03:43세계 최고의 컴퓨터 사용 모델이라고 부르고 있다는 점입니다. 이러한 종류의 기능을 테스트하는 벤치마크가 몇 가지 있는데, 에이전트의 마지막 시험(agent's last exam) 같은 것들이 그렇습니다.
00:03:48다른 벤치마크에서 보아왔듯이, 결과는 무엇을 보여줄까요? 아스트라가 정확도 측면에서나
00:03:52결코 무시할 수 없는 API 비용 측면 모두에서 압도적인 모습을 보여준다는 것을 보여줍니다. 하지만 정확도보다 어쩌면 더 중요한 것은 속도일 것입니다.
00:03:57코덱스(Codex)는 실제로 컴퓨터 사용 능력이 매우 뛰어난데, 특히 음성 모드와 함께 사용할 때 더욱 그렇습니다. 그리고 아스트라는
00:04:01GPT-5.6보다 1.9배 더 빠르다고 합니다. 지난 한 달 정도 동안 해당 모델을
00:04:06많이 사용해 오셨던 분들에게는 아주 반가운 소식입니다. 그들이 강조하는 또 다른 점은 템플릿 준수 능력입니다. 만약 슬라이드 덱 같은
00:04:11어떤 템플릿을 (여기 왼쪽에서 보시는 것처럼) 주고, 이와 동일한 방식으로 다른 주제에 대한
00:04:15슬라이드 덱을 만들어 달라고 요청하면, 오른쪽에 보이는 것과 같은 결과물을 얻게 됩니다.
00:04:20스타일을 매우 정확하게 준수하는 결과물이 나오는 것이죠. 따라서 슬라이드 덱이든 웹사이트든
00:04:25반복해서 사용하는 템플릿이 있다면, 그 어떤 형태의 출력물에 대해서든 디자인 시스템처럼 활용할 수 있으며, GPT-6는 이 용도로 아주 훌륭합니다.
00:04:31엑셀 문서나 일반적인 문서 스타일링에서도 이러한 장점이 다시 한번 드러납니다. 이것이 기본적으로 제공된 레퍼런스 이미지였다면,
00:04:35이전에는 이런 결과물을 얻었을 것입니다. 그리고 레퍼런스 이미지를 참고한 이후의 결과가 오른쪽에 나타나 있습니다.
00:04:41또 다른 흥미로운 점은 웹사이트, 게임, 애플리케이션 및 렌더링 결과물에 대해 GPT-6 아스트라가
00:04:46더 강력한 시각적 판단력을 제공한다고 언급한 대목입니다. 즉, GPT-6가 더 뛰어난 미적 감각을
00:04:51갖추고 있다는 뜻입니다. AI에게는 미적 감각이 없다는 말을 귀에지가 박히도록 들으셨을 겁니다. 하지만 오픈에이아이는 GPT-6는 그렇지 않다고 말합니다.
00:04:55물론 솔직히 말해, AI의 미적 감각에는 언제나 문제가 있기 마련입니다. 왜냐하면 잘못된 프롬프트를 입력하면 어떤 경우든 평균으로의 회귀가 발생하기 때문입니다.
00:05:00그리고 그 평균이 무엇이든 간에, 실제 성능이 아무리 뛰어나도 사람들은 그것을 저질 AI 산출물(AI slop)과 연관시키기 마련입니다.
00:05:05하지만 여기서는 언리얼 엔진 워크스루(walkthrough), 블렌더 모델링, 그리고 몇 가지 정지 이미지를 통해 몇 가지 예시를 보여줍니다.
00:05:10아스트라에 추가된 정말 멋진 기능 중 하나는 컨텍스트 윈도우가 가득 찼을 때 자동 압축(auto compaction)이 작동하는 방식의 변화입니다.
00:05:15보통은 컨텍스트 윈도우가 가득 차면 자동으로 압축되면서 마지막 세션에서 나누었던 모든 대화의 요약을
00:05:20생성하고 새로운 세션을 시작하게 됩니다. 글쎄요, 그렇게 하면 문제가 발생하며 세부 사항이 누락되기도 합니다.
00:05:25하지만 이제 아스트라는 단순한 단일 요약본을 갖는 대신, 컨텍스트 윈도우 전반에 걸쳐 메모를 유지합니다.
00:05:31하나의 문서만 갖는 것이 아니라, 중요하다고 생각되는 내용에 대한 여러 장의 다양한 메모지(sticky notes)를 갖는 셈입니다.
00:05:37그리고 단순히 '여기 요약본이 있으니 우리가 필요한 모든 것이 들어 있기를 바란다'는 식의 단발성 처리에 의존하는 것과 달리, 언제든지 이 메모들을 참조할 수 있습니다.
00:05:41실제로 이전 컨텍스트 윈도우들도 계속 검색 가능한 상태로 유지됩니다.
00:05:46따라서 요약본 형태의 문서가 이것 하나뿐이어서 여기에 내용이 없으면 망한다는 식의 상황은 더 이상 발생하지 않습니다.
00:05:52더 이상 그런 일은 없습니다. 다만 이는 실험적인 기능입니다.
00:05:57따라서 코덱스 설정에서 직접 활성화해야 하지만, 몇 주 후에는 기본값으로 적용될 예정입니다.
00:06:01사이버 보안과 관련해서는, 아스트라 역시 앤스로픽이 페이블을 다루는 방식과 유사한 방침을 취하고 있습니다.
00:06:06즉, 이 모델이 너무 강력해서 수많은 익스플로잇을 만들어낼 수 있기 때문에,
00:06:12어떤 종류의 익스플로잇을 만들려고 하는 것으로 판단되면 아예 허용하지 않겠다는 것입니다.
00:06:16요청에 따르지 않고, 문제에 대한 답변을 제공하지 않습니다. 5 시리즈에 비해 GPT-6에서 이루어진 또 하나의 멋진 개선 사항은
00:06:20더 낮은 환각(hallucination) 발생률입니다.
00:06:24GPT-5.6 솔 및 일반적인 5.6 모델들은 다른 프론티어 모델들에 비해 실제로 환각 현상이 꽤 잦았습니다.
00:06:28하지만 정면으로 비교해 보면, 환각률이 약 9.4%에서
00:06:332%까지 낮아진 것을 볼 수 있습니다. 그렇다면 아스트라는 이용 가능한가요?
00:06:37현재 일부 제한된 조직에만 개방되어 있습니다. 그리고 앞으로 며칠 내에 사실상
00:06:42모든 이에게 공개될 예정입니다. API의 경우 개발자들을 위해 이용 가능합니다.
00:06:48그리고 가격 측면에서도 역시 페이블의 가격 정책과 일치합니다.
00:06:54입력 토큰 100만 개당 10달러, 출력 토큰 100만 개당 50달러 수준입니다.
00:07:01따라서 수치를 바탕으로 볼 때, 오픈에이아이는 앤스로픽의 최고 모델과 완전히 경쟁할 수 있는
00:07:06매우 탄탄한 모델을 내놓았습니다. 게다가 더 저렴한 가격대로 이를 제공하고 있습니다.
00:07:11따라서 저는 이 모델을 직접 써보게 되어 매우 기대가 큽니다.
00:07:17최고의 플레이어들 사이에 경쟁이 존재하는 것은 궁극적으로 우리 같은 최종 사용자에게 큰 이득이라고 생각합니다.

핵심 요약

GPT-6 아스트라는 페이블 5.1을 능가하는 벤치마크 성능과 높은 토큰 효율성을 바탕으로 더 낮은 비용과 2%의 낮은 환각률을 기록했습니다.

하이라이트

  • GPT-6 아스트라는 전문가용 벤치마크 BenchCAD와 browse comp를 포함한 거의 모든 컴퓨터 사용 분야에서 페이블 5.1을 압도합니다.

  • TerminalBench 4.0에서 GPT-6 아스트라는 이전 모델인 5.6 솔로의 37.3점에서 57.7점으로 도약했습니다.

  • 256k에서 512k 토큰 범위의 바늘 찾기 테스트에서 100점 만점을 기록했으며 100만 토큰 컨텍스트에서도 96.3점을 유지합니다.

  • 높음 노력 수준 단계에서 7달러 21센트의 비용으로 57.9%의 정확도를 기록하여 페이블 5.1보다 더 저렴합니다.

  • 환각 발생률이 기존 9.4%에서 2%까지 낮아졌습니다.

타임라인

GPT-6 아스트라 벤치마크 성능

  • 컴퓨터 사용 분야와 전문가용 벤치마크에서 페이블 5.1을 압도합니다.
  • TerminalBench 4.0에서 57.7점을 기록하며 대폭 향상되었습니다.
  • 장기 실행 에이전틱 작업에 초점을 맞춘 DeepSuite에서 74.1%를 기록했습니다.
  • 사이버 보안 벤치마크인 익스플로잇 벤치에서 88.5%를 달성했습니다.

앤스로픽의 페이블 5.1 출시 이후 오픈에이아이가 공개한 GPT-6 아스트라는 학술, 코딩, 사이버 보안 등의 벤치마크에서 뛰어난 성적을 보여줍니다. 인공 분석 인텔리전스 지수를 제외한 대다수 영역에서 기존 모델 대비 큰 폭의 상승을 기록했습니다.

비용 효율성과 컨텍스트 처리

  • 노력 수준이 '높음'에서 '아주 높음'으로 갈수록 비용은 증가하지만 오히려 점수는 낮아집니다.
  • 높음 단계에서 7달러 21센트로 57.9%의 정확도를 얻어 페이블 5.1 대비 비용 우위를 가집니다.
  • 512k에서 100만 토큰에 달하는 컨텍스트 윈도우에서 96.3%의 점수를 기록합니다.

원시 벤치마크 점수 외에도 실제 실행 비용과 토큰 효율성이 분석되었습니다. 페이블 5가 비슷한 점수를 내는 데 약 20달러가 드는 반면 GPT-6 아스트라는 7달러 20센트 수준의 비용이 소요됩니다.

추가 기능과 환각률 개선

  • 코덱스 음성 모드와 함께 사용할 때 GPT-5.6보다 1.9배 더 빠릅니다.
  • 컨텍스트 윈도우가 가득 찼을 때 단일 요약 대신 여러 장의 메모를 유지하는 자동 압축 기능이 도입되었습니다.
  • 환각 발생률이 기존 9.4%에서 2%로 크게 감소했습니다.

세계 최고의 컴퓨터 사용 모델을 지향하는 아스트라는 템플릿 준수 능력과 향상된 시각적 판단력을 제공합니다. 또한 환각 발생률이 대폭 낮아졌으며, API 가격은 입력 토큰 100만 개당 10달러, 출력 토큰 100만 개당 50달러로 책정되었습니다.

커뮤니티 글

모든 글 보기