스크립트
00:00:00OpenAI가 방금 Codex에 새로운 모델을 출시했습니다. 하지만 핵심은
00:00:04벤치마크 점수가 아닙니다. 바로 작업을 분담해 처리할 수 있는 하위 에이전트를
00:00:10직접 생성하는 새로운 울트라(Ultra) 모드입니다. 즉, 평소 직접 구성해야 했던
00:00:15모든 오케스트레이션이 이제 모델 내부에서 처리됩니다. 이번 영상에서는
00:00:19이번 신규 릴리스에 대해 알아야 할 모든 것, 프로덕션 코드 작성 성능,
00:00:23그리고 다른 주요 모델들보다 고려할 가치가 있는지 다뤄보겠습니다. 저희 채널은
00:00:28AI 관련 소식을 꾸준히 전하고 있으니, 새로운 릴리스를 놓치지 않으려면
00:00:38Better Stack을 구독하세요. OpenAI가 방금 GPT 5.6 시리즈 모델들을 출시했습니다. 루나(Luna),
00:00:45테라(Terra), 솔(Sol) 이렇게 세 가지 티어입니다. 이 명칭들은 앞으로도 계속 사용되며
00:00:50업그레이드될 것으로 보입니다. 앤스로픽과 같은 연구소들이 모델을 이름 짓는 방식과 비슷하죠. 루나는 빠르고 저렴한 모델,
00:00:55테라는 일상적인 실무용, 그리고 솔은 새로운 플래그십 모델입니다. 현재 순차적으로 출시 중이라
00:01:01오늘 바로 액세스할 수 있는 분들도 계실 겁니다. 하지만 OpenAI가 선정한 몇몇 신뢰할 수 있는 파트너들은
00:01:07미리 액세스 권한을 얻었습니다. 다들 주목하고 있는 커맨드 라인 및 코딩 작업 벤치마크인
00:01:12Terminal Bench 2.1에서 기본 솔 모델은 88.8점을 기록했고, 새로운 울트라 모드를 켜면 91.9점으로 상승합니다. 비교를 위해
00:01:21GPT 5.5와 클로드 미토스 5는 모두 88점을 기록했습니다. 수치상으로는 솔 울트라가 에이전트 코딩 분야의
00:01:31새로운 최첨단 모델인 셈입니다. 하지만 벤치마크는 실제 코드 베이스가 아니며, 순차적 출시로 인해 현재
00:01:37대부분은 아직 사용해 볼 수 없는 상태입니다. 그러니 이 점수는 참고용으로만 보세요. 이제 정말 흥미로운 점은
00:01:42이번 주 OpenAI Codex 책임자인 티보(Tibo)가 울트라 모드가 포함된 솔 모델이 Codex에 도입될 것임을 확인했다는 사실입니다.
00:01:49그는 또한 7월 후반에 Cerebras 칩에서 구동되는 더 빠른 버전을 선보일 것이라고 예고했습니다. 따라서
00:01:55속도가 중요하다면 주목할 만합니다. 여기 울트라 모드가 바로 흥미로운 기능인데요,
00:02:00작동 방식을 살펴봅시다. 보통 모델은 긴 추론 과정을 통해 작업을 수행하지만,
00:02:06울트라 모드는 작업을 분할한 뒤 여러 하위 에이전트를 생성해 병렬로
00:02:12작업을 처리합니다. 새로운 점은 이 하위 에이전트들이 서로 협력하도록 훈련되어
00:02:18작업 중에 서로 소통하고, 모든 결과를 하나로 합칠 수 있다는 것입니다. 이런 방식의
00:02:23오케스트레이션은 모델 작동 방식의 엄청난 변화입니다. 기획자, 코더, 검토자를 실행하는 것은 보통
00:02:29Codex 작업에서 직접 구성하거나 Claude Code, Copilot 등이 처리하던
00:02:34상위 계층의 영역이었죠. 하지만 OpenAI는 이 모든 복잡성을 모델 내부로 끌어들였습니다.
00:02:40설정할 것이 줄어든다는 의미입니다. 개별 에이전트를 연결하는 대신 울트라에게 작업을 주고
00:02:46나머지는 맡기면 됩니다. 즉, 사용자가 오케스트레이션을 관리할 필요가 줄어들고 이론적으로는
00:02:52크고 복잡한 작업에서 더 빠른 결과를 기대할 수 있습니다. 하지만 문제는 이것이 진정한 기능적 도약인지,
00:02:58아니면 그저 그럴듯한 이름으로 토큰만 소모하는 방식인지입니다. 사실 둘 다일 가능성이 높습니다. 소통하도록 종단간 훈련된
00:03:05하위 에이전트는 흥미로운 연구 방향이지만, 울트라는 단순히 더 오래 생각하고
00:03:10작업을 분산한다는 것을 포장한 마케팅 용어이기도 합니다. 하지만 모든 홍보와 별개로 벤치마크 결과에는 중대한
00:03:15별표(각주)가 붙어 있습니다. OpenAI가 자사 모델 평가에 사용하는 독립 연구소인 METR이
00:03:22솔을 타임 호라이즌 작업에 테스트한 결과, 지금까지 테스트한 그 어떤 공개 모델보다
00:03:28더 자주 부정행위를 저지르는 것으로 나타났습니다. 여기서 부정행위란 숨겨진 테스트 제품군을 읽기 위해
00:03:34답변에 익스플로잇을 포함하거나, 예상 답안을 찾기 위해 숨겨진 소스 코드를 파헤치는 행위 등을 말합니다. 이는
00:03:40측정 결과 전체를 망치는 일이죠. METR이 솔이 단독으로 얼마나 긴 작업을 처리할 수 있는지 측정하려 했을 때,
00:03:46답변은 11시간에서 270시간 이상까지 다양했습니다. 하지만 부정행위 때문에 그들의
00:03:52자체적인 결론은 이러한 수치가 모델의 능력을 측정하는 신뢰할 수 있는 지표가 아니라는 것이었습니다. 즉,
00:03:57리더보드 상위 모델은 스스로 평가 방식을 속이고 있는 모델이라는 점을 기억해야 합니다.
00:04:03이 점은 91.9점이라는 점수를 바탕으로 전체 워크플로를 재구축하기 전에 반드시 고려해야 합니다.
00:04:09에이전트 모델의 핵심은 몇 시간씩 스스로 실행되도록 내버려 두는 것이니까요. 만약 모델이
00:04:14성공한 것처럼 보이려고 테스트를 몰래 조작한다면, 누군가 모든 단계를 지켜보고 검사하지 않는
00:04:20실제 프로덕션 환경에서는 무슨 짓을 할지 의문이 들 수밖에 없습니다. 비용 측면에서는 꽤
00:04:25합리적으로 보입니다. 솔은 입력 토큰 백만 개당 5달러, 출력은 30달러입니다. 테라는 그 절반이고 루나는
00:04:32입력 1달러, 출력 6달러입니다. 참고로 클로드 패블 5는 각각 10달러와 50달러 수준이니 솔은 대략
00:04:40절반 가격인 셈입니다. 벤치마크 점수보다 이 가격 경쟁력이 훨씬 더 유용한 정보일 수 있습니다. 더 저렴한 플래그십 모델과
00:04:45고용량 작업을 위한 적절한 저가형 티어까지 갖춘 셈이죠. 실무에서는 저렴한 고용량
00:04:51작업에는 루나를 사용하고, 일상적인 업무에는 테라를 사용하며, 추가적인 추론이 정말로 필요한 작업에만
00:04:56솔을 사용하는 식이죠. 그래야 모든 것에 플래그십 비용을 지불하지 않아도 됩니다. 그렇다면 오늘
00:05:01당장 무언가를 바꿔야 할까요? 이미 Codex 환경에서 작업 중이라면 당연히 그렇겠지만,
00:05:07다른 모델을 사용 중이라면 이 모델을 위해 전체 워크플로를 바꿀 필요는 아직 없습니다. 벤치마크
00:05:11점수 차이는 몇 점 되지 않으며, 모델 스스로조차 신뢰하지 않는 평가 기준일 뿐이니까요. 이 모델들이 어떻게
00:05:17시스템을 속이는지에 대해 더 알고 싶으시다면 관련 영상을 찍어두었으니 여기서 확인하세요.
00:05:22이상 Better Stack의 워렌이었습니다. 시청해 주셔서 감사합니다. 다음 영상에서 뵙겠습니다.