스크립트
00:00:00오늘 새 모델이 하나만 나온 게 아닙니다.
00:00:02무려 세 개나 나왔죠.
00:00:03약 한 시간 전에 앤스로픽이 클로드 Opus 5.5를 출시했고
00:00:06이제 OpenAI는 GPT-6 Sol과 GPT-6 Luna를 선보이고 있습니다.
00:00:12Opus 5.5는 벤치마크와 비용 면에서
00:00:14정말 훌륭해 보였는데요.
00:00:16이 두 모델은 무엇을 제공하는지 한번 살펴보죠.
00:00:19먼저 벤치마크부터 보겠습니다.
00:00:21GPT-6 라인업이 구성되어 있다는 점을 기억하세요.
00:00:24최상위에는 몇 주 전에 출시된 Astra가 있습니다.
00:00:27그게 메인 모델이죠.
00:00:28Astra 하위로 Sol과 Luna가 있습니다.
00:00:32이 모델들은 Astra보다 뛰어난 성능을 노린 게 아닙니다.
00:00:35대신 비등한 기능과 성능을 제공하면서도
00:00:38비용은 훨씬 저렴하게 만드는 데 목적이 있죠.
00:00:40따라서 Astra에 맡길 만큼
00:00:43복잡하지 않은 문제를
00:00:44처리해야 할 때,
00:00:45바로 이 두 모델을 활용하게 됩니다.
00:00:48그러니 이걸 보고 “아, Astra만큼
00:00:49좋지 않으니 꽝이네”라고 생각하시면 안 됩니다.
00:00:51비교 포인트가 그게 아니니까요.
00:00:53Frontier Code 벤치마크에서 GPT-Astra를 보면
00:00:55무엇이 보일까요?
00:00:56최고 설정에서 53.3% 점수를 기록합니다.
00:00:59그리고 주목해야 할 점은 바로 비용입니다.
00:01:014.59달러죠.
00:01:03한 단계 아래인 Sol의 경우
00:01:0649.3% 점수로 약간 더 낮지만,
00:01:09작업당 비용은 2.14달러입니다.
00:01:12비용은 절반 이하인데
00:01:13점수는 53%에서 49%로 약간만 떨어졌으니 정말 대단하죠.
00:01:18그리고 가장 저렴한
00:01:19Luna를 살펴보면,
00:01:21점수는 42.4%로 떨어지지만
00:01:24비용은 작업당 11센트에 불과합니다.
00:01:27이것이 Frontier Code 벤치마크 결과입니다.
00:01:29동일한 벤치마크에서
00:01:31Opus 5.5를 보면
00:01:326.19달러에 54.4%를 기록했습니다.
00:01:366.19달러에 54.4%인 거죠.
00:01:38이걸 Sol과 비교하면,
00:01:40점수가 5% 떨어지지만
00:01:41비용은 3분의 1 수준입니다.
00:01:44따라서 Opus 5.5나 Astra 6급은 아니더라도
00:01:47여전히 훌륭한 모델입니다.
00:01:50나아가 추론 노력 단계를 낮춰보면,
00:01:53최고 설정에서 49%였던 것이
00:01:55중간으로 내리면 46%가 되는 반면,
00:01:58비용은 80센트로 떨어집니다.
00:02:00즉, Sol과 Luna 모델은
00:02:03최적의 타협점을 제공합니다.
00:02:04앤스로픽 모델에서는 항상 찾기 어려웠던 부분이죠.
00:02:06앤스로픽에는 Opus와 Fable이 있어서
00:02:09정말 훌륭하긴 하지만,
00:02:10꽤 비싼 편이거든요.
00:02:11앤스로픽은 복잡하지 않은 작업을 위한
00:02:13저렴하고 효율 높은 모델을
00:02:14제공하는 데 꽤 애를 먹고 있습니다.
00:02:16이제 Luna와 Sol이 그 공백을 채워줄 수 있죠.
00:02:20전반적인 벤치마크를 살펴볼 때
00:02:21GPT-6 버전들을
00:02:235.6 버전과 비교해 보면,
00:02:24GPT-5.6 Sol에서 GPT-6 Sol로 오면서
00:02:28실질적 성능 면에서는 소폭 상승했지만
00:02:31비용 효율성 측면에서는
00:02:33엄청난 개선이 있었습니다.
00:02:35이는 Luna를 볼 때 훨씬 더 두드러집니다.
00:02:37여기 5.6 Luna와 GPT-6 Luna를 비교하면
00:02:40성능은 거의 동일한 수준이지만,
00:02:43비용 차이는 극적일 정도입니다.
00:02:466 버전에서는 작업당
00:02:4815센트 수준인 반면,
00:02:505.6 버전에서는 작업당 2.57달러가 듭니다.
00:02:55그야말로 초고효율 모델인 거죠.
00:02:57특정 상황에서는 GPT-6가
00:02:59Claude Fable 5.1을 앞서거나
00:03:01낮은 추론의 GPT-6 Astra마저 뛰어넘기도 합니다.
00:03:05그리고 이건 대부분 가격 변동과 관련이 있습니다.
00:03:07전반적으로 5.6에서 6 시리즈로 넘어가면서
00:03:10입력 및 출력 비용 모두
00:03:1350% 절감되었습니다.
00:03:15Luna의 경우 입력은 단 10센트,
00:03:17출력은 50센트로 파격적인 수준입니다.
00:03:20새 모델들의 또 다른 주요 업그레이드는
00:03:21사실성(Factuality) 개선입니다.
00:03:24잘못된 답변을 얼마나 자주 내놓는가의 문제인데요.
00:03:27대체로 전 영역에서 탄탄한 향상을 보였습니다.
00:03:30이전 5.6 Luna에서는
00:03:32최고 추론 설정 시 12%의 확률로
00:03:35사실과 다른 오류가 포함된 답변을 냈습니다.
00:03:39반면 GPT-6는 그 수치가 7.6%로 줄었습니다.
00:03:42그리고 Luna를 낮음 설정으로 사용해
00:03:44최대한 저렴하고 효율적으로 돌리려 했을 때는
00:03:4636%의 확률로
00:03:48오답이 포함되었었죠.
00:03:50이제는 27%에 불과합니다.
00:03:51Sol의 경우에는 8.5%에서
00:03:54오류 답변 비율이 4.6%까지
00:03:57떨어졌는데, 이는 3.9%를 기록한
00:04:00GPT-6 Astra에 육박하는 수준입니다.
00:04:03따라서 정확도 측면에서 GPT-6 Sol은
00:04:07최상위 모델인 Astra와
00:04:10맞먹는 성능을 보여줍니다.
00:04:11캐싱 시스템도 향상되었는데,
00:04:13이 점은 비용 관리에서 매우 중요합니다.
00:04:15OpenAI 에이전트와 대화를 이어 나가면서
00:04:17한 시간 동안 자리를 비우지 않아
00:04:20웜 캐시(Warm Cache) 상태가 유지되면
00:04:22(앤스로픽 쪽도 동일하게 적용됩니다)
00:04:24메시지를 보낼 때 90% 할인이 적용됩니다.
00:04:29만약 하루 동안 자리를 비웠다가 돌아와서
00:04:30동일한 대화창에서
00:04:31Astra, Sol, Luna에 메시지를 전송하면,
00:04:36이전 대화 전체가 다시 전달되면서
00:04:38전체 입력 비용이 그대로 청구되므로
00:04:41꽤 부담스러울 수 있습니다.
00:04:43또한 기존에는 캐시를 초기화시키는 요인들이 더 있었습니다.
00:04:44추론 노력 단계를 변경할 경우,
00:04:46예를 들어 '낮음'으로 설정해 두었다가
00:04:48'높음'으로 끌어올리면
00:04:49캐시가 리셋되면서
00:04:51큰 비용이 청구되곤 했죠.
00:04:53이제는 그러한 조작으로 캐시가 리셋되지 않습니다.
00:04:55따라서 추론 설정을 바꿔도 웜 캐시 상태가 유지되어
00:04:59토큰 사용량을 줄이고
00:05:01비용을 절감할 수 있습니다.
00:05:02특히 API를 사용하는 경우에 유용하죠.
00:05:03실제로 프롬프트 캐싱 대시보드가 추가되어
00:05:06API 사용자로서 아주 세세한 부분까지
00:05:08관리하고 싶은 분들은
00:05:10캐시 관련 중단점(Breakpoints)을
00:05:13직접 최적화할 수도 있습니다.
00:05:14마지막으로 제공 현황을 보면,
00:05:15GPT-6 Sol과 Luna는 거의 모든 곳에서 이용 가능합니다.
00:05:19흥미로운 관전 포인트는
00:05:21조만간 GPT-6 Terra도 보게 될지 여부겠네요.
00:05:24이번 GPT-6 Sol과 Luna 출시에는
00:05:26매력적인 요소가 확실히 많습니다.
00:05:29수치상으로는
00:05:30앤스로픽의 Opus 5.5보다
00:05:32한 단계 아래처럼 보일지 모르지만,
00:05:35서로 다른 문제를 해결하려는 것으로 보입니다.
00:05:38Luna는 Fable이나 Opus급 과제를 해결하기 위한 게 아니며,
00:05:41Sol 역시 마찬가지입니다.
00:05:43한 단계 낮은 수준의 과제,
00:05:45즉 솔직히 말해
00:05:45대부분의 사용자가 작업하는 영역의 과제를
00:05:47훨씬 효율적으로 처리하도록 설계되었습니다.
00:05:50그리고 이러한 계산에서 비용이 얼마나 중요한지
00:05:52결코 간과할 수 없죠.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기