스크립트
00:00:00Anthropic에서 방금 Sonnet 5를 출시했으니, 알아야 할 모든 것을 살펴보겠습니다.
00:00:04우선 벤치마크부터 시작하죠. 참고로 Sonnet 5는
00:00:08Opus나 Fable 같은 모델보다 덜 강력하고 덜 비싼 모델입니다. 4.6 버전 이후로는
00:00:13업그레이드가 없었죠. 이제 5와 4.6을 비교해 보면, 에이전트 코딩 측면에서 엄청난 도약을 했고,
00:00:21다학제적 추론, 컴퓨터 사용, 지식 작업 면에서도 큰 발전을 이뤘습니다. 전반적으로
00:00:26향상된 셈이죠. Opus 4.8과 비교했을 때, 과연 차이가 적을까요? 아니면
00:00:32성능 저하가 있을까요? 솔직히 성능 저하는 크지 않습니다. 오히려 지식 작업에서는
00:00:39더 나은 수치를 보여주는데, 이건 꽤 놀랍습니다. 컴퓨터 사용 능력은 겨우 2% 뒤처지고,
00:00:44에이전트 코딩에서도 2% 차이이며, 다학제적 추론 능력도
00:00:49몇 퍼센트 포인트 차이밖에 나지 않습니다. 가장 큰 격차는 Sweebench Pro에서 63% 대 69%로 나타납니다.
00:00:56하지만 Terminal Bench 2.1에서는 80% 대 82%로 격차가 크지 않죠. 이 성능에 대한 논의는
00:01:03반드시 가격과 함께 고려해야 합니다. Fable 5나 Mythos 5의
00:01:08입력 토큰당 비용은 10달러로, Opus의 5달러보다 두 배 비쌉니다. Opus는 100만 입력 토큰당 5달러니까요.
00:01:16출력 비용은 25달러입니다. 그러니까 입력은 5달러, 출력은 25달러죠. Sonnet 5의 경우 입력 토큰 비용은
00:01:26Opus의 40% 수준인 2달러이며, 출력 비용은 10달러입니다. Opus의 절반 미만 가격으로
00:01:34훨씬 저렴하죠. 그런데 수치를 보면 꽤 근접합니다. 따라서 최첨단 작업이
00:01:40필요 없는 일상적인 작업을 수행하면서도 여전히 강력한 성능을
00:01:46원하는 분들에게 Sonnet 5는 완벽한 대안이 될 것입니다. 이제 벤치마크를 넘어서는
00:01:51차트를 살펴보겠습니다. 여기는 노력 수준에 따른 에이전트 검색 성능으로,
00:01:55Opus 4.8과 Sonnet 5, Sonnet 4.6을 비교하고 있습니다. 바로 눈에 띄는 것은 Sonnet 5의
00:02:04노력 수준에 따른 통과율 격차입니다. 낮은 수준에서는 55%를 기록합니다. 하지만
00:02:13Sonnet 4.6의 낮은 수준이 오히려 더 뛰어납니다. 그럼에도 비용은 훨씬 저렴하죠.
00:02:19중간 수준으로 넘어가면 Sonnet 4.6과 본질적으로 같은 성능을 보이면서
00:02:25상당한 할인 혜택을 누릴 수 있습니다. 높은 노력 수준으로 갈 때 비로소
00:02:34Sonnet 4.6을 능가하기 시작합니다. 하지만 그 시점에는 Sonnet 4.6의
00:02:41낮은 수준 비용으로 더 나은 성능을 얻게 됩니다. 이런 노력 수준에 대한
00:02:49구분은 매우 중요하다고 생각합니다. 단순히 Sonnet 5가 전반적으로 낫다기보다는,
00:02:53Sonnet 5의 낮은 수준은 매우 저렴하다는 의미입니다. 하지만 더 높은 성능을
00:02:59얻기 위해서는 과거와 마찬가지로 높은 수준의 작업을 수행해야 합니다.
00:03:03말씀드린 것처럼 Sonnet 5에서 높은 수준의 작업을 할 때는
00:03:08거의 Opus와 비슷한 비용이 듭니다. Opus는 중간 및 높은 수준에서 Sonnet의 높은 수준과
00:03:14같은 비용이 들지만 더 높은 통과율을 보여줍니다. 이로 인해 논의가 훨씬 복잡해지죠.
00:03:21에이전트 검색에서 Sonnet 5와 Opus 4.5 중 무엇을 써야 할까요? 정말
00:03:27상황에 따라 다릅니다. 복잡한 문제라면 결국 Opus 4.8이 토큰 효율성 때문에
00:03:33오히려 저렴할 수 있습니다. Sonnet이 해당 작업에 적합하지 않을 수 있으니까요.
00:03:38하지만 도전적이지 않은 단순한 작업이라면 Opus 4.8을
00:03:44전혀 사용할 이유가 없겠죠. 그럴 때 Sonnet 5를 가져오는 겁니다. 그래서 지금은
00:03:49어떤 모델을 사용해야 할지 사례별로 판단해야 하는 흥미로운 상황입니다.
00:03:54에이전트 컴퓨터 사용에 대해서도 흥미로운 결과가 있습니다. 전반적으로,
00:03:58대부분의 경우 Sonnet 5가 4.6보다 저렴한 비용으로 더 뛰어난 성능을 보여줍니다.
00:04:05에이전트 검색에서는 그렇지 않았지만, 컴퓨터 사용의 경우
00:04:09갑자기 Sonnet 5를 4.6보다 항상 사용하게 될 것입니다. 이것 역시 다시 모델 선택이
00:04:14상황별로 달라져야 한다는 것을 의미합니다. 흥미롭게도 Opus를 보시죠. Opus High는
00:04:20Max Sonnet 5보다 더 나은 성능을 보이면서도 더 저렴합니다. 그러니 이걸 보고 있으면
00:04:26Opus가 수행하는 작업에 비해 꽤 효율적이라는 생각이 듭니다. Sonnet이 도달할 수 없는
00:04:30더 높은 수준까지 도달한다는 점은 말할 것도 없죠. 고려해야 할 점들이 있습니다. 백만
00:04:36토큰당 비용이 Opus가 더 저렴하다 하더라도 여전히 Opus가 최선인 경우가 많을 겁니다.
00:04:41Anthropic 모델 출시 이야기를 하면서 잘못된 정렬 행동을 언급하지 않을 수 없죠. Sonnet 5는
00:04:45향상되었지만 여전히 Opus 4.8이나 Mythos Preview보다는 기대치에 못 미칩니다. 그리고
00:04:50Mythos의 발목을 잡았던 익스플로잇이나 보안 문제에 있어서는,
00:04:55Sonnet 등급에서는 걱정할 문제가 아닙니다. 솔직히 말해서 이런 벤치마크에는
00:04:59큰 의미를 두지 않을 겁니다. 이런 차트나 벤치마크는 저에게
00:05:05더 많은 생각을 하게 만드는데, 문제는 Sonnet 5 대 4.6이 아니기 때문입니다.
00:05:11거의 항상 Sonnet 5를 쓰게 될 테니까요. 문제는 Sonnet 5 대 Opus 4.8입니다. 그래서 과연
00:05:18Opus가 더 저렴한 건지 궁금합니다. Anthropic에서 더 많은 테스트를 통해
00:05:24어느 선까지는 Sonnet 5가 Opus보다 저렴하고 문제없는지,
00:05:29반대로 어느 순간부터는 Opus가 더 효율적인지 명확히 구분해 주었으면 합니다.
00:05:34생각해 볼 문제들이죠. 확실히 반가운 기능입니다. 전반적으로 낮은 수준의 작업에서
00:05:40Sonnet은 큰 도움이 될 겁니다. API 토큰을 사용하는 저희 같은 사람들에게는,
00:05:46Claude Max Plan 생태계에 있지 않은 앱의 경우 Anthropic을 사용하기가 매우 힘들었으니까요.
00:05:51너무 비싸서 오랫동안 사람들에게 말해왔죠. 그냥 OpenAI의
00:05:55미니 모델을 보라고요. 그게 많은 사람들의 업무에 충분한 경우가 많거든요.
00:05:59이제 Anthropic에도 중급 옵션이 생겨서 아주 좋습니다.
00:06:05오늘 내용은 여기까지입니다. 어디서나 사용 가능합니다. 아마도
00:06:09어디에 가장 적합할지 파악하기 위해 많은 시행착오가 필요할 겁니다. 여러분의
00:06:13생각도 알려주세요. 제 Claude 코드 마스터 클래스를 확인하고 싶다면
00:06:17Chase AI Plus를 확인해 보세요. 다음에 뵙겠습니다.