스크립트
00:00:00Anthropic이 지난주 Claude Sonnet 5를 출시했는데 실망스러웠습니다. 하지만 적어도 Fable 5가 돌아왔고,
00:00:04성능이 낮아졌을 수도 있고, 오, Claude Code에는 중국에서의 사용을 감지하기 위한
00:00:09스파이웨어 같은 코드가 포함되어 있을 수도 있습니다. 바로 시작해 보죠. 먼저 Sonnet 5부터 살펴보겠습니다. 이건 사실 4개월 반 만의 첫 Sonnet 업데이트인데,
00:00:18Anthropic은 이 모델이 자신들이 만든 가장 에이전트적인 Sonnet 모델이라고 말합니다.
00:00:22Opus 4.8에 근접한 성능을 내면서도 가격은 더 낮죠. 이 모델의 가격 책정은 정말 흥미로운 부분이라서
00:00:28나중에 다시 다룰 겁니다. 먼저 Anthropic이 제공한 벤치마크부터 보겠습니다.
00:00:31이전 모델보다 모든 면에서 성능이 향상되었고, 몇몇 지표에서는 Opus에 근접하며,
00:00:35Terminal Bench나 Computer Use 같은 지표에서는 지식 작업 부문에서 Opus를 근소하게 앞서기도 합니다. 저는
00:00:40제3자 벤치마크를 확인하는 걸 선호하는데, 제가 신뢰하는 곳은 Artificial Analysis입니다. 해당
00:00:44코딩 지수에서는 Opus보다 몇 점 뒤처지지만, GPT 5.4보다는 약간 앞서 있습니다. 이전 모델인
00:00:50Sonnet 4.6보다 확실히 멋진 도약을 이뤄냈죠. Intelligence Index에서도 같은 상황인데,
00:00:56GPT 5.5와 GPT 5.4 사이에 위치하지만, 흥미롭게도 에이전트 지수(Agentic Index)에서는 GPT 5.5를 능가했습니다.
00:01:03그러니 블로그에서 에이전트 기능에 많은 노력을 기울였다고 했을 때,
00:01:06그 성과가 여기서 드러난 것 같습니다. 벤치마크 결과로 볼 때 꽤 유능한 모델로 보이고,
00:01:10Sonnet 4.6에서 한 단계 발전한 건 분명합니다. 이제 가격 문제를 이야기해 보죠.
00:01:14API 가격을 보면, 8월 31일까지는 입력 토큰 100만 개당 2달러,
00:01:18출력 토큰 100만 개당 10달러로 할인된 가격을 제공합니다. 그 이후에는
00:01:23다른 Sonnet 모델들과 같은 가격인 입력 토큰 100만 개당 3달러, 출력 토큰 100만 개당 15달러로
00:01:28돌아갈 예정입니다. 이 가격대는 Gemini 3.5 Flash나 GPT 5.6 Terra(출시된다면)와 비슷한 수준이며,
00:01:34앞서 말했듯이 Opus 4.8보다는 저렴합니다. 문제는 실제 사용 시에는 이 말이
00:01:39전혀 사실이 아니라는 점입니다. 이 모델은 토큰을 엄청나게 소비합니다. Artificial Analysis의 Intelligence Index에서
00:01:45작업 하나를 수행하는 데 약 69,000개의 토큰을 사용하는데, 이는 Sonnet 4.6, Opus 4.8, Fable 5, GPT 5.4,
00:01:52그리고 5.5보다 많은 양입니다. 이 사분면에서 녹색이 좋은 위치인데, 이 모델은 거기서
00:01:57가장 멀리 떨어져 있습니다. 당연히 실제 작업 비용에 영향을 미치게 되고,
00:02:02Artificial Analysis는 작업당 비용에서 Sonnet 5가 Opus 4.8보다 더 비싸다는 것을 발견했습니다.
00:02:07Fable만이 더 비쌌죠. 게다가 대부분의 벤치마크에서 더 나은 성능을 보여주는 GPT 5.5와 비교하면,
00:02:12Sonnet 5보다 절반 가격입니다. Artificial Analysis가 할인 가격이 아닌 정가를 기준으로
00:02:16비교했다는 점은 참고해야 합니다. Anthropic이 이 할인을 연장하거나
00:02:20아예 영구적인 가격으로 만들어서 이 문제를 해결하려 할지 정말 궁금하네요.
00:02:25작업당 비용보다 더 심각한 건, Artificial Analysis가 전체 테스트를 실행했을 때
00:02:29Sonnet 5가 Fable 5보다 더 많은 비용이 들었다는 사실입니다. 도대체 무슨 일이 있었던 걸까요? Cursor Bench에서도,
00:02:34Sonnet 5 High를 보면, 비슷한 결과물에 대해 Opus 4.8과 가격이 비슷하고,
00:02:39노력 수준(effort level)을 높일수록 Sonnet 5 Max는 더 높은 비용을 지불하면서도 Opus 4.8 Extra High보다 더 낮은 점수를 기록합니다.
00:02:44무언가를 업데이트하거나 수정해야 할 것 같다는 생각이 듭니다. 그렇지 않으면 이 모델의 위치를 전혀 모르겠거든요.
00:02:48능력 면에서 나쁜 모델은 절대 아니지만 경제적으로는 의문이 듭니다. 저는 Sonnet 모델의
00:02:54큰 팬이었고 우리 중 많은 이들이 처음으로 매일 사용했던 모델들이라고 생각합니다만,
00:02:58지난 몇 달간은 항상 Opus 4.8을 써왔고 이 상황이 제 마음을 바꾸지는 않았습니다.
00:03:02특히 Fable이 돌아왔으니, 어려운 작업에는 Fable,
00:03:05데일리 작업에는 Opus 4.8을 쓰고 Sonnet은 아무것도 안 할 것 같네요. Fable 5 이야기로 넘어가서, 수출 제한이
00:03:11해제되면서 이제 국적에 상관없이 모두가 사용할 수 있게 되었습니다. 하지만 안타깝게도
00:03:15본인 요금제 제한 내에서 일주일 동안 사용할 수 있었고, 아니면 최소 요금제 제한의 50% 정도였죠. 7월 7일 이후에는
00:03:20오직 사용량 크레딧을 통해서만 이용할 수 있을 겁니다. 초기 차단과 관련해 블로그에 흥미로운 점들이 있었는데,
00:03:24이는 한 아마존 연구원의 소위 '탈옥(jailbreak)' 시도에서 비롯된 것이었습니다. 그는 보안 취약점을
00:03:29찾도록 유도했고, 한 사례에서는 취약점을 어떻게 악용하는지 시연하기까지 했죠.
00:03:33그런데 이 사건을 조사하면서 Anthropic은 Claude Opus 4.8,
00:03:37GPT 5.5, Kimi K 2.7 같은 많은 모델들이 그 보고서의 Fable 5와 똑같은 취약점을 식별할 수 있다는 것을 발견했습니다.
00:03:43그리고 그 취약점을 어떻게 악용하는지 보여달라고 했을 때는,
00:03:47테스트된 모든 모델이 할 수 있었습니다. Claude Haiku 4.5, Sonnet 4.6, Opus 4.6,
00:03:524.7, 4.8, GPT 5.4, 5.5, Kimi K 2.7까지 모두 포함해서요. 그러니 그 차단은 꽤 무의미해 보이고,
00:03:58결과적으로 Anthropic이 Fable에 대해 보안 설정을
00:04:02더 엄격하게 만들어서 평범한 요청들도 차단되는 경우가 훨씬 많아졌습니다. 공지 트윗에서
00:04:06디버깅이나 코딩 같은 일상적인 작업은 Opus 4.8로 대체될 것이라고 말했지만,
00:04:11나중에 Anthropic 직원이 소수만 그렇게 될 것이라고 정정했습니다.
00:04:14하지만 일부 벤치마크에서는 다른 것보다 더 많은 영향을 받은 것 같고, Fable이 이제
00:04:18nerfed(성능 저하)되었다는 주장도 있습니다. 기본적으로 Opus 4.8로 더 자주 넘어가니
00:04:23이런 벤치마크에서 훨씬 낮은 성능을 보이는 것이죠. 수출 제한과 차단 이슈와 관련해, 사람들이 Claude
00:04:27Code가 시스템 프롬프트 날짜 문자열을 수정하는 아주 교묘한 방식으로 핑거프린팅을
00:04:32시도하고 있다는 점을 발견했습니다. 자세한 내용을 담은 훌륭한 블로그 게시물이 있는데,
00:04:35아래에 링크해 두겠습니다. 요약하자면 Claude Code에는 당신의 시간대가
00:04:40중국에 있는지 확인하는 함수가 있습니다. 그렇다면 날짜 문자열의 하이픈이 슬래시로 변경됩니다. 그리고
00:04:44API 기반 URL이 이 리스트와 일치하는지, 혹은 호스트네임에 DeepSeq, Minimax, ZAI 같은
00:04:49특정 AI 연구소 키워드가 포함되어 있는지 확인합니다. 만약 그렇다면 'today's'의 아포스트로피를
00:04:55육안으로는 똑같아 보이는 다른 유니코드 문자로 변경합니다. 이건 스테가노그래피(steganography)라는 아주 영리한 기법인데,
00:05:00여러분 대부분은 이 영향에 받지 않을 겁니다. 기본적으로는 API
00:05:03리셀러, 무단 Claude Code 게이트웨이, 모델 증류 공격을 감지하려는 의도입니다. 저는
00:05:08그들이 그걸 시도하는 것에 큰 불만은 없지만, 이런 것들을 숨기려 하지 말고
00:05:12Claude Code에 무엇이 들어 있는지 조금 더 솔직했으면 좋겠습니다. 이게 문제라고 생각하시나요? 그리고
00:05:16Sonnet 5와 Fable의 복귀에 대해 어떻게 생각하시나요? 댓글로 알려주세요. 구독하셨나요?
00:05:20늘 그렇듯 다음 영상에서 뵙겠습니다.