Claude Sonnet 3.5은 실망스러웠습니다... (그래도 Fable은 돌아왔네요!)

BBetter Stack
컴퓨터/소프트웨어경제 뉴스AI/미래기술

스크립트

00:00:00Anthropic이 지난주 Claude Sonnet 5를 출시했는데 실망스러웠습니다. 하지만 적어도 Fable 5가 돌아왔고,
00:00:04성능이 낮아졌을 수도 있고, 오, Claude Code에는 중국에서의 사용을 감지하기 위한
00:00:09스파이웨어 같은 코드가 포함되어 있을 수도 있습니다. 바로 시작해 보죠. 먼저 Sonnet 5부터 살펴보겠습니다. 이건 사실 4개월 반 만의 첫 Sonnet 업데이트인데,
00:00:18Anthropic은 이 모델이 자신들이 만든 가장 에이전트적인 Sonnet 모델이라고 말합니다.
00:00:22Opus 4.8에 근접한 성능을 내면서도 가격은 더 낮죠. 이 모델의 가격 책정은 정말 흥미로운 부분이라서
00:00:28나중에 다시 다룰 겁니다. 먼저 Anthropic이 제공한 벤치마크부터 보겠습니다.
00:00:31이전 모델보다 모든 면에서 성능이 향상되었고, 몇몇 지표에서는 Opus에 근접하며,
00:00:35Terminal Bench나 Computer Use 같은 지표에서는 지식 작업 부문에서 Opus를 근소하게 앞서기도 합니다. 저는
00:00:40제3자 벤치마크를 확인하는 걸 선호하는데, 제가 신뢰하는 곳은 Artificial Analysis입니다. 해당
00:00:44코딩 지수에서는 Opus보다 몇 점 뒤처지지만, GPT 5.4보다는 약간 앞서 있습니다. 이전 모델인
00:00:50Sonnet 4.6보다 확실히 멋진 도약을 이뤄냈죠. Intelligence Index에서도 같은 상황인데,
00:00:56GPT 5.5와 GPT 5.4 사이에 위치하지만, 흥미롭게도 에이전트 지수(Agentic Index)에서는 GPT 5.5를 능가했습니다.
00:01:03그러니 블로그에서 에이전트 기능에 많은 노력을 기울였다고 했을 때,
00:01:06그 성과가 여기서 드러난 것 같습니다. 벤치마크 결과로 볼 때 꽤 유능한 모델로 보이고,
00:01:10Sonnet 4.6에서 한 단계 발전한 건 분명합니다. 이제 가격 문제를 이야기해 보죠.
00:01:14API 가격을 보면, 8월 31일까지는 입력 토큰 100만 개당 2달러,
00:01:18출력 토큰 100만 개당 10달러로 할인된 가격을 제공합니다. 그 이후에는
00:01:23다른 Sonnet 모델들과 같은 가격인 입력 토큰 100만 개당 3달러, 출력 토큰 100만 개당 15달러로
00:01:28돌아갈 예정입니다. 이 가격대는 Gemini 3.5 Flash나 GPT 5.6 Terra(출시된다면)와 비슷한 수준이며,
00:01:34앞서 말했듯이 Opus 4.8보다는 저렴합니다. 문제는 실제 사용 시에는 이 말이
00:01:39전혀 사실이 아니라는 점입니다. 이 모델은 토큰을 엄청나게 소비합니다. Artificial Analysis의 Intelligence Index에서
00:01:45작업 하나를 수행하는 데 약 69,000개의 토큰을 사용하는데, 이는 Sonnet 4.6, Opus 4.8, Fable 5, GPT 5.4,
00:01:52그리고 5.5보다 많은 양입니다. 이 사분면에서 녹색이 좋은 위치인데, 이 모델은 거기서
00:01:57가장 멀리 떨어져 있습니다. 당연히 실제 작업 비용에 영향을 미치게 되고,
00:02:02Artificial Analysis는 작업당 비용에서 Sonnet 5가 Opus 4.8보다 더 비싸다는 것을 발견했습니다.
00:02:07Fable만이 더 비쌌죠. 게다가 대부분의 벤치마크에서 더 나은 성능을 보여주는 GPT 5.5와 비교하면,
00:02:12Sonnet 5보다 절반 가격입니다. Artificial Analysis가 할인 가격이 아닌 정가를 기준으로
00:02:16비교했다는 점은 참고해야 합니다. Anthropic이 이 할인을 연장하거나
00:02:20아예 영구적인 가격으로 만들어서 이 문제를 해결하려 할지 정말 궁금하네요.
00:02:25작업당 비용보다 더 심각한 건, Artificial Analysis가 전체 테스트를 실행했을 때
00:02:29Sonnet 5가 Fable 5보다 더 많은 비용이 들었다는 사실입니다. 도대체 무슨 일이 있었던 걸까요? Cursor Bench에서도,
00:02:34Sonnet 5 High를 보면, 비슷한 결과물에 대해 Opus 4.8과 가격이 비슷하고,
00:02:39노력 수준(effort level)을 높일수록 Sonnet 5 Max는 더 높은 비용을 지불하면서도 Opus 4.8 Extra High보다 더 낮은 점수를 기록합니다.
00:02:44무언가를 업데이트하거나 수정해야 할 것 같다는 생각이 듭니다. 그렇지 않으면 이 모델의 위치를 전혀 모르겠거든요.
00:02:48능력 면에서 나쁜 모델은 절대 아니지만 경제적으로는 의문이 듭니다. 저는 Sonnet 모델의
00:02:54큰 팬이었고 우리 중 많은 이들이 처음으로 매일 사용했던 모델들이라고 생각합니다만,
00:02:58지난 몇 달간은 항상 Opus 4.8을 써왔고 이 상황이 제 마음을 바꾸지는 않았습니다.
00:03:02특히 Fable이 돌아왔으니, 어려운 작업에는 Fable,
00:03:05데일리 작업에는 Opus 4.8을 쓰고 Sonnet은 아무것도 안 할 것 같네요. Fable 5 이야기로 넘어가서, 수출 제한이
00:03:11해제되면서 이제 국적에 상관없이 모두가 사용할 수 있게 되었습니다. 하지만 안타깝게도
00:03:15본인 요금제 제한 내에서 일주일 동안 사용할 수 있었고, 아니면 최소 요금제 제한의 50% 정도였죠. 7월 7일 이후에는
00:03:20오직 사용량 크레딧을 통해서만 이용할 수 있을 겁니다. 초기 차단과 관련해 블로그에 흥미로운 점들이 있었는데,
00:03:24이는 한 아마존 연구원의 소위 '탈옥(jailbreak)' 시도에서 비롯된 것이었습니다. 그는 보안 취약점을
00:03:29찾도록 유도했고, 한 사례에서는 취약점을 어떻게 악용하는지 시연하기까지 했죠.
00:03:33그런데 이 사건을 조사하면서 Anthropic은 Claude Opus 4.8,
00:03:37GPT 5.5, Kimi K 2.7 같은 많은 모델들이 그 보고서의 Fable 5와 똑같은 취약점을 식별할 수 있다는 것을 발견했습니다.
00:03:43그리고 그 취약점을 어떻게 악용하는지 보여달라고 했을 때는,
00:03:47테스트된 모든 모델이 할 수 있었습니다. Claude Haiku 4.5, Sonnet 4.6, Opus 4.6,
00:03:524.7, 4.8, GPT 5.4, 5.5, Kimi K 2.7까지 모두 포함해서요. 그러니 그 차단은 꽤 무의미해 보이고,
00:03:58결과적으로 Anthropic이 Fable에 대해 보안 설정을
00:04:02더 엄격하게 만들어서 평범한 요청들도 차단되는 경우가 훨씬 많아졌습니다. 공지 트윗에서
00:04:06디버깅이나 코딩 같은 일상적인 작업은 Opus 4.8로 대체될 것이라고 말했지만,
00:04:11나중에 Anthropic 직원이 소수만 그렇게 될 것이라고 정정했습니다.
00:04:14하지만 일부 벤치마크에서는 다른 것보다 더 많은 영향을 받은 것 같고, Fable이 이제
00:04:18nerfed(성능 저하)되었다는 주장도 있습니다. 기본적으로 Opus 4.8로 더 자주 넘어가니
00:04:23이런 벤치마크에서 훨씬 낮은 성능을 보이는 것이죠. 수출 제한과 차단 이슈와 관련해, 사람들이 Claude
00:04:27Code가 시스템 프롬프트 날짜 문자열을 수정하는 아주 교묘한 방식으로 핑거프린팅을
00:04:32시도하고 있다는 점을 발견했습니다. 자세한 내용을 담은 훌륭한 블로그 게시물이 있는데,
00:04:35아래에 링크해 두겠습니다. 요약하자면 Claude Code에는 당신의 시간대가
00:04:40중국에 있는지 확인하는 함수가 있습니다. 그렇다면 날짜 문자열의 하이픈이 슬래시로 변경됩니다. 그리고
00:04:44API 기반 URL이 이 리스트와 일치하는지, 혹은 호스트네임에 DeepSeq, Minimax, ZAI 같은
00:04:49특정 AI 연구소 키워드가 포함되어 있는지 확인합니다. 만약 그렇다면 'today's'의 아포스트로피를
00:04:55육안으로는 똑같아 보이는 다른 유니코드 문자로 변경합니다. 이건 스테가노그래피(steganography)라는 아주 영리한 기법인데,
00:05:00여러분 대부분은 이 영향에 받지 않을 겁니다. 기본적으로는 API
00:05:03리셀러, 무단 Claude Code 게이트웨이, 모델 증류 공격을 감지하려는 의도입니다. 저는
00:05:08그들이 그걸 시도하는 것에 큰 불만은 없지만, 이런 것들을 숨기려 하지 말고
00:05:12Claude Code에 무엇이 들어 있는지 조금 더 솔직했으면 좋겠습니다. 이게 문제라고 생각하시나요? 그리고
00:05:16Sonnet 5와 Fable의 복귀에 대해 어떻게 생각하시나요? 댓글로 알려주세요. 구독하셨나요?
00:05:20늘 그렇듯 다음 영상에서 뵙겠습니다.

핵심 요약

Claude Sonnet 5는 이전 버전보다 에이전트 성능은 개선되었으나, 높은 토큰 소비량으로 인해 경제성과 실제 작업 효율성 측면에서 한계를 보입니다.

하이라이트

  • Claude Sonnet 5는 작업 하나당 약 69,000개의 토큰을 소비하며, 이는 비교 모델들 중 가장 많은 소비량입니다.

  • Artificial Analysis 데이터 기준, Sonnet 5의 작업당 비용은 Opus 4.8보다 더 비쌉니다.

  • Sonnet 5는 현재 8월 31일까지 할인된 가격으로 제공되나, 정가 기준으로는 GPT 5.5보다 절반 가격 수준인 경쟁 모델들이 존재합니다.

  • Fable 5에 적용된 강화된 보안 정책은 일상적인 코딩 요청까지 차단하는 결과를 초래했습니다.

  • Claude Code는 시스템 프롬프트 내 유니코드 문자를 변경하는 스테가노그래피 기법을 통해 특정 환경 및 리셀러 사용을 감지합니다.

타임라인

Claude Sonnet 5의 성능과 가격 분석

  • Sonnet 5는 Sonnet 4.6 대비 에이전트 지수에서 성능 도약을 이루었습니다.
  • 작업당 토큰 소비량이 과도하여 비용 효율성이 낮습니다.
  • 할인 기간 종료 후 가격은 100만 입력 토큰당 3달러, 출력 토큰당 15달러로 책정됩니다.

Anthropic의 신규 모델 Sonnet 5는 에이전트 기능 강화에 초점을 맞췄으며, 일부 벤치마크에서는 Opus를 근소하게 앞서기도 합니다. 그러나 실제 작업 시 토큰 소비량이 69,000개 수준으로 경쟁 모델 대비 매우 높습니다. 이로 인해 작업당 실질 비용이 Opus 4.8보다 비싸게 측정되는 비효율성이 발생합니다.

Fable 5의 복귀 및 보안 이슈

  • 수출 제한 해제로 국적 관계없이 Fable 5 사용이 가능해졌습니다.
  • 보안 강화 이후 평범한 일상 작업까지 차단되는 사례가 빈번합니다.
  • 일상적인 코딩 작업은 Opus 4.8로 대체하는 것이 권장됩니다.

Fable 5는 보안 취약점 식별 사건 이후 차단 정책이 더욱 엄격해졌습니다. 테스트 결과 여러 모델이 동일한 취약점을 탐지할 수 있음에도 Fable에 대해서만 강한 제약이 적용되었습니다. 이로 인해 모델의 실질적인 활용도가 낮아지고, 사용자는 Opus 4.8로 작업 경로를 변경하는 상황입니다.

Claude Code의 사용자 감지 기법

  • Claude Code는 중국 등 특정 지역 사용 여부를 감지하기 위해 시간대 정보를 확인합니다.
  • 시스템 프롬프트의 유니코드 문자를 수정하여 API 리셀러와 모델 증류 공격을 식별합니다.
  • 운영상의 투명성 부족이 감지 기법 적용 방식에서 지적받고 있습니다.

Claude Code 내에는 사용자 환경을 감지하기 위한 스테가노그래피 기반의 코드가 포함되어 있습니다. 특정 리스트와 일치하는 호스트네임이나 특정 연구소 키워드가 탐지되면, 날짜 문자열 내 기호를 다른 유니코드 문자로 치환하는 방식을 사용합니다. 이는 API 게이트웨이 및 무단 재판매를 막기 위한 조치로 파악됩니다.

커뮤니티 글

모든 글 보기