절반 가격에 Fable을 제친 Opus 5...?

BBetter Stack
Computing/SoftwareBusiness NewsInternet Technology

Transcript

00:00:00Anthropic이 Claude Opus 5를 막 출시했습니다. 가격은 반값인데
00:00:04실제로 Fable보다 좋을지도 모릅니다. 정말 그렇다면 제 새로운 최애 모델이 될 테니, 한번 알아보죠.
00:00:13그들이 Opus 5를 설명하는 방식은 이렇습니다. Opus 5는 사려 깊고 주도적인 모델로,
00:00:18반값의 가격으로 Claude Fable 5의 프론티어 지능 수준에 근접합니다. 코딩 및 지식 작업
00:00:23Frontier Bench 및 GDP Val과 같은 평가에서 Opus 5는 새로운 최첨단(SOTA) 수준을 달성했지만,
00:00:28사이버 보안 작업에서는 Mythos 5 뒤에 위치합니다. Opus 5는 매일 사용하도록 설계되었으며,
00:00:33다른 모델보다 효율적으로 작동합니다. Claude Max의 새로운 기본 모델이자 Claude Pro 플랜에서 가장 강력한 모델입니다.
00:00:38이후 그들은 벤치마크를 보여주는데, Fable 5가 버티고 있음에도 불구하고
00:00:43상당수의 영역에서 승리하고 있습니다. 차이도 근소하지 않습니다. 그들에 따르면
00:00:47Frontier Bench에서 Fable 5보다 거의 10% 더 뛰어납니다. 하지만 저에게 가장 대단하게 느껴진 건
00:00:52Arc AGI 점수입니다. Opus 4.8은 여기서 1.5%를 기록했고, 이전 최고점이었던 Sol은 7.8%였는데,
00:01:00Opus 5는 30.2%를 기록했습니다. 이 벤치마크를 만든 팀은 Opus가 다른 어떤 모델에서도
00:01:06보지 못했던 새로운 능력을 보여주었다고 언급했습니다. 고차원 논리 추론을 수행하기 위해
00:01:10이 시험 문제들을 대수적 표기법으로 변환하는 능력이었죠. 이건 정말 대단한 부분입니다.
00:01:15참고로 Fable이 왜 여기에 없는지 궁금하시다면, Fable의 데이터 보존 정책 때문입니다.
00:01:19Arc AGI는 벤치마크 세부 정보가 Anthropic에 유출되는 위험을 원치 않았기 때문이죠. 하지만
00:01:24다행인 점은, Opus 5는 일반 액세스 시 데이터 보존 요구사항이 없다는 것입니다.
00:01:29이 점은 많은 사람들을 아주 기쁘게 할 겁니다. 그럼 계속해서 Artificial Analysis의
00:01:33서드파티 벤치마크를 살펴보죠. 코딩 인덱스에서는 GPT 5.6 Sol Extra High에 단 0.3점 차로 뒤처진 2위를 차지했지만,
00:01:39Fable보다는 1.5점 앞서며, Opus 4.8에 비하면 아주 훌륭한 상승 폭을 보여줍니다.
00:01:45거대 기업들 사이를 비집고 들어온 Kimi K3에게도 응원을 보냅니다. 출시되었을 때
00:01:49관련 영상을 다뤘으니, 최신 AI 및 개발자 소식을 놓치지 않으시려면
00:01:52구독해 주세요. 에이전트 인덱스를 살펴보면, Opus 5가 실제로
00:01:57선두를 차지하며 Fable 5보다 약간 앞서고 OpenAI의 Sol 모델도 제쳤습니다.
00:02:02지능 인덱스에서도 마찬가지로 Opus 5가 앞서 나가고 있죠. 성능 면에서만 보면
00:02:06Opus 5는 정말 뛰어난 모델로 보이고, 솔직히 자못 놀랐습니다.
00:02:11저는 그들이 이제 Fable에 집중하고, Opus는 일종의 새로운 Sonic 모델처럼
00:02:15될 줄 알았거든요. 하지만 가격을 고려하기 전까지는 Fable과 Opus가 거의 막상막하인 것처럼 보입니다.
00:02:19Artificial Analysis에서 작업 완료에 드는 비용을 살펴보면, Opus 5는
00:02:23실제로 Fable 5보다 72센트 저렴하며, Opus 4.8보다
00:02:28약간 비싼 수준입니다. 가성비를 고려한다면 GPT 5.6 Sol이
00:02:33Opus 5의 거의 반값이라 여전히 승자라고 할 수 있겠네요.
00:02:37초록색으로 표시된 가장 매력적인 사분면을 차트에서 보면, GPT 모델들이 거의 그 위치에 있으며,
00:02:42그 영역에 자리 잡고 있고, Anthropic 모델들은 높은 가격대 영역에
00:02:46따로 영역을 형성하고 있습니다. Cursor Bench 역시 지금까지 본 모든 벤치마크를 그대로 반영합니다.
00:02:50여기서 Opus 5 Max는 Fable 5와 거의 정확히 동일한 점수를 기록했지만, 해당 작업에 Fable은 17달러가 들었고
00:02:56Opus는 8달러가 들었습니다. 참고로 가격 자체는 Opus 4.8과 동일하여,
00:03:01입력 토큰 백만 개당 5달러, 출력 토큰 백만 개당 25달러입니다. 그러니
00:03:06Opus 4.8을 선호하신다면 이 모델을 쓰지 않을 이유가 없겠죠. 저 역시
00:03:10Fable 5 팬으로서, 구독 이용량과 크레딧 소진을 줄이기 위해 Opus 5를
00:03:14많이 사용하게 될 것 같습니다. 솔직히 Fable 대 Opus에 대한 제 최선의 추측은,
00:03:18정말 긴 호흡의 어려운 문제를 해결해야 할 때는 여전히 Fable이 최상위 모델이겠지만,
00:03:23작업의 95%는 이제 Opus 5가 그 자리를 대체할 수 있다는 것입니다. 그럼 이제 로컬 테스트를 통해
00:03:28실제로 작동하는 모습을 살펴보겠습니다. 제가 진행한 첫 번째 테스트는 모델들에게 Three.js를 사용해
00:03:32단일 HTML 파일로 완성된 F1 레이싱 게임을 만들어달라고 요청한 것이었습니다. 각 모델이 얼마나 걸렸는지,
00:03:37그리고 API 비용은 얼마나 나올지는 마지막에 말씀드리겠지만, 먼저
00:03:40결과부터 확인해 보죠. 이것이 Opus 5가 보여준 결과인데, 정말
00:03:45깊은 인상을 받았습니다. 외부 에셋 같은 건 전혀 사용하지 않았습니다. 전부
00:03:50Opus 5가 구현한 것이며, 모든 게 정말 근사해 보입니다. 트랙 레이아웃이 약간 거꾸로 되어 있긴 했지만,
00:03:55조종감은 완벽합니다. 랩 타임, 순위 측정, 순위표까지
00:03:59모두 잘 작동합니다. 잔디 아래로 운전하고 있긴 하지만 충돌 판정이 작동하는 걸 볼 수 있고,
00:04:03실제로 잔디 밑에 트랙이 깔려 있어서 프롬프트로 아주 쉽게 수정할 수 있습니다.
00:04:07또한 자갈밭(Gravel trap) 표현도 정말 잘 구현되었습니다. 솔직히 말해서 Opus 5에서 얻은
00:04:12결과물이 아주 만족스럽습니다. 제 생각에는 이 F1 차량 모델링이 전체 중에서 가장 좋아 보입니다.
00:04:16판단은 여러분께 맡기겠습니다. 이건 Fable이 보여준 결과입니다. 이 역시
00:04:20트랙 레이아웃은 참 근사하지만, 차량은 Opus 5 결과물보다 조금 더 단순합니다.
00:04:25회전할 때 카메라가 흔들리는 효과는 정말 마음에 드네요. 그리고 마찬가지로
00:04:28트랙 순위, 트랙 타임 측정 등 다른 모든 기능도 작동합니다. Fable 5 역시
00:04:33훌륭하게 해냈지만, 솔직히 저는 Opus 쪽이 더 마음에 듭니다. 다음은
00:04:37GPT 5.6 Sol에서 최대 노력(Max effort) 옵션으로 얻은 결과입니다. 모델링과
00:04:43카메라 뷰 연출은 꽤 잘해주었지만, 보시다시피 트랙이 없고 에셋 일부가
00:04:47뒤집혀 있으며, 트랙 중간쯤 가면 그래픽이 끊어집니다.
00:04:51제 기준에서는 Fable이나 Opus보다 떨어지는 수준이었습니다. 확실히 Opus가
00:04:56여기서도 우위를 점하고 있네요. 마지막으로 테스트한 모델은 Kimi K3이며, 이것이 제출받은 결과입니다.
00:05:01솔직히 오픈 웨이트 모델 치고는 대단히 놀랍습니다. 아주 잘 해냈고,
00:05:05GPT 5.6 Sol과 상당히 유사합니다. 가드레일, 트랙,
00:05:09순위 측정 등 모든 기능이 잘 동작합니다. 단 한 번의 시도로 근사한 게임을 만들어냈죠.
00:05:14해당 실행들의 비용과 소요 시간을 살펴보면, Opus 5는 F1 게임을 완성하는 데
00:05:1946분 51초가 걸렸으며, API를 사용할 경우 약 12.99달러가 들었을 겁니다.
00:05:25따라서 이번 테스트에서 Opus 5는 실제로 Fable보다 비쌌는데, 원인을 파악해 보니
00:05:30토큰을 5배나 더 사용했기 때문이었습니다. 다른 벤치마크에서는 이런 경향이 나타나지 않는 만큼 특이 케이스이길 바랍니다.
00:05:35참고로 저는 Claude 모델의 비용을 Claude Code 사용량 측정 도구로 계산하고 있으므로,
00:05:39구독형 요금제를 쓸 때는 정확한 가격이 나오지 않아서 약간의 오차가 있을 수 있습니다.
00:05:44또한 앞서 말씀드렸듯 이 모델들은 여전히 프리미엄 라인이라, GPT 5.6 같은 모델로 내려오면
00:05:49더 빠르고 저렴한 모델을 얻을 수 있지만, 제 관점에서는 결과물이 더 아쉬웠습니다.
00:05:54다른 테스트를 하나 더 해보죠. 이번에는 개인 자산 관리 대시보드를 만들어 달라고 요청했습니다.
00:05:58프론트엔드와 백엔드가 모두 포함된 풀스택 애플리케이션이 될 것이며, 추가할 수 있는 기능 몇 가지도 나열했습니다.
00:06:02이것이 Opus 5로 얻은 결과이며, 솔직히 매우 인상적이었다고 말할 수 있겠네요.
00:06:06개인적으로 아주 좋아하는 스타일의 UI입니다. 여러분도 마음에 드시는지 댓글로 알려주세요.
00:06:11모든 기능이 완벽하게 동작합니다. 작동 여부를 모두 테스트해 보았는데, 요청했던 각 기능별로
00:06:15독립된 페이지가 구성되어 있었고, 프론트엔드와 백엔드 간에
00:06:20모든 기능이 매끄럽게 잘 연결되어 동작했습니다. 채택한 UI 스타일도 참 마음에 드네요.
00:06:24전체 결과물 중 단연 최고라고 생각합니다. 코드 자체를 보면 프론트엔드에 React와 React Router를 사용했는데
00:06:28제가 아주 좋아하는 조합입니다. 백엔드에서도 실제 데이터베이스를 사용했기에 점수를 더 주고 싶습니다.
00:06:33데이터베이스로 Node SQLite를 사용했고, 서버용으로는 Express를 사용했습니다.
00:06:37이것은 Fable 5가 보여준 결과인데, 저는 Opus 5 UI가 더 마음에 들지만 이것도 나쁘지 않습니다.
00:06:42다만 이 차트들은 솔직히 말해 별로 유용해 보이지는 않네요. 아래쪽에 있는 건 제법 괜찮고,
00:06:48모든 기능이 작동하기는 합니다. 다만 Opus 5가 UI에 조금 더 신경을 썼고,
00:06:53그쪽 영역에 확실히 더 뛰어납니다. 코드 면에서는 Opus 5와 유사하게 React를 사용했지만,
00:06:57라우팅 라이브러리를 별도로 선택하지 않았다는 점이 아쉽습니다. 자체적으로 작은 라우팅 기능을 구현했더군요.
00:07:01개인적으로는 React Router 같은 검증된 표준을 사용하는 쪽을 선호합니다.
00:07:05데이터베이스의 경우 동일하게 Node SQLite를 사용하고 있었고, 이 역시 Express 기반으로
00:07:09구축되어 있어서 백엔드는 꽤 유사했습니다. 그렇지만 Opus가 프론트엔드 스택을 더 잘 선택했다고 봅니다.
00:07:13이것은 GPT 5.6 Sol이 출력해 준 결과인데, UI 디자인 면에서는 손꼽힐 정도라고 말씀드릴 수 있겠네요.
00:07:18확실히 Opus와 견줄만합니다. 스타일의 차이일 뿐이라 취향 문제에 가깝겠지만,
00:07:22저는 이 스타일도 아주 맘에 듭니다. 전체 UI를 구성하는 능력이 대단하고
00:07:26모든 기능이 다 작동합니다. 다만 개별 기능을 위한 별도의 페이지를 만들지는 않고,
00:07:31한 페이지 내에서 다른 구역으로 이동하도록 구현했더군요.
00:07:35또한 기술 스택 면에서 가장 독특한 선택을 했습니다. Next.js 기반에
00:07:38데이터베이스로 Drizzle을 조합했는데, 제가 매우 좋아하는 조합이고 이런 앱에 상당히 타당한 접근법입니다.
00:07:43하지만 실제 호스팅을 위해 Cloudflare와 Vinext를 사용했는데, 이건 다소 이상한 결정이라고 봅니다.
00:07:47아시다시피 Vinext는 극초기 단계라 아직 충분히 검증되지 않았는데,
00:07:52아마도 프롬프트 내에 Cloudflare와 Vinext를 강제로 사용하도록 만드는 지시어가 들어있었던 것 같습니다.
00:07:56Kimi K3 영상에서도 언급했듯이, 자체적으로 호스팅하는 ChatGPT 사이트들이 바로 그런 구조로 작동하기 때문일 것입니다.
00:08:00마지막으로 테스트한 모델은 Kimi K3이며, 이것이 도출된 결과입니다.
00:08:04매우 훌륭하게 수행했다고 말할 수 있겠네요. 이 UI는 GPT 5.4나 5.5에서 볼 법한
00:08:09느낌이라 UI 디자인 측면에서는 약간 뒤처져 있다고 생각하지만,
00:08:14마찬가지로 모든 기능이 작동하고 있어서 UI에 대해 그다지 불만을 가질 수는 없을 것 같습니다. 요청한 대로 정확히 해냈으니까요.
00:08:19하지만 코드 측면에서는 감점 요소가 있었습니다. 프론트엔드로 React를 선택했고,
00:08:24Fable처럼 라우팅 라이브러리를 직접 구현했더군요. 그런데 서버 쪽을 보면
00:08:28단순 Express 서버만 존재할 뿐, Node SQLite 등을 활용한
00:08:32데이터베이스 구축을 전혀 하지 않았습니다. 순수 JavaScript로 자체 데이터베이스 구조를 만들어
00:08:36모든 데이터를 JSON 파일에 저장하도록 했죠. 이건 절대 권장하고 싶지 않은 방식입니다.
00:08:40자산 관리 테스트 시 모델들의 소요 시간과 가격을 보면, Fable이 가장 비쌌습니다.
00:08:4430.79달러가 들었고 소요 시간도 56분 55초였죠. 하지만 Opus의 경우에도
00:08:4829.82달러가 발생하여 Fable과 거의 차이가 없었으며, 소요 시간은 59분 15초로
00:08:55오히려 더 걸렸습니다. 이에 비해 GPT 모델들은 가성비가 훌륭하여 약 3.5배 정도
00:09:02더 저렴합니다. 이러한 경쟁을 통해 Anthropic의 가격이 인하되길 진심으로 바랍니다.
00:09:07따라서 개인적으로는 평가가 다소 엇갈립니다. 물론 각 테스트를 한 번씩만 수행했고 두 가지 테스트만 진행했기에,
00:09:11Opus가 Fable 가격의 3분의 1 수준이라고 하는 Artificial Analysis의 벤치마크가
00:09:16더 정확하기를 바랄 뿐입니다. 하지만 정확한 판단을 위해서는 좀 더 써봐야 할 것 같습니다.
00:09:20어쩌면 제가 비용 측정에 사용하는 도구상의 문제일 수도 있겠네요. Opus의 또 다른 장점은
00:09:24사이버 보안 작업에서 Fable 5보다 제한이 약간 덜하다는 점입니다. 안전장치는
00:09:28좁은 범위의 사이버 작업에 강화된 가드레일이 적용된 점을 제외하면 Opus 4.8과 거의 유사합니다.
00:09:33알려진 바에 따르면 이 안전장치를 통해 Opus 5는 소스 코드의 취약점을 찾아낼 수는 있지만,
00:09:37바이너리 기반 취약점 스캐닝, 모의 침투 테스트 및 익스플로잇 생성은 차단됩니다.
00:09:42테스트 결과에 따르면 이들의 분류 모델(Classifier)은 Fable 5에 비해
00:09:46개입 빈도가 약 85% 적은 것으로 나타났습니다. 그렇습니다. 현재 모델 간의 경쟁은 실로 대단합니다.
00:09:51가격 인하가 가능하다는 것을 보여주는 GPT 5.6이 있고, 지능 면에서
00:09:55거대 기업과 맞먹는 Kimi 같은 오픈 모델이 있으며, 지능의 한계를
00:10:00지속적으로 확장해 나가는 Anthropic이 있습니다. 여러분이 가장 좋아하는 모델은 무엇이며, Opus의 소식이 마음에 드시나요?
00:10:04아래 댓글로 공유해 주시고, 구독도 잊지 마세요. 그럼 언제나 그렇듯 다음 영상에서 뵙겠습니다.
00:10:09시청해 주셔서 감사합니다.

Key Takeaway

Claude Opus 5는 백만 토큰당 5달러/25달러의 가격으로 Fable 5급 지능과 Arc AGI 30.2%라는 압도적 추론 성능을 제공하여, 고난도 작업을 제외한 대부분의 개발 업무에서 비용 효율적인 대체재가 된다.

Highlights

  • Claude Opus 5는 입력 토큰 백만 개당 5달러, 출력 토큰 백만 개당 25달러로 Opus 4.8과 동일한 가격에 Claude Fable 5 수준의 성능을 제공한다.

  • Arc AGI 벤치마크에서 Opus 4.8은 1.5%, 이전 최고점 모델인 Sol은 7.8%를 기록한 반면, Opus 5는 고차원 대수적 표기법 변환 능력을 통해 30.2%를 달성했다.

  • Cursor Bench 및 에이전트 인덱스에서 Opus 5는 Fable 5와 대등하거나 약간 앞서는 성능을 기록하면서도 동일 작업 기준 비용은 17달러에서 8달러로 절반 이하로 줄었다.

  • Three.js 기반 3D F1 게임 생성 로컬 테스트에서 Opus 5는 외부 에셋 없이 조종감, 순위표, 자갈밭 지형까지 완성도 높게 구현했다.

  • Opus 5의 사이버 보안 안전장치는 소스 코드 취약점 탐지를 허용하되 익스플로잇 생성은 차단하는 방식으로, Fable 5 대비 분류 모델의 개입 빈도를 85% 줄였다.

Timeline

Opus 5의 주요 특징 및 벤치마크 성과

  • Opus 5는 Fable 5 반값의 가격으로 프론티어급 지능을 제공하는 Claude Pro 플랜의 새로운 기본 모델이다.
  • Frontier Bench에서 Fable 5보다 약 10% 우수한 성적을 거두었다.
  • Arc AGI 평가에서 대수적 표기법 변환 기법을 통해 이전 최고점인 7.8%를 크게 뛰어넘는 30.2%를 기록했다.

Opus 5는 매일 사용하는 코딩 및 지식 작업을 위해 효율적으로 설계되었다. Arc AGI 벤치마크에서는 시험 문제를 대수적 표기법으로 변환하여 고차원 논리 추론을 수행하는 새로운 능력이 확인되었다. 데이터 보존 요구사항이 없어 일반 액세스 환경에서도 제약 없이 활용 가능하다.

서드파티 벤치마크 및 가성비 비교

  • Artificial Analysis 코딩 인덱스에서 GPT 5.6 Sol Extra High에 0.3점 차 2위를 차지했으나, 에이전트 및 지능 인덱스에서는 1위에 올랐다.
  • Cursor Bench 테스트 기준 Fable 5가 17달러 소모된 작업을 Opus 5는 8달러에 완료했다.
  • 입력 토큰 백만 개당 5달러, 출력 토큰 백만 개당 25달러로 Opus 4.8과 동일한 가격 구조를 유지한다.

에이전트 인덱스와 지능 인덱스 모두에서 Opus 5는 Fable 5와 OpenAI Sol 모델을 제치고 선두를 기록했다. 벤치마크상 작업 완료 비용은 Fable 5보다 72센트 저렴하며, 성능 대비 가성비 면에서는 GPT 5.6 Sol이 여전히 우위를 점하지만 Anthropic 라인업 내에서는 Opus 5가 95%의 작업 영역을 대체할 수 있는 효율을 보인다.

Three.js 기반 3D F1 레이싱 게임 생성 테스트

  • Opus 5는 외부 에셋 없이 단일 HTML 파일로 완성도 높은 3D F1 게임을 생성했다.
  • GPT 5.6 Sol은 트랙이 소실되거나 그래픽이 끊어지는 현상이 발생했고, Kimi K3는 오픈 웨이트 모델로서 뛰어난 완성도를 보였다.
  • 해당 테스트에서 Opus 5는 46분 51초 동안 12.99달러 상당의 토큰을 소비하여 Fable보다 많은 토큰을 사용했다.

단일 프롬프트로 Three.js 기반 게임을 제작한 결과, Opus 5는 완벽한 조종감과 랩 타임 measurement, 자갈밭 표현 등 정교한 완성도를 보였다. Fable 5 역시 안정적인 결과를 출력했으나 차량 모델링에서 Opus 5가 앞섰다. 다만 Opus 5가 토큰을 5배 더 많이 소비하는 특이 케이스가 발생하여 API 사용 시 Fable보다 높은 비용이 집계되었다.

풀스택 자산 관리 대시보드 애플리케이션 구현

  • Opus 5는 React와 React Router, Node SQLite와 Express 스택을 활용해 가장 완벽한 UI와 멀티 페이지 구조를 구현했다.
  • GPT 5.6 Sol은 Next.js와 Drizzle 조합으로 세련된 UI를 제공했으나, 단일 페이지 구역 이동 방식을 채택했다.
  • Kimi K3는 프론티어 데이터베이스 대신 pure JS 기반 JSON 파일 저장 방식을 사용하여 백엔드 구조에서 감점을 받았다.

프론트엔드와 백엔드가 포함된 애플리케이션 생성 테스트에서 Opus 5는 독립된 페이지 구성과 실제 SQLite 데이터베이스 연동을 통해 가장 뛰어난 결과물을 도출했다. 소요 비용은 Fable이 30.79달러(56분 55초), Opus가 29.82달러(59분 15초)로 비슷하게 집계된 반면, GPT 모델들은 약 3.5배 저렴한 비용 효율을 나타냈다.

사이버 보안 가드레일 완화 및 시장 경쟁 상황

  • Opus 5의 분류 모델 개입 빈도는 Fable 5 대비 약 85% 적다.
  • 소스 코드 취약점 탐지는 가능하지만 바이너리 스캐닝 및 익스플로잇 생성은 차단된다.
  • GPT 5.6의 가격 경쟁력과 Kimi K3의 오픈 모델 추격 속에 Anthropic이 지능 한계를 넓히는 구도가 형성되었다.

사이버 보안 영역에서 Opus 5는 Opus 4.8 수준의 안전장치를 유지하여 과도한 거부 반응을 줄였다. 코드 취약점 분석 등 유용한 작업은 허용하면서도 악의적인 모의 침투 및 익스플로잇 생성을 제어하는 실용적인 가드레일을 적용했다.

Community Posts

View all posts