Transcript
00:00:00Anthropic이 Claude Opus 5를 막 출시했습니다. 가격은 반값인데
00:00:04실제로 Fable보다 좋을지도 모릅니다. 정말 그렇다면 제 새로운 최애 모델이 될 테니, 한번 알아보죠.
00:00:13그들이 Opus 5를 설명하는 방식은 이렇습니다. Opus 5는 사려 깊고 주도적인 모델로,
00:00:18반값의 가격으로 Claude Fable 5의 프론티어 지능 수준에 근접합니다. 코딩 및 지식 작업
00:00:23Frontier Bench 및 GDP Val과 같은 평가에서 Opus 5는 새로운 최첨단(SOTA) 수준을 달성했지만,
00:00:28사이버 보안 작업에서는 Mythos 5 뒤에 위치합니다. Opus 5는 매일 사용하도록 설계되었으며,
00:00:33다른 모델보다 효율적으로 작동합니다. Claude Max의 새로운 기본 모델이자 Claude Pro 플랜에서 가장 강력한 모델입니다.
00:00:38이후 그들은 벤치마크를 보여주는데, Fable 5가 버티고 있음에도 불구하고
00:00:43상당수의 영역에서 승리하고 있습니다. 차이도 근소하지 않습니다. 그들에 따르면
00:00:47Frontier Bench에서 Fable 5보다 거의 10% 더 뛰어납니다. 하지만 저에게 가장 대단하게 느껴진 건
00:00:52Arc AGI 점수입니다. Opus 4.8은 여기서 1.5%를 기록했고, 이전 최고점이었던 Sol은 7.8%였는데,
00:01:00Opus 5는 30.2%를 기록했습니다. 이 벤치마크를 만든 팀은 Opus가 다른 어떤 모델에서도
00:01:06보지 못했던 새로운 능력을 보여주었다고 언급했습니다. 고차원 논리 추론을 수행하기 위해
00:01:10이 시험 문제들을 대수적 표기법으로 변환하는 능력이었죠. 이건 정말 대단한 부분입니다.
00:01:15참고로 Fable이 왜 여기에 없는지 궁금하시다면, Fable의 데이터 보존 정책 때문입니다.
00:01:19Arc AGI는 벤치마크 세부 정보가 Anthropic에 유출되는 위험을 원치 않았기 때문이죠. 하지만
00:01:24다행인 점은, Opus 5는 일반 액세스 시 데이터 보존 요구사항이 없다는 것입니다.
00:01:29이 점은 많은 사람들을 아주 기쁘게 할 겁니다. 그럼 계속해서 Artificial Analysis의
00:01:33서드파티 벤치마크를 살펴보죠. 코딩 인덱스에서는 GPT 5.6 Sol Extra High에 단 0.3점 차로 뒤처진 2위를 차지했지만,
00:01:39Fable보다는 1.5점 앞서며, Opus 4.8에 비하면 아주 훌륭한 상승 폭을 보여줍니다.
00:01:45거대 기업들 사이를 비집고 들어온 Kimi K3에게도 응원을 보냅니다. 출시되었을 때
00:01:49관련 영상을 다뤘으니, 최신 AI 및 개발자 소식을 놓치지 않으시려면
00:01:52구독해 주세요. 에이전트 인덱스를 살펴보면, Opus 5가 실제로
00:01:57선두를 차지하며 Fable 5보다 약간 앞서고 OpenAI의 Sol 모델도 제쳤습니다.
00:02:02지능 인덱스에서도 마찬가지로 Opus 5가 앞서 나가고 있죠. 성능 면에서만 보면
00:02:06Opus 5는 정말 뛰어난 모델로 보이고, 솔직히 자못 놀랐습니다.
00:02:11저는 그들이 이제 Fable에 집중하고, Opus는 일종의 새로운 Sonic 모델처럼
00:02:15될 줄 알았거든요. 하지만 가격을 고려하기 전까지는 Fable과 Opus가 거의 막상막하인 것처럼 보입니다.
00:02:19Artificial Analysis에서 작업 완료에 드는 비용을 살펴보면, Opus 5는
00:02:23실제로 Fable 5보다 72센트 저렴하며, Opus 4.8보다
00:02:28약간 비싼 수준입니다. 가성비를 고려한다면 GPT 5.6 Sol이
00:02:33Opus 5의 거의 반값이라 여전히 승자라고 할 수 있겠네요.
00:02:37초록색으로 표시된 가장 매력적인 사분면을 차트에서 보면, GPT 모델들이 거의 그 위치에 있으며,
00:02:42그 영역에 자리 잡고 있고, Anthropic 모델들은 높은 가격대 영역에
00:02:46따로 영역을 형성하고 있습니다. Cursor Bench 역시 지금까지 본 모든 벤치마크를 그대로 반영합니다.
00:02:50여기서 Opus 5 Max는 Fable 5와 거의 정확히 동일한 점수를 기록했지만, 해당 작업에 Fable은 17달러가 들었고
00:02:56Opus는 8달러가 들었습니다. 참고로 가격 자체는 Opus 4.8과 동일하여,
00:03:01입력 토큰 백만 개당 5달러, 출력 토큰 백만 개당 25달러입니다. 그러니
00:03:06Opus 4.8을 선호하신다면 이 모델을 쓰지 않을 이유가 없겠죠. 저 역시
00:03:10Fable 5 팬으로서, 구독 이용량과 크레딧 소진을 줄이기 위해 Opus 5를
00:03:14많이 사용하게 될 것 같습니다. 솔직히 Fable 대 Opus에 대한 제 최선의 추측은,
00:03:18정말 긴 호흡의 어려운 문제를 해결해야 할 때는 여전히 Fable이 최상위 모델이겠지만,
00:03:23작업의 95%는 이제 Opus 5가 그 자리를 대체할 수 있다는 것입니다. 그럼 이제 로컬 테스트를 통해
00:03:28실제로 작동하는 모습을 살펴보겠습니다. 제가 진행한 첫 번째 테스트는 모델들에게 Three.js를 사용해
00:03:32단일 HTML 파일로 완성된 F1 레이싱 게임을 만들어달라고 요청한 것이었습니다. 각 모델이 얼마나 걸렸는지,
00:03:37그리고 API 비용은 얼마나 나올지는 마지막에 말씀드리겠지만, 먼저
00:03:40결과부터 확인해 보죠. 이것이 Opus 5가 보여준 결과인데, 정말
00:03:45깊은 인상을 받았습니다. 외부 에셋 같은 건 전혀 사용하지 않았습니다. 전부
00:03:50Opus 5가 구현한 것이며, 모든 게 정말 근사해 보입니다. 트랙 레이아웃이 약간 거꾸로 되어 있긴 했지만,
00:03:55조종감은 완벽합니다. 랩 타임, 순위 측정, 순위표까지
00:03:59모두 잘 작동합니다. 잔디 아래로 운전하고 있긴 하지만 충돌 판정이 작동하는 걸 볼 수 있고,
00:04:03실제로 잔디 밑에 트랙이 깔려 있어서 프롬프트로 아주 쉽게 수정할 수 있습니다.
00:04:07또한 자갈밭(Gravel trap) 표현도 정말 잘 구현되었습니다. 솔직히 말해서 Opus 5에서 얻은
00:04:12결과물이 아주 만족스럽습니다. 제 생각에는 이 F1 차량 모델링이 전체 중에서 가장 좋아 보입니다.
00:04:16판단은 여러분께 맡기겠습니다. 이건 Fable이 보여준 결과입니다. 이 역시
00:04:20트랙 레이아웃은 참 근사하지만, 차량은 Opus 5 결과물보다 조금 더 단순합니다.
00:04:25회전할 때 카메라가 흔들리는 효과는 정말 마음에 드네요. 그리고 마찬가지로
00:04:28트랙 순위, 트랙 타임 측정 등 다른 모든 기능도 작동합니다. Fable 5 역시
00:04:33훌륭하게 해냈지만, 솔직히 저는 Opus 쪽이 더 마음에 듭니다. 다음은
00:04:37GPT 5.6 Sol에서 최대 노력(Max effort) 옵션으로 얻은 결과입니다. 모델링과
00:04:43카메라 뷰 연출은 꽤 잘해주었지만, 보시다시피 트랙이 없고 에셋 일부가
00:04:47뒤집혀 있으며, 트랙 중간쯤 가면 그래픽이 끊어집니다.
00:04:51제 기준에서는 Fable이나 Opus보다 떨어지는 수준이었습니다. 확실히 Opus가
00:04:56여기서도 우위를 점하고 있네요. 마지막으로 테스트한 모델은 Kimi K3이며, 이것이 제출받은 결과입니다.
00:05:01솔직히 오픈 웨이트 모델 치고는 대단히 놀랍습니다. 아주 잘 해냈고,
00:05:05GPT 5.6 Sol과 상당히 유사합니다. 가드레일, 트랙,
00:05:09순위 측정 등 모든 기능이 잘 동작합니다. 단 한 번의 시도로 근사한 게임을 만들어냈죠.
00:05:14해당 실행들의 비용과 소요 시간을 살펴보면, Opus 5는 F1 게임을 완성하는 데
00:05:1946분 51초가 걸렸으며, API를 사용할 경우 약 12.99달러가 들었을 겁니다.
00:05:25따라서 이번 테스트에서 Opus 5는 실제로 Fable보다 비쌌는데, 원인을 파악해 보니
00:05:30토큰을 5배나 더 사용했기 때문이었습니다. 다른 벤치마크에서는 이런 경향이 나타나지 않는 만큼 특이 케이스이길 바랍니다.
00:05:35참고로 저는 Claude 모델의 비용을 Claude Code 사용량 측정 도구로 계산하고 있으므로,
00:05:39구독형 요금제를 쓸 때는 정확한 가격이 나오지 않아서 약간의 오차가 있을 수 있습니다.
00:05:44또한 앞서 말씀드렸듯 이 모델들은 여전히 프리미엄 라인이라, GPT 5.6 같은 모델로 내려오면
00:05:49더 빠르고 저렴한 모델을 얻을 수 있지만, 제 관점에서는 결과물이 더 아쉬웠습니다.
00:05:54다른 테스트를 하나 더 해보죠. 이번에는 개인 자산 관리 대시보드를 만들어 달라고 요청했습니다.
00:05:58프론트엔드와 백엔드가 모두 포함된 풀스택 애플리케이션이 될 것이며, 추가할 수 있는 기능 몇 가지도 나열했습니다.
00:06:02이것이 Opus 5로 얻은 결과이며, 솔직히 매우 인상적이었다고 말할 수 있겠네요.
00:06:06개인적으로 아주 좋아하는 스타일의 UI입니다. 여러분도 마음에 드시는지 댓글로 알려주세요.
00:06:11모든 기능이 완벽하게 동작합니다. 작동 여부를 모두 테스트해 보았는데, 요청했던 각 기능별로
00:06:15독립된 페이지가 구성되어 있었고, 프론트엔드와 백엔드 간에
00:06:20모든 기능이 매끄럽게 잘 연결되어 동작했습니다. 채택한 UI 스타일도 참 마음에 드네요.
00:06:24전체 결과물 중 단연 최고라고 생각합니다. 코드 자체를 보면 프론트엔드에 React와 React Router를 사용했는데
00:06:28제가 아주 좋아하는 조합입니다. 백엔드에서도 실제 데이터베이스를 사용했기에 점수를 더 주고 싶습니다.
00:06:33데이터베이스로 Node SQLite를 사용했고, 서버용으로는 Express를 사용했습니다.
00:06:37이것은 Fable 5가 보여준 결과인데, 저는 Opus 5 UI가 더 마음에 들지만 이것도 나쁘지 않습니다.
00:06:42다만 이 차트들은 솔직히 말해 별로 유용해 보이지는 않네요. 아래쪽에 있는 건 제법 괜찮고,
00:06:48모든 기능이 작동하기는 합니다. 다만 Opus 5가 UI에 조금 더 신경을 썼고,
00:06:53그쪽 영역에 확실히 더 뛰어납니다. 코드 면에서는 Opus 5와 유사하게 React를 사용했지만,
00:06:57라우팅 라이브러리를 별도로 선택하지 않았다는 점이 아쉽습니다. 자체적으로 작은 라우팅 기능을 구현했더군요.
00:07:01개인적으로는 React Router 같은 검증된 표준을 사용하는 쪽을 선호합니다.
00:07:05데이터베이스의 경우 동일하게 Node SQLite를 사용하고 있었고, 이 역시 Express 기반으로
00:07:09구축되어 있어서 백엔드는 꽤 유사했습니다. 그렇지만 Opus가 프론트엔드 스택을 더 잘 선택했다고 봅니다.
00:07:13이것은 GPT 5.6 Sol이 출력해 준 결과인데, UI 디자인 면에서는 손꼽힐 정도라고 말씀드릴 수 있겠네요.
00:07:18확실히 Opus와 견줄만합니다. 스타일의 차이일 뿐이라 취향 문제에 가깝겠지만,
00:07:22저는 이 스타일도 아주 맘에 듭니다. 전체 UI를 구성하는 능력이 대단하고
00:07:26모든 기능이 다 작동합니다. 다만 개별 기능을 위한 별도의 페이지를 만들지는 않고,
00:07:31한 페이지 내에서 다른 구역으로 이동하도록 구현했더군요.
00:07:35또한 기술 스택 면에서 가장 독특한 선택을 했습니다. Next.js 기반에
00:07:38데이터베이스로 Drizzle을 조합했는데, 제가 매우 좋아하는 조합이고 이런 앱에 상당히 타당한 접근법입니다.
00:07:43하지만 실제 호스팅을 위해 Cloudflare와 Vinext를 사용했는데, 이건 다소 이상한 결정이라고 봅니다.
00:07:47아시다시피 Vinext는 극초기 단계라 아직 충분히 검증되지 않았는데,
00:07:52아마도 프롬프트 내에 Cloudflare와 Vinext를 강제로 사용하도록 만드는 지시어가 들어있었던 것 같습니다.
00:07:56Kimi K3 영상에서도 언급했듯이, 자체적으로 호스팅하는 ChatGPT 사이트들이 바로 그런 구조로 작동하기 때문일 것입니다.
00:08:00마지막으로 테스트한 모델은 Kimi K3이며, 이것이 도출된 결과입니다.
00:08:04매우 훌륭하게 수행했다고 말할 수 있겠네요. 이 UI는 GPT 5.4나 5.5에서 볼 법한
00:08:09느낌이라 UI 디자인 측면에서는 약간 뒤처져 있다고 생각하지만,
00:08:14마찬가지로 모든 기능이 작동하고 있어서 UI에 대해 그다지 불만을 가질 수는 없을 것 같습니다. 요청한 대로 정확히 해냈으니까요.
00:08:19하지만 코드 측면에서는 감점 요소가 있었습니다. 프론트엔드로 React를 선택했고,
00:08:24Fable처럼 라우팅 라이브러리를 직접 구현했더군요. 그런데 서버 쪽을 보면
00:08:28단순 Express 서버만 존재할 뿐, Node SQLite 등을 활용한
00:08:32데이터베이스 구축을 전혀 하지 않았습니다. 순수 JavaScript로 자체 데이터베이스 구조를 만들어
00:08:36모든 데이터를 JSON 파일에 저장하도록 했죠. 이건 절대 권장하고 싶지 않은 방식입니다.
00:08:40자산 관리 테스트 시 모델들의 소요 시간과 가격을 보면, Fable이 가장 비쌌습니다.
00:08:4430.79달러가 들었고 소요 시간도 56분 55초였죠. 하지만 Opus의 경우에도
00:08:4829.82달러가 발생하여 Fable과 거의 차이가 없었으며, 소요 시간은 59분 15초로
00:08:55오히려 더 걸렸습니다. 이에 비해 GPT 모델들은 가성비가 훌륭하여 약 3.5배 정도
00:09:02더 저렴합니다. 이러한 경쟁을 통해 Anthropic의 가격이 인하되길 진심으로 바랍니다.
00:09:07따라서 개인적으로는 평가가 다소 엇갈립니다. 물론 각 테스트를 한 번씩만 수행했고 두 가지 테스트만 진행했기에,
00:09:11Opus가 Fable 가격의 3분의 1 수준이라고 하는 Artificial Analysis의 벤치마크가
00:09:16더 정확하기를 바랄 뿐입니다. 하지만 정확한 판단을 위해서는 좀 더 써봐야 할 것 같습니다.
00:09:20어쩌면 제가 비용 측정에 사용하는 도구상의 문제일 수도 있겠네요. Opus의 또 다른 장점은
00:09:24사이버 보안 작업에서 Fable 5보다 제한이 약간 덜하다는 점입니다. 안전장치는
00:09:28좁은 범위의 사이버 작업에 강화된 가드레일이 적용된 점을 제외하면 Opus 4.8과 거의 유사합니다.
00:09:33알려진 바에 따르면 이 안전장치를 통해 Opus 5는 소스 코드의 취약점을 찾아낼 수는 있지만,
00:09:37바이너리 기반 취약점 스캐닝, 모의 침투 테스트 및 익스플로잇 생성은 차단됩니다.
00:09:42테스트 결과에 따르면 이들의 분류 모델(Classifier)은 Fable 5에 비해
00:09:46개입 빈도가 약 85% 적은 것으로 나타났습니다. 그렇습니다. 현재 모델 간의 경쟁은 실로 대단합니다.
00:09:51가격 인하가 가능하다는 것을 보여주는 GPT 5.6이 있고, 지능 면에서
00:09:55거대 기업과 맞먹는 Kimi 같은 오픈 모델이 있으며, 지능의 한계를
00:10:00지속적으로 확장해 나가는 Anthropic이 있습니다. 여러분이 가장 좋아하는 모델은 무엇이며, Opus의 소식이 마음에 드시나요?
00:10:04아래 댓글로 공유해 주시고, 구독도 잊지 마세요. 그럼 언제나 그렇듯 다음 영상에서 뵙겠습니다.
00:10:09시청해 주셔서 감사합니다.