Transcript
00:00:00Claude Opus 5가 방금 출시되었는데, Anthropic은 이번 모델이
00:00:04절반 비용으로 Fable 5급 성능에 근접했다고 주장합니다. 어떤 모습인지 살펴보죠.
00:00:09벤치마크부터 보면, 시작부터 정말 놀라운 수치가 눈에 띕니다.
00:00:14여러 테스트에서 Fable 5를 제치고 Opus 4.8을 압도하는 모습을 보여주는데요.
00:00:20특히 에이전트 기반 터미널 코딩, 지식 작업, 에이전트 검색 분야에서 뛰어납니다. GPT 5.6 같은 모델도
00:00:27해당 영역에서 제치고 있죠. Opus 5가 Fable 5보다 뒤처지는 유일한 영역은
00:00:33다학제적 추론 부문인데, 이마저도 차이가 크지 않습니다. 도구를 사용할 땐 오히려 앞서기도 하죠. 그리고
00:00:39법률 및 보건 분야 정도입니다. 하지만 그 외 모든 영역에서는 최상위 모델을 능가하고 있습니다. 이 수치가
00:00:46사실이라면 정말 대단한 거죠. 여기 Cursor Bench 3.2 Max Effort 기준 결과를 보면,
00:00:51Fable 5의 최고 점수와 0.5% 차이밖에 나지 않으면서 작업당 비용은 절반 수준입니다. 엄청나죠. 바로
00:00:57여기서 확인하실 수 있습니다. 빨간색이 Opus 5, 주황색이 Fable 5, 그리고 아래 파란색이 Opus 4.8입니다.
00:01:03확실히 최대로 연산 노력을 들였을 때는 Fable 5가 앞서지만, 대부분의 사람들은
00:01:08최대 옵션으로 구동하지 않죠. High나 Extra High 정도로 설정해 사용합니다. 그리고 Extra High 및 High 환경을
00:01:13Fable과 비교해 보면, Opus 5로 거의 동일한 결과물을 얻으면서도
00:01:17비용은 절반 정도에 불과합니다. 또한 Artificial Analysis 코딩 에이전트 인덱스 같은 다른 벤치마크에서는
00:01:23Opus 5가 Fable 5를 완벽히 압도합니다. Frontier Bench에서도 마찬가지로
00:01:27Fable을 훨씬 앞서면서 비용까지 더 저렴합니다. 이제 지식 작업 및
00:01:32문제 해결 능력을 살펴보겠습니다. 개인적으로 정말 놀라운 점은 단순히 Fable 5와 Opus 5의
00:01:37대결 구도뿐만 아니라, Opus 4.8에서 Opus 5로 넘어오면서 이뤄낸 도약입니다. 전반적인 모든 항목에서
00:01:43엄청난 발전을 이루어냈죠. 만약 이게 Sonnet 5처럼
00:01:49이전 모델보다 성능은 좋아졌지만 가격이 지나치게 비싼 경우였다면 이야기가 달랐을 겁니다.
00:01:53Sonnet 5는 작업 단위로 분석해 보면 현존하는 모델 중 가장 비싼 축에 속하니까요.
00:01:57하지만 이번엔 그렇지 않습니다. Opus는 이 두 모델에 비해 토큰 효율성이 매우 뛰어난 것으로 보입니다.
00:02:03그리고 Fable 5를 능가한다는 사실 자체만으로도 정말 감탄스럽네요.
00:02:07또 하나 흥미로운 개선점은 시각적 출력 능력입니다. Opus 5가 시뮬레이션한
00:02:13풍동 실험 결과물이고, 이쪽은 3D 인터랙티브 동물 세포
00:02:19아티팩트를 제작한 모습입니다. Claude의 단점 중 하나가 직접 이미지를 생성하지 못한다는 것이었는데,
00:02:24이렇게 3D SVG나 HTML 그래픽 생성 능력이 향상된 점은 엄청난 발전입니다.
00:02:31또 다른 주요 개선 사항으로, Anthropic은 작업 검증 및
00:02:35성공할 때까지 신중하게 반복 개선하는 능력이 훨씬 강해졌다고 밝혔습니다. 이것이 의미하는 바는 무엇일까요?
00:02:40Opus 5를 장기적인 에이전트 작업에 투입할 때, 즉 단발성 처리가 아닌
00:02:45루프 형태의 작업에 유용하다는 뜻입니다. 요즘 사람들이 이야기하는 그래프 엔지니어링 같은 거죠.
00:02:49제시된 목표에 맞춰 Claude가 스스로의 작업을 끊임없이 점검하고
00:02:53반복 수행해야 하는 작업들 말이죠. Opus 5는 이 부분에서 Opus 4.8보다 훨씬 뛰어납니다.
00:02:58흥미로운 사례로, Opus 5에 기계 부품 도면을 주고 이를 3D FreeCAD 모델로
00:03:03재구성하는 코드를 작성하라는 지시가 내려졌습니다. 하지만 도면을 직접 볼 수 있는 수단은 제공되지 않았죠.
00:03:09목표만 주어졌을 뿐 구체적인 방법은 제시되지 않은 상황이었습니다. 그러자 모델은
00:03:14직접 컴퓨터 비전 파이프라인을 구축해 원본 픽셀에서 기하학적 구조를 추출해 낸 뒤
00:03:19기계 부품 전체를 완벽히 재구성했습니다. Clear한 목표가 주어진 장기적 과제에서
00:03:25Opus 5는 4.8보다 수행 능력이 월등히 향상되었습니다. 오작동 및 이탈 행동 측면에서도
00:03:29이전 모델들을 크게 앞섭니다. 그래프 수치가 낮을수록 좋은 수치입니다. 또한 오픈소스 코드의 취약점과
00:03:35취약점 공격 포인트를 찾아내는 능력도 Opus 4.8 대비 크게 향상되었습니다. 또 하나의 장점은 안전장치입니다.
00:03:40사이버 보안이나 생물학 관련 단어만 언급해도 거부 반응을 일으키던 Fable 같은 상황은 발생하지 않습니다.
00:03:45Opus 5는 Fable 5에 비해 이러한 가드레일 제약이 훨씬 완화되었습니다.
00:03:50여전히 분류기 시스템이 존재하긴 하지만, Fable 대비 오작동 차단율이 85% 적어졌다고 합니다.
00:03:56마지막으로 가장 중요한 건 가격입니다. 앞서 말씀드렸듯 Fable의 절반 가격입니다.
00:04:01백만 입력 토큰당 5달러, 백만 출력 토큰당 25달러 수준이죠. 차트와 벤치마크에서 확인했듯이
00:04:07토큰 효율성도 꽤 높은 모델입니다. 그래서 직접 사용해 보는 것이 정말 기대되는데요,
00:04:12이 수치들이 사실이라면 절반 가격에 Fable보다 우수한 모델을 얻은 셈이기 때문입니다.