오퍼스 5 출시, 페이블보다 낫다고?!

CChase AI
컴퓨터/소프트웨어경제 뉴스AI/미래기술

Transcript

00:00:00Claude Opus 5가 방금 출시되었는데, Anthropic은 이번 모델이
00:00:04절반 비용으로 Fable 5급 성능에 근접했다고 주장합니다. 어떤 모습인지 살펴보죠.
00:00:09벤치마크부터 보면, 시작부터 정말 놀라운 수치가 눈에 띕니다.
00:00:14여러 테스트에서 Fable 5를 제치고 Opus 4.8을 압도하는 모습을 보여주는데요.
00:00:20특히 에이전트 기반 터미널 코딩, 지식 작업, 에이전트 검색 분야에서 뛰어납니다. GPT 5.6 같은 모델도
00:00:27해당 영역에서 제치고 있죠. Opus 5가 Fable 5보다 뒤처지는 유일한 영역은
00:00:33다학제적 추론 부문인데, 이마저도 차이가 크지 않습니다. 도구를 사용할 땐 오히려 앞서기도 하죠. 그리고
00:00:39법률 및 보건 분야 정도입니다. 하지만 그 외 모든 영역에서는 최상위 모델을 능가하고 있습니다. 이 수치가
00:00:46사실이라면 정말 대단한 거죠. 여기 Cursor Bench 3.2 Max Effort 기준 결과를 보면,
00:00:51Fable 5의 최고 점수와 0.5% 차이밖에 나지 않으면서 작업당 비용은 절반 수준입니다. 엄청나죠. 바로
00:00:57여기서 확인하실 수 있습니다. 빨간색이 Opus 5, 주황색이 Fable 5, 그리고 아래 파란색이 Opus 4.8입니다.
00:01:03확실히 최대로 연산 노력을 들였을 때는 Fable 5가 앞서지만, 대부분의 사람들은
00:01:08최대 옵션으로 구동하지 않죠. High나 Extra High 정도로 설정해 사용합니다. 그리고 Extra High 및 High 환경을
00:01:13Fable과 비교해 보면, Opus 5로 거의 동일한 결과물을 얻으면서도
00:01:17비용은 절반 정도에 불과합니다. 또한 Artificial Analysis 코딩 에이전트 인덱스 같은 다른 벤치마크에서는
00:01:23Opus 5가 Fable 5를 완벽히 압도합니다. Frontier Bench에서도 마찬가지로
00:01:27Fable을 훨씬 앞서면서 비용까지 더 저렴합니다. 이제 지식 작업 및
00:01:32문제 해결 능력을 살펴보겠습니다. 개인적으로 정말 놀라운 점은 단순히 Fable 5와 Opus 5의
00:01:37대결 구도뿐만 아니라, Opus 4.8에서 Opus 5로 넘어오면서 이뤄낸 도약입니다. 전반적인 모든 항목에서
00:01:43엄청난 발전을 이루어냈죠. 만약 이게 Sonnet 5처럼
00:01:49이전 모델보다 성능은 좋아졌지만 가격이 지나치게 비싼 경우였다면 이야기가 달랐을 겁니다.
00:01:53Sonnet 5는 작업 단위로 분석해 보면 현존하는 모델 중 가장 비싼 축에 속하니까요.
00:01:57하지만 이번엔 그렇지 않습니다. Opus는 이 두 모델에 비해 토큰 효율성이 매우 뛰어난 것으로 보입니다.
00:02:03그리고 Fable 5를 능가한다는 사실 자체만으로도 정말 감탄스럽네요.
00:02:07또 하나 흥미로운 개선점은 시각적 출력 능력입니다. Opus 5가 시뮬레이션한
00:02:13풍동 실험 결과물이고, 이쪽은 3D 인터랙티브 동물 세포
00:02:19아티팩트를 제작한 모습입니다. Claude의 단점 중 하나가 직접 이미지를 생성하지 못한다는 것이었는데,
00:02:24이렇게 3D SVG나 HTML 그래픽 생성 능력이 향상된 점은 엄청난 발전입니다.
00:02:31또 다른 주요 개선 사항으로, Anthropic은 작업 검증 및
00:02:35성공할 때까지 신중하게 반복 개선하는 능력이 훨씬 강해졌다고 밝혔습니다. 이것이 의미하는 바는 무엇일까요?
00:02:40Opus 5를 장기적인 에이전트 작업에 투입할 때, 즉 단발성 처리가 아닌
00:02:45루프 형태의 작업에 유용하다는 뜻입니다. 요즘 사람들이 이야기하는 그래프 엔지니어링 같은 거죠.
00:02:49제시된 목표에 맞춰 Claude가 스스로의 작업을 끊임없이 점검하고
00:02:53반복 수행해야 하는 작업들 말이죠. Opus 5는 이 부분에서 Opus 4.8보다 훨씬 뛰어납니다.
00:02:58흥미로운 사례로, Opus 5에 기계 부품 도면을 주고 이를 3D FreeCAD 모델로
00:03:03재구성하는 코드를 작성하라는 지시가 내려졌습니다. 하지만 도면을 직접 볼 수 있는 수단은 제공되지 않았죠.
00:03:09목표만 주어졌을 뿐 구체적인 방법은 제시되지 않은 상황이었습니다. 그러자 모델은
00:03:14직접 컴퓨터 비전 파이프라인을 구축해 원본 픽셀에서 기하학적 구조를 추출해 낸 뒤
00:03:19기계 부품 전체를 완벽히 재구성했습니다. Clear한 목표가 주어진 장기적 과제에서
00:03:25Opus 5는 4.8보다 수행 능력이 월등히 향상되었습니다. 오작동 및 이탈 행동 측면에서도
00:03:29이전 모델들을 크게 앞섭니다. 그래프 수치가 낮을수록 좋은 수치입니다. 또한 오픈소스 코드의 취약점과
00:03:35취약점 공격 포인트를 찾아내는 능력도 Opus 4.8 대비 크게 향상되었습니다. 또 하나의 장점은 안전장치입니다.
00:03:40사이버 보안이나 생물학 관련 단어만 언급해도 거부 반응을 일으키던 Fable 같은 상황은 발생하지 않습니다.
00:03:45Opus 5는 Fable 5에 비해 이러한 가드레일 제약이 훨씬 완화되었습니다.
00:03:50여전히 분류기 시스템이 존재하긴 하지만, Fable 대비 오작동 차단율이 85% 적어졌다고 합니다.
00:03:56마지막으로 가장 중요한 건 가격입니다. 앞서 말씀드렸듯 Fable의 절반 가격입니다.
00:04:01백만 입력 토큰당 5달러, 백만 출력 토큰당 25달러 수준이죠. 차트와 벤치마크에서 확인했듯이
00:04:07토큰 효율성도 꽤 높은 모델입니다. 그래서 직접 사용해 보는 것이 정말 기대되는데요,
00:04:12이 수치들이 사실이라면 절반 가격에 Fable보다 우수한 모델을 얻은 셈이기 때문입니다.

Key Takeaway

Claude Opus 5는 백만 입력 토큰당 5달러, 출력 토큰당 25달러라는 Fable 5의 절반 가격으로 코딩 에이전트 및 장기 반복 과제에서 동등하거나 뛰어난 성능을 제공한다.

Highlights

  • Claude Opus 5는 백만 입력 토큰당 5달러, 백만 출력 토큰당 25달러로 Fable 5 대비 절반 가격에 제공된다.

  • Cursor Bench 3.2 Max Effort 기준 Opus 5는 Fable 5의 최고 점수와 0.5% 차이에 불과하며 Extra High 및 High 환경에서는 절반 비용으로 동일한 성과를 낸다.

  • Anthropic 분류기 시스템의 오작동 차단율이 Fable 대비 85% 감소하여 사이버 보안 및 생물학 관련 질의 거부 현상이 줄었다.

  • Opus 5는 직접적인 이미지 파일 생성 대신 3D SVG와 HTML 그래픽 출력 능력을 활용해 풍동 실험 시뮬레이션 및 3D 세포 구조를 구현한다.

  • 시각적 정보 없이 명시적 지시만 전달받은 상태에서 스스로 컴퓨터 비전 파이프라인을 구축해 기계 부품의 3D FreeCAD 모델을 재구성했다.

Timeline

Opus 5의 주요 벤치마크 결과 및 비용 효율성

  • Opus 5는 에이전트 기반 터미널 코딩, 지식 작업, 에이전트 검색 분야에서 Fable 5와 GPT 5.6을 제쳤다.
  • Cursor Bench 3.2 Max Effort에서 Fable 5 최고 점수와 0.5% 차이를 기록하며 작업당 비용은 절반을 유지한다.
  • Artificial Analysis 코딩 에이전트 인덱스와 Frontier Bench에서 Fable 5보다 높은 점수와 저렴한 단가를 기록했다.

Opus 5는 다학제적 추론과 법률, 보건 일부 영역을 제외한 대부분의 성능 지표에서 최상위 모델을 앞선다. 연산 노력을 최대로 설정했을 때는 Fable 5가 미세하게 우위를 점하지만, 일반적인 High나 Extra High 설정에서는 Opus 5가 절반의 비용으로 동일한 결과물을 출력한다. 이전 모델인 Opus 4.8과 비교해도 전반적인 성능 도약이 뚜렷하다.

시각적 출력 능력 및 에이전트 작업 수행 방식의 변화

  • Opus 5는 3D SVG 및 HTML 그래픽 생성을 통해 시뮬레이션과 3D 인터랙티브 아티팩트를 출력한다.
  • 목표 달성 시까지 결과물을 점검하고 수정하는 루프 형태의 장기 과제 수행 능력이 향상되었다.
  • 기계 부품 도면 데이터로 컴퓨터 비전 파이프라인을 직접 구축해 3D FreeCAD 모델을 재구성하는 성능을 보였다.

Sonnet 5가 높은 성능 대비 비싼 토큰 단가를 형성했던 것과 달리 Opus 5는 토큰 효율성을 유지한다. 이미지 직접 생성 기능의 부재를 3D SVG나 HTML 코드로 대체하여 풍동 실험 및 세포 구조 같은 정교한 그래픽을 표현한다. 또한 구체적인 실행 방법이 주어지지 않은 목표 중심 과제에서 원본 픽셀의 기하학적 구조를 추출하는 등 에이전트 오작동과 이탈 행동이 줄어들었다.

안전장치 가드레일 완화 및 최종 가격 정책

  • 사이버 보안 및 생물학 전문 용어 입력 시 발생하는 과도한 거부 반응이 감소했다.
  • Fable 대비 오작동 차단율이 85% 감소하여 가드레일 제약이 완화되었다.
  • 가격은 백만 입력 토큰당 5달러, 백만 출력 토큰당 25달러로 책정되었다.

기존 Fable 모델에서 자주 나타나던 완고한 안전 제약이 완화되었다. 분류기 시스템은 여전히 가동되지만 정상적인 사이버 보안이나 생물학 관련 작업 도중 명령을 거부하는 비율이 85% 줄어들었다. 가격은 Fable 5 대비 50% 수준이며 뛰어난 토큰 효율성을 바탕으로 실제 작업 비용을 절감한다.

Community Posts

View all posts