Fable 5.1은 역대 최고의 모델입니다 (심지어 Fable 5보다 더 저렴함)

CChase AI
Computing/Software

Transcript

00:00:00자, Fable 5.1이 드디어 나왔습니다. 더 좋아지고 저렴해졌는데요,
00:00:02오늘 그에 대해 알아야 할
00:00:04모든 것을 소개해 드리겠습니다.
00:00:05먼저 가장 중요한 가격부터 보죠.
00:00:07Fable 5.1은 Fable 5보다 대략 25% 저렴해질 예정인데요,
00:00:11이는 캐시 읽기 비용을
00:00:13인하했기 때문입니다.
00:00:14장시간 실행되는 에이전트 작업을 많이 하시는 분들께는 엄청난 소식이죠.
00:00:19특히 이 점을 강조하고 있는데,
00:00:21비용 절감 효과가 최대 45%까지
00:00:23나타날 수 있는 경우도 있습니다.
00:00:24수많은 토큰을 다루는 작업을 수행하면서
00:00:27컨텍스트 윈도우 길이를
00:00:2850, 60, 70%씩 채울 때 말이죠.
00:00:30데이터 보관 정책도 업데이트하고 있으며,
00:00:32기업 고객들을 대상으로 이를 단계적으로 도입 중입니다.
00:00:34안전 장치와 관련해서는
00:00:35오탐(false positive)을 줄였는데요,
00:00:37이게 기존 Fable 5에서는
00:00:38꽤나 골칫거리였습니다.
00:00:40사이버 보안 같은 분야와
00:00:41관련된 질문을 던지면
00:00:43끊임없이 차단당했으니까요.
00:00:44이번에는 오탐 발생 확률이 무려 60%나 줄어들었습니다.
00:00:47이제 벤치마크를 한번 살펴보죠.
00:00:49이제 벤치마크를 한번 살펴보죠.
00:00:50모든 부문에서 Fable 5, Opus 5,
00:00:53그리고 GPT 5.6을 말 그대로 압도하고 있습니다.
00:00:56어떤 부분은 도약 폭이 꽤 큽니다.
00:00:58에이전트 기반 과학 연구를 살펴보면,
00:01:00Fable 5의 두 배에 달합니다.
00:01:03에이전트 코딩 능력도 엄청난 도약을 이뤄냈습니다.
00:01:05Fable 5의 42%에서 Fable 5.1의 55.8%로 올랐습니다.
00:01:09Opus 5의 벤치마크를 처음 접했을 때가 기억나네요.
00:01:11Opus 5가 순수 수치 측면에서 보여준 결과물에
00:01:14다들 꽤 놀랐었죠.
00:01:16실제로 대다수의 사람들은 여전히 Opus 5보다 Fable 5를 선호하지만,
00:01:19Fable 5와 5.1의 비교는 실제로 사용할 때의
00:01:23체감 성능을 파악하는 데
00:01:24훨씬 더 정확한 기준이
00:01:26되어줄 것 같습니다.
00:01:28그 외의 벤치마크 상승 폭은
00:01:29대체로 점진적입니다.
00:01:31여기저기서 몇 퍼센트 포인트 정도 오르는 수준인데,
00:01:32자동화 벤치마크를 활용한 비즈니스
00:01:34워크플로가 그 예외라고 할 수 있죠.
00:01:37자, 중요한 건 벤치마크 점수 그 자체뿐만이 아니라
00:01:39이러한 점수를 얻기 위해 우리가 비용을 얼마나 지불하느냐,
00:01:41그리고 추론 노력(effort) 수준을 조절했을 때
00:01:43어떤 변화가 나타나느냐입니다.
00:01:44이동을 살펴보는 건 언제나 정말 흥미롭거든요.
00:01:46보통 아주 높음(extra high)이나
00:01:48최대(max) 노력 수준을 볼 때,
00:01:49높음이나 심지어 보통 수준과 비교했을 때
00:01:51투자 대비 효용이 그렇게 크지 않으니까요.
00:01:53그래서 여기 준비된 것이 Terminal Bench 4.0입니다.
00:01:56맨 위에는 Mythos 5.1이 있고,
00:01:59가운데에 Fable 5.1이 있으며,
00:02:00아래쪽에 Mythos 5가 있습니다.
00:02:02Fable 5는 대략 Mythos 바로 아래에 위치한다고 보시면 됩니다.
00:02:05따라서 Fable 5.1과 Mythos 5.1은
00:02:07Mythos 5에 비해 확실히 엄청난 도약을 이뤘고,
00:02:10가격도 더 저렴합니다.
00:02:12정말 멋진 점은 예를 들어 대부분의 사람들이
00:02:13주로 사용하는 '높음' 같은 설정을 볼 때입니다.
00:02:15주로 사용하는 '높음' 같은 설정을 볼 때입니다.
00:02:16저 같은 경우 Fable을 쓸 때
00:02:17종종 '보통' 수준을 사용하곤 하는데요,
00:02:20기본적으로,
00:02:20'보통' 수준을 보면
00:02:21Mythos 5의 최대 출력 성능과 맞먹으면서도,
00:02:25비용이 26달러인 대신에
00:02:277달러 80센트밖에 안 하게 됩니다.
00:02:30그리고 '높음' 단계로 넘어가서,
00:02:32높음과 최대 설정을 비교해 보면
00:02:34성능 차이는 고작
00:02:356% 정도밖에 나지 않는데도
00:02:38비용은 19달러 50센트 대 10달러 50센트가 됩니다.
00:02:42이 새로운 모델들의 정말 멋진 점은
00:02:43중간 정도의 노력 수준만 설정해도
00:02:45극도로 높은 성능을 이끌어내면서도
00:02:47비용을 확실히 절감할 수 있다는 것입니다.
00:02:50다른 벤치마크에서도 똑같은 양상이 나타나죠?
00:02:52이건 Humanity's last exam입니다.
00:02:53이건 Humanity's last exam입니다.
00:02:55여기서도 높음에서 최대 수준으로 뛰어넘을 때
00:02:57어마어마한 성능 향상이 일어나지는 않지만,
00:02:59중간 수준의 설정만으로도
00:03:00합리적인 비용으로
00:03:02정말 뛰어난 성능을 낼 수 있습니다.
00:03:04한 가지 예외가 있다면
00:03:05Cursor 벤치마크의 에이전틱 코딩인데,
00:03:07Fable 5.1의 경우
00:03:08high에서 extra high로 갈 때 성능이 상당히 뜁니다.
00:03:11하지만 이 역시 extra high와 max 사이에서는
00:03:13큰 차이가 없습니다.
00:03:14하지만 Fable 5.1에서
00:03:15high 설정으로 사용하는 것은
00:03:17Fable 5의 extra high와
00:03:18동일한 수준이면서도
00:03:20비용은 절반도 안 됩니다.
00:03:22따라서 엄청난 비용 절감이 가능한데,
00:03:24꼭 엄청나게 복잡한
00:03:25작업을 하는 사람이 아니더라도 마찬가지입니다.
00:03:27소위 말하는 평균적인
00:03:291인 개발자라 할지라도
00:03:30해결하는 문제가 그렇게 복잡하지 않으면서도
00:03:32최첨단 모델을 선호한다면
00:03:33이제 추론 수준을 낮추어
00:03:34기존과 거의 동일한 작업을
00:03:36수행할 수 있게 되며,
00:03:37앞서 말씀드렸듯
00:03:38비용은 절반으로 줄어듭니다.
00:03:40이는 아무리 강조해도 지나치지 않습니다.
00:03:41과학 연구 분야는
00:03:42항상 Fable과 Mythos 모델의
00:03:44주요 셀링 포인트 중 하나였습니다.
00:03:46이번 5.1 버전에서도 마찬가지입니다.
00:03:48분자 설계에 대해 많이 다루고 있으며,
00:03:49분자 설계에 대해 많이 다루고 있으며,
00:03:51컴퓨터 기반 분석 및 모델링,
00:03:53그리고 전산 생물학을 언급합니다.
00:03:55물론 이것들은 일부 전문가들이 해결하는
00:03:57조금 더 틈새 시장의 문제들이지만,
00:03:58표준적인 에이전틱 코딩 벤치마크에서의
00:04:00성능과 비교하여 이러한 영역에서
00:04:01어떤 결과가 나오는지 보는 것은
00:04:03언제나 흥미롭습니다.
00:04:03에이전틱 코딩 벤치마크에서의 성능과 비교해서요.
00:04:05서두에서 언급했듯이
00:04:07안전성, 보안 및
00:04:08정렬 측면에서도
00:04:09몇 가지
00:04:09변화가 있었습니다.
00:04:11큰 틀에서 보면,
00:04:12오탐이 줄어들었습니다.
00:04:13사이버 보안과 같은 주제에 대해
00:04:14더 많은 질문을 던져도
00:04:15모델이 충분히 똑똑해져서
00:04:16무조건 겁을 먹고
00:04:18Opus로 전환해 버리는 일은
00:04:19없어졌습니다.
00:04:20이에 대해 아주 깊이 있게
00:04:21알고 싶다면,
00:04:21언제든 시스템 카드를
00:04:23참고해 보시면 됩니다.
00:04:24분량이 꽤 돼서,
00:04:25수백 페이지에 달하며
00:04:27정확히는 212페이지이지만,
00:04:28여기서 좋은 요약을 제공합니다.
00:04:30하지만 여러분이 주목해야 할 점은
00:04:31이 안전 장치들이
00:04:32더 정교해져서
00:04:33무해한 콘텐츠를
00:04:34잘못 감지하여
00:04:35다른 하위 모델로
00:04:36보내는 일이 줄어든다는 점입니다.
00:04:37특히 사이버 보안 관련 질문과 관련하여,
00:04:40Cloud Code 사용자들은
00:04:40이러한 안전 장치로 인해
00:04:41세션당 평균 60% 적은
00:04:43개입을
00:04:44경험하게 될 것입니다.
00:04:46이는 특정 사용 사례에 맞는
00:04:46최고의 사이버 보안 관행에 대해
00:04:47질문을 해야 하는
00:04:48어떤 종류의 애플리케이션에서든
00:04:49작업을 진행할 때
00:04:51매우 유용한 부분입니다.
00:04:53또한 여기에는
00:04:53증류 방지 메커니즘에 관한
00:04:54흥미로운
00:04:55단락이 하나 있습니다.
00:04:57이는 본질적으로
00:04:58본질적으로 추출하는
00:04:59방식에 대한 내용입니다
00:05:01Fable 5와
00:05:02Fable 5.1에서 말이죠.
00:05:03이것은 오픈소스
00:05:04모델과 관련해서
00:05:05정말 큰 이야기
00:05:06주제 중 하나입니다.
00:05:07요즘 정말 훌륭한
00:05:08오픈소스 모델들이
00:05:08많이 나오고 있다는 이야기를
00:05:09들으셨을 겁니다.
00:05:10그리고 앞으로도 의심할 여지 없이
00:05:11계속해서 출시될 것입니다.
00:05:13최첨단 모델로부터
00:05:14지식을 증류해 내면서 말이죠.
00:05:15따라서 이런 논의들은
00:05:17어느 정도
00:05:17계속 주시하고
00:05:18싶은 주제입니다.
00:05:18최종 사용자이신 여러분께
00:05:20직접적인 영향은 없지만,
00:05:21뭐랄까요,
00:05:22일종의 메타적인 현상입니다.
00:05:23중국에서 수많은
00:05:24오픈소스 모델들이 나오고
00:05:25있는 상황에서,
00:05:26대부분의 최첨단
00:05:26기업들은 미국에 있으니까요.
00:05:27그래서 항상
00:05:28이런 얘기가 나오죠.
00:05:29저기,
00:05:31이 모든 오픈소스 모델들이
00:05:32결국에는
00:05:32Opus나 Fable 같은
00:05:33모델들의 데이터를 가져다가
00:05:35쓰고 있다는 식의 말 말입니다.
00:05:36이들이 그 작동
00:05:37방식의 예시를 하나 듭니다.
00:05:38새로운 API 계정으로는
00:05:39Claude의 이전
00:05:40컨텍스트를 편집할 수 없도록 해서
00:05:42본질적으로 Claude가
00:05:43어떻게 생각하고
00:05:44답변을 도출해
00:05:44내는지를
00:05:45추출하지 못하게 막는 식이죠.
00:05:46다시 말씀드리지만,
00:05:46이것은 신규
00:05:47계정에만 해당되는 내용이라서요.
00:05:48이미 계정이 있으신 분들이라면
00:05:48역시 마찬가지로
00:05:49큰 영향은 없을 것입니다.
00:05:50자, 다음으로 비용과
00:05:51가용성에 대해 알아보죠.
00:05:52가용성은
00:05:52이용 가능성은
00:05:53현재 어디서나 가능합니다.
00:05:54비용.
00:05:55토큰당 가격을
00:05:56살펴보면,
00:05:56Fable 5와
00:05:58완전히 동일합니다.
00:05:58입력 토큰 100만 개당
00:05:5910달러이고
00:06:00출력 토큰 100만 개당
00:06:0250달러입니다.
00:06:03하지만 실제 사용 환경에서
00:06:04어떤 작업을 수행하도록
00:06:05맡겨보면,
00:06:06비용은 더
00:06:07적게 들게 됩니다.
00:06:08그 이유는 바로
00:06:09캐시 읽기 기능 덕분에
00:06:10비용이 절감되기 때문입니다.
00:06:12프롬프트 캐싱이
00:06:12무엇인지 잘 모르신다면,
00:06:14제가 지난주에
00:06:14올린 관련 영상을
00:06:16참고해 보시기 바랍니다.
00:06:18간단히 말해,
00:06:18이 기능은 장기
00:06:19에이전트 작업을
00:06:20주로 수행하는
00:06:20분들에게는 엄청난 장점입니다.
00:06:23아주 방대한
00:06:23세션과 대량의
00:06:25컨텍스트를 가지고
00:06:26지속적으로 사용하는
00:06:27경우 말이죠.
00:06:28작업을 시켜놓고
00:06:29다음 날에 돌아오는
00:06:29방식이 아니라요.
00:06:30그냥 AI와 계속해서
00:06:31실시간으로 대화를
00:06:32주고받는 거죠.
00:06:32이러한 캐시 읽기는
00:06:33비용이 75%나 더 저렴합니다.
00:06:35정말 어마어마한 변화이며,
00:06:37이로 인해 전체적인 비용이
00:06:39낮아지게 되는 것입니다.
00:06:40이 그래프가 바로
00:06:41그 점을 보여줍니다.
00:06:42일반적인 작업의
00:06:42경우 비용이 대략
00:06:4425% 정도 줄어들 수 있고,
00:06:45다시 말씀드리지만,
00:06:46에이전트 중심의 고부하
00:06:47작업에서는 최대 45%까지 절감됩니다.
00:06:49따라서 Fable 모델이
00:06:49이렇게 업그레이드된 것은
00:06:50정말 흥미로운 소식입니다.
00:06:51저는 Fable 5를 정말 좋아했지만,
00:06:53Opus 5가
00:06:53나왔을 때는 좀 애매했었죠.
00:06:54하지만 Fable을
00:06:55직접 써보신 분들이라면
00:06:56공감하시겠지만,
00:06:57Anthropic이 제공해 온
00:06:58기존 모델들과 비교해
00:06:59이번 모델이 가져다주는 변화가
00:07:01상당하다는 점에 분명
00:07:02동의하실 거라고
00:07:03생각합니다.
00:07:03따라서 성능은 더 뛰어나고
00:07:04비용은 더 저렴하며,
00:07:05안전장치에 대한
00:07:06부담도 덜 수 있는
00:07:07이러한 모델이 나왔다는 것은
00:07:09정말 멋진 일이라고
00:07:10생각합니다.
00:07:11그러니 꼭 한번 확인해 보세요.
00:07:12여러분의 생각도
00:07:13댓글로 남겨주세요.

Key Takeaway

Fable 5.1은 Fable 5보다 25% 저렴해진 가격과 최대 60% 줄어든 오탐률을 바탕으로 향상된 에이전트 및 코딩 성능을 제공한다.

Highlights

  • Fable 5.1은 Fable 5 대비 캐시 읽기 비용 인하로 전체 비용이 약 25%에서 최대 45%까지 절감된다.

  • 사이버 보안 분야 등의 오탐 발생 확률이 기존 모델 대비 60% 감소했다.

  • 에이전트 기반 과학 연구 성능이 Fable 5의 두 배에 달하며, 에이전트 코딩 능력은 42%에서 55.8%로 향상됐다.

  • 중간 정도의 추론 노력(effort) 수준을 설정해도 최상위 수준의 성능을 내면서 비용을 크게 낮출 수 있다.

  • 입력 토큰 100만 개당 10달러, 출력 토큰 100만 개당 50달러의 기본 토큰 가격이 적용된다.

Timeline

가격 인하 및 안전 장치 개선

  • Fable 5.1은 캐시 읽기 비용 인하로 Fable 5보다 대략 25% 저렴하다.
  • 장시간 실행되는 에이전트 작업에서는 비용 절감 효과가 최대 45%에 달한다.
  • 사이버 보안 분야에서 기존의 골칫거리였던 오탐 발생 확률이 60% 줄어들었다.

캐시 읽기 비용이 낮아지면서 대규모 토큰을 다루는 작업에서 비용 부담이 크게 줄어든다. 특히 사이버 보안 질문에서 무조건 차단당하던 오탐 현상이 줄어들면서 작업 효율성이 높아졌다.

벤치마크 및 추론 노력 수준별 성능

  • 에이전트 기반 과학 연구 성능은 Fable 5의 두 배를 기록했다.
  • 에이전트 코딩 능력은 Fable 5의 42%에서 55.8%로 상승했다.
  • 중간 정도의 추론 노력 수준만 설정해도 높은 성능을 유지하면서 비용을 대폭 아낄 수 있다.

대다수의 벤치마크에서 기존 모델들을 압도하는 성능을 보여준다. 최대(max) 수준과 높음(high) 수준 간의 성능 차이가 크지 않기 때문에, 중간 설정을 활용하는 것이 비용 대비 효용 측면에서 유리하다.

전문 분야 활용과 가용성 및 비용 구조

  • 분자 설계, 컴퓨터 기반 분석, 전산 생물학 등 과학 연구 분야에서 주요하게 활용된다.
  • 신규 API 계정에서는 이전 컨텍스트 편집을 제한하는 증류 방지 메커니즘이 도입됐다.
  • 기본 토큰 가격은 입력 100만 개당 10달러, 출력 100만 개당 50달러로 Fable 5와 동일하다.

전문적인 과학 연구 및 전산 생물학 영역에서 강력한 성능을 발휘한다. 캐시 읽기 기능이 75% 더 저렴하게 제공되므로 실제 사용 환경에서의 총비용은 기본 가격보다 훨씬 낮아진다.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video