Вышел Opus 5, и он ЛУЧШЕ, ЧЕМ FABLE?!

CChase AI
Computing/SoftwareBusiness NewsInternet Technology

Transcript

00:00:00Итак, вышел Claude Opus 5, и Anthropic утверждает, что у нас появилась модель,
00:00:04которая приближается к уровню Fable 5 за полцены. Давайте посмотрим, что они предлагают.
00:00:09Взглянем на бенчмарки, и цифры тут прямо-таки впечатляющие. Мы видим,
00:00:14что она обходит Fable 5 и камня на камне не оставляет от Opus 4.8 в ряде тестов,
00:00:20особенно в написании кода через терминал, работе с знаниями и поиске. Также она превосходит GPT 5.6
00:00:27в этих же категориях. Единственные сферы, где Opus 5 уступает Fable 5 —
00:00:33это междисциплинарные рассуждения, да и то незначительно. При использовании инструментов она даже обгоняет её, а также
00:00:39в юриспруденции и медицине. Но во всех остальных категориях она опережает их флагманскую модель. И если этим цифрам
00:00:46можно верить, это просто невероятно. Здесь указано, что на CursorBench 3.2 при максимальном усилии модель показала результат
00:00:51в пределах 0.5% от пикового показателя Fable 5, но вдвое дешевле за задачу. Безумие! И вы можете видеть это прямо
00:00:57здесь. Opus 5 выделен красным, Fable 5 — оранжевым, а внизу синим — Opus 4.8.
00:01:03Да, при максимальном усилии Fable 5 вырывается вперед, но большинство людей не работает
00:01:08на максимуме. Они используют либо высокий, либо сверхвысокий уровень. И если посмотреть на них
00:01:13в сравнении с Fable, то с Opus 5 мы получаем практически те же результаты, но опять же,
00:01:17примерно за полцены. А в некоторых других бенчмарках, вроде Artificial Analysis Coding Agent Index,
00:01:23Opus 5 прямо-таки обходит Fable 5. То же самое и в FrontierBench.
00:01:27Она буквально утирает нос Fable, оставаясь дешевле. Теперь давайте взглянем на задачи,
00:01:32связанные с работой со знаниями и решением проблем. И опять же, по-настоящему поражает не только
00:01:37вся эта динамика между Fable 5 и Opus 5, а именно скачок с Opus 4.8 до Opus 5. По всем
00:01:43показателям это просто огромный, колоссальный шаг вперед. И ладно бы это было как с Sonnet 5,
00:01:49которая работала лучше предыдущей модели, но при этом была непомерно
00:01:53дорогой — ведь Sonnet 5 почему-то оказалась самой дорогой моделью на рынке в пересчете
00:01:57на задачу. Но здесь другой случай. Opus выглядит крайне эффективным по токенам по сравнению
00:02:03с двумя другими моделями. И тот факт, что он превосходит Fable 5, просто
00:02:07не укладывается в голове. Еще одно интересное улучшение — визуальный вывод. Вот пример работы Opus 5
00:02:13с моделированием в аэродинамической трубе. А здесь она создает интерактивный 3D-артефакт
00:02:19животной клетки. Один из минусов Claude в том, что она не умеет генерировать собственные изображения. Поэтому
00:02:24то, что она стала лучше создавать 3D SVG и графику в стиле HTML — это огромный плюс.
00:02:31Еще одно важное улучшение — Anthropic заявляет, что модель намного лучше проверяет свою работу
00:02:35и тщательно вносит итерации до достижения успеха. Что это значит? Это значит, что когда мы используем Opus 5
00:02:40для долгосрочных агентских задач, которые решаются не за один шаг... Это циклы, верно? Это
00:02:45как граф-инжиниринг, о котором сейчас все говорят. Любая задача, где требуется,
00:02:49чтобы Claude сверял свою работу со сформулированной целью и повторял этот процесс снова
00:02:53и снова. Так вот, Opus 5 справляется с этим значительно лучше, чем Opus 4.8. Любопытный
00:02:58Интересный пример: Opus 5 дали чертёж детали и поручили написать код для ее воссоздания в виде
00:03:033D-модели в FreeCAD. Но у модели не было возможности непосредственно просмотреть чертеж. То есть,
00:03:09ей поставили цель, но не указали конкретный способ ее достижения. И она сама
00:03:14написала конвейер компьютерного зрения для извлечения геометрии из пикселей и воссоздала
00:03:19всю деталь целиком. Опять же, в любых долгосрочных задачах с ориентиром на конечную цель
00:03:25Opus 5 справляется намного лучше, чем 4.8. Что касается нежелательного поведения,
00:03:29она также на шаг впереди предшественников. Чем ниже столбец, тем лучше. И мы видим огромный рост ее способности
00:03:35находить уязвимости и эксплойты в исходном коде по сравнению с Opus 4.8. Еще одна отличная вещь —
00:03:40защитные механизмы. Это не история с Fable, где при упоминании кибербезопасности или биологии
00:03:45все сразу блокируется. Эти ограничения у Opus 5 куда мягче, чем у Fable 5.
00:03:50Хотя классификаторы все еще присутствуют, вероятность их ложного срабатывания на 85% ниже,
00:03:56чем у Fable. Наконец, главное — это цена. Как я уже сказал, она вдвое дешевле Fable:
00:04:01$5 за миллион входных токенов и $25 за миллион выходных. И, судя по бенчмаркам
00:04:07и графикам, эта модель весьма экономична. Так что мне очень хочется опробовать ее в деле,
00:04:12потому что если цифры правдивы, мы получили аналог Fable, который даже лучше, да еще и вдвое дешевле.

Key Takeaway

Новая модель Claude Opus 5 обходит Fable 5 по ключевым бенчмаркам написания кода и поиска, предлагая аналогичную производительность в сложных задачах за половину стоимости ($5/$25 за миллион токенов).

Highlights

  • Claude Opus 5 превосходит Fable 5 и GPT 5.6 в тестах на написание кода через терминал, работу со знаниями и поиск.

  • На бенчмарке CursorBench 3.2 модель показала результат в пределах 0.5% от пикового показателя Fable 5 при стоимости в два раза ниже.

  • Ложные срабатывания защитных классификаторов у Opus 5 происходят на 85% реже, чем у Fable 5.

  • Стоимость использования Opus 5 составляет $5 за миллион входных токенов и $25 за миллион выходных токенов.

Timeline

Сравнение производительности Opus 5 и Fable 5 в бенчмарках

  • Opus 5 опережает Fable 5 и GPT 5.6 в кодинге через терминал и поиске знаний.
  • Результаты CursorBench 3.2 отстают от максимума Fable 5 всего на 0.5%.
  • Модель демонстрирует превосходство в индексах Artificial Analysis Coding Agent и FrontierBench.

Новая модель от Anthropic демонстрирует значительный рост показателей по сравнению с Opus 4.8. Единственные области преимущественного превосходства Fable 5 — междисциплинарные рассуждения, юриспруденция и медицина. При стандартных и высоких уровнях нагрузки Opus 5 выдает аналогичную точность при двукратном снижении расходов на задачу.

Токеномика и визуальные возможности Opus 5

  • Opus 5 потребляет токены значительно эффективнее предшественников.
  • Модель генерирует интерактивные 3D SVG и HTML-графику высокой четкости.

В отличие от Sonnet 5, которая оказалась дорогой в пересчете на одну задачу, Opus 5 предлагает более высокую эффективность расхода токенов. Отсутствие встроенного генератора растровых изображений компенсируется созданием сложного визуального кода, включая моделирование аэродинамической трубы и интерактивные 3D-структуры.

Автономное решение многошаговых задач и безопасность

  • Opus 5 самостоятельнее проверяет ошибки при долгосрочных агентских циклах.
  • Способность выявлять уязвимости и эксплойты в коде существенно выросла.
  • Количество цензурных блокировок снизилось на 85% по сравнению с Fable 5.

В тестах на воссоздание деталь в FreeCAD без прямого доступа к чертежу модель самостоятельно написала конвейер компьютерного зрения для анализа пикселей и сборки 3D-модели. При работе с темами кибербезопасности Opus 5 редкие ошибочные блокировки сочетает с мягкой модерацией. Финальная цена закрепилась на уровне $5 за 1M входных и $25 за 1M выходных токенов.

Community Posts

View all posts