Transcript
00:00:00Итак, вышел Claude Opus 5, и Anthropic утверждает, что у нас появилась модель,
00:00:04которая приближается к уровню Fable 5 за полцены. Давайте посмотрим, что они предлагают.
00:00:09Взглянем на бенчмарки, и цифры тут прямо-таки впечатляющие. Мы видим,
00:00:14что она обходит Fable 5 и камня на камне не оставляет от Opus 4.8 в ряде тестов,
00:00:20особенно в написании кода через терминал, работе с знаниями и поиске. Также она превосходит GPT 5.6
00:00:27в этих же категориях. Единственные сферы, где Opus 5 уступает Fable 5 —
00:00:33это междисциплинарные рассуждения, да и то незначительно. При использовании инструментов она даже обгоняет её, а также
00:00:39в юриспруденции и медицине. Но во всех остальных категориях она опережает их флагманскую модель. И если этим цифрам
00:00:46можно верить, это просто невероятно. Здесь указано, что на CursorBench 3.2 при максимальном усилии модель показала результат
00:00:51в пределах 0.5% от пикового показателя Fable 5, но вдвое дешевле за задачу. Безумие! И вы можете видеть это прямо
00:00:57здесь. Opus 5 выделен красным, Fable 5 — оранжевым, а внизу синим — Opus 4.8.
00:01:03Да, при максимальном усилии Fable 5 вырывается вперед, но большинство людей не работает
00:01:08на максимуме. Они используют либо высокий, либо сверхвысокий уровень. И если посмотреть на них
00:01:13в сравнении с Fable, то с Opus 5 мы получаем практически те же результаты, но опять же,
00:01:17примерно за полцены. А в некоторых других бенчмарках, вроде Artificial Analysis Coding Agent Index,
00:01:23Opus 5 прямо-таки обходит Fable 5. То же самое и в FrontierBench.
00:01:27Она буквально утирает нос Fable, оставаясь дешевле. Теперь давайте взглянем на задачи,
00:01:32связанные с работой со знаниями и решением проблем. И опять же, по-настоящему поражает не только
00:01:37вся эта динамика между Fable 5 и Opus 5, а именно скачок с Opus 4.8 до Opus 5. По всем
00:01:43показателям это просто огромный, колоссальный шаг вперед. И ладно бы это было как с Sonnet 5,
00:01:49которая работала лучше предыдущей модели, но при этом была непомерно
00:01:53дорогой — ведь Sonnet 5 почему-то оказалась самой дорогой моделью на рынке в пересчете
00:01:57на задачу. Но здесь другой случай. Opus выглядит крайне эффективным по токенам по сравнению
00:02:03с двумя другими моделями. И тот факт, что он превосходит Fable 5, просто
00:02:07не укладывается в голове. Еще одно интересное улучшение — визуальный вывод. Вот пример работы Opus 5
00:02:13с моделированием в аэродинамической трубе. А здесь она создает интерактивный 3D-артефакт
00:02:19животной клетки. Один из минусов Claude в том, что она не умеет генерировать собственные изображения. Поэтому
00:02:24то, что она стала лучше создавать 3D SVG и графику в стиле HTML — это огромный плюс.
00:02:31Еще одно важное улучшение — Anthropic заявляет, что модель намного лучше проверяет свою работу
00:02:35и тщательно вносит итерации до достижения успеха. Что это значит? Это значит, что когда мы используем Opus 5
00:02:40для долгосрочных агентских задач, которые решаются не за один шаг... Это циклы, верно? Это
00:02:45как граф-инжиниринг, о котором сейчас все говорят. Любая задача, где требуется,
00:02:49чтобы Claude сверял свою работу со сформулированной целью и повторял этот процесс снова
00:02:53и снова. Так вот, Opus 5 справляется с этим значительно лучше, чем Opus 4.8. Любопытный
00:02:58Интересный пример: Opus 5 дали чертёж детали и поручили написать код для ее воссоздания в виде
00:03:033D-модели в FreeCAD. Но у модели не было возможности непосредственно просмотреть чертеж. То есть,
00:03:09ей поставили цель, но не указали конкретный способ ее достижения. И она сама
00:03:14написала конвейер компьютерного зрения для извлечения геометрии из пикселей и воссоздала
00:03:19всю деталь целиком. Опять же, в любых долгосрочных задачах с ориентиром на конечную цель
00:03:25Opus 5 справляется намного лучше, чем 4.8. Что касается нежелательного поведения,
00:03:29она также на шаг впереди предшественников. Чем ниже столбец, тем лучше. И мы видим огромный рост ее способности
00:03:35находить уязвимости и эксплойты в исходном коде по сравнению с Opus 4.8. Еще одна отличная вещь —
00:03:40защитные механизмы. Это не история с Fable, где при упоминании кибербезопасности или биологии
00:03:45все сразу блокируется. Эти ограничения у Opus 5 куда мягче, чем у Fable 5.
00:03:50Хотя классификаторы все еще присутствуют, вероятность их ложного срабатывания на 85% ниже,
00:03:56чем у Fable. Наконец, главное — это цена. Как я уже сказал, она вдвое дешевле Fable:
00:04:01$5 за миллион входных токенов и $25 за миллион выходных. И, судя по бенчмаркам
00:04:07и графикам, эта модель весьма экономична. Так что мне очень хочется опробовать ее в деле,
00:04:12потому что если цифры правдивы, мы получили аналог Fable, который даже лучше, да еще и вдвое дешевле.