Opus 5 Beats Fable... at Half the Price?
BBetter Stack
Computing/SoftwareBusiness NewsInternet Technology
Transcript
00:00:00Anthropic только что выпустила Claude Opus 5, и она может быть даже лучше, чем Fable,
00:00:04будучи вдвое дешевле. Если это правда, то это моя новая любимая модель, так что давайте проверим.
00:00:13Вот как они описывают Opus 5. Opus 5 — это продуманная и проактивная модель, которая
00:00:18приближается к передовому интеллекту Claude Fable 5 за половину цены. На тестах
00:00:23программирования и интеллектуальной работы, таких как Frontier Bench и GDP Val, Opus 5 — это новый лидер,
00:00:28уступающий только Mythos 5 в задачах кибербезопасности. Opus 5 создана для повседневного использования,
00:00:33работает эффективнее других моделей и является новой моделью по умолчанию в Claude Max,
00:00:38а также самой мощной моделью на тарифах Claude Pro. Далее они показывают бенчмарки,
00:00:43и она лидирует во многих из них, несмотря на наличие Fable 5, причем выигрывает со значительным отрывом.
00:00:47По их данным, она почти на 10% лучше Fable 5 в Frontier Bench, но самым безумным для меня
00:00:52стал результат в Arc AGI. Opus 4.8 набрала здесь 1,5%, тогда как Sol набрала 7,8%,
00:01:00что было предыдущим рекордом, но Opus 5 набирает 30,2%. Команда этого бенчмарка показала,
00:01:06что у Opus появилась новая способность, которой они раньше не видели ни у одной другой модели:
00:01:10она переводила эти тесты в алгебраическую нотацию для глубокого логического анализа. Это действительно впечатляет.
00:01:15Кстати, если вам интересно, почему здесь нет Fable, то это из-за политики хранения данных Fable.
00:01:19Разработчики Arc AGI не хотят рисковать утечкой деталей бенчмарка в Anthropic, но хорошая
00:01:24новость в том, что у Opus 5 нет требований к хранению данных при общем доступе. Это порадует
00:01:29очень многих людей. Но пойдем дальше и взглянем на сторонние бенчмарки от Artificial Analysis.
00:01:33В индексе программирования она на втором месте, уступая всего 0,3 балла GPT 5.6 Sol Extra High,
00:01:39но обходит Fable на 1,5 балла, и это отличный скачок по сравнению с Opus 4.8.
00:01:45Кстати, респект Kimi K3 за то, что потеснила гигантов. Я делал о ней видео,
00:01:49когда она вышла, так что обязательно подпишитесь, чтобы быть в курсе новостей ИИ
00:01:52и разработки. Если же мы посмотрим на агентский индекс, Opus 5 здесь вырывается в лидеры,
00:01:57слегка обгоняя Fable 5 и побеждая модель Sol от OpenAI. То же самое происходит
00:02:02и в индексе интеллекта, где Opus 5 также лидирует. Так что с точки зрения производительности
00:02:06Opus 5 выглядит очень серьезной моделью, и, честно говоря, я довольно удивлен. Я думал,
00:02:11что они сосредоточатся на Fable, а Opus станет чем-то вроде новой модели Sonic,
00:02:15но сейчас кажется, что Fable и Opus идут почти ноздря в ноздрю, пока мы не учитываем цены.
00:02:19Если взглянуть на стоимость выполнения задачи на Artificial Analysis, Opus 5
00:02:23оказывается на 72 цента дешевле Fable 5 и лишь немного дороже Opus 4.8.
00:02:28Я бы сказал, если вам важно соотношение цены и качества, GPT 5.6 Sol
00:02:33все равно останется победителем, так как стоит почти вдвое дешевле Opus 5. Вы можете видеть
00:02:37на этой диаграмме, где зеленый — самый привлекательный квадрант, что модели GPT находятся как раз там
00:02:42вместе с Kimi K3, а модели Anthropic занимают отдельную секцию в более высоком ценовом
00:02:46сегменте. Cursor Bench также отражает все эти бенчмарки, которые мы рассмотрели. В нем
00:02:50Opus 5 Max набирает почти столько же баллов, сколько Fable 5, но Fable стоит $17 за эту
00:02:56задачу, а Opus — $8. Сама цена, кстати, такая же, как у Opus 4.8, то есть
00:03:01$5 за миллион входных токенов и $25 за миллион выходных, так что если вы любите
00:03:06Opus 4.8, не вижу причин не использовать эту модель. И как фанат
00:03:10Fable 5, я определенно буду часто использовать Opus 5, чтобы сэкономить подписку
00:03:14и кредиты, чтобы они не заканчивались так быстро. Честно говоря, мой главный вывод по Fable и Opus:
00:03:18Fable останется топовой моделью для действительно сложных долгосрочных задач,
00:03:23но для 95% работы Opus 5 теперь может ее заменить. Теперь давайте перейдем к делу
00:03:28и посмотри на нее в действии на локальных тестах. Первый тест — я попросил модели создать
00:03:32полноценную гоночную игру Формулы-1 в одном HTML-файле с использованием Three.js. В конце я расскажу,
00:03:37сколько времени ушло у каждой модели и во сколько это обойдется по API, но сначала
00:03:40просто посмотрим на результаты. Вот такой результат выдала Opus 5, и должен сказать, я действительно
00:03:45впечатлен этой моделью. Она не использует никаких сторонних ассетов или чего-то подобного.
00:03:50Все сделано самой Opus 5, и выглядит отлично. Трасса тут была проложена немного задом наперед,
00:03:55но управление в порядке. Время кругов работает, позиционирование работает, порядок пилотов работает —
00:03:59все работает хорошо. Да, мы едем под травой, но, как видите, столкновения работают,
00:04:03и под этой травой действительно есть дорога, так что это легко исправить промптом.
00:04:07А еще зоны с гравием работают очень приятно. Честно, я очень впечатлен
00:04:12результатом от Opus 5. На мой взгляд, эти болиды F1 выглядят лучше всех.
00:04:16Впрочем, решать вам. Вот результат, который выдала Fable. Думаю, здесь тоже очень неплохая
00:04:20планировка трассы, но машинки чуть более простые по сравнению с Opus 5.
00:04:25Мне очень нравится покачивание камеры при поворотах, и опять же, все остальные
00:04:28функции работают: позиционирование, тайминг и прочее. Так что Fable 5 тоже
00:04:33отлично справилась, но, честно говоря, вариант от Opus мне нравится больше. А вот результат,
00:04:37который я получил от GPT 5.6 Soul, тоже на максимальных настройках. Тут неплохо проработаны
00:04:43модели и вид камеры, но, как видите, самой трассы нет, некоторые объекты инвертированы,
00:04:47а где-то на середине пути трек просто обрывается. На мой взгляд, она справилась хуже,
00:04:51чем Fable и Opus. Я определенно считаю, что Opus здесь лидирует.
00:04:56И последняя модель, которую я протестировал, — Kimi K3, вот такой результат она выдала,
00:05:01и, честно говоря, это невероятно впечатляет для модели с открытыми весами. Сработано достойно,
00:05:05очень похоже на GPT 5.6 Soul. Ограждения есть, трасса работает, позиционирование —
00:05:09все функционирует. Она сделала хорошую игру с первой попытки. Если посмотреть на
00:05:14стоимость и время этих прогонов, Opus 5 потратила 46 минут и 51 секунду
00:05:19на создание игры F1, что обошлось бы примерно в $12,99 через API. Так что для меня
00:05:25Opus 5 оказалась дороже, чем Fable, и, судя по всему, из-за того, что она использовала
00:05:30в пять раз больше токенов. Надеюсь, это исключение, так как другие бенчмарки не указывают
00:05:35на подобное. Добавлю, что я рассчитываю стоимость моделей Claude через плагин подсчета расхода,
00:05:39так что здесь могут быть неточности, ведь при подписке точная цена не отображается.
00:05:44Кроме того, эти модели относятся к премиум-сегменту, поэтому если спуститься к GPT 5.6,
00:05:49вы получите более быструю и дешевую модель, но результаты, на мой взгляд, были хуже.
00:05:54Давайте проведем еще один тест. На этот раз я попросил их создать панель управления личными
00:05:58финансами. Это должно быть фулстек-приложение с фронтендом и бэкендом,
00:06:02и я указал несколько функций для реализации. Вот такой результат вернула
00:06:06Opus 5, и, честно, я весьма впечатлен. Мне очень нравится такой интерфейс,
00:06:11это именно мой стиль. Напишите в комментариях, нравится ли он вам, и все полностью
00:06:15функционально. Я протестировал — все работает, есть отдельные страницы для каждой
00:06:20из запрошенных функций, и взаимодействие фронтенда с бэкендом исправно.
00:06:24Стиль интерфейса просто отличный, я считаю его лучшим из всех.
00:06:28Что касается кода, на фронтенде использовались React и React Router, что мне очень нравится,
00:06:33а бэкенд получает плюс за использование настоящей базы данных. Для базы
00:06:37использовался Node SQLite, а для сервера — Express. Вот результат,
00:06:42который выдала Fable 5. Мне больше нравится UI от Opus 5, но и этот вариант неплох,
00:06:48хотя графики здесь бесполезны. Нижний график приятный, и, опять же,
00:06:53все функции работают. Просто Opus 5 вложила больше усилий в UI,
00:06:57и она явно сильнее в этой части. В коде она сделала нечто похожее на Opus 5, применив
00:07:01React, но не выбрала библиотеку маршрутизации, а написала собственную
00:07:05небольшую библиотеку роутинга. Я бы предпочел стандартный React Router.
00:07:09Для базы данных она тоже взяла Node SQLite, а сервер сделан на Express,
00:07:13так что бэкенд похож, но Opus выбрала более удачный стек для фронтенда.
00:07:18А вот результат от GPT 5.6 Sol, и скажу, что ее UI-дизайн тоже на высоте.
00:07:22Он вполне на уровне Opus. Это просто другой стиль, так что дело вкуса,
00:07:26но мне очень нравится. Она проделала невероятную работу по проектированию UI,
00:07:31и все функции работают, но модель не стала делать отдельные страницы для функций,
00:07:35а просто разместила их на разных участках одной страницы. Стек она выбрала
00:07:38самый уникальный: NextJS в связке с Drizzle для базы данных, что мне очень нравится
00:07:43и отлично подходит для такой задачи. Но при этом она использовала Cloudflare и Vinext
00:07:47для хостинга, что странно, ведь Vinext еще очень свежий инструмент и вряд ли
00:07:52достаточно проверен. Похоже, в системный промпт зашивают принудительное использование
00:07:56Cloudflare и Vinext. Как я говорил в видео про Kimi K3, это,
00:08:00вероятно, связано с тем, как устроены их собственные сервисы ChatGPT.
00:08:04И последняя модель — Kimi K3. Вот какой результат мы получили,
00:08:09и она справилась очень хорошо. Этот интерфейс напоминает мне то, что выдавали
00:08:14GPT 5.4 или 5.5, так что дизайн слегка отстает, но все функции
00:08:19работают, и к UI претензий нет. Приложение делает ровно то, что требовалось.
00:08:24За код я бы снизил баллы. Для фронтенда она взяла React
00:08:28и написала свой роутинг, как Fable, но если посмотреть на сервер,
00:08:32там оказался только Express без полноценной базы данных вроде Node SQLite.
00:08:36Она просто создала самодельную базу на JavaScript, сохраняя
00:08:40все данные в JSON-файл. Это явно не тот подход, который хотелось бы видеть.
00:08:44Что касается времени и стоимости моделей в тесте с финансами, Fable оказалась самой дорогой,
00:08:48обошедшись в $30,79 при времени работы 56 минут и 55 секунд. Но цена Opus
00:08:55снова оказалась близкой к Fable — $29,82, а времени ушло даже больше:
00:09:0259 минут и 15 секунд. Модели GPT на этом фоне выглядят очень выгодными,
00:09:07они примерно в три с половиной раза дешевле, и я надеюсь, что конкуренция снизит цены Anthropic.
00:09:11Впечатления неоднозначные. Конечно, я запускал каждый тест только один раз и сделал всего два теста,
00:09:16так что рассчитываю на точность Artificial Analysis, где Opus
00:09:20стоит втридешево от Fable. Нужно потестировать еще, чтобы разобраться.
00:09:24Возможно, дело в инструменте, которым я измерял расходы. Еще один плюс Opus —
00:09:28она менее строгая к темам кибербезопасности, чем Fable 5. Защитные ограничения похожи
00:09:33на Opus 4.8, за исключением более строгих рамок в узком спектре задач.
00:09:37Судя по всему, фильтры позволят Opus 5 находить уязвимости в исходном коде,
00:09:42но будут блокировать сканирование бинарных уязвимостей, пентестинг
00:09:46и генерацию эксплоитов. Их тесты показали, что классификаторы срабатывают на 85% реже,
00:09:51чем у Fable 5. Так что соперничество моделей сейчас действительно впечатляет.
00:09:55GPT 5.6 показывает снижение цен, открытые модели вроде Kimi сравнялись
00:10:00с лидерами по интеллекту, а Anthropic постоянно двигает эту планку еще выше.
00:10:04Какая модель ваша любимая и как вам Opus? Поделитесь в комментариях,
00:10:09не забудьте подписаться и, как всегда, до встречи в следующем видео!