스크립트
00:00:00Anthropic только что выпустили Sonnet 5, так что давайте разберем все, что вам нужно о нем знать.
00:00:04Начнем с тестов. И помните, Sonnet 5 — это менее мощная,
00:00:08менее дорогая модель, чем Opus и уж точно Fable. У нас не было обновлений в этой линейке
00:00:13с версии 4.6. Сравнивая 5 с 4.6, мы видим огромный скачок вперед в плане агентного кодинга,
00:00:21муждисциплинарного мышления, использования компьютера и интеллектуальной работы. Так что это полное улучшение
00:00:26по всем направлениям. Теперь, сравнивая его с Opus 4.8, вопрос не в том, близки ли они? А в том, насколько
00:00:32велик разрыв? И, честно говоря, он не так уж велик. На самом деле, модель показывает лучшие результаты
00:00:39в интеллектуальной работе, что довольно безумно. В использовании компьютера она отстает всего на 2%, и всего
00:00:44на 2% отстает в агентном кодинге, и лишь на несколько процентных пунктов в
00:00:49муждисциплинарном мышлении. Самый большой разрыв наблюдается в Sweebench Pro: 63% против 69%.
00:00:56Но эй, в Terminal Bench 2.1 — 80 против 82. Так что разрыв невелик. И это обсуждение
00:01:03производительности должно проходить в контексте цен. Помните, Fable 5, Mythos 5,
00:01:08мы говорим о 10 долларах за миллион входных токенов, что вдвое больше, чем у Opus. Opus стоит 5 долларов за миллион.
00:01:16А для вывода цена составляет 25 долларов. Итак, 5 и 25. Для Sonnet 5 мы имеем 2 доллара, то есть всего 40% от стоимости
00:01:26Opus за входные токены. А для вывода — 10 долларов. Значительно дешевле, менее половины стоимости
00:01:34Opus. При этом, если взглянуть на цифры, разница совсем небольшая. Это отличные новости, если вы
00:01:40не занимаетесь самыми передовыми задачами с ИИ, а выполняете более рутинную работу, но при этом
00:01:46все еще хотите мощности — Sonnet 5 заполняет этот пробел. Теперь давайте посмотрим на графики,
00:01:51которые выходят за рамки просто тестов. Здесь мы видим производительность агентного поиска в зависимости от уровня усилий,
00:01:55сравнивая Opus 4.8 с Sonnet 5 и Sonnet 4.6. Сразу заметите, что у Sonnet 5 огромный
00:02:04разрыв в процентах успешных ответов при изменении уровня усилий. На низком уровне он выдает 55%. Но если посмотреть
00:02:13на низкий уровень Sonnet 4.6, то он работает лучше. Хотя по стоимости — гораздо дешевле.
00:02:19Переходим к среднему — мы получаем примерно ту же производительность, что и у Sonnet 4.6,
00:02:25но со значительной скидкой. И только при переходе к высокому уровню усилий мы начинаем превосходить
00:02:34Sonnet 4.6. Но в этот момент мы получаем лучшую производительность, чем у Sonnet 4.6, но по цене,
00:02:41которая была бы на низком уровне усилий у Sonnet 4.6. Так что это различие в уровнях усилий,
00:02:49на мой взгляд, очень важно, потому что это не просто “Sonnet 5 лучше по всем параметрам”, где низкий
00:02:53уровень на 5-й версии обязательно лучше низкого на 4.6. Низкий на Sonnet 5 просто означает, что это будет супер
00:02:59дешево. Но для получения более высокого уровня производительности, как мы видели раньше,
00:03:03вероятно, нужно использовать высокий уровень. При этом, когда мы используем высокий уровень
00:03:08с Sonnet 5, мы платим примерно столько же, сколько за Opus. Opus на среднем
00:03:14и высоком уровнях стоит так же, как Sonnet на высоком, но мы получаем лучший процент успеха. Так что это
00:03:21вносит много нюансов в обсуждение. Стоит ли использовать Sonnet 5 или Opus 4.5 в вещах вроде
00:03:27агентного поиска? Я думаю, все зависит от ситуации. Если задача сложная, в конечном итоге Opus 4.8 может быть
00:03:33дешевле, так как он очень эффективно использует токены, а Sonnet просто не подходит для этой работы.
00:03:38Однако, когда мы выполняем задачи, которые не так сложны для этих моделей, возможно,
00:03:44использовать Opus 4.8 вообще не имеет смысла. Вот тогда и приходит Sonnet 5. Думаю, это
00:03:49интересная ситуация, когда выбор модели зависит от каждого конкретного случая.
00:03:54Еще один интересный момент — агентное использование компьютера. В целом,
00:03:58в большинстве случаев Sonnet 5 превосходит Sonnet 4.6, и делает это при довольно низкой цене. Так что в
00:04:05агентном поиске это было не совсем так, но в агентном использовании компьютера внезапно
00:04:09мы всегда бы выбирали Sonnet 5 вместо 4.6. И опять же, это возвращает нас к мысли, что выбор
00:04:14модели теперь зависит от случая. Интересно, посмотрите на Opus. Opus на высоком уровне работает
00:04:20лучше, чем Sonnet 5 на максимуме, при этом он дешевле. Так что глядя на это, можно подумать:
00:04:26вау, Opus на самом деле довольно эффективен для своих задач. Не говоря уже о том, что он достигает уровней,
00:04:30которые Sonnet просто не может достичь. Нужно это учитывать. Честно говоря, только потому, что стоимость за миллион
00:04:36токенов дешевле у Opus, во многих случаях Opus все равно будет лучшим выбором. Не хочу выпускать
00:04:41видео о новой модели Anthropic, не поговорив о дезинформации. Мы видим улучшения
00:04:45в Sonnet 5, но все еще ниже уровня, который мы ожидаем от Opus 4.8 и Mythos Preview. Что касается
00:04:50эксплойтов и вопросов кибербезопасности, из-за которых Mythos был заблокирован, это не
00:04:55проблема, о которой стоит беспокоиться в классе Sonnet. В общем, я бы не уделял
00:04:59слишком много внимания этим тестам, честно говоря. Такие тесты и графики заставляют меня
00:05:05задуматься, потому что вопрос, мне кажется, не в выборе между Sonnet 5 и 4.6. Мы почти всегда будем
00:05:11использовать Sonnet 5. Вопрос в выборе между Sonnet 5 и Opus 4.8. И действительно ли Opus дешевле?
00:05:18Я бы хотел увидеть больше тестов от Anthropic, которые четко очертили бы границу, где
00:05:24Sonnet 5 справляется отлично и стоит дешевле, чем
00:05:29Opus, а где задача более сложная и Opus будет эффективнее, чем
00:05:34Sonnet в ее выполнении. Так что есть над чем подумать, безусловно, приятное дополнение. Думаю, в целом,
00:05:40задачи более низкого уровня будут отлично решаться Sonnet, потому что для тех из нас, кто использует API-токены для
00:05:46наших приложений или того, что не входит в экосистему Claude Max, работать с
00:05:51Anthropic довольно сложно. Это просто ужасно дорого. И я давно говорил людям, просто посмотрите
00:05:55на OpenAI, посмотрите на их модели mini, потому что для многих людей этого более чем достаточно.
00:05:59Что ж, теперь у нас есть средний вариант от Anthropic, что приятно.
00:06:05Так что на этом я закончу сегодня. Модель доступна везде. Думаю,
00:06:09потребуется много проб и ошибок, чтобы понять, где она наиболее уместна. Дайте знать,
00:06:13что вы думаете. Обязательно загляните в Chase AI Plus, если хотите получить доступ к моему мастер-классу
00:06:17по Claude Code, и увидимся.