Claude Sonnet 5 разочаровывает... (Зато Fable снова в строю!)

BBetter Stack
컴퓨터/소프트웨어경제 뉴스AI/미래기술

스크립트

00:00:00Anthropic выпустила Claude Sonnet 5 на прошлой неделе, и это разочаровало, но хотя бы вернулся Fable 5,
00:00:04пусть и немного “понерфленный”, и да, в Claude Code, возможно, есть шпионский код для отслеживания
00:00:09китайских пользователей. Давайте начнем. Сначала о Sonnet 5. Это первое обновление Sonnet за четыре
00:00:18с половиной месяца, и Anthropic утверждает, что это их самая агентная модель Sonnet на данный момент,
00:00:22с производительностью, близкой к Opus 4.8, но по более низкой цене. Ценообразование — очень интересный момент
00:00:28для этой модели, так что мы еще к этому вернемся. Но сначала давайте взглянем на тесты,
00:00:31предоставленные Anthropic. Она обходит своего предшественника во всех них и приближается к Opus в некоторых,
00:00:35таких как Terminal Bench и Computer Use, даже немного превосходя Opus в интеллектуальной работе. Я предпочитаю смотреть
00:00:40на сторонние тесты, и тем, которым я доверяю, — это тесты от Artificial Analysis. И в их
00:00:44индексе кодинга она отстает от Opus на несколько пунктов, но немного опережает GPT 5.4. Она совершила очень
00:00:50хороший скачок по сравнению со своим предшественником, Sonnet 4.6. Та же история и с Индексом интеллекта,
00:00:56где она расположилась между GPT 5.5 и GPT 5.4, но, что интересно, в агентном индексе она превзошла GPT 5.5.
00:01:03Так что, когда они писали в блоге, что проделали большую работу над агентными возможностями,
00:01:06это, похоже, принесло свои плоды. Судя по тестам, модель выглядит вполне компетентной,
00:01:10и это определенно шаг вперед по сравнению с Sonnet 4.6, но теперь давайте обсудим ценообразование.
00:01:14В API они предлагают цену со скидкой: 2 доллара за миллион входных токенов
00:01:18и 10 долларов за миллион выходных токенов — и это до 31 августа. Затем цена вернется
00:01:23к уровню других моделей Sonnet, то есть 3 доллара за миллион входных токенов и 15 долларов за миллион выходных.
00:01:28Это ставит ее в один ряд с Gemini 3.5 Flash и GPT 5.6 Terra, если мы когда-нибудь получим к ней доступ,
00:01:34и, как они заявляли, она дешевле, чем Opus 4.8. Проблема, однако, в том, что на практике это совсем
00:01:39не так. Модель невероятно “прожорлива” к токенам. Она использует около 69 000 токенов для выполнения одной задачи в
00:01:45индексе интеллекта Artificial Analysis, обходя по этому показателю Sonnet 4.6, Opus 4.8, Fable 5, GPT 5.4
00:01:52и 5.5. Если посмотреть на этот квадрант, где зеленый цвет — это идеал, то она находится
00:01:57как можно дальше от этого идеала среди всех моделей. Это, очевидно, имеет последствия для реальной стоимости задачи,
00:02:02и Artificial Analysis обнаружили, что Sonnet 5 обходится дороже, чем Opus 4.8 за задачу,
00:02:07уступая только Fable. К тому же, если взять модель вроде GPT 5.5, которая показывает лучшие результаты в большинстве
00:02:12тестов, она вдвое дешевле, чем Sonnet 5. Стоит отметить, что Artificial Analysis
00:02:16используют стандартную цену модели, а не цену со скидкой, поэтому мне было бы очень
00:02:20интересно узнать, попытается ли Anthropic исправить это, продлив скидку или оставив такую цену навсегда.
00:02:25Что еще хуже стоимости задачи, Artificial Analysis обнаружили, что
00:02:29прохождение всего их набора тестов на Sonnet 5 стоило дороже, чем на Fable 5. Что здесь произошло? Даже в
00:02:34тесте Cursor Bench, если посмотреть на Sonnet 5 High, она стоит примерно столько же, сколько Opus 4.8 за аналогичный
00:02:39результат, а по мере увеличения уровня усилий Sonnet 5 Max показывает худшие результаты, чем Opus 4.8 Extra High,
00:02:44при этом обходясь дороже. Такое ощущение, что им нужно что-то обновить или исправить, иначе я просто не вижу,
00:02:48куда вписывается эта модель. Это отнюдь не плохая модель с точки зрения возможностей, просто экономически, а я
00:02:54был большим фанатом моделей Sonnet. Думаю, они были первыми, которыми многие из нас пользовались ежедневно,
00:02:58но за последние несколько месяцев я постоянно использовал Opus 4.8, и ничто из этого не заставило меня изменить мнение.
00:03:02Особенно с возвращением Fable: Fable — для сложных задач,
00:03:05Opus 4.8 — для повседневной работы, а Sonnet — ни для чего. Кстати, о возвращении Fable 5: экспортные ограничения
00:03:11были сняты, и теперь он снова доступен для всех, независимо от гражданства, но, к сожалению,
00:03:15у вас была неделя на использование в рамках лимитов вашего плана, или хотя бы 50% от них, а после 7 июля
00:03:20он будет доступен только через кредиты на использование. В этом блоге были интересные моменты насчет
00:03:24изначального запрета. Он якобы возник из-за джейлбрейка от исследователя Amazon, которому удалось
00:03:29заставить модель найти уязвимости безопасности, а в одном случае продемонстрировать, как одну из них использовать,
00:03:33но изучив это, Anthropic обнаружили, что куча других моделей, таких как Claude Opus 4.8,
00:03:37GPT 5.5 и Kimi K 2.7, могли идентифицировать ту же самую уязвимость, что и Fable 5 в том отчете,
00:03:43а когда дело дошло до демонстрации эксплуатации той же самой уязвимости,
00:03:47каждая протестированная модель могла это сделать, включая Claude Haiku 4.5, Sonnet 4.6, Opus 4.6,
00:03:524.7, 4.8, GPT 5.4, 5.5 и Kimi K 2.7. Так что мне кажется, что запрет был довольно бессмысленным,
00:03:58и все, чего они на самом деле добились — Anthropic сделали меры защиты
00:04:02еще более строгими в Fable, из-за чего множество обычных запросов блокируется. В их анонсирующем
00:04:06твите было сказано, что рутинные задачи вроде отладки и кодинга будут перенаправляться на Opus 4.8,
00:04:11но сотрудник Anthropic позже поправил это, сказав, что это касается лишь малого количества задач.
00:04:14Тем не менее, это, похоже, повлияло на некоторые тесты больше, чем на другие, и ходят заявления, что Fable
00:04:18теперь “понерфлен”. По сути, он чаще полагается на Opus 4.8, поэтому в этих
00:04:23тестах показывает себя намного хуже. На ту же тему экспортных ограничений и банов: некоторые заметили, что Claude
00:04:27Code теперь пытается использовать очень хитрый цифровой отпечаток, изменяя системную
00:04:32строку даты в промптах. Есть отличный пост в блоге с подробностями, я оставлю ссылку
00:04:35внизу, но если вкратце: в Claude Code есть функция, проверяющая, не находится ли ваш часовой пояс в
00:04:40Китае. Если это так, формат строки даты изменится: вместо дефисов будут косые черты. Затем он также
00:04:44проверит, совпадает ли ваш API-адрес с этим списком, или содержит ли хостнейм ключевые слова AI-лабораторий
00:04:49вроде DeepSeq, Minimax или ZAI, и если это так, он заменит апостроф в слове “today's” на другой
00:04:55символ Unicode, который выглядит практически так же. Это очень умный прием, называемый стеганографией,
00:05:00и большинство из вас этого даже не заметит. Это в основном сделано для попыток обнаружить реселлеров
00:05:03API, неавторизованные шлюзы Claude Code и атаки на дистилляцию моделей. У меня нет
00:05:08проблем с тем, что они пытаются это делать, я просто предпочел бы, чтобы они были честнее по поводу вещей,
00:05:12включенных в Claude Code, и не пытались прятать это таким образом. Считаете ли вы это проблемой, и что вы
00:05:16думаете о Sonnet 5 и возвращении Fable? Дайте знать в комментариях внизу, подпишитесь,
00:05:20и, как всегда, увидимся в следующем выпуске.

핵심 요약

Несмотря на высокие показатели интеллекта, Claude Sonnet 5 экономически проигрывает конкурентам из-за чрезмерного потребления токенов, а возвращение модели Fable 5 сопровождается ужесточенными мерами безопасности.

하이라이트

  • Claude Sonnet 5 потребляет около 69 000 токенов на выполнение одной задачи в индексе интеллекта Artificial Analysis, превосходя по этому показателю модели Opus 4.8, Fable 5 и GPT 5.4.

  • Стоимость использования Claude Sonnet 5 за задачу превышает стоимость Opus 4.8, при этом модель GPT 5.5 демонстрирует лучшие результаты в тестах при двукратной экономии средств.

  • Ограничения на использование Fable 5, связанные с гражданством, сняты, однако после 7 июля доступ к модели осуществляется исключительно через платные кредиты.

  • Технический анализ Claude Code выявил скрытые методы стеганографии, использующие изменение символов Unicode и форматов дат для отслеживания пользователей, API-реселлеров и атак на дистилляцию.

  • Анализ безопасности показал, что уязвимости, выявленные в Fable 5 и послужившие поводом для его блокировки, успешно идентифицируются широким спектром других моделей, включая Claude Opus 4.8, GPT 5.5 и Kimi K 2.7.

타임라인

Оценка возможностей и экономическая неэффективность Claude Sonnet 5

  • Claude Sonnet 5 показывает значительный прогресс в агентных задачах по сравнению с версией 4.6.
  • Модель демонстрирует крайне низкую экономическую эффективность из-за высокого расхода токенов на единицу работы.
  • Стоимость выполнения стандартных задач на Sonnet 5 превышает расходы при использовании Opus 4.8 и GPT 5.5.

Модель позиционируется как агентное решение с производительностью уровня Opus 4.8, но при более низкой цене API. Сторонние тесты Artificial Analysis подтверждают прогресс в кодинге и агентных возможностях, однако реальная стоимость эксплуатации оказывается высокой. Невероятно большое количество токенов, потребляемых для простых задач, делает использование Sonnet 5 менее выгодным, чем эксплуатация Opus 4.8 или GPT 5.5.

Возвращение Fable 5 и пересмотр ограничений

  • Доступ к Fable 5 восстановлен для всех пользователей независимо от регионального признака.
  • Первоначальные ограничения основывались на способности модели обнаруживать уязвимости, которые идентифицируют и другие популярные LLM.
  • Меры безопасности в Fable 5 были ужесточены, что приводит к частой блокировке обычных запросов и перенаправлению задач на Opus 4.8.

Снятие экспортных ограничений вернуло Fable 5 в общий доступ, однако модель теперь работает под более строгими фильтрами безопасности. Исследования показали, что способность модели находить уязвимости не уникальна, так как аналогичными навыками обладают модели семейств Claude, GPT и Kimi. В текущей версии Fable 5 чаще прибегает к помощи Opus 4.8, что негативно сказывается на результатах в ряде тестов.

Методы отслеживания в Claude Code

  • Claude Code применяет методы стеганографии для скрытого сбора данных о среде выполнения пользователей.
  • Программное обеспечение меняет форматы дат и символы Unicode в зависимости от геолокации и хоста для идентификации неавторизованных шлюзов.
  • Целью данных механизмов является выявление API-реселлеров и предотвращение атак на дистилляцию моделей.

Claude Code использует скрытые проверки для определения нахождения пользователя в Китае или взаимодействия с определенными AI-лабораториями. Система меняет дефисы на косые черты в строках даты и подменяет апострофы на визуально идентичные символы Unicode. Эти действия направлены на защиту коммерческих интересов Anthropic, хотя непрозрачность реализации этих методов вызывает вопросы у сообщества.

커뮤니티 글

모든 글 보기