Fable 5.1 добавляет водяные знаки ВО ВСЁМ, вот как их убрать

CChase AI
Computing/SoftwareInternet Technology

Transcript

00:00:00Итак, вчера Anthropic выпустила Fable 5.1, и это первая созданная ими модель,
00:00:04которая теперь добавляет водяные знаки ко всему, что она производит. И сегодня я покажу вам, как от этого избавиться.
00:00:10Но сначала давайте поговорим о том, что вообще представляет собой этот водяной знак, потому что
00:00:14называть его водяным знаком — не совсем корректно, зачем он вообще нужен и как он работает.
00:00:19Потому что, если вы это поймете, решение проблемы обхода этого водяного знака станет
00:00:23намного понятнее. Почему нам вообще приходится с этим сталкиваться? Ну, потому что это
00:00:26соответствует Закону ЕС об искусственном интеллекте, который подписали практически все основные ведущие лаборатории,
00:00:31за исключением XAI. И этот свод правил гласит, что им — то есть ЕС —
00:00:38нужен способ определять, был ли какой-то текст или результат создан с помощью ИИ.
00:00:43И чтобы сделать это, Anthropic добавила водяной знак во все свои результаты для моделей, выпущенных
00:00:50после 2 августа 2026 года, к коим и относится Fable 5.1. При этом Anthropic утверждает, что это не оказывает
00:00:56никакого практического влияния на получаемый вами результат и что изменения крайне ограничены,
00:00:59если речь идет о коде. Но как эта штука работает на самом деле? И почему
00:01:03я сразу назвал это название неточным? Стратегия Anthropic по внедрению этих водяных знаков
00:01:07в свои результаты основана на вышедшей в 2024 году статье Google под названием «Масштабируемые водяные знаки
00:01:13для идентификации результатов работы больших языковых моделей». Это относительно техническая статья, она затрагивает
00:01:19турнирное нанесение водяных знаков SynthID. Но позвольте мне дать вам простую ментальную модель, которую вы сможете взять на вооружение.
00:01:25Как вы знаете, большие языковые модели и их результаты основаны на вероятностях, и здесь присутствует
00:01:29пределенная доля случайности. Если я дам модели предложение «она — пропуск» и ей нужно
00:01:34его заполнить, у нее будет список слов, которые она потенциально может использовать для завершения предложения.
00:01:41Допустим, эти слова: красивая, потрясающая, великолепная и симпатичная. В реальности
00:01:48с каждым из этих слов связан определенный процент или вероятность выбора
00:01:54большой языковой моделью. Термин, который вы часто будете слышать — это softmax, но вам просто нужно
00:01:58понять, что с каждым из этих слов связана определенная вероятность того, какое из них
00:02:04выберет большая языковая модель. Для этого мысленного эксперимента я хочу, чтобы вы представили, что у всех них
00:02:08абсолютно одинаковый процент, верно? То есть у каждого из этих слов для завершения предложения есть 25-процентный шанс
00:02:14быть выбранным. В обычных условиях, до появления водяных знаков, модель просто выбирала одно из них.
00:02:20Допустим, она бросает четырехгранный кубик и выбирает «красивая». Круто, верно? Шанс был 25%,
00:02:26у всех был равный шанс на выбор. Но теперь мы работаем в другой системе, и эта система
00:02:31представляет собой систему водяных знаков. В системе водяных знаков мы можем оказаться в той же ситуации, когда я говорю:
00:02:38«Эй, мне нужно, чтобы ты заполнил предложение “она — пропуск”, и у тебя есть четыре варианта, верно?». И предположим,
00:02:42что это снова те же четыре слова с одинаковой вероятностью. Когда мы добавляем механизм нанесения водяных знаков,
00:02:49он по сути «нагружает» этот кубик. Если это какой-то
00:02:54четырёхгранная кость, он тогда скажет: хмм, в целях нанесения водяных знаков, “прекрасная” теперь будет
00:03:01составлять 50%, а “великолепная” — 30%. Так что при внедрении системы водяных знаков,
00:03:10она начинает выбирать определенные слова и придавать им больший вес. И поскольку определенные слова имеют
00:03:15больший вес при выборе большой языковой моделью, эти слова будут появляться
00:03:19чаще! Используя систему водяных знаков, модель чаще всего будет говорить, что она
00:03:25красивая. Теперь вы, как конечный пользователь, понятия не имеете, что это за слова и каким словам отдается
00:03:32больший вес. Но кто-то, у кого есть ключ, секретный ключ водяных знаков, может это определить. При этом
00:03:40они не могут сказать это со стопроцентной уверенностью, потому что, как и раньше, всегда был шанс,
00:03:45что модель скажет «она красивая». Вы не знаете наверняка, был ли у этого слова повышенный
00:03:49шанс из-за водяного знака. Но человек с ключом будет знать, каким словам отдавался
00:03:55тяжелее. И тогда это дает им некоторую вероятность, которая говорит пользователю, у которого
00:04:01есть ключ, то есть европейским регуляторам: «Хорошо, здесь есть 90-процентная вероятность, что этот текст, 100-процентная вероятность, 99-процентная вероятность, что этот
00:04:09текст был написан с помощью Claude или этот текст был написан с помощью ИИ». Вот как это работает. Теперь,
00:04:15идея здесь в том, что слова, которые модель выбирает для изменения и которым придает больший вес с помощью водяных знаков,
00:04:20не изменят общего смысла предложения. Это не изменит ваш результат.
00:04:24Это не изменит производительность. И когда мы говорим конкретно о коде, это не изменит
00:04:28код так, чтобы повлиять на то, как будет выглядеть результат. И это не изменит факты.
00:04:34Знаете, если говорится, что это историческое событие произошло 8 октября... ну,
00:04:41это не изменит формулировку, верно? Это факт. Оно произошло 8 октября. Это не будет
00:04:45изменено. Но это упрощенное, опять же, упрощенное объяснение того, как работает эта система.
00:04:52Anthropic пока не раскрыла точный алгоритм работы, но мы можем
00:04:57экстраполировать это из научных работ DeepMind. И то, что вы также должны были извлечь из этого,
00:05:02это то, что наличие этого ключа — единственный способ узнать, написан ли текст ИИ на основе системы водяных знаков.
00:05:08И этот ключ не является общедоступным. Чтобы получить к нему доступ, нужно запросить разрешение. Публичного
00:05:12Вероятно, для этого нужно быть каким-то регулятором ЕС. Поэтому любой, кто заявляет:
00:05:16«О, эй, вот мой сайт, который может определить, есть ли водяной знак», — лжет, такого не существует.
00:05:21Если вы хотите углубиться в то, как работают текстовые водяные знаки, у Anthropic есть собственная
00:05:25статья. И они действительно пытаются донести мысль, что это не повлияет на результаты.
00:05:29Таким образом, система водяных знаков, по сути, сводится к тому, что определенные слова выбираются чаще других.
00:05:35И это статистический алгоритм, который вы, конечный пользователь, никогда не сможете разгадать, если
00:05:40у вас есть ключ. Так как же это исправить? Достаточно ли просто немного отредактировать тексты,
00:05:47которые выдает нам Claude, в надежде, что это сработает? Или нам нужно полностью переписать текст?
00:05:52И как его переписать? Ведь нельзя использовать Claude для переписывания этого предложения,
00:05:56потому что на него тоже поставят водяной знак. И вы также не можете использовать ChatGPT. И Gemini тоже.
00:06:01Так что ваши варианты становятся вполне очевидными. Вам нужно переписать значительные части текста,
00:06:09сохранив при этом общую атмосферу. И вам нужно использовать либо XAI. То есть либо Grok, либо,
00:06:16какую-нибудь открытую модель, верно? Какую-нибудь китайскую модель,
00:06:21которую вы можете скачать и запустить на своем компьютере, которая, во-первых, будет бесплатной, а во-вторых, на которую не распространяются
00:06:28эти законы о водяных знаках. Как эта система выглядит на практике? Вы получаете все обычные результаты от Claude.
00:06:33И если вы создали что-то вроде длинной записи в блоге, и не хотите, чтобы ее пометили водяным знаком, мы берем этот результат.
00:06:37Затем вы отправляете его в какую-нибудь локальную модель. И Claude может сделать это за вас. Существует множество отличных локальных моделей,
00:06:42которые можно загрузить через Ollama. Эта локальная модель берется за работу.
00:06:47Она переписывает текст. Вы даете ей промпт: «Эй, я хочу, чтобы ты,
00:06:51знаешь, сохранила общий тон. Можешь добавить свои голосовые заметки и все прочее».
00:06:55знаешь, сохранить саму суть. Можешь добавить свои голосовые заметки, что угодно». И затем, когда
00:07:01это будет готово, оно просто отправит точный ответ обратно в Claude. И вы можете делать
00:07:05с ним всё, что захотите. Теперь ещё одна переменная, о которой нужно подумать во всём этом
00:07:09процессе — это длина ваших результатов. То есть, о каком количестве токенов идет речь? Ведь, и это не
00:07:14чтобы API обнаружения (если он запущен) мог с какой-то степенью уверенности заявить, что текст написан ИИ.
00:07:19Потому что, если я пишу комментарии в LinkedIn вроде «Она прекрасна», сможет ли API действительно определить,
00:07:25написано это с помощью Claude или нет? Нет. Поэтому, если вы сильно переживаете по поводу того,
00:07:31что ваши тексты будут помечены водяными знаками и приписаны Claude, просто спросите себя:
00:07:37«Пишу ли я тексты, достаточно длинные, чтобы это вообще имело значение?» Если речь идет о постах в LinkedIn, комментариях
00:07:41объемом менее 100 слов или около того — пожалуй, нет. Но если мы говорим об огромных статьях в блогах на тысячи слов,
00:07:46то да, этот водяной знак вас затронет. И будет очень очевидно,
00:07:51что текст написан с помощью Claude. Самый простой способ все это настроить — скачать Ollama,
00:07:56Теперь самый простой способ всё это настроить — скачать Ollama,
00:08:00загрузить локальную модель, подходящую под ваше железо, а затем создать навык в
00:08:05Claude, который при вызове отправляет ваш текст этой локальной модели, она полностью его переписывает,
00:08:10вас и Claude через весь этот процесс. Вы просто копируете и вставляете его в Claude. Модель выполнит
00:08:15анализ вашего оборудования, выяснит, какая локальная модель вам подходит, скачает и установит Ollama,
00:08:20если вы еще этого не сделали. Затем она создаст для вас навык
00:08:24и задаст вопросы, чтобы понять точную стилистику переписывания текста.
00:08:28В общем, внедрит ваш голос, подберет примеры и все в таком духе. Ссылку на это я оставлю ниже.
00:08:35И вместо того чтобы разбирать все это шаг за шагом в течение следующих 10 минут,
00:08:40просто запустите этот промпт, и он сделает все за вас. Надеюсь, это объяснение
00:08:44принципа работы водяных знаков было понятным. Это не настоящий водяной знак. За кулисами ничего не пишется.
00:08:48Там нет никакого кода. Просто определенные слова используются чаще.
00:08:53Вы понятия не имеете, что это за конкретные слова. Единственный способ узнать — это иметь
00:08:57Вы понятия не будете иметь, что это за конкретные слова. Единственный способ узнать — если у вас
00:09:02есть ключ к водяному знаку, которого у вас нет, если только вы не какой-нибудь регулятор. Так что любой,
00:09:07кто утверждает, что может распознать водяной знак, практически вам лжет. Так что знайте это сразу.
00:09:11И основываясь на том, как это работает, опять же, вы можете изучить ту работу DeepMind, если хотите. Единственный способ
00:09:16А единственный способ сделать это — использовать модель с открытым исходным кодом.
00:09:20К тому же это будет самым дешевым вариантом. Так что, если вы хотите заполучить этот промпт,
00:09:24вы найдете его внизу. Надеюсь, это кому-то из вас поможет. Честно говоря,
00:09:29мне кажется, вся эта шумиха вокруг проставления водяных знаков и тому подобного сильно раздута.
00:09:33У большинства людей, использующих ИИ для написания текстов, и так до боли очевидно,
00:09:38что это сделал ИИ, потому что они понятия не имеют, как сделать текст более человечным или похожим на их собственный.
00:09:43И если мы не придем к ситуации, когда повсюду, куда бы вы ни публиковали материалы,
00:09:49на каждом веб-сайте будет стоять какой-нибудь детектор водяных знаков и это станет огромным моветоном...
00:09:52Опять же, все, что нам нужно сделать — это прогнать текст через локальную модель, и вы практически в безопасности.
00:09:58Опять же, всё, что нам нужно сделать, это прогнать это через локальную модель, и вы вроде как на свободе.
00:10:02Так что дайте мне знать, что вы думаете. Обязательно загляните в Chase AI+, чтобы получить доступ к
00:10:06мастер-классу по Cloud Code, если вы хотите погрузиться в это глубже.
00:10:10До встречи!

Key Takeaway

Обход скрытых водяных знаков Fable 5.1 осуществляется путем автоматической переписке текстов через локальные модели с помощью Ollama, что нейтрализует статистические маркеры Anthropic.

Highlights

  • Модель Fable 5.1 от Anthropic добавляет скрытые водяные знаки ко всем результатам генерации с 2 августа 2026 года в соответствии с Законом ЕС об искусственном интеллекте.

  • Механизм водяных знаков основан на статье Google 2024 года и алгоритме SynthID, изменяющем вероятностные веса (softmax) конкретных слов без искажения смысла текста.

  • Секретный ключ для расшифровки водяных знаков доступен исключительно европейским регуляторам, поэтому сторонние публичные детекторы водяных знаков неэффективны.

  • Для устранения водяного знака используется локальная языковая модель через Ollama, которая переписывает сгенерированный текст в исходном стиле пользователя.

  • Водяные знаки имеют практическое значение только для объемных материалов вроде длинных статей, тогда как короткие посты и комментарии не поддаются надежному обнаружению.

Timeline

Внедрение водяных знаков в Fable 5.1

  • Компания Anthropic выпустила модель Fable 5.1 с обязательным добавлением водяных знаков ко всему выходящему контенту.
  • Нововведение обусловлено требованиями Закона ЕС об искусственном интеллекте для отслеживания текстов, созданных нейросетями.

Модели, выпущенные после 2 августа 2026 года, подпадают под европейские нормативные акты. Разработчики утверждают, что изменения минимальны и не влияют на качество кода или фактические данные.

Принцип работы технологии водяных знаков

  • Алгоритм водяных знаков базируется на принципах из научной работы Google 2024 года о масштабируемой идентификации результатов языковых моделей.
  • Система искусственно повышает вероятностные веса (softmax) определенных слов при генерации, создавая статистический паттерн.
  • Секретный ключ расшифровки находится исключительно у регуляторов, исключая достоверность сторонних онлайн-детекторов.

Модель выбирает слова из равновероятных вариантов, смещая распределение в сторону заранее определенных маркеров. Изменения не затрагивают общий смысл, фактологию и работоспособность кода, а проверка возможна только при наличии закрытого ключа.

Методы удаления и нейтрализации водяных знаков

  • Редактирование текста через другие крупные коммерческие ИИ-системы неэффективно, так как они также используют водяные знаки.
  • Локальная обработка текста через модели на базе Ollama полностью стирает статистические маркеры генерации.
  • Короткие текстовые сообщения и комментарии не накапливают достаточного объема токенов для надежного обнаружения водяных знаков.

Использование утилит вроде Ollama на локальном оборудовании позволяет переформулировать объемные статьи с сохранением авторского стиля. Автоматизация процесса через специальные промпты исключает ручное исправление и защищает контент от алгоритмического анализа.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video