Эта открытая модель исправляет главный недостаток ИИ (ThinkingCap)
BBetter Stack
Computing/SoftwareSmall Business/Startups
Transcript
00:00:00Это один и тот же вопрос, заданный той же базовой модели.
00:00:03Посмотрите на счетчики токенов здесь.
00:00:05Одна из них тратит много времени на рассуждения над вопросом,
00:00:09в то время как другая уже справилась с задачей.
00:00:12И если мы проверим оба результата, ответ на вопрос практически совпадает.
00:00:16Но модель справа потратила гораздо больше токенов на тот же вывод.
00:00:21И это здорово, ведь единственное различие между этими двумя моделями
00:00:24заключается в том, что на левой запущена Thinking Cap,
00:00:27специально дообученная версия той же модели,
00:00:31которая призвана обеспечить такое же качество ответов
00:00:34при меньшем расходе токенов и двукратном ускорении получения ответа.
00:00:39Поэтому в сегодняшнем видео мы рассмотрим Thinking Cap,
00:00:42посмотрим, как она работает, а затем протестируем ее самостоятельно
00:00:45чтобы понять, действительно ли это инновационный подход к дообучению ИИ-моделей.
00:00:50Будет очень интересно, так что давайте погрузимся в тему.
00:00:57Прежде чем говорить о Thinking Cap, давайте немного вернемся назад и посмотрим, как мы вообще к этому пришли.
00:01:03Самая первая общедоступная модель GPT-3 была запущена еще в 2020 году,
00:01:09а в конце 2022 года
00:01:11ChatGPT впервые предоставил GPT-3.5 в распоряжение широкой публики.
00:01:17Именно тогда у большинства людей началось знакомство с искусственным интеллектом.
00:01:21GPT-4 последовала за ней в 2023 году, став еще одним скачком в возможностях,
00:01:25но в основе своей сохраняла ту же концепцию.
00:01:28Прогнозировать следующий токен и отвечать немедленно.
00:01:31Но затем, в сентябре 2024 года, OpenAI выпустила O1,
00:01:37и это была первая модель, которая использовала режим размышления перед ответом.
00:01:42Поэтому вместо того, чтобы сразу выдать отклик,
00:01:45она тратила дополнительное время и токены на обдумывание проблемы.
00:01:49Этот единственный архитектурный сдвиг положил начало эре моделей рассуждения.
00:01:54DeepSeek R1 появилась несколько месяцев спустя
00:01:56и принесла ту же концепцию в мир открытого исходного кода.
00:02:00И довольно быстро
00:02:01рассуждения стали тем, что выпускал каждый крупный разработчик ИИ-моделей.
00:02:05Но теперь, чуть больше года спустя,
00:02:08мы начинаем наблюдать противоположную тенденцию.
00:02:11Модели дообучаются специально для того, чтобы думать меньше, а не больше.
00:02:15В некотором роде мы возвращаемся к истокам,
00:02:17но с учетом всего опыта, полученного за эру рассуждений.
00:02:21Но вот в чем дело.
00:02:22Этот сдвиг в сторону усиления размышлений решил одну проблему и тихо создал другую.
00:02:28Никто на самом деле не научил эти модели, когда нужно прекращать думать.
00:02:31Если вы спросите модель рассуждений о чем-то действительно простом,
00:02:34она все равно сожжет тысячи токенов,
00:02:37переосмысливая то, что она уже поняла три предложения назад,
00:02:41повторяя ту же мысль другими словами
00:02:44или, в худшем случае, начнет зацикливаться.
00:02:48И я говорю это почти буквально.
00:02:50Позвольте мне показать вам один из самых нелепых примеров, с которыми я сталкивался.
00:02:54Это step 3.5 flash.
00:02:56И когда я тестировал эту модель рассуждений,
00:02:58я просто отправил ей одно слово: “привет”.
00:03:01И посмотрите, что она с этим делает.
00:03:03Она тратит несколько абзацев на обсуждение того, обязана ли она представляться своим точным названием модели,
00:03:09значит ли фраза “всегда используйте точное имя при представлении”, что она должна представляться каждый раз или только по своему выбору.
00:03:19Затем она взвешивает, уместно ли упоминать сегодняшнюю дату.
00:03:22И в конце концов, после всего этого, выдает ответ, который любой из нас напечатал бы секунд за двадцать.
00:03:28Привет, я step 3.5 flash.
00:03:31Чем я могу помочь вам сегодня?
00:03:33Так что это на самом деле не рассуждения.
00:03:35Это модель, обученная думать, но ее никогда не учили понимать, когда размышления закончены.
00:03:41Теперь о BottleCap AI — европейском стартапе, специализирующемся на повышении эффективности инференса.
00:03:47И то, что они сделали с Thinking Cap, честно говоря, очень умно.
00:03:51Они взяли модель Qwen 3.6 с 27 миллиардами параметров
00:03:55и не пытались сделать ее умнее, не обучали ее новым навыкам, не меняли ее характер и не трогали ее поведение в плане безопасности.
00:04:04Единственное, что они хотели изменить, — это сколько вычислительных ресурсов оно тратит на получение ответа, который и так было способно выдать.
00:04:11И это звучит просто, но на деле оказывается сложнее, чем кажется.
00:04:15Ленивый способ ускорить модель — просто прервать ее рассуждения.
00:04:20Заставить ее остановиться после определенного количества токенов, закончила она или нет.
00:04:25Это определенно сократит количество токенов.
00:04:27Но это также приведет к тому, что модель станет чаще ошибаться, потому что иногда ей действительно нужны эти дополнительные шаги.
00:04:34Так что настоящая инженерная задача здесь — не сделать ответ короче.
00:04:38А сделать его короче, не превращая модель в тайную глупышку.
00:04:42И вот как они это сделали.
00:04:44Взяв за основу базовую контрольную точку Qwen 3.6 с 27 миллиардами параметров,
00:04:48они обучили ее на тщательно подобранном наборе задач из разных доменов и уровней сложности.
00:04:55И вместо того, чтобы вознаграждать модель за правильный ответ,
00:04:58модель вознаграждали за то, что она дает правильный ответ эффективно.
00:05:02Потому что если модель получает награду только за правильность, многословие ничего не стоит.
00:05:08Нет стимула прекращать размышления раньше.
00:05:10Но явно вознаграждая за эффективность наряду с правильностью,
00:05:14модель учится понимать, когда у нее уже достаточно данных для ответа.
00:05:19В итоге у них получилась модель, которая ведет себя практически так же, как оригинал.
00:05:23А теперь давайте взглянем на цифры, потому что тут начинается самое интересное.
00:05:27На 12 бенчмарках вне обучающей выборки, то есть на задачах, которых не было в тренировочных данных,
00:05:33Thinking Cap сократила токены размышлений в среднем на 45,8%.
00:05:37А точность почти не изменилась.
00:05:40В среднем она изменилась менее чем на один процентный пункт.
00:05:43А на бенчмарках из обучающего домена
00:05:46сокращение токенов оказалось еще больше — почти 58%.
00:05:49А на GSM 8K точность даже выросла с 93,3% до 96,5%.
00:05:58Также они отслеживали показатель зацикливания.
00:06:00Как часто модель застревает, перефразируя одни и те же мысли снова и снова без результата,
00:06:06как мы только что видели в примере с Step 3.5 Flash.
00:06:10Этот показатель тоже снизился на большинстве бенчмарков,
00:06:12что говорит о том, что значительная часть дополнительных размышлений моделей была бесполезной.
00:06:18Это был просто шум, который выглядел как усердие.
00:06:21Ладно, цифры на бумаге — это одно, но давайте протестируем ее сами.
00:06:26Я запускаю этот тест на машине с RTX 5090 и 64 гигабайтами оперативки.
00:06:32И я задам обеим моделям один и тот же вопрос.
00:06:35Каково наименьшее положительное целое число n, при котором n! имеет ровно 100 нулей на конце?
00:06:42Чтобы получить ответ на этот вопрос, нужно использовать формулу Лежандра,
00:06:47которая для данного конкретного вопроса дает ответ 405.
00:06:51Здесь есть только один правильный ответ.
00:06:53Промежуточных вариантов нет.
00:06:55Так что если мы получим 405, мы поймем, что модель ответила верно.
00:07:00Сначала запустим стандартную квантованную модель Quen 3.6 с 27 миллиардами параметров
00:07:05и посмотрим, как она справляется.
00:07:07Как видите, с самого начала скорость генерации токенов не так уж плоха.
00:07:12Она составляет около 60 токенов в секунду.
00:07:14Но посмотрите, как много эта модель думает.
00:07:17Это просто невероятно.
00:07:20Прошло уже больше минуты, а она все еще выдает токены только для этапа рассуждений.
00:07:26Мне пришлось ускорить запись, потому что общее время превысило две минуты.
00:07:30Но в конце концов мы получили правильный результат — 405, и это хорошо.
00:07:37Но посмотрите на общее затраченное время.
00:07:39Оно составило 140 секунд.
00:07:41И взгляните на расход токенов.
00:07:43Более 7000 токенов ушло только на рассуждения, и всего 900 — на вывод самого ответа.
00:07:52Этот пример наглядно показывает, насколько безумно Quen рассуждает над каждым запросом.
00:07:59Теперь переключимся на версию той же модели с Thinking Cap.
00:08:02Напомню, мы используем ту же модель на 27 миллиардов параметров с тем же квантованием.
00:08:08Как видите, прошло 20 секунд, и она уже закончила рассуждения.
00:08:13Всего 9 секунд спустя мы получаем ответ, который в данном случае тоже верный — 405.
00:08:19Посмотрите, какая колоссальная разница.
00:08:21Мало того, что мы потратили в общей сложности менее 2000 токенов, из которых на размышления ушло всего 1100,
00:08:30так еще и скорость генерации выросла до 62 токенов в секунду.
00:08:36По всем параметрам эта модель просто уделывает базовую Quen 3.6.
00:08:42Она быстрее, эффективнее, требует меньше токенов и дает тот же правильный ответ.
00:08:48Так что это довольно впечатляющее улучшение.
00:08:51Вот деталь из их отчета, о которой нельзя не упомянуть, так как это забавная случайность.
00:08:57Их изначальной целью было сократить только цепочку размышлений,
00:09:02оставив финальный ответ точно такой же длины, как раньше.
00:09:06Но у них был баг.
00:09:07Сокращение случайно затронуло и финальный ответ, а не только размышления.
00:09:12Они исправили баг, но, судя по всему, внутренне всем больше понравилась версия с багом.
00:09:18Поэтому их теория заключается в том, что люди устают писать длинные ответы, поэтому мы естественно сжимаем то, что говорим.
00:09:25А у этих моделей до сих пор не было такой утомляемости.
00:09:29В итоге они все равно выпустили сломанную лаконичную версию, а технически правильную приберегли на будущее.
00:09:37Вот такие дела, друзья.
00:09:38Это Thinking Cap в двух словах.
00:09:40Главный вывод здесь в том, что мы всегда верили: чем больше модель думает, тем она умнее.
00:09:48Тогда как Thinking Cap доказала, что это не всегда так.
00:09:53Если правильно обучить модель, можно получить результат того же качества за малую часть затрат и практически без потерь.
00:10:01Если вы хотите попробовать модель самостоятельно, она в свободном доступе на Hugging Face по лицензии Apache 2.0.
00:10:08И я хочу услышать ваше мнение, друзья.
00:10:10Что вы думаете об этом новом подходе?
00:10:12Видите ли вы какие-то плюсы или минусы у этой техники?
00:10:15Дайте нам знать в комментариях ниже.
00:10:17И если вам нравятся такие технические разборы, пожалуйста, дайте мне знать, нажав кнопку лайка под видео.
00:10:23А также не забудьте подписаться на наш канал.
00:10:26С вами был Андрес из BetterStack, увидимся в следующих видео.