Что нового в инженерии инференса — Филип Кили, Baseten
AAI Engineer
Computing/SoftwareInternet Technology
Transcript
00:00:00Я здесь, чтобы рассказать о новинках в инженерии инференса. Всем привет, я Филипп, и я здесь,
00:00:19потому что написал книгу. Я уже третий год на AI Engineer World's Fair, и это моя любимая
00:00:24конференция во всем мире. Это главное событие года для меня. Свое
00:00:29становление как спикера и инженера я начал именно здесь в 2024 году, вернулся в 2025-м и много чего сделал.
00:00:36И вот я снова тут. Обожаю это место и очень благодарен организаторам за приглашение. Я написал
00:00:44книгу «Inference Engineering», мы опубликовали ее 3–4 месяца назад, и я просто
00:00:49поражен откликом. Мы выпустили её 23 февраля, и на текущий момент
00:00:57распродали более 11 000 печатных копий, подбираемся к 30 000 цифровых копий, а 24 миллиона
00:01:04человек по всему миру (или 24 миллиона аккаунтов в Twitter, так что посмотрим, сколько это людей)
00:01:09увидели что-то об инженерии инференса. И на фоне такого теплого приема
00:01:17мне постоянно задают один и тот же вопрос: «Зачем вообще ты это сделал? Зачем
00:01:23писать книгу о том, что меняется так быстро?». Знаете, я верю, что многие
00:01:29принципы инженерии инференса к настоящему моменту уже закрепились, и есть много того, что
00:01:34мы можем изучать и применять от поколения к поколению моделей. Но сегодня я здесь, чтобы рассказать
00:01:42о новинках в этой сфере. Это первое публичное дополнение со свежими данными с момента выхода книги.
00:01:48Мы немного повторим базовые принципы инженерии инференса, а затем обсудим
00:01:54все, что произошло в мире инференса с 23 февраля 2026 года. Поговорим о том,
00:02:00что стало с TurboQuant, затронем тему KV-уплотнения (compaction), уделим много
00:02:05времени D-Flash и другим интересным новинкам в спекулятивном декодировании. А в конце
00:02:12я немного попрогнозирую, сделаю пару предсказаний о том, что ждет инференс
00:02:17в будущем, и чем я надеюсь поделиться с вами в следующий раз, когда вы увидите меня на этой сцене.
00:02:23Отлично, давайте начинать. В ходе множества бесед
00:02:30об инференсе я выделил несколько общих принципов. И
00:02:38один из главных… Недавно я был на подкасте у Сары, мы обсуждали инференс,
00:02:44и сейчас отчетливо выделились два направления. Есть локальный инференс,
00:02:48где главная стратегия — просто заставить модель работать на любом имеющемся железе,
00:02:56сжимая ее квантованием, дистилляцией, прунингом — чем угодно, распараллеливая по всем
00:03:02видеокартам, которые есть дома. Сначала вы заставляете её работать, а потом делаете «менее глупой»:
00:03:09устраняете критические проблемы, возникшие из-за сжатия,
00:03:15и пытаетесь вернуть исходный уровень интеллекта при размере батча 1. А есть
00:03:20мой мир — мир дата-центров и больших батчей. Здесь подход такой: запустите всё,
00:03:27соберите vLLM, заставьте работать, а затем сделайте «менее медленным» с помощью KV-маршрутизации, спекуляции,
00:03:33дезагрегации. И я думаю, что этим двум мирам есть чему научиться друг у друга.
00:03:40В этом докладе я сосредоточусь на достижениях в инженерии инференса для дата-центров,
00:03:46поскольку это то, в чем я разбираюсь. Но и в мире локального инференса происходит много крутого.
00:03:52В своей книге «Inference Engineering» я исходил из того, что веса — это готовый продукт. Я
00:03:58все еще считаю, что переход от обучения к инференсу важно принимать во внимание,
00:04:03и это хороший способ разграничить эти области. Однако в последнее время я все чаще вижу,
00:04:10что многие оптимизации инференса закладываются еще на этапе обучения. Границы между
00:04:17обучением и инференсом становятся все более размытыми, и это важный тренд.
00:04:22Запускается циклический процесс: ускорение инференса дает больше данных, на которых обучается
00:04:28более совершенная модель, что дает еще более быстрый инференс и еще больше данных, и так по кругу,
00:04:33пока вы не станете сказочно богаты. Итак, говоря об обучении для инференса,
00:04:39нам нужно обсудить ряд новых методов из «большой тройки». Мы поговорим
00:04:45о новостях в квантовании, кэшировании (в частности, о механизме KV-кэша) и
00:04:52спекулятивном декодировании. В мире инференса много всего интересного,
00:04:57включая темы, которые я затрону в конце, но когда речь заходит о повседневной практике —
00:05:02как сделать конкретную модель быстрее, — чаще всего выбирают именно эти три подхода.
00:05:09Итак, февраль, я выпускаю книгу и горжусь собой: «Вау,
00:05:16все, что нужно знать об инференсе, собрано в одном месте!». И тут у нас появляются новости
00:05:23новости из мира квантования. Напомню: квантование — это когда мы используем менее точный формат чисел с меньшим разрядом,
00:05:32чтобы сэкономить пропускную способность, снизить нагрузку на вычисления, улучшить TTFT и TPS. Это
00:05:39обычно привязано к железу и снижает затраты, хотя и может немного ухудшить качество модели.
00:05:45Кстати, если хотите послушать мой разбор темы квантования, я выступал на AI Engineer
00:05:51в Майами в прошлом месяце. Я рассказывал, почему квантование вовсе не такое зло, как кажется, и что
00:05:57есть много способов сохранить качество. В общем, я был доволен тем, как раскрыл тему,
00:06:04а потом 20 миллионов человек увидели TurboQuant. Это даже вызвало кратковременное проседание акций производителей памяти,
00:06:12потому что все подумали: «Ого, память теперь станет намного эффективнее,
00:06:16нам больше не нужно столько флеш-памяти». Что было ошибкой, но, так или иначе, появился этот новый
00:06:23подход к квантованию, набравший популярность в марте этого года. Он использует полярные координаты
00:06:29и позволяет сжимать KV-кэш до 4 бит. Вокруг этого был дикий хайп, и я подумал:
00:06:36«Блин, я упустил целый пласт темы! И как всё это теперь выглядит?»
00:06:43Наша команда провела исследование. Если вы знаете интерна из Ватерлоо в Twitter —
00:06:50Али из нашей группы оптимизации моделей (не уверен, интерн ли он всё ещё),
00:06:57в общем, он из Ватерлоо. Он написал отличную статью про математику, стоящую за TurboQuant.
00:07:04Главное преимущество TurboQuant — возможность кодировать KV-кэш 4 битами
00:07:09вместо 8. Вы экономите половину памяти и пропускной способности, получая двукратный прирост
00:07:14скорости при перемещении KV-кэша в системной памяти. Но минус весьма существенен.
00:07:21Оказалось, что для TurboQuant требуются дополнительные вычисления на этапе прямого прохода,
00:07:25чтобы учесть это при декодировании. В итоге TPS падает более чем вдвое — неприемлемый компромисс
00:07:32для большинства реальных задач в продакшене. Мы внимательно изучили TurboQuant, но не применяем
00:07:38его на боевых нагрузках. Мы всё ещё используем традиционное квантование NVFP4.
00:07:44Тем не менее, это отличная техника для локального инференса. Если вы запускаете модель,
00:07:51особенно языковую модель с большим контекстом, на своем ПК или на GPU у себя в подвале,
00:07:58вы жестко ограничены объемом памяти — это главное узкое место. И всё, что освобождает память
00:08:04от KV-кэша и позволяет уместить более длинные последовательности, будет очень полезно.
00:08:09А дополнительные вычисления при прямом проходе окажутся не столь критичным минусом.
00:08:16Так что TurboQuant — потрясающее научное исследование и отличный метод, который просто оказался
00:08:22не столь применимым для инференса в дата-центрах, как могло показаться сначала. Вместо этого мы
00:08:28фокусируемся на NVFP4, делая упор на квантование весов, а не KV-кэша.
00:08:36Пытаемся сгладить погрешности квантования весов, следим, чтобы распределения вероятностей
00:08:41не искажались. Для самого KV-кэша мы используем маршутизацию с учетом KV, сброс, шаринг KV,
00:08:49применяем NCCL, NVIDIA Dynamo и другие инструменты для перемещения KV-кэша
00:08:55внутри системы и его выгрузки в оперативную память процессора, а не пытаемся сжимать его через TurboQuant.
00:09:04Кроме того, мы работаем над квантованием для разных модальностей, думая о том,
00:09:11как применить преимущества NVFP4 не только к языковым моделям, но и к моделям генерации изображений и видео.
00:09:17Али также опубликовал много классных материалов об этом в X/Twitter, советую почитать.
00:09:23Тем не менее, KV-кэш остаётся крайне важным, так что давайте поговорим о нем и об упаковывании KV-кэша.
00:09:29Снова краткий повтор: если подать тот же промпт с тем же префиксом, можно повторно использовать
00:09:35токена, рассчитанные на этапе префилла в прошлый раз. Это делает всю систему быстрее и эффективнее.
00:09:42В целом, KV-кэш — это память без потерь. В системе инференса есть лишь пару источников
00:09:48памяти без потерь: содержимое промпта, контекст и KV-кэш.
00:09:55И всё это растет линейно с увеличением объема передаваемых данных. И когда речь заходит
00:09:59о последовательностях в миллион токенов, объемы становятся очень внушительными. Поэтому многие задумались,
00:10:05как сжимать память и контекст. Агентские фреймворки сжимают контекст, RAG-поиск —
00:10:11все эти техники, о которых мы говорим годами, представляют собой своего рода сжатие
00:10:17большого контекста в нечто компактное, что можно передать модели или записать в файлы.
00:10:22Все эти методы растут сублинейно относительно объема данных. Но что, если есть серединный путь?
00:10:28Что, если можно существенно сжать сохраняемые данные, сохранив информацию почти без потерь?
00:10:34Существует много способов определить, что именно стоит удерживать в кэше.
00:10:41Недавние методы упаковывания показали, что кэш можно заменить намного более коротким.
00:10:47гораздо более коротким. Есть работы вроде Attention Matching и Cartridges, которые показывают отличные
00:10:53результаты с высокой степенью сжатия. Но оба этих метода запускаются во время инференса. Опять же, одна из тем,
00:11:00о которых я хочу поговорить, — это обучение с прицелом на инференс. В данном случае
00:11:05я хочу представить метод STILL от исследовательской команды BaseTen, где синтез поверх
00:11:12кэша — когда мы храним обученное представление информации, а не сам контент
00:11:17напрямую или его детерминированное подмножество — амортизируется за счет обучения. Чарли и Мудит из
00:11:25нашей команды пост-обучения провели отличную презентацию на Cosa Compile. Она есть на YouTube. Я очень
00:11:31рекомендую посмотреть ее, если вам интересно сжатие KV-кэша. К сожалению,
00:11:37у меня нет ни времени, ни гениальности, чтобы объяснить всё здесь, но базовый механизм заключается в том,
00:11:46что STILL — это «узкое горлышко» Perceiver, которое берет фиксированный набор обученных векторов запросов, сопоставляет их
00:11:53с полным KV-кэшем через cross-attention и за один прямой проход генерирует сжатые ключи и значения.
00:11:59Это создает быструю дифференцируемую сжатую память, к которой LLM обращается как к реальному контексту.
00:12:05Так что, если вас интересует сжатие KV-кэша, обязательно ознакомьтесь с работой Чарли и Мудита.
00:12:09Это действительно потрясающая тема. Итак, мы рассмотрели две техники:
00:12:16квантование и кэширование. Последняя — спекулятивное декодирование, и здесь многое изменилось.
00:12:21Напомню: при спекулятивном декодировании мы берем черновики токенов, проверяем их
00:12:29во время прямого прохода и используем для генерации более чем одного токена за проход.
00:12:34Это сильно помогает увеличить количество токенов в секунду и является оптимизацией без потерь,
00:12:40что здорово, ведь нам не нужно переживать за качество. В истории развития спекулятивного декодирования
00:12:46все эти методы описаны в книге. Был SpecDec, где маленькая модель из того же семейства
00:12:52генерировала токенов-черновики. Но оказалось, что маленькие модели не очень хорошо подходят на эту роль.
00:12:58Они просто хорошие компактные модели. Поэтому индустрия придумала новые методы, вроде Medusa,
00:13:04где к модели добавляются дополнительные декодирующие головы, а затем появился Eagle 3, где за основу взяли идею:
00:13:09что если обучить модель на миллиард параметров на скрытых состояниях целевой модели
00:13:15для генерации драфт-токенов? И это сработало отлично.
00:13:21Примерно до февраля прошлого года — а точнее, февраля этого года — Eagle 3 оставался лучшим методом
00:13:27в спекулятивном декодировании. Но теперь у нас есть dFlash. dFlash еще лучше — это диффузия для спекуляции.
00:13:36dFlash создает сразу последовательность токенов-черновиков, а не один токен. Это диффузионная языковая модель,
00:13:43то есть она генерирует всю последовательность токенов так же, как модель генерации видео или изображений создает
00:13:49последовательность кадров или пикселей и итерирует по ним, вместо авторегрессионной
00:13:55потокеновой генерации. Модели dFlash могут работать в 2–4 раза медленнее, но при этом предсказывают
00:14:018 или 16 токенов за один раз за то же окно, тогда как Eagle создает лишь по одному токену. Поэтому один
00:14:08прямой проход dFlash быстрее всей фазы генерации Eagle и дает больше токенов. Эти токены могут
00:14:14взаимодействовать через cross-attention и обеспечивают более высокий уровень принятых токенов, а в спекуляции
00:14:21процент принятия решает всё. На практике мы видим прирост более чем в 3 раза благодаря dFlash.
00:14:30Это измерено на одной B200 с Qwen 38B. По сравнению с Eagle, это существенный прогресс —
00:14:40как в коэффициенте принятия токенов, так и в скорости генерации (токен/с). Модели dFlash обучены с маской внимания для
00:14:47двунаправленного черновика. Целевая модель предоставляет контекст, а внутри каждого блока
00:14:54выбирается подмножество «чистых» токенов. Маска внимания обеспечивает
00:14:59причинно-следственную последовательность, но всё же допускает двунаправленное внимание, тогда как в
00:15:06традиционной авторегрессионной модели вы смотрите на токены только в одном направлении. Именно поэтому мы можем
00:15:13эффективно использовать эту диффузионную архитектуру. И вот, когда я думал, что закончил,
00:15:19пару дней назад вышел dSpark. dFlash у нас уже работает в продакшене,
00:15:25а dSpark — это свежее исследование. Так что о нем я могу сказать лишь то, что он существует, он крут и мы
00:15:31изучаем его. В отличие от dFlash, там используется не только диффузионная модель, но и
00:15:38последовательная модель. Идея в том, чтобы повысить процент принятия токенов за счет их
00:15:45совместной работы, а не использовать только итеративный, диффузионный
00:15:51или авторегрессионный спекулятор. dSpark крайне интересен, но у нас пока нет
00:15:57результатов из продакшена, чтобы поделиться ими. Надеюсь, они появятся к следующему разу.
00:16:03А вот где у нас есть результаты, так это в непрерывном дообучении спекулятора. Мы снова
00:16:09возвращаемся к dFlash. Суть в том, что спекулятивное декодирование сильно зависит от
00:16:15конкретного содержания промптов и ответов, обрабатываемых вашей системой. И если вы
00:16:21постоянно дообучаете спекулятор на реальных промптах и ответах, вы можете получить прирост доли
00:16:29принятых токенов от 20% до 2 раз. На самом деле это очень сложно сделать: требуется много
00:16:36памяти, а также нужно убедиться в наличии прав на использование данных таким образом.
00:16:40Это требует огромных вычислительных ресурсов и постоянной передачи данных. К тому же,
00:16:46при изменении основной модели приходится менять и спекулятор. Однако глядя
00:16:51в будущее, я уверен, что непрерывная спекуляция для очень крупных систем станет целесообразной
00:16:58оптимизацией. Что же дальше в сфере инференса? Вся дальнейшая информация — это личное мнение, гипотезы
00:17:06и публичные данные. Если бы я знал что-то о готовящихся релизах, я бы всё равно не мог
00:17:11об этом говорить. Так что это просто мое видение. Я прошёл
00:17:17уже три цикла аппаратного обеспечения: релизы Ampere, Hopper и Blackwell. И всегда
00:17:23требуется время с момента отгрузки чипов до их установки в дата-центрах и адаптации
00:17:30всего программного стека под их возможности. Но меня вдохновляет то,
00:17:36что с выходом Rubin производительность в формате NVFP4 обещает быть фантастической.
00:17:44Чем больше методов мы заимствуем из локального инференса и чем увереннее запускаем
00:17:49модели в формате NVFP4, тем эффективнее мы сможем использовать невероятную
00:17:54производительность будущих систем Rubin. Я также думаю, что дезагрегация и связь
00:18:00на уровне всей системы будут играть всё более важную роль. Мы видим отличные первые результаты от PD-
00:18:05дезагрегации, и возможность передавать данные — например, KV-кэш — по всей системе
00:18:12станет критически важной. И, как я уже говорил, подход «обучения для инференса»
00:18:17продолжит оказывать огромное влияние на индустрию в будущем. Огромное спасибо всем вам
00:18:25за то, что пришли на мой доклад. Я есть в X (Twitter) и LinkedIn, а также раздаю бесплатные книги.
00:18:32Вы можете скачать PDF по QR-коду или пройти со мной к стенду BaseTen, чтобы получить печатный экземпляр
00:18:37книги «Inference Engineering». У нас там приличный запас, возможно, хватит всем, а если нет — курьер
00:18:43привезет еще из офиса. Так что я буду внизу у стенда BaseTen. Всем огромное
00:18:48спасибо и отличного дня!
Community Posts
No posts yet. Be the first to write about this video!
Write about this video