Что нового в инженерии инференса — Филип Кили, Baseten

AAI Engineer
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00Я здесь, чтобы рассказать о новинках в инженерии инференса. Всем привет, я Филипп, и я здесь,
00:00:19потому что написал книгу. Я уже третий год на AI Engineer World's Fair, и это моя любимая
00:00:24конференция во всем мире. Это главное событие года для меня. Свое
00:00:29становление как спикера и инженера я начал именно здесь в 2024 году, вернулся в 2025-м и много чего сделал.
00:00:36И вот я снова тут. Обожаю это место и очень благодарен организаторам за приглашение. Я написал
00:00:44книгу «Inference Engineering», мы опубликовали ее 3–4 месяца назад, и я просто
00:00:49поражен откликом. Мы выпустили её 23 февраля, и на текущий момент
00:00:57распродали более 11 000 печатных копий, подбираемся к 30 000 цифровых копий, а 24 миллиона
00:01:04человек по всему миру (или 24 миллиона аккаунтов в Twitter, так что посмотрим, сколько это людей)
00:01:09увидели что-то об инженерии инференса. И на фоне такого теплого приема
00:01:17мне постоянно задают один и тот же вопрос: «Зачем вообще ты это сделал? Зачем
00:01:23писать книгу о том, что меняется так быстро?». Знаете, я верю, что многие
00:01:29принципы инженерии инференса к настоящему моменту уже закрепились, и есть много того, что
00:01:34мы можем изучать и применять от поколения к поколению моделей. Но сегодня я здесь, чтобы рассказать
00:01:42о новинках в этой сфере. Это первое публичное дополнение со свежими данными с момента выхода книги.
00:01:48Мы немного повторим базовые принципы инженерии инференса, а затем обсудим
00:01:54все, что произошло в мире инференса с 23 февраля 2026 года. Поговорим о том,
00:02:00что стало с TurboQuant, затронем тему KV-уплотнения (compaction), уделим много
00:02:05времени D-Flash и другим интересным новинкам в спекулятивном декодировании. А в конце
00:02:12я немного попрогнозирую, сделаю пару предсказаний о том, что ждет инференс
00:02:17в будущем, и чем я надеюсь поделиться с вами в следующий раз, когда вы увидите меня на этой сцене.
00:02:23Отлично, давайте начинать. В ходе множества бесед
00:02:30об инференсе я выделил несколько общих принципов. И
00:02:38один из главных… Недавно я был на подкасте у Сары, мы обсуждали инференс,
00:02:44и сейчас отчетливо выделились два направления. Есть локальный инференс,
00:02:48где главная стратегия — просто заставить модель работать на любом имеющемся железе,
00:02:56сжимая ее квантованием, дистилляцией, прунингом — чем угодно, распараллеливая по всем
00:03:02видеокартам, которые есть дома. Сначала вы заставляете её работать, а потом делаете «менее глупой»:
00:03:09устраняете критические проблемы, возникшие из-за сжатия,
00:03:15и пытаетесь вернуть исходный уровень интеллекта при размере батча 1. А есть
00:03:20мой мир — мир дата-центров и больших батчей. Здесь подход такой: запустите всё,
00:03:27соберите vLLM, заставьте работать, а затем сделайте «менее медленным» с помощью KV-маршрутизации, спекуляции,
00:03:33дезагрегации. И я думаю, что этим двум мирам есть чему научиться друг у друга.
00:03:40В этом докладе я сосредоточусь на достижениях в инженерии инференса для дата-центров,
00:03:46поскольку это то, в чем я разбираюсь. Но и в мире локального инференса происходит много крутого.
00:03:52В своей книге «Inference Engineering» я исходил из того, что веса — это готовый продукт. Я
00:03:58все еще считаю, что переход от обучения к инференсу важно принимать во внимание,
00:04:03и это хороший способ разграничить эти области. Однако в последнее время я все чаще вижу,
00:04:10что многие оптимизации инференса закладываются еще на этапе обучения. Границы между
00:04:17обучением и инференсом становятся все более размытыми, и это важный тренд.
00:04:22Запускается циклический процесс: ускорение инференса дает больше данных, на которых обучается
00:04:28более совершенная модель, что дает еще более быстрый инференс и еще больше данных, и так по кругу,
00:04:33пока вы не станете сказочно богаты. Итак, говоря об обучении для инференса,
00:04:39нам нужно обсудить ряд новых методов из «большой тройки». Мы поговорим
00:04:45о новостях в квантовании, кэшировании (в частности, о механизме KV-кэша) и
00:04:52спекулятивном декодировании. В мире инференса много всего интересного,
00:04:57включая темы, которые я затрону в конце, но когда речь заходит о повседневной практике —
00:05:02как сделать конкретную модель быстрее, — чаще всего выбирают именно эти три подхода.
00:05:09Итак, февраль, я выпускаю книгу и горжусь собой: «Вау,
00:05:16все, что нужно знать об инференсе, собрано в одном месте!». И тут у нас появляются новости
00:05:23новости из мира квантования. Напомню: квантование — это когда мы используем менее точный формат чисел с меньшим разрядом,
00:05:32чтобы сэкономить пропускную способность, снизить нагрузку на вычисления, улучшить TTFT и TPS. Это
00:05:39обычно привязано к железу и снижает затраты, хотя и может немного ухудшить качество модели.
00:05:45Кстати, если хотите послушать мой разбор темы квантования, я выступал на AI Engineer
00:05:51в Майами в прошлом месяце. Я рассказывал, почему квантование вовсе не такое зло, как кажется, и что
00:05:57есть много способов сохранить качество. В общем, я был доволен тем, как раскрыл тему,
00:06:04а потом 20 миллионов человек увидели TurboQuant. Это даже вызвало кратковременное проседание акций производителей памяти,
00:06:12потому что все подумали: «Ого, память теперь станет намного эффективнее,
00:06:16нам больше не нужно столько флеш-памяти». Что было ошибкой, но, так или иначе, появился этот новый
00:06:23подход к квантованию, набравший популярность в марте этого года. Он использует полярные координаты
00:06:29и позволяет сжимать KV-кэш до 4 бит. Вокруг этого был дикий хайп, и я подумал:
00:06:36«Блин, я упустил целый пласт темы! И как всё это теперь выглядит?»
00:06:43Наша команда провела исследование. Если вы знаете интерна из Ватерлоо в Twitter —
00:06:50Али из нашей группы оптимизации моделей (не уверен, интерн ли он всё ещё),
00:06:57в общем, он из Ватерлоо. Он написал отличную статью про математику, стоящую за TurboQuant.
00:07:04Главное преимущество TurboQuant — возможность кодировать KV-кэш 4 битами
00:07:09вместо 8. Вы экономите половину памяти и пропускной способности, получая двукратный прирост
00:07:14скорости при перемещении KV-кэша в системной памяти. Но минус весьма существенен.
00:07:21Оказалось, что для TurboQuant требуются дополнительные вычисления на этапе прямого прохода,
00:07:25чтобы учесть это при декодировании. В итоге TPS падает более чем вдвое — неприемлемый компромисс
00:07:32для большинства реальных задач в продакшене. Мы внимательно изучили TurboQuant, но не применяем
00:07:38его на боевых нагрузках. Мы всё ещё используем традиционное квантование NVFP4.
00:07:44Тем не менее, это отличная техника для локального инференса. Если вы запускаете модель,
00:07:51особенно языковую модель с большим контекстом, на своем ПК или на GPU у себя в подвале,
00:07:58вы жестко ограничены объемом памяти — это главное узкое место. И всё, что освобождает память
00:08:04от KV-кэша и позволяет уместить более длинные последовательности, будет очень полезно.
00:08:09А дополнительные вычисления при прямом проходе окажутся не столь критичным минусом.
00:08:16Так что TurboQuant — потрясающее научное исследование и отличный метод, который просто оказался
00:08:22не столь применимым для инференса в дата-центрах, как могло показаться сначала. Вместо этого мы
00:08:28фокусируемся на NVFP4, делая упор на квантование весов, а не KV-кэша.
00:08:36Пытаемся сгладить погрешности квантования весов, следим, чтобы распределения вероятностей
00:08:41не искажались. Для самого KV-кэша мы используем маршутизацию с учетом KV, сброс, шаринг KV,
00:08:49применяем NCCL, NVIDIA Dynamo и другие инструменты для перемещения KV-кэша
00:08:55внутри системы и его выгрузки в оперативную память процессора, а не пытаемся сжимать его через TurboQuant.
00:09:04Кроме того, мы работаем над квантованием для разных модальностей, думая о том,
00:09:11как применить преимущества NVFP4 не только к языковым моделям, но и к моделям генерации изображений и видео.
00:09:17Али также опубликовал много классных материалов об этом в X/Twitter, советую почитать.
00:09:23Тем не менее, KV-кэш остаётся крайне важным, так что давайте поговорим о нем и об упаковывании KV-кэша.
00:09:29Снова краткий повтор: если подать тот же промпт с тем же префиксом, можно повторно использовать
00:09:35токена, рассчитанные на этапе префилла в прошлый раз. Это делает всю систему быстрее и эффективнее.
00:09:42В целом, KV-кэш — это память без потерь. В системе инференса есть лишь пару источников
00:09:48памяти без потерь: содержимое промпта, контекст и KV-кэш.
00:09:55И всё это растет линейно с увеличением объема передаваемых данных. И когда речь заходит
00:09:59о последовательностях в миллион токенов, объемы становятся очень внушительными. Поэтому многие задумались,
00:10:05как сжимать память и контекст. Агентские фреймворки сжимают контекст, RAG-поиск —
00:10:11все эти техники, о которых мы говорим годами, представляют собой своего рода сжатие
00:10:17большого контекста в нечто компактное, что можно передать модели или записать в файлы.
00:10:22Все эти методы растут сублинейно относительно объема данных. Но что, если есть серединный путь?
00:10:28Что, если можно существенно сжать сохраняемые данные, сохранив информацию почти без потерь?
00:10:34Существует много способов определить, что именно стоит удерживать в кэше.
00:10:41Недавние методы упаковывания показали, что кэш можно заменить намного более коротким.
00:10:47гораздо более коротким. Есть работы вроде Attention Matching и Cartridges, которые показывают отличные
00:10:53результаты с высокой степенью сжатия. Но оба этих метода запускаются во время инференса. Опять же, одна из тем,
00:11:00о которых я хочу поговорить, — это обучение с прицелом на инференс. В данном случае
00:11:05я хочу представить метод STILL от исследовательской команды BaseTen, где синтез поверх
00:11:12кэша — когда мы храним обученное представление информации, а не сам контент
00:11:17напрямую или его детерминированное подмножество — амортизируется за счет обучения. Чарли и Мудит из
00:11:25нашей команды пост-обучения провели отличную презентацию на Cosa Compile. Она есть на YouTube. Я очень
00:11:31рекомендую посмотреть ее, если вам интересно сжатие KV-кэша. К сожалению,
00:11:37у меня нет ни времени, ни гениальности, чтобы объяснить всё здесь, но базовый механизм заключается в том,
00:11:46что STILL — это «узкое горлышко» Perceiver, которое берет фиксированный набор обученных векторов запросов, сопоставляет их
00:11:53с полным KV-кэшем через cross-attention и за один прямой проход генерирует сжатые ключи и значения.
00:11:59Это создает быструю дифференцируемую сжатую память, к которой LLM обращается как к реальному контексту.
00:12:05Так что, если вас интересует сжатие KV-кэша, обязательно ознакомьтесь с работой Чарли и Мудита.
00:12:09Это действительно потрясающая тема. Итак, мы рассмотрели две техники:
00:12:16квантование и кэширование. Последняя — спекулятивное декодирование, и здесь многое изменилось.
00:12:21Напомню: при спекулятивном декодировании мы берем черновики токенов, проверяем их
00:12:29во время прямого прохода и используем для генерации более чем одного токена за проход.
00:12:34Это сильно помогает увеличить количество токенов в секунду и является оптимизацией без потерь,
00:12:40что здорово, ведь нам не нужно переживать за качество. В истории развития спекулятивного декодирования
00:12:46все эти методы описаны в книге. Был SpecDec, где маленькая модель из того же семейства
00:12:52генерировала токенов-черновики. Но оказалось, что маленькие модели не очень хорошо подходят на эту роль.
00:12:58Они просто хорошие компактные модели. Поэтому индустрия придумала новые методы, вроде Medusa,
00:13:04где к модели добавляются дополнительные декодирующие головы, а затем появился Eagle 3, где за основу взяли идею:
00:13:09что если обучить модель на миллиард параметров на скрытых состояниях целевой модели
00:13:15для генерации драфт-токенов? И это сработало отлично.
00:13:21Примерно до февраля прошлого года — а точнее, февраля этого года — Eagle 3 оставался лучшим методом
00:13:27в спекулятивном декодировании. Но теперь у нас есть dFlash. dFlash еще лучше — это диффузия для спекуляции.
00:13:36dFlash создает сразу последовательность токенов-черновиков, а не один токен. Это диффузионная языковая модель,
00:13:43то есть она генерирует всю последовательность токенов так же, как модель генерации видео или изображений создает
00:13:49последовательность кадров или пикселей и итерирует по ним, вместо авторегрессионной
00:13:55потокеновой генерации. Модели dFlash могут работать в 2–4 раза медленнее, но при этом предсказывают
00:14:018 или 16 токенов за один раз за то же окно, тогда как Eagle создает лишь по одному токену. Поэтому один
00:14:08прямой проход dFlash быстрее всей фазы генерации Eagle и дает больше токенов. Эти токены могут
00:14:14взаимодействовать через cross-attention и обеспечивают более высокий уровень принятых токенов, а в спекуляции
00:14:21процент принятия решает всё. На практике мы видим прирост более чем в 3 раза благодаря dFlash.
00:14:30Это измерено на одной B200 с Qwen 38B. По сравнению с Eagle, это существенный прогресс —
00:14:40как в коэффициенте принятия токенов, так и в скорости генерации (токен/с). Модели dFlash обучены с маской внимания для
00:14:47двунаправленного черновика. Целевая модель предоставляет контекст, а внутри каждого блока
00:14:54выбирается подмножество «чистых» токенов. Маска внимания обеспечивает
00:14:59причинно-следственную последовательность, но всё же допускает двунаправленное внимание, тогда как в
00:15:06традиционной авторегрессионной модели вы смотрите на токены только в одном направлении. Именно поэтому мы можем
00:15:13эффективно использовать эту диффузионную архитектуру. И вот, когда я думал, что закончил,
00:15:19пару дней назад вышел dSpark. dFlash у нас уже работает в продакшене,
00:15:25а dSpark — это свежее исследование. Так что о нем я могу сказать лишь то, что он существует, он крут и мы
00:15:31изучаем его. В отличие от dFlash, там используется не только диффузионная модель, но и
00:15:38последовательная модель. Идея в том, чтобы повысить процент принятия токенов за счет их
00:15:45совместной работы, а не использовать только итеративный, диффузионный
00:15:51или авторегрессионный спекулятор. dSpark крайне интересен, но у нас пока нет
00:15:57результатов из продакшена, чтобы поделиться ими. Надеюсь, они появятся к следующему разу.
00:16:03А вот где у нас есть результаты, так это в непрерывном дообучении спекулятора. Мы снова
00:16:09возвращаемся к dFlash. Суть в том, что спекулятивное декодирование сильно зависит от
00:16:15конкретного содержания промптов и ответов, обрабатываемых вашей системой. И если вы
00:16:21постоянно дообучаете спекулятор на реальных промптах и ответах, вы можете получить прирост доли
00:16:29принятых токенов от 20% до 2 раз. На самом деле это очень сложно сделать: требуется много
00:16:36памяти, а также нужно убедиться в наличии прав на использование данных таким образом.
00:16:40Это требует огромных вычислительных ресурсов и постоянной передачи данных. К тому же,
00:16:46при изменении основной модели приходится менять и спекулятор. Однако глядя
00:16:51в будущее, я уверен, что непрерывная спекуляция для очень крупных систем станет целесообразной
00:16:58оптимизацией. Что же дальше в сфере инференса? Вся дальнейшая информация — это личное мнение, гипотезы
00:17:06и публичные данные. Если бы я знал что-то о готовящихся релизах, я бы всё равно не мог
00:17:11об этом говорить. Так что это просто мое видение. Я прошёл
00:17:17уже три цикла аппаратного обеспечения: релизы Ampere, Hopper и Blackwell. И всегда
00:17:23требуется время с момента отгрузки чипов до их установки в дата-центрах и адаптации
00:17:30всего программного стека под их возможности. Но меня вдохновляет то,
00:17:36что с выходом Rubin производительность в формате NVFP4 обещает быть фантастической.
00:17:44Чем больше методов мы заимствуем из локального инференса и чем увереннее запускаем
00:17:49модели в формате NVFP4, тем эффективнее мы сможем использовать невероятную
00:17:54производительность будущих систем Rubin. Я также думаю, что дезагрегация и связь
00:18:00на уровне всей системы будут играть всё более важную роль. Мы видим отличные первые результаты от PD-
00:18:05дезагрегации, и возможность передавать данные — например, KV-кэш — по всей системе
00:18:12станет критически важной. И, как я уже говорил, подход «обучения для инференса»
00:18:17продолжит оказывать огромное влияние на индустрию в будущем. Огромное спасибо всем вам
00:18:25за то, что пришли на мой доклад. Я есть в X (Twitter) и LinkedIn, а также раздаю бесплатные книги.
00:18:32Вы можете скачать PDF по QR-коду или пройти со мной к стенду BaseTen, чтобы получить печатный экземпляр
00:18:37книги «Inference Engineering». У нас там приличный запас, возможно, хватит всем, а если нет — курьер
00:18:43привезет еще из офиса. Так что я буду внизу у стенда BaseTen. Всем огромное
00:18:48спасибо и отличного дня!

핵심 요약

Развитие инженерии инференса смещается в сторону оптимизаций на этапе обучения, где метод сжатия KV-кэша STILL и диффузионный спекулятор dFlash обеспечивают трехкратный прирост скорости генерации в дата-центрах.

하이라이트

  • Книга «Inference Engineering» распродана тиражом более 11 000 печатных и около 30 000 цифровых копий.

  • Метод квантования TurboQuant позволяет сжимать KV-кэш до 4 бит, но снижает генерацию токенов в секунду (TPS) более чем в два раза.

  • Сжатие KV-кэша с помощью метода STILL использует архитектуру Perceiver cross-attention для создания дифференцируемой сжатой памяти за один прямой проход.

  • Диффузионная модель dFlash генерирует 8 или 16 токенов за один раз, обеспечивая ускорение инференса Qwen 38B на B200 более чем в 3 раза по сравнению с Eagle 3.

  • Непрерывное дообучение спекулятора на реальных промптах и ответах увеличивает долю принятых токенов в диапазоне от 20% до 200%.

타임라인

Разделение инженерии инференса на локальный уровень и дата-центры

  • Инженерия инференса разделилась на локальную оптимизацию ресурсов и ускорение масштабных батчей в дата-центрах.
  • Границы между обучением моделей и их инференсом постепенно размываются.

Локальный инференс ориентирован на запуск моделей на ограниченном пользовательском железе путем агрессивного сжатия через квантование, дистилляцию и прунинг при размере батча 1. В дата-центрах ключевой задачей является сокращение задержек крупных систем с помощью KV-маршрутизации, спекулятивного декодирования и дезагрегации. Оптимизация инференса начинает закладываться еще на этапе обучения, формируя замкнутый цикл: быстрый инференс дает больше данных для обучения более качественных моделей.

Ограничения TurboQuant и альтернативные способы работы с KV-кэшем

  • TurboQuant сжимает KV-кэш до 4 бит в полярных координатах, но не подходит для дата-центров.
  • Для серверных нагрузок эффективнее использовать квантование весов NVFP4 и системную маршрутизацию кэша.

Сжатие KV-кэша до 4 бит с помощью TurboQuant экономит половину памяти и вдвое ускоряет его перемещение в системной памяти. Однако дополнительные вычисления на этапе прямого прохода снижают показатель TPS больше чем в два раза, что делает метод неприменимым для дата-центров. Технология востребована на локальных ПК, где объем памяти является главным узким местом. В инфраструктуре дата-центров приоритет отдается квантованию весов в NVFP4, а для KV-кэша используются маршрутизация, сброс и разгрузка в CPU через NCCL и NVIDIA Dynamo.

Сжатие контекста и технология STILL

  • Метод STILL амортизирует синтез KV-кэша за счет обучения.
  • Архитектура Perceiver преобразует полный KV-кэш в компактное дифференцируемое представление.

Передача контекста размером в миллион токенов требует сублинейных методов сжатия памяти. Метод STILL от команды BaseTen использует блок Perceiver, который сопоставляет обученные векторы запросов с полным KV-кэшем через cross-attention. За один прямой проход генерируются сжатые ключи и значения, к которым языковая модель обращается как к полноценному контексту.

Эволюция спекулятивного декодирования: dFlash, dSpark и непрерывное дообучение

  • Диффузионная модель dFlash превосходит авторегрессионный спекулятор Eagle 3.
  • Непрерывное дообучение спекулятора повышает процент принятия токенов до двух раз.

В отличие от Eagle 3, генерирующего черновики поочередно, dFlash создает всю последовательность из 8 или 16 токенов за один раз с помощью диффузионного подхода. Двунаправленное внимание внутри блоков увеличивает процент принятых токенов, обеспечивая ускорение более чем в 3 раза на GPU B200 для модели Qwen 38B. Новый метод dSpark совмещает диффузионную и последовательную модели. Постоянное дообучение спекулятора на входящем потоке промптов дата-центра дополнительно повышает точность предсказаний, несмотря на высокие требования к памяти и вычислительным ресурсам.

Перспективы аппаратного обеспечения и архитектур инференса

  • Архитектура NVIDIA Rubin повысит производительность вычислений в формате NVFP4.
  • Дезагрегация префилла и декодирования (PD) станет стандартом для передачи KV-кэша по всей системе.

Внедрение каждого нового поколения GPU требует времени на адаптацию программного стека. Переход на архитектуру Rubin позволит масштабировать использование формата NVFP4, перенесенного из сферы локального инференса. Ключевую роль в крупных системах займет PD-дезагрегация, позволяющая передавать KV-кэш между узлами дата-центра.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기