Инфраструктурное облако ИИ-инференса для агентов — Бён-Гон (Гон) Чун, FriendliAI

AAI Engineer
컴퓨터/소프트웨어창업/스타트업AI/미래기술

스크립트

00:00:00Давайте начинать. Всем привет, спасибо, что пришли. Уже конец дня в заключительный день, поэтому я очень ценю ваше присутствие.
00:00:25Меня зовут Гон, я основатель и CEO Friendly AI. Сегодня я хочу поговорить об агентном инференсе. Сначала я расскажу, что изменилось, почему это важно и как мы перестраиваем облако инференса для агентов.
00:00:40Прежде чем углубиться, позвольте кратко представить Friendly AI. Friendly AI — это передовое облако инференса ИИ для агентов.
00:00:50В масштабе, быстрее, дешевле и надежнее. Мы выросли из исследовательской группы Сеульского национального университета, и эти исследовательские корни до сих пор определяют то, кто мы.
00:01:02Мы — команда, создавшая непрерывное батчивание (continuous batching), оптимизацию инференса, ставшую стандартом во всей индустрии, а наша работа над ORCA вдохновила vLLM, широко используемый открытый фреймворк.
00:01:15Сегодня мы работаем по всему миру: штаб-квартира находится в Сан-Франциско, а команда в Сеуле занимается масштабированием передового инференса.
00:01:24Как вы знаете, 2026 год — это год, когда агенты массово выходят в продакшен, и это связано со слиянием двух трендов.
00:01:33Во-первых, происходит экспоненциальный рост агентов. ИИ-агенты обеспечивают взрывное внедрение в сфере ПО, операционной деятельности и интеллектуального труда.
00:01:45Во-вторых, открытые модели достигли передового уровня и сделала агентов экономически выгодными. Теперь они соперничают по возможностям с проприетарными передовыми моделями, а это значит, что вы можете запускать агентов передового качества на открытых моделях с гораздо меньшими затратами на токены.
00:02:00Позвольте показать: открытые модели теперь достаточно сильны для подобных реальных агентных процессов.
00:02:13Здесь мы дали двум моделям абсолютно одинаковую задачу — создать игру в жанре Tower Defense с помощью кодинг-агента.
00:02:19Слева — GLM 5.2, открытая модель, работающая на Friendly AI. Справа — Opus 4.8 от Anthropic.
00:02:29Главное здесь не то, что результаты идентичны. Главное — обе модели справляются с задачей на уровне, вполне пригодном к использованию.
00:02:38Для многих агентных сценариев открытые модели превзошли порог качества, но экономика тут совсем иная.
00:02:49Для той же задачи Opus 4.8 стоит около $1,50. GLM 5.2 на Friendly AI стоит $0,27 — в 5,6 раза дешевле.
00:03:03И в этом суть того, о чем я говорил раньше: открытые модели дадут вам передовых агентов за долю стоимости.
00:03:12Но стоимость модели — лишь часть истории. Чтобы сделать агентов по-настоящему быстрыми и надежными, меняться должен сам стек инференса.
00:03:22Давайте посмотрим, что на самом деле происходит внутри агентной нагрузки.
00:03:28Прежде всего взглянем на изменения в рабочей нагрузке. Раньше доминирующим сценарием был чат.
00:03:34Базовой единицей был запрос. Человек задает вопрос, модель отвечает, человек читает.
00:03:41Задержка означала, как быстро я получу один ответ. У агентов всё иначе. Базовая единица — это задача.
00:03:49Задача может включать много вызовов модели, много вызовов инструментов и выполняться автономно в течение некоторого времени.
00:03:58Так что пользователя не особо волнует задержка одного отдельного запроса.
00:04:04Пользователя волнует, когда будет завершена вся задача целиком.
00:04:08Это значит, что мы должны оптимизировать процесс под задачи, а не только под отдельные запросы.
00:04:16Рассмотрим агентные нагрузки подробнее. Агент, по сути, запускает сессию, состоящую из задач.
00:04:23Каждая задача обычно выполняется в цикле. Сначала планирование — как правило, это вызов LLM.
00:04:29Затем действие — возможно, через вызов инструмента. Затем получение результата и добавление его обратно в контекст.
00:04:38И цикл повторяется, пока задача не будет выполнена.
00:04:41Таким образом, происходит постоянное чередование инференса LLM и выполнения одного или нескольких внешних инструментов.
00:04:50Поэтому между вызовами LLM есть паузы. Агент также может создавать субагентов и запускать их параллельно.
00:05:01Входные данные агента также сильно отличаются от чата. На этом графике показано распределение длины промпта и ответа для наших внутренних прогонов кодинг-агента на GLM 5.2, которые мы используем ежедневно.
00:05:15Они значительно длиннее. Они растут по мере выполнения задачи, так как каждый полученный результат добавляется обратно в контекст.
00:05:25Здесь есть одна важная закономерность: последовательные шаги агента обычно имеют огромный общий префикс.
00:05:32Если мы пересчитываем один и тот же префикс каждый раз, мы впустую тратим много ресурсов на уже сделанную работу.
00:05:40И это одна из главных возможностей для оптимизации в агентном инференсе.
00:05:46Так насколько же агенты «прожорливы» к токенам?
00:05:49Давайте рассмотрим пример длительной задачи, такой как глубокое исследование (deep research).
00:05:53Мы объясняли фреймворк спекулятивного декодирования в vLLM с помощью кода на GLM 5.2 в Friendly AI.
00:06:02Здесь есть несколько этапов, и каждый этап состоит из субагентов, которые делают множество инференсов и вызовов инструментов.
00:06:12Таким образом, процесс может включать десятки или даже сотни шагов инференса, иногда растягиваясь на минуты или часы.
00:06:19И общий контекст продолжает расти всё это время.
00:06:23Для пользователя важна не задержка одного токена или одного вызова.
00:06:28Важно то, когда завершится вся его задача.
00:06:35Так что агентный инференс — это не просто чат с бóльшим количеством запросов.
00:06:39Это совсем другая проблема. Контекст растет со временем.
00:06:43Работа инструментов вклинивается между вызовами модели.
00:06:46Количество вызовов модели зависит от входных данных.
00:06:49Поэтому планировать исходя из фиксированной частоты запросов не получится.
00:06:55И реальная метрика — это сквозная задержка выполнения задачи, а не задержка одного запроса.
00:07:02Как же мы это делаем? Позвольте показать ключевую инженерную составляющую проекта.
00:07:23Вот карта нашей инженерной концепции.
00:07:27Мы строили этот стек слой за слоем вокруг агентных процессов.
00:07:33Есть четыре основных кипариса, о которых я расскажу сегодня.
00:07:37Кэширование префиксов, управление Key-Value (KV) кэшем, маршрутизация с учетом кэша и адаптивная оптимизация под агентов.
00:07:48И, разумеется, под этим нам нужна оптимизация на уровне модели, например, разреженное внимание (sparse attention) для длинных контекстов,
00:07:56методы снижения ошибок, быстрые кернелы, отказоустойчивое обслуживание и многое другое.
00:08:02В этом докладе я сосредоточусь на этих четырех столпах.
00:08:05Начнем с кэширования префиксов.
00:08:09Поскольку шаги агента имеют большой общий префикс, мы один раз вычисляем KV для префикса и кэшируем его.
00:08:17Затем на следующих шагах мы повторно используем закодированный KV и обрабатываем только новый суффикс.
00:08:23Чтение из кэша обходится значительно дешевле, чем повторные вычисления префикса (prefill),
00:08:27Поэтому это сокращает время до первого токена и снижает объём вычислений на каждом шаге.
00:08:33И чем дольше выполняется задача агента, тем ценнее становится этот подход.
00:08:41Но кэширование работает, только если KV-кэш помещается в память и эффективен в перемещении.
00:08:48Так что нам нужно эффективное управление KV-кэшем.
00:08:52Мы используем управление памятью в стиле Google, чтобы упаковать больше активных контекстов в память каждого GPU.
00:08:59Мы прибегаем к квантованию KV, чтобы уменьшить занимаемый объём памяти.
00:09:04Мы применяем иерархическое кэширование между памятью GPU, системной памятью и диском, выходя за пределы GPU.
00:09:13Также мы используем распределённое кэширование, чтобы один префикс мог обслуживаться между репликами, а не внутри одного инстанса.
00:09:26В масштабах глобального кластера критически важной становится маршрутизация.
00:09:29Примитивный балансировщик нагрузки может равномерно распределить запросы по кластерам GPU, но разрушит локальность кэша.
00:09:38Маршрутизатор с учётом кэша на глобальном уровне действует умнее.
00:09:42Он отправляет запрос на под, где нужный префикс уже закэширован, превращая полный prefill в считывание из кэша.
00:09:51При этом он всё ещё балансирует нагрузку, чтобы один под не становился узким местом.
00:09:58В этом примере оба запроса задачи A отправляются на один и тот же под для сохранения локальности кэша.
00:10:08Следующий элемент — оптимизация с учётом особенностей агентов.
00:10:11И это новый рубеж в области агентного инференса.
00:10:16Сегодня большинство систем планируют каждый вызов LLM так, будто он независим.
00:10:21Они не понимают, что этот вызов — часть более длинной агентной программы.
00:10:27Но если оптимизатор знает агентный контекст, он может принимать более удачные решения.
00:10:33Например, вытеснение нужной задачи, спекулятивный prefill контекста для вероятного следующего шага или лучшее вытеснение из кэша.
00:10:48Так что цель — сократить сквозную задержку выполнения задачи, а не просто ускорить один вызов.
00:10:58Когда мы объединяем всё это вместе, мы получаем главный результат.
00:11:01Мы используем ту же модель GLM 5.2 с Kilo Code для создания простой мобильной игры.
00:11:07Мы запустили ту же задачу через API Friendly AI и другого известного провайдера инференса.
00:11:14Как видите, Friendly AI завершает ту же сквозную задачу быстрее благодаря нашей агентно-центричной облачной архитектуре.
00:11:24Что же это дает на практике?
00:11:29Более мощный стек для продакшен-агентов.
00:11:32Возьмите агента, который вам уже нравится.
00:11:35И подключайте передовые модели с открытыми весами вроде GLM 5.2, MiniMax и Kimi на Friendly AI.
00:11:43Модель дает вам передовое качество, возможности и лучшую экономию.
00:11:49Friendly AI обеспечивает скорость, надёжность и производительность задач, необходимые в продакшене.
00:11:56Именно сочетание качества, скорости, надёжности и стоимости делает агентов действительно полезными и экономичными.
00:12:06Friendly AI сейчас обеспечивает работу команд в продакшене — от ИИ-стартапов до международных корпораций.
00:12:15Я бы хотел выделить парочку из них.
00:12:20Kilo — невероятно популярный агентный ИИ-инструмент для написания кода, обслуживающий миллионы пользователей.
00:12:27LG — международный гигант, чей бизнес охватывает всё: от электроники до здравоохранения и энергетики.
00:12:35Совершенно разные компании, но всем им нужно одно и то же.
00:12:39Быстрый, надёжный и экономичный агентный инференс.
00:12:45Этот отзыв от нашего клиента Kilo говорит сам за себя.
00:12:50За последний год Kilo Code протестировал нескольких провайдеров инференса с открытыми и закрытыми моделями.
00:12:56В сплит-тесте использования GLM 5 в сравнении с другими сторонними провайдерами и напрямую от лаборатории Zhipu AI,
00:13:05Friendly AI стабильно работала в 7 раз быстрее при значительно меньшем количестве ошибок.
00:13:12Сегодня Friendly AI — ключевой компонент стека Kilo.
00:13:17И вы можете использовать это так, как подходит вашему стеку.
00:13:23Model API — самый быстрый способ начать.
00:13:26Основные открытые передовые модели доступны через наш serverless API.
00:13:29Выделенные эндпоинты дают изолированное развёртывание с гарантированным SLA для продакшен-нагрузок.
00:13:36А BYOG (Bring Your Own GPU) позволяет запускать Friendly-инференс на вашей собственной инфраструктуре.
00:13:44Один стек, три способа развёртывания.
00:13:49Подводя итог, следует запомнить три вещи.
00:13:53Во-первых, передовые открытые модели делают агентные системы в продакшене экономически масштабируемыми.
00:13:59Во-вторых, агенты — это не просто чат с большим количеством вызовов.
00:14:03Агентный инференс требует оптимизации сквозной задержки с учётом упомянутых мной проблем.
00:14:10В-третьих, Friendly AI создана как облако инференса для современного мира.
00:14:16Быстрый, надёжный и экономичный агентный инференс.
00:14:23Спасибо за внимание.
00:14:25Если вы создаёте агентов, попробуйте передовые открытые модели на Friendly AI уже сегодня.
00:14:30Вы можете начать работу с Friendly AI за считанные минуты.
00:14:34И спасибо вам.
00:14:35Я буду неподалёку после выступления.
00:14:37Спасибо.
00:14:38Большое спасибо.

핵심 요약

Оптимизация сквозной задержки выполнения задач с помощью кэширования префиксов и маршрутизации с учетом KV-кэша позволяет открытым моделям на инфраструктуре FriendliAI работать в 7 раз быстрее и в 5,6 раза дешевле закрытых аналогов.

하이라이트

  • Создание метода continuous batching и фреймворка ORCA исследовательской группой из Сеульского национального университета заложило основу архитектуры vLLM.

  • Открытая модель GLM 5.2 на платформе FriendliAI выполняет агентную задачу кодинга за $0,27, что в 5,6 раза дешевле закрытой модели Opus 4.8 стоимостью $1,50.

  • Шаги ИИ-агентов имеют повторяющийся префикс контекста, поэтому кэширование префиксов сокращает время до первого токена и исключает повторный prefill.

  • Использование GLM 5 на FriendliAI обеспечивает 7-кратное ускорение выполнения агентных задач по сравнению со сторонними провайдерами и прямым API Zhipu AI.

타임라인

Истоки FriendliAI и эволюция инференса

  • Команда FriendliAI создала метод continuous batching в Сеульском национальном университете.
  • Архитектура системы ORCA стала основой для создания фреймворка vLLM.
  • Штаб-квартира компании находится в Сан-Франциско, а инженерная команда расположена в Сеуле.

FriendliAI выросла из академической исследовательской группы, специализирующейся на системах глубокого обучения. Разработанные командой методы батчинга и оптимизации инференса стали общеиндустриальным стандартом. Сегодня эти технологии адаптируются под специализированные облачные нагрузки.

Экономическая выгода открытых моделей для агентов

  • Открытые модели сравнялись по качеству с закрытыми проприетарными системами в агентных задачах.
  • Стоимость выполнения одной задачи генерации игры составляет $0,27 на GLM 5.2 против $1,50 на Opus 4.8.
  • Экономика открытых моделей делает массовый запуск агентов в продакшен финансово целесообразным.

При сравнении кодинг-агентов на базе GLM 5.2 и Opus 4.8 в задаче разработки игры Tower Defense обе системы показывают применимый в продакшене результат. Главное различие заключается в стоимости токенов, где открытые модели на специализированном инференсе дают снижение затрат более чем в 5 раз.

Специфика агентных нагрузок и проблема контекста

  • Базовой единицей рабочей нагрузки агента является автономная задача, а не одиночный запрос.
  • Главной метрикой производительности становится сквозная задержка выполнения всей задачи.
  • Контекст агента постоянно растет из-за добавления результатов работы внешних инструментов.

В отличие от классического чата, где человек ждет одного быстрого ответа, агент запускает длительный цикл из планирования, вызова инструментов и анализа результатов. Между обращениями к LLM возникают паузы, а объём входных данных растет с каждым шагом. Постоянный повторный перерасчет общего префикса приводит к неэффективному расходу вычислительных ресурсов GPU.

Четыре столпа архитектуры агентного инференса

  • Кэширование префиксов исключает повторные вычисления фазы prefill для повторяющихся частей контекста.
  • Иерархическое управление KV-кэшем выгружает данные из памяти GPU в системную память и на диск.
  • Глобальный маршрутизатор направляет запросы на те ноды, где нужный префикс уже находится в памяти.
  • Планировщик с учетом контекста программы выполняет спекулятивную подгрузку и оптимизирует вытеснение из кэша.

Инфраструктурный стек FriendliAI оптимизирован под специфику длительных сессий. Квантование и распределённое хранение KV-кэша позволяют удерживать гигантские контексты без переполнения памяти видеокарт. Умная маршрутизация сохраняет локальность данных и предотвращает повторный prefill на уровне всего кластера GPU.

Результаты тестирования и варианты развертывания

  • Сплит-тесты компании Kilo показали 7-кратное преимущество FriendliAI по скорости над другими провайдерами.
  • Платформа поддерживает три формата работы: Serverless Model API, Dedicated Endpoints и Bring Your Own GPU.
  • Снижение числа ошибок и гарантированный SLA обеспечивают стабильность нагрузок enterprise-уровня.

Практическое применение агентного стека подтверждено клиентами уровня Kilo Code и LG. Оптимизация сквозной задержки позволяет ускорить финальное выполнение задач разработки ПО и аналитики. Инфраструктура адаптивна и позволяет запускать модели как в публичном облаке, так и на собственных GPU клиента.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기