Рассогласование модальностей и атрибуция оригинальности в коротких видео — Адитья Гаутам, Meta
AAI Engineer
Computing/SoftwareInternet Technology
Transcript
00:00:00Адитья Рам: Всем привет, меня зовут Адитья, и мы поговорим о двух главных проблемах,
00:00:17возникающих на платформах с короткими видео.
00:00:20Мы обсудим, как решать эти задачи в больших масштабах.
00:00:25Для начала разберем особенности данных,
00:00:28с которыми мы работаем, две ключевые проблемы,
00:00:33и мультиагентные системы для их решения на масштабном уровне.
00:00:39Рассмотрим специализированные небольшие VLM для отдельной агентной задачи,
00:00:46способы создания таких агентов и методы их оптимизации
00:00:50для высокой масштабируемости, а затем перейдем к комплексной,
00:00:56всесторонней оценке на 360 градусов, не ограничиваясь точностью и полнотой.
00:01:00Что у нас есть?
00:01:01Как понять весь мультиагентный пайплайн — от LLM до инструментов, MCP и прочего.
00:01:08Всех доступных компонентов.
00:01:09Затем углубимся в методы оптимизации, специфичные для зрения
00:01:14и данных, которые дают нам логику понимания того,
00:01:20что сложный процесс нужен не для всех видео: мы можем выделить небольшой
00:01:25набор кандидатов для такой обработки.
00:01:29И завершим ключевыми выводами.
00:01:32Реальные данные очень хаотичны.
00:01:34Мы говорим о масштабах в 100+ миллионов и обилии вирусного контента.
00:01:39Много состязательного, вредоносного контента.
00:01:42Люди пытаются обмануть систему.
00:01:43На экранах, в видео и на изображениях полно многоязычного текста.
00:01:48При этом данные крайне динамичны.
00:01:50Они меняются от месяца к месяцу.
00:01:52Появляются новые ИИ-инструменты и многое другое.
00:01:54Всё меняется очень быстро.
00:01:57Из-за этого возникает дрейф данных и другие сопутствующие проблемы.
00:02:00Кроме того, у нас нет четкой эталонной истины для решаемой задачи.
00:02:05Таковы типы проблем, возникающие в реальных видеодатасетах.
00:02:10Первая проблема, которую мы рассмотрим — рассогласование модальностей.
00:02:14Межмодальное рассогласование — уже вполне решенная задача.
00:02:19Можно взять модель CLIP,
00:02:20сопоставить модальности изображений, видео, аудио, текста
00:02:25и вычислить косинусное сходство их эмбеддингов.
00:02:29Это куда более простая задача.
00:02:31Мы же поговорим о работе с внутримодальными проблемами.
00:02:37Представьте себе видеоролик.
00:02:39У нас есть длинное видео,
00:02:40и вдруг в нем появляется реклама, пропаганда, политика
00:02:45или что-то еще, чего не должно быть в ролике, который вы открыли.
00:02:49Как нам анализировать короткие фрагменты видео, выявлять эту проблему
00:02:54и находить аномалии или состязательные манипуляции,
00:02:59которых изначально там быть не должно?
00:03:01Первая проблема требует глубокого детализированного понимания видео
00:03:05и визуального ряда, чтобы отслеживать происходящее на уровне клипов и кадров.
00:03:10Вторая проблема — выявление неоригинального контента.
00:03:14Сегодня, с доступными ИИ-инструментами, дублировать контент стало очень легко.
00:03:19Когда кто-то выгружает видео, мы видим, как его копируют и видоизменяют,
00:03:25и благодаря новым инструментам преобразовывать видео всё проще.
00:03:29Как же нам детектировать такой неоригинальный контент?
00:03:33Как определить первоисточник видео?
00:03:35Это создаёт проблемы с атрибуцией, указанием авторства и дисбалансом экосистемы.
00:03:41А также приводит к усталости пользователей от обилия повторяющихся видео.
00:03:47Что касается мультиагентных систем: почему именно они,
00:03:54а не один агент или одна LLM? Потому что задача крайне сложна.
00:03:57Она требует узкоспециализированных узлов и глубокого понимания на каждом этапе:
00:04:04поиска, анализа контента и логического вывода.
00:04:07Если бы задачу можно было решить одной LLM, мультиагентная система бы не потребовалась.
00:04:14Вот как устроен центральный модуль и как происходят декомпозиция и анализ задачи.
00:04:22Сначала видео и его ID передаются агенту-рецензенту (Reviewer agent).
00:04:28Это центральный агент.
00:04:29По сути, он выступает оркестратором.
00:04:31Представьте его как API-шлюз для разложения сигналов и анализа визуала.
00:04:38Он обращается к агенту-восприятию (Perceiver agent), который представляет собой
00:04:46продвинутый VLM-эксперт с множеством инструментов для обработки видео и изображений.
00:04:52Perceiver получает ID от Reviewer и запрашивает видео из базы данных.
00:05:01Он разбивает его на части с помощью семантических эмбеддингов и анализа временных изменений.
00:05:08Детали этого метода выходят за рамки доклада, но он позволяет не использовать фиксированную частоту кадров,
00:05:17а находить точки изменений во времени и сжимать похожие кадры в 1–2 ключевых кадра.
00:05:23Затем Perceiver извлекает данные клипа и эмбеддинги, собирает теги, OCR, текстовые описания
00:05:34и временные метки кадров, формируя метаданные.
00:05:41Он передает эти данные рецензенту.
00:05:43Reviewer изучает сырой JSON с временной структурой, эмбеддингами, тегами и OCR от Perceiver
00:05:52и проводит временной анализ.
00:05:55Он видим, что с первого кадра по 360-й (первые 6 секунд) шло видео о спорте,
00:06:05а с 6.0 по 6.5 секунды видеоряд резко сменяется политической тематикой.
00:06:14Анализируя только метаданные, Reviewer способен обнаружить и понять суть аномалии
00:06:22во временном пространстве.
00:06:23После этого он определяет, является ли это рассогласованием модальностей или здесь более глобальная проблема.
00:06:30Reviewer обращается к агенту-поисковику (Retriever agent) с запросом на поиск аналогичных видео.
00:06:36Он передает обработанные и очищенные от дублей метаданные
00:06:41и просит найти похожие фрагменты в имеющемся корпусе.
00:06:47Retriever берет данные от Perceiver, метаданные клипа и видео, и индексирует их в разных БД.
00:06:57Например, темы можно организовать в виде инвертированного индекса.
00:07:02Для эмбеддингов применяются векторные базы данных.
00:07:06А извлеченные сущности заносятся в графовые базы данных для связывания метаданных.
00:07:16Это позволяет в онлайн-режиме быстро находить похожие клипы, темы и сущности, повышая полноту поиска (recall).
00:07:28Перейдем к отдельным агентам. Мы упоминали Perceiver.
00:07:32Он сканирует видео, разбивает его на клипы на основе алгоритмов и эмбеддингов, а тонко настроенная VLM выдает
00:07:45детализированную информацию о каждом фрагменте и обо всем ролике.
00:07:51Из-за огромных объемов мы не можем использовать стандартные коробочные VLM.
00:07:56Поэтому необходимы сжатие и экономичный подход к исполнению этих моделей в масштабе миллиардов кадров.
00:08:05Поэтому мы применяем предобучение, файнтюнинг, дистилляцию знаний и квантование
00:08:13для развертывания узкоспециализированных VLM.
00:08:16И кратко разберем этот процесс.
00:08:19Агент Retriever отвечает за поиск верхнего уровня.
00:08:22В офлайн-режиме он берет разобранные Perceiver сигналы
00:08:29и проводит их масштабный анализ (например, в кластере Ray).
00:08:34Собранные метаданные индексируются в базах данных.
00:08:37Периодическая офлайн-кластеризация выявляет похожий контент
00:08:42и присваивает ID кластеров и эмбеддингов для клипов и видео.
00:08:50Эти данные используются в онлайне для поиска похожих роликов.
00:08:56При онлайн-запросе с ID клипа и метаданными
00:09:01система определяет наиболее похожие материалы в базе.
00:09:06И находит варианты с высокой степенью сходства.
00:09:09Агент ищет похожие клипы, авторов и метаданные в базе данных.
00:09:16Переранжирует эти кандидаты и использует некоторые инструменты, например, традиционный спам-скор модели, как оценку классификатора,
00:09:24чтобы отсеять кандидатов, которые могут быть спамом или низкого качества.
00:09:29Получив топ N кандидатов, он передаёт их агенту-рецензенту.
00:09:33И рецензент их обрабатывает: вот основные контентные сигналы и эмбеддинги ролика,
00:09:39вот похожие видео от агента-поисковика.
00:09:42Подумаю над этим: нужно ли пересоздать запрос и запросить больше данных у поисковика?
00:09:48Таким образом, рецензент содержит все временные сигналы одного ролика.
00:09:52У него есть вся информация о похожих роликах, понимание аналогичных авторов и прочее.
00:09:58У него также есть информация в реальном времени о том, как пользователи взаимодействуют с видео.
00:10:03Какие поступают жалобы или комментарии, каков эмоциональный окрас этих комментариев.
00:10:13Многие из этих сигналов, упускаемые офлайн-обработкой, VLM и другими агентами,
00:10:18тоже учитываются, чтобы отслеживать смену тональности.
00:10:22Какую обратную связь я получаю в реальном времени?
00:10:25Для этого есть разные инструменты, позволяющие понимать видео не только по контенту
00:10:30и смыслу, но и с точки зрения взаимодействия пользователей.
00:10:36Эти сигналы очень, очень важны.
00:10:38Организовав этот процесс, мы построили агентную систему.
00:10:44И в этой системе все три агента работают на базе специализированных
00:10:50VLM и компактных VLM-моделей.
00:10:54Сначала поговорим о предобучении.
00:10:58Обычно как бывает: есть предобученная модель,
00:11:01вы немного донастраиваете свой Vision Transformer и адаптируете его под конкретную задачу.
00:11:08Проблема в том, что доступные общедоступные VLM-модели,
00:11:14обучены на очень чистых, качественных веб-данных, отлично очищенных и обработанных.
00:11:20Но внутренние данные для конкретной задачи обладают совершенно иными характеристиками.
00:11:26Они хаотичны.
00:11:27Они созданы пользователями.
00:11:28Они предназначены для вашего конкретного процесса.
00:11:30Это значит, что вам нужно дообучать Vision Transformer с нуля на этих токенах изображений и текста,
00:11:37чтобы оценить прирост от обучения с нуля по сравнению с донастройкой.
00:11:42Именно здесь помогает предобучение.
00:11:44Это немного затратно, но если есть прирост качества, это отлично работает.
00:11:50Второй этап — инструктивный файн-тюнинг (Instruction Fine-Tuning) для решения двух задач.
00:11:54У нас есть определенные правила и инструкции.
00:11:57Мы понимаем контент и сигналы, донастраивая модель на этих данных с целевой
00:12:04структурой вывода (например, JSON-схемой), чтобы выявлять несоответствие модальностей,
00:12:10дублирование оценок и пошаговые рассуждения от агента-рецензента.
00:12:16Итак, у нас есть видеоклип.
00:12:17Есть визуальный энкодер, который мы уже немного предобучили.
00:12:21И сейчас мы продолжаем его дообучать.
00:12:23Между Vision Transformer и языковой моделью находится проектор,
00:12:27служащий мостом между ними.
00:12:30Затем мы получаем вывод на основе данных инструктивного файн-тюнинга.
00:12:35Это ключевой этап для повышения производительности модели в вашей предметной области.
00:12:45Суть в том, что у вас есть роль, правила, доступные инструменты
00:12:50для привязки к метаданным и прочие ресурсы.
00:12:54Всё это кратко подаётся в контекст, позволяя модели самой определить
00:13:01найденные структурированные метки. Это внутренние метки, созданные нами,
00:13:06которые отражают модальности, фиксируют проблемы,
00:13:12задают цепочки рассуждений для модели
00:13:15и определяют вид результата для асессора. Это высококачественный
00:13:21датасет для файн-тюнинга разных агентов. После завершения
00:13:27предобучения для понимания визуальных и иных модальностей видео,
00:13:33затем мы переходим к тонкой настройке, чтобы модель понимала контекст и выдавала результат
00:13:38в нужном для обработки формате. Следующий этап — DPO.
00:13:44Эта техника часто применяется на этапе постобучения для точной настройки моделей
00:13:51под конкретную область или правила. Но её также можно активно
00:13:58использовать в продакшене для анализа примеров,
00:14:02где мультиагентная система и LLM показывают слабые результаты.
00:14:11Как это работает: у вас есть поступающий поток реальных данных и множество запросов,
00:14:17вы делаете выборку из этих данных и пропускаете её
00:14:23через LLM-судью, обученную на размеченных людьми данных, а затем отправляете
00:14:29в очередь ручной проверки для оценки качества работы реальной системы.
00:14:36Если качество отличное и превышает заданный порог
00:14:40(например, 95% для каждой задачи), то всё замечательно. Если же нет,
00:14:47нужен способ дообучения на примерах, где модель ошибается.
00:14:52Здесь и подключается человек. Он анализирует трейсы всех агентов,
00:14:57вызовы LLM и MCP, чтобы найти сбой. Проблема в цепочке
00:15:02рассуждений? Или вызваны не те инструменты, либо подвёл поиск?
00:15:08Такая валидация и разбор каждого хука и узла как на уровне интеллекта модели,
00:15:14так и на уровне структуры, позволяют определить,
00:15:20какие улучшения необходимы для ошибочных примеров.
00:15:28Имея положительные и отрицательные примеры и понимание необходимых правок,
00:15:34вы дообучаете модель для повышения качества. Это непрерывный процесс:
00:15:40мы изучаем примеры, переобучаем и улучшаем модели, формируем новые датасеты
00:15:46из реальных данных и отслеживаем дрейф данных и поведение
00:15:53модели. Участие человека в контуре (Human-in-the-loop) происходит постоянно:
00:15:58ежедневно берутся выборки из продакшена для оценки работы модели и LLM-судьи.
00:16:05Из-за стоимости и масштаба задачи мы не можем использовать стандартные флагманские
00:16:14VLM-модели. Это не масштабируется, требует слишком много вычислений и сложности,
00:16:20а мы решаем очень узкую задачу. Мне не важно, умеет ли модель писать
00:16:25код. Главное — решение узкопрофильной задачи. Модель не используется клиентами напрямую,
00:16:31это внутренний инструмент. Поэтому я применяю off-policy и on-policy дистилляцию знаний
00:16:37и квантование на основе экспериментов, чтобы понять,
00:16:41подходит ли 4-битное квантование или bfloat16. Затем я составлю таблицу
00:16:47с разными уровнями дистилляции и квантования, чтобы наглядно увидеть,
00:16:54где качество остается на нужном уровне и где достигается наибольшая экономия вычислений
00:17:00и затрат при инференсе за счёт оптимизации. Это критически важно,
00:17:07поскольку само решение задачи — это отлично, но в продакшене система должна быть масштабируемой
00:17:13и рентабельным. Это не может быть чем-то оторванным от реальности,
00:17:21ведь у нас очень специфическая задача. Что касается оценки, во-первых,
00:17:27это успешность выполнения задачи — бинарная метрика: модальность совпала или нет,
00:17:31есть выравнивание или расхождение. Точность, полнота и F1-мера — очевидные показатели
00:17:37успешности. Но мы хотим оценивать систему комплексно,
00:17:42не только финальный результат, но и работу каждого узла: насколько эффективно работает поиск,
00:17:47каковы задержка и полнота, а также качество рассуждений. Какова цепочка
00:17:53мыслей генерируется этими моделями на каждом агентском уровне или там, где применимы рассуждения,
00:17:59у агента-рецензента) и каково её качество? Нет ли
00:18:04избыточных вычислений? Можно ли уменьшить бюджет ресурсов, сохранив
00:18:09высокое качество работы? Или стоит увеличить бюджет на планирование и рассуждения,
00:18:16чтобы повысить точность и качество решения сложных задач?
00:18:22Поэтому адаптивный бюджет рассуждений очень важен. Далее — надежность:
00:18:29какие крайние случаи мы наблюдаем, каков уровень ошибок
00:18:34и на каких узлах они возникают? Плохо работает вызов инструментов,
00:18:39подводит поиск или сама LLM ошибается? Затем
00:18:45идет эффективность системы: мы оцениваем не только качество результатов,
00:18:51но и стоимость токенов для каждого вызова LLM. Можно ли
00:18:56дополнительно оптимизировать LLM для экономии? Каковы эффективность
00:19:01и задержка каждого агента и всей системы в целом? Кроме того, оценивая LLM-судью,
00:19:08мы учитываем, что в любой системе прогнозирования происходит дрейф данных, особенно
00:19:14при работе с пользовательским контентом. Насколько корректно наш LLM-судья, используемый для оценки,
00:19:20справляется по сравнению с ручной проверкой? Есть ли дрейф? Нужно ли дообучать LLM-судью
00:19:25на новых данных от команды разметить? Как улучшить работу в этой части?
00:19:30В плане оптимизации мы применяем пространственно-временное сжатие данных, объединяя похожие кадры
00:19:35в один. Это значительно сокращает объем обработки
00:19:41видео. Второй метод — кэширование: когда появляется трендовый,
00:19:47вирусный контент, нет смысла прогонять дублирующиеся ролики
00:19:52через весь конвейер. При высоком коэффициенте сходства
00:19:57мы пропуская мультиагентную систему, сразу выдаём готовое решение. Третий критически важный способ —
00:20:01фильтрация по метаданным. Мы сужаем пространство поиска кандидатов на основе
00:20:07метаданных, например, тем и авторов с уже проверенным высоким репутационным рейтингом.
00:20:12Это избавляет от необходимости обрабатывать все изображения и видео от авторов,
00:20:18обладающих высоким показателем подлинности, с отличной репутацией,
00:20:22высоким качеством видео и вовлеченностью. Метаданные позволяют
00:20:27отсеивать контент еще до его поступления в систему.
00:20:33Использование таких флагов очень помогает. Главные выводы,
00:20:42которые стоит сделать: декомпозиция задачи — ключ к успеху, разбивайте её по мере необходимости. Адаптивная
00:20:50оптимизация критически важна для окупаемости и контроля расходов. Качественная оценка первостепенна,
00:20:56на ней строится вся система и VLM-модели. А мониторинг
00:21:02прогнозов и качественные улучшения необходимы для долгосрочной устойчивости.
00:21:08На этом я закончу. Большое спасибо за внимание!
Community Posts
No posts yet. Be the first to write about this video!
Write about this video