Transcript
00:00:00Думаю, давайте начнем. Я Армин, сооснователь и генеральный директор Perceptron.
00:00:20Мы немного коснемся того, чем занимаемся, но сегодня я хочу поговорить прежде всего
00:00:25о нашей исследовательской позиции: мы хотим отойти от разделения на VLM, VLA,
00:00:32модели мира и прочее к тому, что мы называем воплощенными базовыми моделями.
00:00:42Если говорить о Perceptron, наша главная цель — научиться
00:00:48создавать базовая модель физического ИИ, способные воспринимать, понимать и взаимодействовать
00:00:53с физическим миром в реальном времени. И наша ориентир — соединить
00:00:58физический и цифровой миры. По сути, наша цель заключается в том, чтобы везде, где есть устройство,
00:01:07прибор, робот, камера или датчик, мы наделяли его интеллектом.
00:01:14Говоря о парадигме «воспринимать, рассуждать,
00:01:19и умения действовать, мы рассматриваем это как своего рода объединение традиционного мультимодального моделирования.
00:01:25Я пришел из FAIR, проработал там шесть лет, и моей задачей было понять,
00:01:31как масштабировать подходы к мультимодальным моделям. Одной из первых задач,
00:01:37над которой мы начали работать (и много опубликовали в этой области), было раннее слияние.
00:01:41Это концепция, при которой все модальности объединяются как можно раньше. Основная сложность —
00:01:47найти правильный способ корректного представления всех различных модальностей как на входе, так и на
00:01:52выходе, чтобы отразить их целостно. VLM стали главным образом,
00:01:58когда я говорю о мультимодальных моделях, вы, вероятно, представляете VLM. Это способность принимать
00:02:03изображение, видео и текст и выдавать, по сути, текст. Существуют и вариации.
00:02:09Есть модели вроде ER (модели воплощенных рассуждений), которые могут выдавать
00:02:15точки привязки и чуть лучше справляются с пространственным пониманием и рассуждениями.
00:02:20Затем идут VLA, которые расширяют выходную область за пределы просто текста —
00:02:25добавляются действия. И они, конечно, традиционно продолжают строиться на стандартных архитектурах VLM,
00:02:30хотя предпринимались попытки перейти от
00:02:35VLM к моделям мира или моделям мира и действий, хотя пока ничто из этого не дало
00:02:39суперплодотворных результатов. Затем мы переходим к более интересным и сложным вариантам мультимодальных
00:02:46моделей, таким как модели мира, где вы генерируете видео на основе входных данных,
00:02:51которыми могут быть изображения, видео или даже комбинация изображений, видео и действий. И последнее,
00:02:57о чем я упомяну, — это недавнее направление, семантические модели мира: вы ничего не генерируете на выходе,
00:03:02но обучаетесь представлению, которое считаете полезным в будущем. То, что мы называем
00:03:08воплощенной базовой моделью, на самом деле представляет собой подходы, позволяющие совместить
00:03:13стандартное восприятие, воплощенные рассуждения и главную цель — управление — в рамках одной модели.
00:03:20То есть способность анализировать различные сенсорные модальности на входе и выполнять
00:03:25большую часть из того, о чем я упомянул, на выходе — и все это внутри единой единой модели.
00:03:31Быстро скажу о двух проблемах: это фундаментальные
00:03:35исследовательские вызовы, с которыми мы сталкиваемся, и я расскажу, как наша компания подходила к их решению
00:03:40и что делают в этом направлении другие.
00:03:43Первое: подумайте о том, чтобы смоделировать, например, час видео.
00:03:48В зависимости от представления, на вход поступает около
00:03:52одного миллиона визуальных токенов. Правда в том, что нет никакой эталонной размеченной истины,
00:03:57которую можно было бы эффективно использовать. Можно, конечно, делать то, что делают многие:
00:04:02извлекать расшифровки, предсказывать их по видео или синтетически
00:04:08размечать кадры, задавать вопросы. Но оказывается, это колоссальная трата ресурсов.
00:04:13Вдумайтесь: в модель поступает миллион токенов,
00:04:16а функция потерь рассчитывается примерно по 0,2% всех входящих
00:04:22токенов. Это фундаментальная проблема. И как ни пытайся
00:04:27это исправить, по сути вносится неверный обучающий сигнал.
00:04:31Он либо слишком разрежен, либо слишком искусственен, либо не избирателен. Альтернативой
00:04:37синтетическому обогащению стала идея предсказывать каждый пиксель. Да,
00:04:42это очень плотный сигнал, но он крайне плохо распределяет внимание.
00:04:47Пикселю фона придается ровно то же значение, что и
00:04:51кончику захвата, точкам контакта, конкретным сбоям или физике процесса.
00:04:56Поэтому в Perceptron (и это часть нашей ключевой интеллектуальной собственности)
00:05:01мы задумываемся: как выглядит естественная целевая функция восприятия? В частности, как
00:05:06автоматически предсказывать объекты восприятия, которые будут важны в будущем? К примеру,
00:05:11можно жестко запрограммировать правило: если есть роборука, то кончик захвата
00:05:16является очень полезным объектом для прогнозирования. Некоторые уже начали
00:05:20это делать — например, разработчики MOMO Act из AI2, а также создатели других VLA.
00:05:26Но это все равно жестко заданный объект. Вопрос в том, можно ли найти автоматический
00:05:30способ, чтобы модель семантически сама обучалась этой уникальной задаче? И мы
00:05:37нашли такой способ. Раскрывать его здесь мы не будем, но это дает представление о том,
00:05:41как мы решаем проблему разреженности данных. Вторая ключевая проблема, которой мы уделяем много
00:05:49внимания — раздувание контекста. Если у вас постоянно включены камеры или роботы, которые
00:05:54не останавливаются и не ждут, вам приходится анализировать огромные последовательности токенов.
00:06:01Текст относительно плотен, а видео — разрежено. Возникает вопрос: есть ли архитектурные
00:06:08прорывы, позволяющие справляться с этой проблемой нативном уровне,
00:06:13вместо попыток убрать дисбаланс искусственными методами?
00:06:20Здесь есть несколько путей. Первый базовый принцип — нужно
00:06:25начинать обучать разные модальности совершенно по-разному. Нельзя относиться к токенам текста
00:06:31так же, как к токенам изображений, аудио или видео. Можно начать
00:06:36с фокуса на пространственном сжатии или сжатии токенов. Применяются очень примитивные
00:06:41вещи — мы и сами с них начинали, и это работает. Можно попробовать
00:06:44усреднять представления патчей по видео или изображению. Это позволяет добиться
00:06:51любопытного коэффициента сжатия, вплоть до 10 раз. Но все равно это костыль, и здесь
00:06:57нет отработанных архитектурных методов решения. За последние пару месяцев
00:07:04мы представили наш подход к работе с разной степенью
00:07:10разреженности: дать модели самой решать, на какие токены смотреть, а какие
00:07:14игнорировать. Мы опубликовали статью про разреженную смесь экспертов по данным,
00:07:19которая позволяет это делать. Модель (точнее, роутер в ней) может
00:07:24прогнозировать, какой токен принять, а какой пропустить, причем происходит это практически
00:07:30бесплатно на всех слоях. И оказывается, если просто дать модели учиться,
00:07:36не закладывая в нее жестких архитектурных ограничений, она действительно обучается.
00:07:43Визуализируя распределение вычислений в наших моделях, можно заметить, что
00:07:49они сами учатся фокусироваться на информативных или релевантных задаче участках.
00:07:56Справа вверху видно, что модель фокусируется на графике —
00:08:00на чем зумировался бы и человек, так как это наиболее интересная часть
00:08:05изображения. Более того, распределение внимания зависит даже от конкретной
00:08:13задачи. Слева внизу, если задать самый общий вопрос,
00:08:18карта внимания распределится по всему кадру. Модель просто
00:08:22не знает, как правильно распределить ресурсы. Но если попросить её,
00:08:27к примеру, сегментировать все фрукты, она выделяет больше токенов на то,
00:08:31что считает фруктами. Это отличный приём, который мы используем и описали в публикациях,
00:08:36и другие тоже начинают внедрять априорные знания в архитектуру, чтобы справиться
00:08:43с дисбалансом разреженности модальностей, но без жестких ограничений, мешающих
00:08:49естественному обучению. Объединив все эти наработки (возможно, вы видели
00:08:57анонс), пару недель назад мы выпустили модель, которую считаем первой полноценной воплощенной
00:09:03базовой моделью. Она находится на передовом уровне и соперничает с Gemini
00:09:093.1 Pro, превосходит Gemini Embodied Reasoning и при этом примерно в 15 раз дешевле.
00:09:15Она обучена на датасете объемом в один петабайт, собранном буквально
00:09:20отовсюду: от веб-сканирования до наших собственных методов дообучения и синтетических данных.
00:09:28Этот петабайт включает текст, изображения, видео и траектории,
00:09:34причем самые разные: от работы за ПК до прохождения видеоигр.
00:09:41При таком подходе начинают проявляться очень интересные свойства.
00:09:46Главным из них (что оглядываясь назад кажется очевидным)
00:09:50заключается в том, что к классическим задачам компьютерного зрения можно подходить как к агентным. И в данном
00:09:57случае мы переосмыслили детекцию объектов как агентную задачу. То есть наша модель может писать код,
00:10:02запрашивать приближение отдельных фрагментов, изменять контрастность. И вы
00:10:09видите, что это очень сложная задача. На Reddit есть целый сабреддит, посвященный
00:10:14поиску очень труднозаметных объектов на изображениях. И наши модели отлично справляются
00:10:19с этой задачей. Но они делают это именно как агенты. Это не традиционное «найди вот эту одну
00:10:24рамку». Модель сама решает, что картинку нужно разбить на фрагменты, изменять
00:10:28контрастность. Она предлагает область здесь, повышает контраст и в итоге находит птицу.
00:10:36Опять же, это очень трудно сделать даже человеку, хотя люди отлично распознают визуальные образы.
00:10:42И всё это благодаря использованию
00:10:46нативно нативных воплощенных моделей, умеющих работать с разными модальностями.
00:10:51Как это связано с общепринятым подходом к физическому ИИ в робототехнике?
00:10:57Я позаимствовал этот слайд у коллег из GDM. На примере робототехнических агентных систем
00:11:04мы начинаем видеть разделение между моделями физического рассуждения (оркестраторами)
00:11:11и моделями тактильного управления. Рассмотрим пример:
00:11:17приготовление кофе занимает три минуты. Можно заставить всю VLA-модель
00:11:21пытаться выполнить эту задачу целиком. Или же использовать модель-оркестратор,
00:11:26которая разобьет процесс на подзадачи, пока поверх работает политика тактильного
00:11:31управления. Существует целый спектр решений — от чистых VLA
00:11:36до подобных агентных систем. Главное, что я хочу подчеркнуть:
00:11:41физическое рассуждение — крайне интересная и сложная проблема, которая всё ещё не решена.
00:11:46Тем не менее, наши модели удерживают передовые позиции в области физического рассуждения.
00:11:50И благодаря этому мы наблюдаем удивительные вещи, которых не видели раньше.
00:11:55Вот конкретный пример сложной аннотации робототехнических данных.
00:11:59Видно, как модель перемещается по видео,
00:12:04просматривая разные фрагменты, обрезая их, проверяя точность описаний
00:12:09и выполняя самопроверку. Это возможно, потому что наши авторегрессионные модели работают быстро.
00:12:15Они значительно дешевле существующих аналогов. Попытка сделать это через Gemini
00:12:20обошлась бы в пару долларов за видео, а у нас стоимость измеряется центами.
00:12:24Всё это результат реализации передовых возможностей физического рассуждения,
00:12:29ранее недоступных в других моделях.
00:12:37Сейчас я расскажу о нашем главном исследовательском прорыве. Подробности
00:12:41мы опубликуем в ближайшие недели, скорее всего, в Twitter. Мы открыли
00:12:48новые законы масштабирования для воплощенных базовых моделей. В них можно
00:12:53совмещать обучение управлению, траекториям, восприятию
00:12:59и физическому рассуждению. Найдя правильную комбинацию
00:13:03и верные целевые функции, вы получаете рычаги влияния,
00:13:08о существовании которых ранее не подозревали.
00:13:11Конкретный пример — возможность взаимозамены общих видеоданных
00:13:19предобучения и данных телеопераций. Как известно, данные телеопераций очень дороги —
00:13:25около 100 долларов за час. На эти же 100 долларов можно собрать кратно больше видеоданных.
00:13:32Этот график показывает, что при обучении чистых VLA-моделей существует определенный диапазон.
00:13:39Законы масштабирования работают, и увеличение объёма данных телеопераций дает прирост.
00:13:43Однако этот прирост не так значителен, как при обучении
00:13:48единых воплощенных базовых моделей. Это иллюстрирует нижняя часть графика.
00:13:55Главный вывод: можно сократить объем данных телеопераций в 10 раз,
00:14:03компенсировав это 10-кратным увеличением объема видеоданных. Это подтверждается
00:14:09на имеющихся вычислительных мощностях нашей компании. Мы продолжим исследовать пределы возможностей
00:14:16воплощенных базовых моделей. На видео показана работы алгоритма.
00:14:28Надеемся выложить одну из младших моделей в открытый доступ через пару недель. Всё исполняется нативно
00:14:33внутри одной модели, способной к физическому рассуждению для выполнения задачи.
00:14:38Она генерирует управляющие токены. Заметны небольшие рывки, но это нормально.
00:14:43Рассчитываем решить это при масштабировании. Вы видите выполнение очень сложных задач,
00:14:48непосильных для чистых VLA-моделей. На видео справа
00:14:54модели требуется прочитать название книги, определить её категорию
00:14:58это, а затем правильно положить её в один из контейнеров. Так что это многоэтапная задача
00:15:04сочетающая восприятие и управление. Ее крайне трудно решить
00:15:09с помощью сквозной модели управления, не способной распознать промежуточные визуальные подзадачи.
00:15:23Выглядит впечатляюще. Модель хорошо работает в режиме zero-shot без подготовки.
00:15:28Мы рады предоставить доступ к ней разработчикам в июле.
00:15:33Оставлю пару минут для вопросов. Если вам интересно, пишите.
00:15:41Ограниченному числу партнеров мы предоставляем доступ к весам модели Mark 1
00:15:47и к весам наших более крупных воплощенных базовых моделей. Пишите на почту или в Twitter.
00:15:58Перейдем к вопросам, у нас есть еще пару минут.
00:16:02Спасибо.
00:16:03Спасибо.
00:16:05Спасибо.
00:16:05Спасибо.
00:16:09Спасибо.
00:16:11Спасибо.
00:16:13Спасибо.
00:16:24Вопрос о том, как нам удалось добиться такого уровня временного понимания.
00:16:31Хороший вопрос. Честно говоря, задача не решена полностью. Предстоит много работы для надежного внедрения.
00:16:37Ключевой момент — управление контекстом. Контекст ограничен: здесь у моделей 1 миллион токенов, что легко заполняется видео с высокой частотой кадров.
00:17:06Нужно искать новые подходы. К примеру, раньше мы использовали соотношение ключевых и дельта-кадров.
00:17:19Так можно оптимизировать контекст. Затем на этапе предобучения стоит закладывать данные, полезные для задач робототехники.
00:17:32Пример — ориентация в пространстве, вызывавшая трудности у ранних версий Gemini.
00:17:40Различать «лево» и «право» сложно на данных из интернета, так как подобные пространственные связи редко размечены в текстах.
00:17:51Проработка распределения данных на ранних этапах позволяет быстро добиться результатов. Фокус на физическом рассуждении позволил нам превзойти Gemini ER при меньших вычислениях.
00:18:07Наиболее заметная устойчивость VLA-моделей проявляется при их дообучении под конкретные задачи.
00:18:35Изменение фона стола в китайских аналогах приводит к сбою работы алгоритма.
00:18:47Совместное моделирование восприятия и управления повышает устойчивость к подобным помехам и изменениям освещения.
00:18:56Это обеспечивает устойчивость к изменению фона, недоступную традиционным моделям.
00:19:03При этом не стоит переоценивать возможности: задача остается сложной.
00:19:07Если посветить фонарем в камеру манипулятора, произойдет сбой.
00:19:12Однако совместное моделирование существенно улучшает показатели.
00:19:16Мы также симулируем отключение одной из камер манипулятора во время обучения.
00:19:27Имитируем падение солнечного света под определенным углом.
00:19:31Эти методы аугментации повышают надежность системы.
00:19:35Основной прирост дает переход к парадигме раннего слияния данных в робототехнике.
00:19:43Отлично.
00:19:44.
00:19:50Базы знаний?
00:19:52Модель подходит для создания описаний к изображениям и видео.
00:19:57Мы сотрудничаем с разработчиками роботов для эгоцентрической аннотации данных.
00:20:02Речь идет не о построении онтологий, а о глубоком структурированном извлечении информации,
00:20:07с чем наши модели отлично справляются.
00:20:10Да.
00:20:11Продемонстрированные функции доступны через публичные API.
00:20:15Бенчмарки также находятся в открытом доступе.
00:20:17Время выступления истекло.
00:20:19Я могу продолжить обсуждение в кулуарах.
00:20:22Спасибо за внимание.
00:20:27Спасибо.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video