Почему ИИ-агентам нужен контекст на миллион токенов — Томас Вольф и Олив Сонг, MiniMax

AAI Engineer
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00К нам на сцену поднимается соучредитель и главный научный сотрудник Hugging Face Томас Вольф.
00:00:30Всем привет. Привет, Олив. Рады видеть тебя на сцене. Спасибо, что пригласили. Думаю, сегодня вас ждет кое-что интересное, ведь вы только что видели GLM, которая сейчас занимает второе место в Artificial Analysis. Я говорю об этом с оговоркой, потому что ею мало кто может воспользоваться. А теперь у нас четвертое место. Так что вас ждет целая череда лучших моделей, по крайней мере, лучших открытых моделей подряд.
00:00:57И нам очень повезло, что с нами Олив, у которой довольно удивительный жизненный путь. Она приехала в США, в Пенсильванию. Она училась в аспирантуре NYU в лаборатории Яна Лекуна, работая над JPA. Но мы решили, что сегодня не будем говорить о JPA, верно? Оставим это на другой день. И вместо того, чтобы присоединиться к Hugging Face, которая в то время тоже находилась в Нью-Йорке, она решила пойти в Minimax.
00:01:26Для тех, кто, возможно, не знает все неолаборатории по всему миру — и вас можно понять, потому что сейчас их, кажется, штук 64, — Minimax является одной из ведущих так называемых «ии-драконов» в Китае. Среди них новые игроки: DeepSeek, который сейчас очень известен, Moonshot, создавший Kimi, Zee и GLM, которую вы только что видели.
00:01:51Итак, вот новая модель, а теперь у нас есть Minimax. Все они чрезвычайно хороши, это талантливейшие команды, борющиеся за первое место.
00:01:58Последним релизом Minimax стала модель M3, вышедшая в начале июня, которая на тот момент была лучшей моделью, лучшей открытой моделью.
00:02:08Очень впечатляет. В этой модели есть много интересного, так что мы быстро погрузимся в детали, а затем поговорим о том, чем именно отличается Minimax и в чем ее сильные стороны.
00:02:20Да. Олив, для начала не могла бы ты поделиться своим мнением об M3, что тебе нравится в этой модели, как прошел релиз?
00:02:32Да, M3 мы выпустили в начале этого месяца, и это относительно небольшая модель: около 400 миллиардов параметров в общей сложности и 20 миллиардов активных.
00:02:45Но она обладает огромными возможностями как в плане генерации кода, так и в понимании визуальных данных.
00:02:52Обычно открытые модели этим не отличаются — они умеют работать только с кодом, но эта модель также способна понимать видео и изображения, а ее контекстное окно достигает одного миллиона токенов.
00:03:09Благодаря нашей новой архитектуре MSA (Minimax Sparse Attention). Мы действительно объединили эти три составляющие, поскольку знаем, что они будут крайне важны для будущих ИИ-приложений: навыки написания кода,
00:03:26агентные возможности, длинный контекст и мультимодальное понимание. Да, я думаю, именно это делает модель столь интересной.
00:03:35Да, в этой модели многое предстоит обсудить, и мне кажется, это по-прежнему единственная модель из топ-5, модель с открытым исходным кодом, которая действительно является мультимодальной, так что об этом стоит поговорить.
00:03:45Но сначала давай поговорим о длинном контексте, ведь вы были одними из первых, кто реализовал этот реальный контекст на миллион токенов, который действительно работает.
00:03:54И вы также разработали Minimax Sparse Attention — метод обеспечения эффективности, о котором вы подробно писали и рассказывали.
00:04:04Не мог бы ты рассказать об этом поподробнее, например, как развивался проект от механизма внимания до создания такого длинного контекста?
00:04:11Я бы сказала, что история длинного контекста уходит корнями еще к Minimax M1 и Minimax 01, где модель фактически была способна справляться с задачами при контексте в 10 миллионов токенов.
00:04:25Десять миллионов. Десять миллионов, да. Но тогда это не была агентная модель, верно? Она просто позволяла, например, загрузить книгу и выдавать рецензии на нее и тому подобные вещи.
00:04:37И мы поняли, что больший контекст на самом деле открывает множество возможностей, особенно при взаимодействии с пользователями.
00:04:47И теперь, когда агент взаимодействует со всей средой, получает ответы от всех инструментов и работает в несколько раундов, короткого контекста уже недостаточно для выполнения сложных задач.
00:05:03Поэтому для этой версии мы решили: «Обязательно нужно вернуть поддержку длинного контекста».
00:05:09И то, к чему мы пришли — это Minimax Sparse Attention, архитектура, которая оказалась масштабируемой и имела простой дизайн.
00:05:23Если говорить на более высоком уровне, в ней есть ветка индексации, которая на верхнем уровне выбирает наиболее важные элементы в контексте.
00:05:36А затем у нас есть ветка разреженного внимания, которая выполняет вычисления на выбранных блоках для непосредственного решения задач.
00:05:44И благодаря этому мы создали изящную архитектуру, позволяющую масштабировать длину контекста, а в будущем — и размер самой модели.
00:05:57Это прекрасно. Мне нравится, как для тех, кто давно в этой сфере, было проделано столько работы над вниманием, верно?
00:06:03Эта сложность N в квадрате, и было много вариантов линейного внимания.
00:06:06Да.
00:06:06А потом все это в какой-то момент исчезло.
00:06:09Когда появился Flash Attention, мы обнаружили, что нам просто нужны более эффективные ядра.
00:06:13И теперь мне нравится, как мы возвращаемся к первому принципу: что такое внимание?
00:06:18Как сделать его еще эффективнее?
00:06:20Миллион токенов — это безумие, верно? У GPT-2 было 1024, и все думали: «Ого, это огромный объем, нам больше никогда не понадобится».
00:06:28Куда, по-твоему, это движется в будущем? Недавно Джефф Дин рассказывал мне про внимание на триллион токенов.
00:06:35Как думаешь, стоит ли нам переходить к вниманию на триллион токенов?
00:06:38Это определенно то направление, в котором можно развиваться — ультрабольшая длина контекста, безусловно.
00:06:45Это очень интересная область для исследований, которая потребует серьезных изысканий как в проектировании архитектуры, так и в аппаратном обеспечении.
00:06:54Да.
00:06:55Думаешь, здесь еще много низко висящих плодов?
00:06:57Например, сегодня мы видим, как OpenAI действительно сокращает — хотя мы точно не знаем как — затраты на инференс вдвое, вероятно, за счет более эффективной обработки механизмов внимания.
00:07:08Считаешь ли ты, что есть еще масса простых возможностей улучшить то, как мы это обрабатываем?
00:07:14В M3 до сих пор очень интересно то, насколько она дешевая, в частности из-за этого разреженного внимания, а отчасти потому, что она небольшая, но при этом очень эффективная.
00:07:22Верно.
00:07:23Как думаешь, сможем ли мы пойти еще дальше?
00:07:25Кстати, как вы изобрели Minimax Sparse Attention?
00:07:29Эту идею предложил агент?
00:07:31Или это до сих пор дело рук человека?
00:07:33Расскажи нам немного об этом.
00:07:35Да.
00:07:36Мы действительно считаем, что можно проделать еще много работы над архитектурой и оптимизацией инференса, чтобы модель стала еще эффективнее, особенно для задач, которые очень чувствительны к характеристикам, но требуют мощных возможностей.
00:07:52И для такого рода задач мы очень хотим, чтобы модель работала эффективно.
00:07:56А кто придумал эту часть?
00:07:59Вообще-то, над этим работал стажер из нашей команды.
00:08:02Надо же.
00:08:03Правда, уже не стажер.
00:08:04В большинстве лабораторий такое случается редко, потому что, кажется, в некоторых местах стажеры не имеют доступа к данным, проектам и прочему.
00:08:15Но да, мы открыты для каждого, кто хочет внести свой вклад в нашу модель.
00:08:20Так что эту архитектуру действительно разработал стажер.
00:08:23Очень здорово.
00:08:24У стажеров здесь все еще есть простор для работы.
00:08:26Хорошие новости.
00:08:27Это отличный переход к тому, как Minimax устроена изнутри.
00:08:32Перед выходом на сцену мы обсуждали, что здесь каждый может предложить проект.
00:08:37Не мог бы ты рассказать немного о том, как вы организованы, как вы проводите исследования?
00:08:41Я думаю, это сильно отличается даже от учебы в школе или ранних,
00:08:49скажем так, технологических компаний.
00:08:51Это совсем другое.
00:08:53Мы заботимся о том, чтобы у нас была хорошая база и инфраструктура, позволяющая любому сотруднику экспериментировать с моделью
00:09:04и предлагать идеи по ее улучшению.
00:09:07И затем, после релиза моделей, когда у них появляется свободное время, они могут поиграть с моделью.
00:09:13Они могут придумать собственные бенчмарки.
00:09:15Они могут найти слабые места и предложить то, что хотят улучшить в модели.
00:09:21А другие люди, которым это интересно, присоединяются к проекту.
00:09:26Они работают над ним пару недель или даже пару месяцев.
00:09:29И когда все получается, финальный результат внедряется в нашу модель.
00:09:33Мы используем это при финальном обучении, и разработка становится доступна пользователям.
00:09:39Интересно.
00:09:39То есть люди могут работать над проектом довольно долгое время.
00:09:42Когда ты говоришь «пара месяцев», это может быть по-настоящему глубокое исследование возможных вариантов.
00:09:46Да.
00:09:47И я бы сказала, что, например, архитектура может потребовать больше времени на изучение, исследования,
00:09:53эксперименты и даже пересчет оценок для этапа предварительного обучения.
00:09:57Да.
00:09:58Так что это может занять больше времени.
00:10:00Это здорово.
00:10:01Да.
00:10:02И я знаю, что вы также уделяете большое внимание оценке.
00:10:03Согласна.
00:10:04Об этом можно поговорить.
00:10:05Вероятно, с этим связана уникальная особенность M3 и вашей команды в отношении
00:10:11мультимодальности.
00:10:12То есть эта модель понимает не только текст, но также изображения и видео.
00:10:16И, насколько я понимаю — поправь меня, если я ошибаюсь, — когда мы читаем описание модели на Hugging Face,
00:10:21там указано, что модель обучалась с самого первого шага как мультимодальная, а не просто добавлена поверх уже готового текста, верно?
00:10:26Да.
00:10:27Да.
00:10:28Не мог бы ты рассказать об этом подробнее и объяснить, почему вы считаете это важным и
00:10:33почему вы начинаете обучение мультимодальности с самого первого шага, а не доучиваете модель позже?
00:10:37Мы называем это нативной мультимодальностью.
00:10:41Обычно лаборатории обучают мультимодальным возможностям — например, возможностям понимания изображений — уже после завершения текстового предварительного обучения.
00:10:50Они добавляют адаптеры и дообучают эту часть.
00:10:54Они добавляют адаптеры и обучают эту часть.
00:10:57Но мы выяснили, что это на самом деле ухудшает качество работы с текстом.
00:11:02И качество понимания визуальных данных сходится не так хорошо, поскольку модель уже в значительной степени
00:11:08настроена именно на понимание текста.
00:11:11Это не самый оптимальный и не самый масштабируемый подход.
00:11:17Если задуматься, мы хотим масштабировать данные, верно?
00:11:20Кроме того, некоторые лаборатории обучают этой возможности с середины этапа предварительного обучения.
00:11:27Например, продолжают предварительное обучение.
00:11:29Но мы обнаружили, что это очень сильно зависит от рецептуры.
00:11:35Рецепты будут отличаться для разных архитектур, разных наборов данных
00:11:41и разных скоростей обучения.
00:11:43Это трудно контролировать и масштабировать, результаты экспериментов и выводы сложно перенести на более крупную модель.
00:11:52и выводы на более крупную модель.
00:11:54И поэтому мы подумали: почему бы просто не обучать модель с самого первого шага?
00:12:01Это кажется самым естественным.
00:12:03Мы знаем, что многие лаборатории сталкиваются с проблемами при таком подходе.
00:12:07Модель может разрушиться после нескольких шагов обучения пониманию как текста, так и визуальных данных.
00:12:15Но нам удалось решить эту проблему.
00:12:18Мы проделали большую работу над архитектурой и над данными, на которых мы фактически обучаем модель.
00:12:26Например, мы используем чередующиеся данные, то, что мы называем чередующимися данными.
00:12:30Это фактически естественные данные, но мы сохраняем изображения и видео вместо того, чтобы их маскировать.
00:12:38И мы проводим довольно качественную очистку и маскирование данных.
00:12:42И создаем отличную модель вознаграждения, чтобы обучать её с самого первого шага, и она отлично масштабируется.
00:12:50Да, она не коллапсирует.
00:12:52Это действительно впечатляет.
00:12:53Впечатляет.
00:12:54Стоит ли нам ждать еще более крупные модели в будущем?
00:12:57То есть эта всё ещё довольно маленькая, верно?
00:12:59В ней 428 миллиардов параметров, 23 миллиарда активных.
00:13:04Как думаете, перейдете ли вы отметку в триллион?
00:13:08Определенно.
00:13:09Да, безусловно, в будущем.
00:13:12Есть много задач, с которыми модель с меньшим числом параметров не сможет справляться очень хорошо.
00:13:21Мы настроены гораздо более амбициозно.
00:13:25Это здорово.
00:13:26Ждем с нетерпением.
00:13:27И еще одна интересная вещь, которая всегда меня восхищает в Minimax — это то, как у вас есть целый ряд приложений и продуктов, верно?
00:13:36Помню, Minimax начала выкладывать разработки в открытый доступ на платформе Hugging Face еще в январе прошлого года.
00:13:43То есть прошло 18 месяцев.
00:13:45И мы немного общались с командой, чтобы понять, чем вы занимаетесь.
00:13:48И я помню, у некоторых из этих приложений уже тогда было огромное количество пользователей.
00:13:54Не расскажете немного о том, как всё начиналось?
00:13:57То есть у вас было много приложений, и вы подумали: у нас есть все эти данные,
00:14:02почему бы не обучить модель?
00:14:03И тогда они создали исследовательскую команду.
00:14:05Как это было?
00:14:07Наша история началась с модели с первого дня.
00:14:11Я считаю, что мультимодальная модель, способная понимать все визуальные данные и выдавать любые модальности,
00:14:19была главной целью нашего CEO с самого первого дня, еще до основания компании.
00:14:25Такой была мечта об AGI.
00:14:27Думаю, это было очень-очень рано, еще до выхода ChatGPT.
00:14:30Ух ты.
00:14:31Да.
00:14:32А приложения появились уже попутно.
00:14:35Поскольку у вас есть возможности модели, хочется, чтобы люди могли оценить их на практике.
00:14:40Не многие могут использовать её через API, верно?
00:14:43Мы не можем ожидать, что каждый будет работать через API.
00:14:46Поэтому нам нужны хорошие пользовательские интерфейсы, хорошие приложения, подходящие сценарии, где люди могут протестировать модель.
00:14:57Кажется, эти приложения охватили более 300 миллионов человек примерно в 200 странах мира.
00:15:06И, думаю, более миллиона компаний.
00:15:09Да.
00:15:10Это поразило меня, когда я услышал о таких масштабах.
00:15:12Мы часто не осознаем объемы подобного использования.
00:15:17И это подводит меня к вопросу о бизнес-модели с открытым исходным кодом, который возникает постоянно: здорово открывать модели, но нужно же иметь источник дохода, верно?
00:15:33И я так понимаю, вы решили предоставить M3 бесплатно.
00:15:38И я считаю, что это здорово для всего мира.
00:15:41Как вы на это смотрите?
00:15:42Используете ли вы какие-то специальные модели для самого приложения?
00:15:45Как вы думаете, продолжите ли вы открывать модели в будущем — наверное, сложно сказать наверняка?
00:15:52Какова сейчас культура вокруг опенсоурса?
00:15:55Лично я, да и вся наша исследовательская команда, мы всегда надеемся открывать модели.
00:16:01Таков наш план, потому что мы воочию видим, как совместная работа открытого сообщества помогает улучшать модель.
00:16:09Например, мы получаем много отзывов о производительности модели от прекрасного сообщества и получаем пул-реквесты для того, что открываем, верно?
00:16:20И они очень-очень ценны для наших последующих версий.
00:16:24Так что открытый исходный код — это определенно здорово.
00:16:27Это здорово.
00:16:28А есть ли у вас какая-то просьба к аудитории, к тем, кто пользуется M3 или Minimax?
00:16:33Что бы вам хотелось получать от них в качестве обратной связи?
00:16:37Читаете ли вы, например, о том, как люди пытаются модифицировать модели или экспериментируют с ними?
00:16:43Или что, по вашему мнению, лучше всего взять у сообщества для будущих моделей?
00:16:51Я бы сказал, любые проблемы, с которыми сталкиваются люди, особенно в мультимодальности, верно?
00:16:57Мы объединяем это впервые.
00:16:59В будущем мы будем действовать еще более амбициозно.
00:17:03Сейчас могут быть какие-то недочеты, но мы над ними работаем.
00:17:06Так что любые отзывы о том, где модель проявляет себя не лучшим образом, мы обязательно учтем в будущих версиях.
00:17:13А также любые функции, которые нужны пользователям.
00:17:17Скажем, например, контроль глубины рассуждений, верно?
00:17:21Некоторые люди об этом просят.
00:17:23Каждый может высказать пожелания, и мы постараемся реализовать их в будущих моделях.
00:17:28Да.
00:17:29Видите ли вы много пользователей, использующих мультимодальность для агентов-программистов?
00:17:33Мне кажется, это направление исследовано недостаточно.
00:17:37Это так.
00:17:38Так и есть.
00:17:39Но на самом деле это может раскрыть множество возможностей и сценариев для агентских приложений.
00:17:47Допустим, вы хотите, чтобы модель читала презентации PowerPoint, верно?
00:17:51Или изучала какие-то не очень структурированные отчеты.
00:17:55Или чтобы она понимала очень длинное видео.
00:17:58Представьте, что вы записали длинное видео, а затем хотите, чтобы модель задействовала какие-то инструменты после его осмысления.
00:18:07Это открывает самые разные варианты использования агентов.
00:18:12То есть агент наконец-то сможет посмотреть мой туториал на YouTube и понять, как использовать мои инструменты программирования, то, как я их описываю?
00:18:18Это что-то в таком духе?
00:18:19А?
00:18:20Сможет ли агент наконец смотреть видеоролики на YouTube и извлекать из них информацию?
00:18:24Да.
00:18:25Да.
00:18:26Думаю, да.
00:18:27Используете ли вы много инструментов для агентского кодинга внутри компании?
00:18:30То есть — ну, для написания кода определенно, но применяется ли это уже и в исследованиях?
00:18:34Автоматизировано ли это?
00:18:35Да.
00:18:36Отчасти?
00:18:37Или нет?
00:18:38Как это работает?
00:18:39Да.
00:18:40У нас есть собственные исследовательские фреймворки.
00:18:42Мы создаем собственные среды, которые автоматизируют наши рабочие процессы.
00:18:46Я бы сказал, что многие наши процессы автоматизированы.
00:18:49Вы можете видеть, как все передовые модели стремятся к возможностям оптимизации ядер силами искусственного интеллекта, верно?
00:18:57Позволяя модели создавать другие модели.
00:19:00Позволяя модели генерировать данные, автоматизировать датасеты и тому подобное.
00:19:05Вы видите, что всё больше моделей способны на это, включая M3.
00:19:10На самом деле, мы очень преуспели в таких задачах, как работа с большими контекстами и оптимизация ядер.
00:19:16Так что мы можем задействовать эти возможности модели, объединить их и помогать себе в повседневной рутине,
00:19:24делая наши итерации еще быстрее.
00:19:26Создает ли команда M3 уже модель M4?
00:19:30Создаем M3.1.
00:19:31M3.1?
00:19:32Да.
00:19:33Понятно.
00:19:34Пока не четвертую.
00:19:35Уже.
00:19:36Я бы хотел завершить разговор тем, что кажется вам самым интересным в ближайшие месяцы.
00:19:41Как вы думаете?
00:19:42Это может быть связано с функциями или событиями, которые вы хотите увидеть в ИИ, или в целом с тем,
00:19:49что, по вашему мнению, действительно будет у всех на слуху.
00:19:54Многое вызывает большой интерес.
00:19:58Но больше всего меня в последнее время восхищают мультиагентные системы, которые, как мне кажется,
00:20:04используются во многих ИИ-приложениях: маршрутизация моделей, мультиагенты, открывающие еще большие возможности,
00:20:11решающие еще более сложные задачи.
00:20:13И кроме того, это показывает нам, на что модели способны, а на что нет.
00:20:19И с этим можно сделать очень многое.
00:20:22Это потрясающе.
00:20:24Большое спасибо, Alive.
00:20:25Рад был пообщаться.
00:20:26Спасибо, что пригласили.
00:20:27Спасибо всем.
00:20:28Спасибо всем.
00:20:29Спасибо всем.
00:20:29Спасибо.
00:20:29Спасибо всем.

핵심 요약

Открытая мультимодальная модель M3 с контекстным окном на миллион токенов и разреженным вниманием демонстрирует эффективное масштабирование ИИ-агентов.

하이라이트

  • Модель M3 от компании Minimax содержит около 400 миллиардов параметров в общей сложности и 20 миллиардов активных параметров.

  • Контекстное окно модели M3 достигает одного миллиона токенов благодаря новой архитектуре Minimax Sparse Attention.

  • Приложения компании Minimax охватили более 300 миллионов человек примерно в 200 странах мира и более одного миллиона компаний.

  • Архитектура Minimax Sparse Attention была разработана стажером в составе команды исследователей.

  • Мультимодальная архитектура M3 обучалась с самого первого шага как единая система для работы с текстом, изображениями и видео.

타임라인

Представление модели M3 и мультимодальные возможности

  • Модель M3 содержит 400 миллиардов общих и 20 миллиардов активных параметров.
  • Архитектура поддерживает генерацию кода, понимание визуальных данных и контекст в один миллион токенов.
  • Minimax входит в число ведущих ИИ-лабораторий Китая наряду с DeepSeek и Moonshot.

Томас Вольф и Олив Сонг обсуждают релиз модели M3 компании Minimax. Новая разработка сочетает навыки написания кода и мультимодальное понимание в рамках единой системы.

Архитектура длинного контекста Minimax Sparse Attention

  • Архитектура Minimax Sparse Attention включает ветку индексации и ветку разреженного внимания.
  • Длинный контекст необходим для работы агентов в несколько раундов со сложной средой.
  • Идею разреженного внимания разработал стажер внутри исследовательской команды.

Разбор механизмов обработки длинного контекста объемом до одного миллиона токенов. Метод решает проблему квадратичной сложности внимания и снижает затраты на инференс.

Организация исследований и нативная мультимодальность

  • Исследователи работают в гибких командах и могут предлагать собственные проекты на несколько месяцев.
  • Модель M3 обучалась как мультимодальная с самого первого шага предварительного обучения.
  • Приложения Minimax охватили более 300 миллионов пользователей по всему миру.

Внутренняя структура компании позволяет сотрудникам и стажерам экспериментировать с архитектурой. Нативный подход к мультимодальности предотвращает ухудшение текстовых характеристик.

Открытый исходный код и будущие мультиагентные системы

  • Открытый исходный код позволяет собирать ценные отзывы и пул-реквесты от сообщества.
  • В планах компании разработка новых версий модели и улучшение контроля глубины рассуждений.
  • Мультиагентные системы и маршрутизация моделей определяют вектор развития ИИ-приложений.

Команда продолжает развивать открытые модели и взаимодействовать с сообществом. В фокусе будущих исследований находятся автоматизированные среды и мультиагентная оркестрация.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기