Pourquoi les agents IA ont besoin d'un contexte d'un million de jetons — Thomas Wolf & Olive Song, MiniMax

AAI Engineer
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00Rejoignant sur scène le cofondateur et directeur scientifique de Hugging Face, Thomas Wolfe.
00:00:30Bonjour à tous. Bonjour Olive. C'est un plaisir de vous avoir sur scène. Merci de m'accueillir. Je pense que vous allez être gâtés aujourd'hui car vous venez de voir GLM, qui est actuellement numéro deux sur Artificial Analysis. Je mets cela de côté car personne ne peut l'utiliser. Et maintenant nous avons le numéro quatre. Donc en gros, vous aurez tous les meilleurs modèles, du moins le meilleur modèle open source d'affilée.
00:00:57Et nous avons beaucoup de chance d'avoir Olive, qui a un parcours de vie assez extraordinaire. Elle est venue aux États-Unis, en Pennsylvanie. Elle étudiait et faisait un doctorat à l'NYU dans le laboratoire de Yann LeCun, travaillant sur le JPA. Mais nous avons décidé de ne pas parler du JPA aujourd'hui, n'est-ce pas ? C'est une question pour une autre fois. Et puis au lieu de rejoindre Hugging Face, qui était également à New York à l'époque, elle a décidé d'aller rejoindre Minimax.
00:01:26Alors pour ceux qui ne connaissent peut-être pas tous les néo-laboratoires du monde entier, et vous êtes excusés car je pense qu'il y a environ 64 néo-laboratoires en ce moment, Minimax est l'un des tout premiers de ce que nous appelons les dragons de l'IA en Chine. Il y a donc les nouveaux, il y a DeepSeek, qui est très bien connu maintenant, Moonshot, qui fait Kimi, Z, et GLM que vous venez juste de voir.
00:01:51Voici donc le nouveau modèle, et maintenant nous avons Minimax. Ils sont tous extrêmement bons, des équipes extrêmement talentueuses qui se battent pour la première place.
00:01:58La dernière version de Minimax était donc M3, un peu plus tôt en juin, qui était le meilleur modèle à cette époque, le meilleur modèle open source.
00:02:08Très impressionnant. Il y a beaucoup de choses très intéressantes à propos de ce modèle, nous allons donc nous y plonger rapidement, puis parler un peu de ce qui est spécifique à Minimax, de ce qui est formidable.
00:02:20Oui. Alors peut-être Olive, pour commencer un peu, pouvez-vous nous donner, vous savez, un peu votre point de vue sur M3, ce que vous aimez dans ce modèle, comment s'est passée la sortie ?
00:02:32Oui, M3, nous avons sorti M3 au début de ce mois, et c'est un modèle plus petit avec 400, environ 400 milliards de paramètres au total, et 20 milliards activés.
00:02:45Mais il est très performant à la fois en termes de performances de codage, et il comprend également la vision.
00:02:52C'est donc ce que les modèles open source n'ont généralement pas, c'est que le modèle ne peut pas seulement traiter le codage, mais il peut aussi comprendre des vidéos, des images, et il possède un contexte super long d'un million.
00:03:09Avec notre nouvelle architecture appelée MSA, Minimax Sparse Attention. Nous avons donc vraiment réuni ces trois éléments, car nous savons qu'ils sont -- qu'ils seront très importants dans les futures applications de l'IA, les capacités de codage,
00:03:26les capacités d'agent, un contexte plus long et la compréhension multimodale. Oui, je pense que cela serait très intéressant concernant le modèle.
00:03:35Oui, il y a donc beaucoup de choses à analyser dans ce modèle, et c'est toujours, je pense, le seul modèle du top cinq, un modèle open source, qui est réellement multimodal, nous devons donc en parler.
00:03:45Mais peut-être d'abord à propos du contexte long, parce qu'il a également été le premier à avoir vraiment ce véritable contexte long d'un million de jetons, qui est réellement fonctionnel.
00:03:54Et vous aviez également le Minimax Sparse Attention, qui est cette technique pour rendre cela efficace, que vous avez également publiée et partagée de manière approfondie,
00:04:04pouvez-vous donc en parler un peu, peut-être de la façon dont le projet a évolué à partir de l'attention, comment créer ce contexte long ?
00:04:11Oui, je dirais que l'histoire du contexte long remonte à Minimax M1 ou Minimax 01, où le modèle était en fait -- était capable d'exécuter des tâches d'un contexte de 10 millions de jetons.
00:04:25Dix millions. Dix millions, oui. Mais ce n'était pas un modèle d'agent, n'est-ce pas ? C'était juste, par exemple, le fait de charger un livre, il était capable de donner des critiques dessus, des choses comme ça.
00:04:37Nous avons donc réalisé qu'un contexte plus long libère en fait de nombreuses capacités, en particulier lors de l'interaction avec les utilisateurs.
00:04:47Et maintenant, lorsque l'agent interagit avec l'ensemble de l'environnement et obtient toutes les réponses aux outils, obtient plusieurs cycles, un contexte plus court ne suffirait pas pour exécuter des tâches complexes.
00:05:03Pour cette version, nous avons donc dit, oh, nous devons ramener notre contexte plus long.
00:05:09Et ce que nous avons poursuivi, c'est notre Minimax Sparse Attention, qui, vous savez, était l'architecture qui était évolutive et avait une conception simple.
00:05:23Donc, d'un point de vue plus général, n'est-ce pas ? Il possède une branche d'indexation qui, vous savez, sélectionne à un niveau supérieur ce qui est -- ce qui compte le plus dans le contexte.
00:05:36Et ensuite, nous avons une branche d'attention éparse qui calcule -- effectue le calcul sur les blocs sélectionnés pour réellement exécuter les tâches.
00:05:44Et donc, oui, c'est ainsi que nous avons réellement conçu une architecture élégante afin de pouvoir faire évoluer la longueur, puis faire évoluer la taille du modèle à l'avenir grâce à cela.
00:05:57C'est magnifique. J'aime la façon dont, pour ceux qui sont dans le domaine depuis un certain temps, nous avons eu beaucoup de travaux sur l'attention, n'est-ce pas ?
00:06:03Ce N-carré, et il y a eu beaucoup d'attention linéaire.
00:06:06Oui.
00:06:06Et puis d'une manière ou d'une autre, tout cela a disparu à un moment donné.
00:06:09Quand Flash Attention est apparu, nous avons découvert que nous avions juste besoin d'un noyau plus efficace.
00:06:13Et maintenant j'aime la façon dont nous revenons à la réflexion, vous savez, par premier principe, qu'est-ce que l'attention ?
00:06:18Comment pouvons-nous rendre cela plus efficace ?
00:06:20Un million de jetons, c'est fou, n'est-ce pas ? GPT-2 était à 1 024, et tout le monde se disait : “Oh, c'est vraiment grand. Nous n'aurons jamais besoin de plus.”
00:06:28Où voyez-vous cela aller, genre dans le futur ? Genre Jeff Dean me parlait l'autre jour d'une attention d'un billion de jetons.
00:06:35Pensez-vous que nous devrions aller vers une attention d'un billion de jetons ?
00:06:38C'est définitivement quelque chose vers quoi nous pouvons explorer, n'est-ce pas, la longueur ultra-longue du contexte, définitivement.
00:06:45C'est quelque chose qui est très passionnant à explorer, et quelque chose que la conception de l'architecture, ainsi que le matériel, nécessiterait beaucoup de recherche.
00:06:54Oui.
00:06:55Pensez-vous qu'il y a encore beaucoup de fruits faciles à cueillir ?
00:06:57Typiquement aujourd'hui, nous avons vu OpenAI réduire vraiment, je veux dire, nous ne savons pas comment précisément, mais genre réduire leur facture d'inférence de moitié en ayant probablement un traitement plus efficace autour des attentions.
00:07:08Pensez-vous qu'il y ait encore beaucoup de fruits faciles à cueillir concernant la façon dont nous pouvons traiter cela ?
00:07:14Une chose qui reste donc très intéressante à propos de M3 est à quel point il est bon marché, en particulier en raison de cette attention éparse, ou en partie parce qu'il est petit, mais il est aussi très efficace.
00:07:22C'est vrai.
00:07:23Pensez-vous que nous pouvons aller encore beaucoup plus loin ?
00:07:25Peut-être, comment avez-vous inventé le MinMax Sparse Attention ?
00:07:29Était-ce un agent qui a eu l'idée ?
00:07:31Était-ce encore un humain qui a eu l'idée ?
00:07:33Dites-nous en un peu plus à ce sujet.
00:07:35Oui.
00:07:36Nous pensons donc qu'il y a encore beaucoup de travail qui peut être consacré à l'architecture et à l'optimisation de l'inférence afin que le modèle puisse être plus efficace, en particulier s'il y a des tâches très sensibles aux tâches, mais qui nécessitent des capacités très fortes, n'est-ce pas ?
00:07:52Et pour ce type de tâches, nous voulons vraiment que le modèle soit efficace.
00:07:56Et qui a trouvé cette partie ?
00:07:59En fait, je pense qu'un stagiaire de notre équipe a travaillé là-dessus.
00:08:02Moi aussi.
00:08:03Pas encore un stagiaire.
00:08:04Cela n'arrive généralement pas dans beaucoup de laboratoires, car je pense que dans certains laboratoires, les stagiaires n'ont pas accès aux données, au travail, et ainsi de suite.
00:08:15Mais oui, nous sommes ouverts à quiconque souhaite contribuer à notre modèle.
00:08:20L'architecture a donc été conçue par un stagiaire.
00:08:23C'est très bien.
00:08:24Il y a encore du travail pour les stagiaires ici.
00:08:26Bonne nouvelle.
00:08:27C'est aussi une bonne transition vers la façon dont MinMax fonctionne en interne.
00:08:32Nous discutions donc avant de monter sur scène en disant que tout le monde peut proposer un projet.
00:08:37Pouvez-vous nous dire un peu comment vous êtes organisés, comment vous faites de la recherche ?
00:08:41Je pense que c'est très différent, même de l'école ou même des premiers, vous savez,
00:08:49les entreprises technologiques précédentes.
00:08:51C'est assez différent.
00:08:53C'est que ce dont nous nous assurons, c'est d'avoir de bonnes bases et une bonne infrastructure afin que tout le monde puisse jouer avec le modèle
00:09:04et puisse réfléchir à ce qu'il peut améliorer avec le modèle.
00:09:07Et puis après les sorties de modèles, quand ils sont libres, n'est-ce pas, ils peuvent jouer avec le modèle.
00:09:13Ils peuvent penser à leurs propres évaluations.
00:09:15Ils peuvent trouver leurs propres faiblesses et proposer une chose qu'ils veulent améliorer sur le modèle.
00:09:21Et puis d'autres personnes qui s'intéressent à cela vont, vous savez, proposer de rejoindre le projet.
00:09:26Et ils travailleront dessus pendant quelques semaines ou même quelques mois.
00:09:29Et lorsque cela fonctionne, la chose finale est intégrée à notre modèle.
00:09:33C'est, vous savez, nous l'utilisons dans notre entraînement final et c'est livré au public.
00:09:39Intéressant.
00:09:39Vous pouvez donc avoir des gens qui travaillent pendant très longtemps sur un projet.
00:09:42Quand vous dites quelques mois, cela peut être une exploration vraiment approfondie de ce qui est possible.
00:09:46Oui.
00:09:47Et je dirais, par exemple, que l'architecture peut nécessiter un temps plus long d'investigation, de recherche,
00:09:53d'expériences, voire de refonte des évaluations pour le pré-entraînement.
00:09:57Oui.
00:09:58Cela peut donc prendre plus de temps.
00:10:00C'est vraiment bien.
00:10:01Oui.
00:10:02Et je sais que vous êtes aussi très fort en évaluation.
00:10:03Je suis d'accord.
00:10:04Nous pourrions en parler.
00:10:05Une chose probablement liée à cela est cette spécificité unique que M3 et votre équipe possèdent autour de
00:10:11la multimodalité.
00:10:12Donc pas seulement du texte, mais ce modèle peut aussi comprendre l'image et la vidéo.
00:10:16Et si j'ai bien compris, mais veuillez mieux l'expliquer, lorsque nous lisons la fiche du modèle sur Hugging Face,
00:10:21il est dit que le modèle a été entraîné dès la première étape en tant que multimodal, pas seulement comme un utilisateur
00:10:26en tant qu'après-source, n'est-ce pas ?
00:10:27Oui.
00:10:28Pouvez-vous nous en dire un peu plus à ce sujet et pourquoi vous pensez que c'est important et pourquoi
00:10:33commencez-vous dès la première étape par l'entraînement multimodal et pas seulement cet entraînement ?
00:10:37Nous appelons cela la multimodalité native.
00:10:41Et donc il est en quelque sorte typique pour les laboratoires de modèles d'entraîner le modèle multi, disons les capacités de compréhension de la vision
00:10:50une fois que le pré-entraînement textuel est terminé.
00:10:54Ils mettent des adaptateurs et entraînent ensuite cette partie.
00:10:57Mais ce que nous avons découvert, c'est que cela nuirait en fait aux performances textuelles.
00:11:02Et les performances de compréhension de la vision ne convergeraient pas aussi bien parce que le modèle converge en quelque sorte
00:11:08vers la compréhension textuelle.
00:11:11Et ce n'est tout simplement pas le plus optimal et ce n'est pas non plus le plus évolutif.
00:11:17Si vous y réfléchissez, nous voulons faire évoluer les données, n'est-ce pas ?
00:11:20Et nous pouvons aussi, certains laboratoires entraînent cette capacité à partir de la moitié du pré-entraînement.
00:11:27Par exemple, un pré-entraînement continu.
00:11:29Mais ce que nous avons trouvé, c'est que cela serait très, vous savez, sensible à la recette.
00:11:35C'est différent pour, la recette serait différente pour différentes architectures, différents, vous savez,
00:11:41mélanges de données, différents taux d'apprentissage.
00:11:43C'est difficile à contrôler, difficile de, vous savez, faire évoluer vos résultats d'expérimentation
00:11:52et vos conclusions vers un modèle plus grand.
00:11:54Et donc, vous savez, ce que nous avons pensé, c'est pourquoi ne pas simplement l'entraîner dès la toute première étape ?
00:12:01C'est ce qui vient le plus naturellement.
00:12:03Nous savons que beaucoup de laboratoires rencontrent des problèmes en faisant cela.
00:12:07Le modèle s'effondrerait après quelques étapes d'entraînement, vous savez, à la fois pour la compréhension du texte et de la vision.
00:12:15Mais nous avons réussi à résoudre ce problème.
00:12:18Nous avons fait beaucoup de travail sur l'informatique et nous avons fait beaucoup de travail sur les données que nous entraînons réellement.
00:12:26Par exemple, nous faisons des données entrelacées, ce que nous appelons des données entrelacées.
00:12:30Ce sont en fait des données naturelles, mais nous gardons les images et les vidéos au lieu de les masquer.
00:12:38Et nous faisons un très bon travail de nettoyage et de masquage des données.
00:12:42Et nous concevons une excellente modélisation des récompenses pour un entraînement dès le premier pas et qui s'adapte beaucoup.
00:12:50Oui, ça ne s'effondre pas.
00:12:52C'est vraiment impressionnant.
00:12:53Impressionnant.
00:12:54Devons-nous nous attendre à un modèle bien plus grand à l'avenir ?
00:12:57Celui-ci est donc encore assez petit, n'est-ce pas ?
00:12:59Il fait 428 milliards de paramètres, dont 23 milliards actifs.
00:13:04Eh bien, pensez-vous dépasser le billion ?
00:13:08Certainement.
00:13:09Oui, certainement à l'avenir.
00:13:12Il y a de nombreuses tâches que le modèle ne pourrait pas très bien accomplir avec un plus petit nombre de paramètres.
00:13:21Nous allons définitivement voir plus grand que ça.
00:13:25C'est super.
00:13:26On a hâte d'y être.
00:13:27Et une autre chose intéressante que je trouve toujours fascinante chez Minimax, c'est que vous proposez toute une gamme d'applications et de produits, n'est-ce pas ?
00:13:36Je me souviens donc que Minimax a commencé à open sourcer des choses sur la plateforme Hugging Face en janvier de l'année dernière.
00:13:43C'était donc il y a 18 mois.
00:13:45Et nous discutions un peu avec l'équipe pour comprendre ce que vous faisiez.
00:13:48Et je me souviens que vous aviez déjà une utilisation énorme sur certaines de ces applications.
00:13:54Pouvez-vous nous raconter un peu comment tout cela a commencé ?
00:13:57Est-ce que vous aviez essentiellement beaucoup d'applications et puis vous vous êtes dit, nous avons toutes ces données.
00:14:02Pourquoi ne pas entraîner un modèle ?
00:14:03Et ensuite, ils ont créé une équipe de recherche.
00:14:05Quelle a été l'histoire ?
00:14:07Notre histoire, c'est le modèle dès le premier jour.
00:14:11Je crois donc qu'un modèle multimodal, un modèle capable de comprendre toutes les visions et de restituer toutes les modalités,
00:14:19était la première chose qu'avait planifiée notre PDG dès le premier jour, avant même la création de l'entreprise.
00:14:25C'était donc le rêve de l'AGI.
00:14:27Je pense que c'était très, très tôt, avant même la sortie de ChatGPT.
00:14:30Waouh.
00:14:31Oui.
00:14:32Et puis les applications sont venues s'ajouter.
00:14:35Puisque vous avez des capacités de modèle, vous voulez que les gens en fassent l'expérience.
00:14:40Tout le monde ne peut pas l'utiliser via l'API, n'est-ce pas ?
00:14:43On ne peut pas s'attendre à ce que tout le monde l'expérimente avec l'API.
00:14:46Nous avons donc besoin de bonnes interactions utilisateur, d'interfaces, de bonnes applications, de bons scénarios pour que les gens puissent faire l'expérience du modèle.
00:14:57Je pense qu'en fait, ces applications ont touché plus de 300 millions de personnes dans environ 200 pays à travers le monde.
00:15:06Et je crois plus d'un million d'entreprises également.
00:15:09Oui.
00:15:10C'était hallucinant quand j'ai entendu parler de cette échelle.
00:15:12Et on ne réalise pas souvent l'ampleur de ce type d'utilisation déjà en place.
00:15:17Et cela m'amène un peu à la question du modèle économique open source et tout ça, qui est la question permanente : aujourd'hui, c'est bien de rendre un modèle open source, mais il faut aussi avoir des sources de revenus, n'est-ce pas ?
00:15:33Et donc je suppose que M3 est quelque chose que vous avez décidé, par exemple, de donner gratuitement.
00:15:38Et je pense que c'est formidable pour le monde.
00:15:41Comment voyez-vous cela ?
00:15:42Utilisez-vous aussi des modèles spécifiques pour l'application ?
00:15:45Pensez-vous qu'à l'avenir vous continuerez — c'est probablement difficile à dire avec certitude — à proposer des modèles open source ?
00:15:52Quelle est la culture actuelle autour de l'open source ?
00:15:55Personnellement, et pour l'équipe de recherche sur les modèles, nous espérons toujours rendre les modèles open source.
00:16:01C'est notre projet car nous voyons bien comment la communauté open source peut aider ensemble à construire un meilleur modèle.
00:16:09Par exemple, nous recevons énormément de retours sur les performances du modèle de la part de cette formidable communauté et nous recevons des PR sur tout ce que nous open sourçons, n'est-ce pas ?
00:16:20Et c'est très, très précieux pour nos versions ultérieures.
00:16:24Donc l'open source est définitivement une excellente chose.
00:16:27C'est super.
00:16:28Et d'ailleurs, avez-vous une requête pour le public, les personnes qui utilisent M3 ou Minimax ?
00:16:33Y a-t-il quelque chose que vous aimeriez qu'ils vous renvoient comme commentaires ?
00:16:37Lisez-vous, par exemple, quand les gens essaient de modifier les modèles ou de faire des réglages ?
00:16:43Ou quelle est la meilleure chose que vous puissiez retirer de la communauté pour les futurs modèles, par exemple ?
00:16:51Je dirais tous les problèmes que les gens rencontrent, en particulier avec la multimodalité, n'est-ce pas ?
00:16:57C'est la première fois que nous combinons tout cela.
00:16:59Nous allons définitivement voir plus grand à l'avenir.
00:17:03Il y a peut-être quelques défauts pour l'instant, mais nous les améliorons.
00:17:06Donc tous les retours indiquant que le modèle ne fonctionne pas très bien, nous allons certainement les améliorer dans les versions futures.
00:17:13Et aussi toutes les fonctionnalités que les gens souhaitent.
00:17:17Disons, par exemple, l'effort de réflexion, n'est-ce pas ?
00:17:21Certaines personnes le demandent.
00:17:23Tout le monde peut demander et nous essaierons de l'accomplir dans les futurs modèles.
00:17:28Oui.
00:17:29Voyez-vous beaucoup d'utilisateurs s'intéresser déjà à la multimodalité pour les agents de codage ?
00:17:33J'ai l'impression que c'est un peu sous-exploité.
00:17:37C'est le cas.
00:17:38C'est le cas.
00:17:39Mais cela peut en réalité libérer beaucoup de capacités et un grand nombre d'applications d'agents.
00:17:47Par exemple, vous voulez que le modèle lise des PowerPoint, n'est-ce pas ?
00:17:51Ou qu'il lise des rapports peu structurés.
00:17:55Et vous voulez qu'il comprenne une vidéo très longue.
00:17:58Disons que vous avez fait une longue vidéo et que vous voulez que le modèle agisse en utilisant des outils après l'avoir comprise.
00:18:07Et cela ouvre un large éventail de cas d'utilisation pour les agents.
00:18:12Donc l'agent pourrait enfin regarder mon tutoriel YouTube et comprendre comment utiliser mes outils de code, comment je les décris ?
00:18:18C'est quelque chose comme ça ?
00:18:19Hein ?
00:18:20L'agent pourrait-il enfin regarder des tutoriels YouTube et tout comprendre grâce à eux ?
00:18:24Oui.
00:18:25Oui.
00:18:26Je pense que oui.
00:18:27Utilisez-vous beaucoup d'outils de codage d'agents en interne ?
00:18:30Est-ce que c'est, je veux dire, le code c'est sûr, mais est-ce que c'est aussi déjà appliqué à la recherche ?
00:18:34Est-ce automatisé ?
00:18:35Oui.
00:18:36En partie ?
00:18:37Ou non ?
00:18:38Comment cela fonctionne-t-il ?
00:18:39Oui.
00:18:40Nous avons nos propres environnements de recherche.
00:18:42Nous construisons nos propres environnements qui automatisent nos flux de travail.
00:18:46Je dirais qu'une grande partie de nos flux de travail sont automatisés.
00:18:49Vous voyez bien que les derniers modèles de pointe poursuivent tous l'optimisation des kernels sans capacité, n'est-ce pas ?
00:18:57Comme laisser le modèle évaluer d'autres modèles.
00:19:00Laisser le modèle générer des données automatiquement, des choses comme ça.
00:19:05Vous voyez que de plus en plus de modèles sont capables de le faire, y compris M3.
00:19:10En fait, nous étions très bons sur ces cas, les horizons plus longs et l'optimisation des kernels.
00:19:16Nous pouvons donc exploiter ces capacités de modèle, les regrouper et aider notre routine quotidienne,
00:19:24et rendre nos itérations encore plus rapides.
00:19:26Est-ce que M3 construit déjà M4 ?
00:19:30On construit M3.1.
00:19:31M3.1 ?
00:19:32Oui.
00:19:33D'accord.
00:19:34Pas encore le gros.
00:19:35Déjà.
00:19:36J'aimerais terminer sur ce qui vous passionne pour le mois à venir.
00:19:41Qu'en pensez-vous ?
00:19:42Cela peut concerner les fonctionnalités ou des choses que vous voulez voir arriver en IA, ou plus généralement
00:19:49en ce qui concerne ce qui vous préoccupe le plus, j'ai envie de dire, et qui va se produire.
00:19:54Beaucoup de choses sont très excitantes.
00:19:58Mais ce que je trouve le plus passionnant récemment, ce sont les multi-agents. Je pense que beaucoup
00:20:04d'applications d'IA utilisent le routage de modèles, des multi-agents, ce qui libère encore plus de capacités,
00:20:11des tâches encore plus complexes.
00:20:13Et cela nous montre aussi de quoi les modèles sont capables ou non.
00:20:19Et on peut, vous savez, faire beaucoup de choses avec ça.
00:20:22C'est plutôt excitant.
00:20:24Merci beaucoup, Alive.
00:20:25Un plaisir de vous avoir.
00:20:26Merci de m'avoir invité.
00:20:27Merci à tous.
00:20:28Merci à tous.
00:20:29Merci à tous.
00:20:29Merci.
00:20:29Merci à tous.

핵심 요약

Le modèle open source M3 intègre l'architecture Minimax Sparse Attention pour gérer un contexte d'un million de jetons avec une multimodalité native dès la première étape d'entraînement.

하이라이트

  • Le modèle M3 possède 400 milliards de paramètres au total dont 20 milliards activés.

  • L'architecture Minimax Sparse Attention permet de gérer une longueur de contexte d'un million de jetons.

  • Les applications de Minimax atteignent plus de 300 millions de personnes dans environ 200 pays.

  • L'entraînement multimodal natif intègre les images et les vidéos dès la première étape pour préserver les performances textuelles.

타임라인

Présentation du modèle M3 et de ses performances

  • Le modèle M3 compte environ 400 milliards de paramètres au total avec 20 milliards activés.
  • Le modèle intègre le codage, la vision et un contexte de un million de jetons.
  • L'architecture MSA gère la multimodalité native pour traiter les images et les vidéos.

Cette section introduit Olive Song et le laboratoire Minimax à travers la sortie du modèle M3. Les caractéristiques techniques combinent des capacités de codage élevées et le traitement de fichiers visuels et textuels massifs.

L'architecture Minimax Sparse Attention et le contexte long

  • La version M1 atteignait déjà un contexte de dix millions de jetons pour l'analyse de livres.
  • La branche d'indexation sélectionne les éléments prioritaires tandis que la branche éparse effectue les calculs.
  • Un stagiaire au sein de l'équipe a conçu cette architecture.

L'historique du contexte long montre une évolution vers les agents conversationnels. L'architecture MSA résout la complexité quadratique en combinant une sélection d'index et un calcul éparse.

Organisation interne et recherche collaborative chez Minimax

  • L'infrastructure permet à l'ensemble des membres d'expérimenter directement avec les modèles.
  • Les collaborateurs identifient les faiblesses et développent des améliorations sur plusieurs semaines ou mois.

Le fonctionnement interne repose sur une base technique ouverte où chaque collaborateur, y compris les stagiaires, peut proposer des contributions intégrées ensuite aux entraînements finaux.

Multimodalité native et adoption mondiale

  • L'entraînement multimodal dès le premier pas évite la baisse des performances textuelles constatée avec des adaptateurs.
  • Les applications de Minimax touchent plus de 300 millions d'utilisateurs dans 200 pays et plus d'un million d'entreprises.

La multimodalité native utilise des données entrelacées nettoyées sans masquage pour stabiliser l'apprentissage. Les applications grand public démontrent une utilisation à grande échelle.

Perspectives futures et multi-agents

  • Les flux de recherche internes automatisent l'optimisation des kernels et l'évaluation des modèles.
  • Le développement se concentre actuellement sur les architectures multi-agents pour traiter des tâches complexes.

Les versions futures du modèle M3 intègrent les retours de la communauté open source. L'utilisation de systèmes multi-agents ouvre la voie à des niveaux d'autonomie supérieurs.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기