Por qué los agentes de IA necesitan un contexto de un millón de tokens — Thomas Wolf y Olive Song, MiniMax

AAI Engineer
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00Nos acompaña en el escenario el cofundador y director científico de Hugging Face, Thomas Wolfe.
00:00:30Hola a todos. Hola, Olive. Qué gusto tenerte en el escenario. Gracias por invitarme. Bueno, creo que hoy nos espera una gran presentación porque acaban de ver GLM, que actualmente es el número dos en Artificial Analysis. Lo menciono porque nadie puede usarlo. Y ahora tenemos al número cuatro. Así que básicamente tendrán todos los mejores modelos, al menos el mejor modelo de código abierto, uno tras otro.
00:00:57Y tenemos mucha suerte de contar con Olive, que tiene una trayectoria bastante increíble. Llegó a Estados Unidos, a Pensilvania. Estudiaba haciendo su doctorado en la NYU en el laboratorio de Yann LeCun, trabajando en JPA. Pero decidimos que no hablaremos de JPA hoy, ¿verdad? Eso queda para otro día. Y en lugar de unirse a Hugging Face, que también estaba en Nueva York en ese momento, decidió unirse a Minimax.
00:01:26Así que para quienes quizás no conozcan todos los laboratorios de IA del mundo, y están perdonados porque creo que hay como 64 laboratorios ahora mismo, Minimax es uno de los principales de lo que llamamos los dragones de IA en China. Estos son los nuevos; está DeepSeek, que ahora es muy conocido; Moonshot, que hace Kimi; Zhipu; y GLM, que acaban de ver.
00:01:51Aquí está el nuevo modelo y ahora tenemos a Minimax. Todos son sumamente buenos, equipos muy talentosos que luchan por el primer puesto.
00:01:58El último lanzamiento de Minimax fue M3, a principios de junio, que era el mejor modelo en ese momento, el mejor modelo de código abierto.
00:02:08Muy impresionante. Hay muchas cosas muy interesantes sobre este modelo, así que profundizaremos rápidamente en ellas y luego hablaremos un poco sobre lo que hace que Minimax sea especial y genial.
00:02:20Sí. Para empezar, Olive, ¿podrías darnos un poco tu perspectiva sobre M3, qué te gusta de este modelo y cómo fue el lanzamiento?
00:02:32Sí, lanzamos M3 a principios de este mes, y es un modelo más pequeño con 400, alrededor de 400 mil millones de parámetros totales y 20 mil millones activos.
00:02:45Pero es muy capaz tanto en términos de rendimiento de programación como en la comprensión de visión.
00:02:52Eso es lo que los modelos de código abierto normalmente no tienen; es decir, no solo puede encargarse de la programación, sino que también puede entender videos e imágenes, y cuenta con un contexto súper largo de un millón de tokens.
00:03:09Con nuestra nueva arquitectura llamada MSA, Minimax Sparse Attention. Realmente juntamos estas tres cosas porque sabemos que son o serán muy importantes en las futuras aplicaciones de IA: capacidades de programación,
00:03:26capacidades de agentes, contexto más largo y comprensión multimodal. Sí, creo que eso es muy interesante del modelo.
00:03:35Sí, hay mucho que analizar en este modelo, y sigue siendo, creo, el único modelo de código abierto entre los cinco primeros que es verdaderamente multimodal, así que tenemos que hablar de eso.
00:03:45Pero quizás primero sobre el contexto largo, porque también fue el primero que realmente tuvo este contexto largo real de un millón de tokens que de verdad funciona.
00:03:54Y ustedes también desarrollaron la atención dispersa de Minimax (Minimax Sparse Attention), que es esa técnica para hacerlo eficiente, la cual también publicaron y compartieron ampliamente.
00:04:04¿Podrías hablarnos un poco sobre esto y sobre cómo evolucionó el proyecto desde la atención hasta lograr este contexto largo?
00:04:11Sí, diría que la historia del contexto largo se remonta a Minimax M1 y Minimax 01, donde el modelo en realidad era capaz de realizar tareas con un contexto de 10 millones de tokens.
00:04:25¿Diez millones? Diez millones, sí. Pero entonces no era un modelo agéntico, ¿verdad? Era simplemente, por ejemplo, cargar un libro completo y poder dar reseñas sobre él, cosas por el estilo.
00:04:37Así que lo que nos dimos cuenta fue que un contexto más largo realmente desbloquea muchas capacidades, especialmente al interactuar con los usuarios.
00:04:47Y ahora, cuando el agente interactúa con todo el entorno y recibe todas las respuestas de las herramientas, obteniendo múltiples rondas, un contexto más corto no sería suficiente para realizar tareas complejas.
00:05:03Así que para esta versión dijimos: oh, tenemos que recuperar nuestro contexto largo.
00:05:09Y por eso lo que perseguimos fue con nuestra atención dispersa de Minimax, que, ya sabes, era la arquitectura escalable y de diseño sencillo.
00:05:23Así que diría que, a grandes rasgos, ¿no? Tiene una rama de índices que, ya sabes, selecciona a un nivel superior qué es lo que importa más en el contexto.
00:05:36Y luego tenemos una rama de atención dispersa que calcula, realiza el cálculo en los bloques seleccionados para llevar a cabo realmente las tareas.
00:05:44Y sí, de esa manera diseñamos una arquitectura elegante para poder escalar la longitud y luego escalar el tamaño del modelo en el futuro con ella.
00:05:57Es maravilloso. Me gusta cómo, para aquellos que llevan bastante tiempo en el campo, hemos tenido mucho trabajo sobre la atención, ¿verdad?
00:06:03Esta complejidad de N al cuadrado, y hubo mucha atención lineal.
00:06:06Sí.
00:06:06Y luego de alguna manera todo esto desapareció en un momento dado.
00:06:09Cuando apareció Flash Attention, descubrimos que solo necesitábamos un núcleo más eficiente.
00:06:13Y ahora me gusta cómo volvemos a pensar desde los primeros principios: ¿qué es la atención?
00:06:18¿Cómo podemos hacerla más eficiente?
00:06:20Así que un millón de tokens es una locura, ¿verdad? GPT-2 tenía 1.024, y todos decían: “Oh, eso es realmente grande. Nunca necesitaremos más”.
00:06:28¿Adónde ves que va esto en el futuro? El otro día Jeff Dean me comentaba sobre la atención de un billón de tokens.
00:06:35¿Crees que deberíamos avanzar hacia una atención de un billón de tokens?
00:06:38Definitivamente es algo hacia lo que podemos explorar, ¿verdad? Longitudes ultraextensas del contexto, sin duda.
00:06:45Es algo muy emocionante para explorar, y requiere mucha investigación en el diseño de la arquitectura junto con el hardware.
00:06:54Sí.
00:06:55¿Crees que todavía hay muchos frutos al alcance de la mano?
00:06:57Por lo general, hoy vimos que OpenAI redujo considerablemente —bueno, no sabemos cómo exactamente como empresa—, pero redujeron sus costos de inferencia a la mitad, probablemente teniendo un procesamiento más eficiente en torno a la atención.
00:07:08¿Crees que todavía hay muchos frutos fáciles de conseguir en cuanto a cómo procesamos esto?
00:07:14Algo que sigue siendo muy interesante sobre M3 es lo económico que es, en parte debido a esta atención dispersa, o en parte porque es un modelo pequeño, pero también es muy eficiente.
00:07:22Cierto.
00:07:23¿Crees que podemos ir aún mucho más allá?
00:07:25Quizás, ¿cómo inventaron ustedes la atención dispersa de MinMax?
00:07:29¿Fue un agente el que se le ocurrió la idea?
00:07:31¿Fue un humano el que todavía ideó el concepto?
00:07:33Cuéntanos un poco sobre esto.
00:07:35Sí.
00:07:36Creemos que todavía hay mucho trabajo que se puede hacer en la arquitectura y en la optimización de la inferencia para que el modelo sea más eficiente, especialmente si hay tareas que son muy sensibles a la tarea pero que requieren capacidades muy sólidas, ¿verdad?
00:07:52Y para ese tipo de tareas, realmente queremos que el modelo sea eficiente.
00:07:56¿Y a quién se le ocurrió esta parte?
00:07:59De hecho, creo que un pasante de nuestro equipo trabajó en eso.
00:08:02Yo también.
00:08:03Todavía no somos pasantes.
00:08:04Eso no suele suceder en muchos laboratorios porque creo que en algunos laboratorios los pasantes no tienen acceso a los datos, al trabajo, etcétera.
00:08:15Pero sí, estamos abiertos a cualquiera que quiera contribuir a nuestro modelo.
00:08:20Así que la arquitectura fue diseñada en realidad por un pasante.
00:08:23Eso es muy bueno.
00:08:24Todavía hay trabajo para los pasantes aquí.
00:08:26Buenas noticias.
00:08:27Esa es también una buena transición hacia cómo trabaja MinMax internamente.
00:08:32Estábamos discutiendo antes de subir al escenario que cualquiera puede proponer un proyecto.
00:08:37¿Puedes contarnos un poco sobre cómo están organizados, cómo hacen la investigación?
00:08:41Creo que eso es muy diferente incluso a la escuela o incluso antes, ya sabes,
00:08:49en las empresas tecnológicas anteriores.
00:08:51Es bastante diferente.
00:08:53Lo que nos aseguramos es de tener una buena base y una buena infraestructura para que cualquiera pueda jugar con el modelo
00:09:04y pueda pensar en qué puede mejorar del modelo.
00:09:07Y luego, después de los lanzamientos de los modelos, cuando están libres, pueden jugar con el modelo.
00:09:13Pueden pensar en sus propias evaluaciones.
00:09:15Pueden encontrar sus propias debilidades y proponer algo que quieran mejorar en el modelo.
00:09:21Y luego otras personas que estén interesadas en eso propondrán unirse al proyecto.
00:09:26Y trabajarán en él durante un par de semanas o incluso un par de meses.
00:09:29Y cuando funciona, el resultado final se integra en nuestro modelo.
00:09:33Lo usamos en nuestro entrenamiento final y se lanza al público.
00:09:39Interesante.
00:09:39Así que puedes tener personas trabajando durante mucho tiempo en un proyecto.
00:09:42Cuando dices un par de meses, puede ser una exploración muy profunda de lo que es posible.
00:09:46Sí.
00:09:47Y diría que, por ejemplo, la arquitectura puede requerir un tiempo más largo de investigación, búsqueda,
00:09:53experimentos, e incluso repetir las evaluaciones para el entrenamiento previo.
00:09:57Sí.
00:09:58Así que podría tomar más tiempo.
00:10:00Eso es muy agradable.
00:10:01Sí.
00:10:02Y sé que también le dan mucha importancia a la evaluación.
00:10:03De acuerdo.
00:10:04Podríamos hablar de eso.
00:10:05Algo probablemente relacionado con eso es esta especificidad única que M3 y tu equipo tienen en torno a
00:10:11la multimodalidad.
00:10:12Así que no solo texto, sino que este modelo también puede entender imágenes y videos.
00:10:16Y según entiendo, pero por favor explícalo mejor, cuando leemos la tarjeta del modelo en Hugging Face,
00:10:21dice que el modelo fue entrenado desde el primer paso como multimodal, no solo como...
00:10:26como fuente posterior, ¿verdad?
00:10:27Sí.
00:10:28¿Puedes contarnos un poco más sobre eso y por qué crees que es importante y por qué
00:10:33empiezan desde el primer paso en el entrenamiento multimodal y no solo en este entrenamiento?
00:10:37Lo llamamos multimodalidad nativa.
00:10:41Y de alguna manera es típico para los laboratorios de modelos entrenar la parte multimodal, digamos las capacidades de comprensión visual,
00:10:50después de que el entrenamiento previo de texto ha terminado.
00:10:54Ponen adaptadores y luego entrenan esa parte.
00:10:57Pero lo que descubrimos fue que eso en realidad perjudicaría el rendimiento del texto.
00:11:02Y el rendimiento de la comprensión visual no convergería tan bien porque el modelo converge
00:11:08hacia la comprensión del texto.
00:11:11Y simplemente no es lo más óptimo ni tampoco lo más escalable.
00:11:17Si lo piensas, queremos escalar los datos, ¿verdad?
00:11:20Y también, algunos laboratorios entrenan esta capacidad desde la mitad del entrenamiento previo.
00:11:27Por ejemplo, entrenamiento previo continuado.
00:11:29Pero lo que descubrimos es que esto sería muy sensible a la receta.
00:11:35La receta sería diferente para diferentes arquitecturas, diferentes mezclas de datos,
00:11:41diferentes tasas de aprendizaje.
00:11:43Es difícil de controlar, difícil de escalar, no se pueden escalar realmente los resultados de los experimentos
00:11:52y las conclusiones a un modelo más grande.
00:11:54Así que pensamos: ¿por qué no entrenar desde el primer paso?
00:12:01Eso es lo que resulta más natural.
00:12:03Sabemos que muchos laboratorios se encuentran con problemas al hacer eso.
00:12:07El modelo colapsaría después de un par de pasos de entrenamiento, tanto en la comprensión de texto como de visión.
00:12:15Pero logramos resolver ese problema.
00:12:18Hicimos un gran trabajo con la infraestructura y con los datos que realmente estamos entrenando.
00:12:26Por ejemplo, usamos datos intercalados, lo que llamamos datos intercalados.
00:12:30En realidad son datos naturales, pero mantenemos las imágenes y los videos dentro en lugar de enmascararlos.
00:12:38Y realizamos una limpieza y un enmascaramiento bastante buenos en los datos.
00:12:42Y hacemos un modelado de recompensas muy bueno para entrenarlo desde el primer paso y que escale muchísimo.
00:12:50Sí, no colapsa.
00:12:52Eso es realmente impresionante.
00:12:53Impresionante.
00:12:54¿Debemos esperar un modelo mucho más grande en el futuro?
00:12:57Así que este todavía es bastante pequeño, ¿verdad?
00:12:59Tiene 428 mil millones de parámetros, 23 mil millones activos.
00:13:04Bueno, ¿crees que superarán el billón?
00:13:08Definitivamente.
00:13:09Sí, definitivamente en el futuro.
00:13:12Hay muchas tareas en las que el modelo no podría rendir muy bien con parámetros más pequeños.
00:13:21Definitivamente vamos a ser más ambiciosos que esto.
00:13:25Genial.
00:13:26Lo esperamos con ansias.
00:13:27Y otra cosa interesante que siempre me fascina de Minimax es cómo también tienen toda esta gama de aplicaciones y productos, ¿verdad?
00:13:36Así que ya recuerdo, Minimax comenzó a abrir código de cosas en la plataforma Hugging Face en enero del año pasado.
00:13:43Así que eso fue hace 18 meses.
00:13:45Y estuvimos charlando un poco sobre el equipo para entender qué estaban haciendo.
00:13:48Y recuerdo que ustedes ya tenían un uso enorme en algunas de estas aplicaciones.
00:13:54¿Puedes contarnos un poco cómo empezó esto, verdad?
00:13:57Básicamente tenían muchas aplicaciones y luego pensaron, tenemos todos estos datos.
00:14:02¿Por qué no entrenar un modelo?
00:14:03Y luego armaron un equipo de investigación.
00:14:05¿Cómo fue esa historia?
00:14:07Nuestra historia es el modelo desde el primer día.
00:14:11Creo que un modelo multimodal, un modelo que pueda entender todas las visiones y generar todas las modalidades,
00:14:19fue lo primero que planeó nuestro director ejecutivo el primer día, incluso antes de que la empresa comenzara.
00:14:25Ese era el sueño de la AGI.
00:14:27Creo que eso fue muy, muy temprano, incluso antes de que saliera ChatGPT.
00:14:30Vaya.
00:14:31Sí.
00:14:32Y luego las aplicaciones fueron algo que vino después.
00:14:35Porque como tienes ciertas capacidades de modelo, quieres que la gente las experimente bien.
00:14:40No mucha gente puede usarlo con API, ¿verdad?
00:14:43No podemos esperar que todos lo experimenten con una API.
00:14:46Así que necesitamos buenas interacciones de usuario, ya sabes, interfaces, buenas aplicaciones, buenos escenarios para que la gente pueda, ya sabes, experimentar el modelo.
00:14:57Creo que en realidad esas aplicaciones cubrieron a más de 300 millones de personas en unos 200 países a nivel global.
00:15:06Y creo que también a más de un millón de empresas.
00:15:09Sí.
00:15:10Esto me voló la cabeza cuando escuché sobre el tamaño.
00:15:12Y a menudo no nos damos cuenta de la magnitud de este tipo de uso ya.
00:15:17Y eso me lleva un poco a la pregunta sobre el modelo de negocio de código abierto y todo eso, que es la pregunta de siempre, que ahora está bien abrir modelos, pero también necesitas tener alguna fuente de ingresos, ¿verdad?
00:15:33Y supongo que M3 es algo que decidieron, por ejemplo, regalar gratis.
00:15:38Y creo que eso es genial para el mundo.
00:15:41¿Cómo ves esto?
00:15:42¿También tienes algunos modelos específicos que usas para la aplicación?
00:15:45¿Piensas, crees que en el futuro seguirás... es probablemente difícil decirlo con certeza, pero crees que seguirás abriendo modelos?
00:15:52¿Cómo es la cultura en torno al código abierto en este momento?
00:15:55Personalmente, y también para el equipo de investigación de modelos, siempre esperamos abrir los modelos.
00:16:01Ese es nuestro plan porque realmente vemos cómo la comunidad de código abierto en conjunto puede ayudar a construir un mejor modelo.
00:16:09Por ejemplo, recibimos muchos comentarios sobre el rendimiento del modelo por parte de la gran comunidad y recibimos solicitudes de extracción (PR) sobre lo que abrimos, ¿verdad?
00:16:20Y esos son muy, muy valiosos y se incorporan a nuestras versiones posteriores.
00:16:24Así que definitivamente el código abierto es genial.
00:16:27Genial.
00:16:28Y de hecho, ¿tienes alguna petición para la audiencia, para las personas que usan M3 o Minimax?
00:16:33¿Hay algo que te encantaría que te enviaran de vuelta como comentarios?
00:16:37Por ejemplo, ¿lees cuando la gente intenta modificar los modelos o hacer pruebas, ya sabes, ajustes?
00:16:43O, ¿cuál es la mejor cosa que crees que puedes tomar de la comunidad para los futuros modelos, por ejemplo?
00:16:51Yo diría que cualquier problema con el que se encuentre la gente, especialmente con la multimodalidad, ¿verdad?
00:16:57Esta es la primera vez que los combinamos.
00:16:59Definitivamente vamos a ser más ambiciosos con eso en el futuro.
00:17:03Puede que tenga algunos fallos ahora mismo, pero los estamos mejorando.
00:17:06Así que cualquier comentario de que el modelo no está rindiendo tan bien, definitivamente lo mejoraremos en versiones futuras.
00:17:13Y también cualquier característica que la gente quiera.
00:17:17Digamos, por ejemplo, esfuerzo de pensamiento, ¿verdad?
00:17:21Alguna gente lo pide.
00:17:23Cualquiera puede pedirlo e intentaremos lograrlo en los próximos modelos.
00:17:28Sí.
00:17:29¿Ves a muchos usuarios ahora mismo ya en multimodalidad en términos de agentes de programación?
00:17:33Siento que está un poco inexplorado.
00:17:37Lo está.
00:17:38Lo está.
00:17:39Pero en realidad puede desbloquear una gran cantidad de capacidades y muchas aplicaciones de agentes.
00:17:47Digamos, por ejemplo, que quieres que el modelo lea las presentaciones de PowerPoint, ¿verdad?
00:17:51O que lea algunos informes que no están muy estructurados.
00:17:55Y quieres que entienda un vídeo muy largo.
00:17:58Digamos que has hecho un vídeo largo y luego quieres que el modelo actúe usando algunas herramientas después de entenderlo.
00:18:07Y eso abre una amplia variedad de casos de uso de agentes.
00:18:12Así que el agente podría finalmente ver mi tutorial de YouTube y entender cómo usar mis herramientas de programación, cómo lo describo.
00:18:18¿Es algo así?
00:18:19¿Eh?
00:18:20¿Podría el agente finalmente ver tutoriales de YouTube y entender las cosas a partir de ellos?
00:18:24Sí.
00:18:25Sí.
00:18:26Creo que sí.
00:18:27¿Usan muchas herramientas de programación de agentes internamente?
00:18:30Es como, quiero decir, la programación por supuesto, pero, ¿también ya en términos de investigación?
00:18:34¿Está automatizado?
00:18:35Sí.
00:18:36¿En parte?
00:18:37¿O no?
00:18:38¿Cómo funciona esto?
00:18:39Sí.
00:18:40Tenemos nuestros propios entornos de investigación.
00:18:42Construimos nuestros propios entornos de investigación que automatizan nuestros flujos de trabajo.
00:18:46Diría que muchos de nuestros flujos de trabajo están automatizados.
00:18:49Puedes ver cómo los últimos modelos de frontera persiguen la optimización de kernels sin capacidad, ¿verdad?
00:18:57Como dejar que el modelo evalúe a otros modelos.
00:19:00Dejar que el modelo construya datos, datos automáticos, cosas por el estilo.
00:19:05Puedes ver cómo cada vez más modelos son capaces de hacer eso, incluido M3.
00:19:10De hecho, fuimos muy buenos en esos casos, horizontes más largos y organizaciones de kernels.
00:19:16Y así podemos usar esa capacidad del modelo, integrarla y ayudar con nuestra rutina diaria,
00:19:24y hacer nuestras iteraciones aún más rápidas.
00:19:26¿Está M3 construyendo M4 ya?
00:19:30Construyendo M3.1.
00:19:31¿M3.1?
00:19:32Sí.
00:19:33De acuerdo.
00:19:34Todavía no el trabajo.
00:19:35Ya.
00:19:36Me encantaría terminar con lo que encuentras emocionante en el próximo mes.
00:19:41¿Qué opinas?
00:19:42Puede ser más fácil en términos de funciones o cosas que quieres ver que sucedan en la IA, o más generalmente
00:19:49en términos de lo que realmente tienes en mente, diría yo, que va a suceder.
00:19:54Hay muchas cosas muy emocionantes.
00:19:58Pero lo que recientemente me parece más emocionante serían los agentes múltiples, que creo que muchas
00:20:04aplicaciones de IA están usando el enrutamiento de modelos, agentes múltiples, eso desbloquea aún más capacidades,
00:20:11tareas aún más complejas.
00:20:13Y también nos dice de qué son capaces los modelos y de qué no.
00:20:19Y puedes, ya sabes, hacer muchas cosas con eso.
00:20:22Es bastante emocionante.
00:20:24Muchas gracias, Alive.
00:20:25Un placer tenerte.
00:20:26Gracias por invitarme.
00:20:27Gracias a todos.
00:20:28Gracias a todos.
00:20:29Gracias a todos.
00:20:29Gracias.
00:20:29Gracias a todos.

핵심 요약

El modelo de código abierto M3 de Minimax integra capacidades de programación, visión y una atención dispersa de un millón de tokens mediante un entrenamiento multimodal nativo desde el primer paso.

하이라이트

  • El modelo M3 de MiniMax cuenta con 400 mil millones de parámetros totales y 20 mil millones activos.

  • La arquitectura de atención dispersa de Minimax (MSA) permite gestionar eficazmente un contexto largo de un millón de tokens.

  • El modelo M3 se entrenó desde el primer paso como un sistema nativamente multimodal para integrar texto, vídeo e imágenes sin degradar el rendimiento.

  • Las aplicaciones desarrolladas por Minimax alcanzan a más de 300 millones de usuarios en aproximadamente 200 países y a más de un millón de empresas.

  • El diseño de la arquitectura de atención dispersa fue realizado inicialmente por un pasante del equipo de investigación.

타임라인

Lanzamiento y características del modelo M3

  • El modelo M3 posee 400 mil millones de parámetros totales y 20 mil millones activos.
  • Integra rendimiento de programación, comprensión de visión y un contexto de un millón de tokens.
  • Utiliza la arquitectura de atención dispersa de Minimax (MSA).

El modelo M3 destaca en código abierto por combinar capacidades de programación y procesamiento multimodal. La atención dispersa de Minimax resuelve los problemas de eficiencia para manejar contextos masivos en futuras aplicaciones de agentes.

Evolución y funcionamiento de la atención dispersa

  • Las versiones M1 y M1 de Minimax soportaban hasta 10 millones de tokens para tareas estáticas.
  • La arquitectura MSA cuenta con una rama de índices que selecciona las partes importantes y una rama de atención dispersa para el cálculo.
  • Un pasante del equipo de investigación diseñó la arquitectura de atención dispersa.

La necesidad de un contexto largo surgió de la interacción agéntica con múltiples rondas de herramientas. La arquitectura divide el proceso en un índice superior y un cálculo focalizado, permitiendo escalar el tamaño y la longitud de manera eficiente.

Organización interna e investigación descentralizada

  • Cualquier miembro del equipo puede proponer mejoras tras jugar con los modelos liberados.
  • Los proyectos de investigación colaborativa duran desde un par de semanas hasta meses antes de integrarse.

La infraestructura de Minimax permite que los investigadores y desarrolladores internos realicen experimentos propios y formen equipos flexibles. Los resultados exitosos se incorporan directamente en el entrenamiento final del modelo.

Multimodalidad nativa desde el primer paso

  • El entrenamiento multimodal tradicional posterior perjudica el rendimiento del texto.
  • M3 utiliza datos intercalados de texto, imágenes y vídeos sin enmascarar desde el inicio del entrenamiento previo.
  • Se aplicó modelado de recompensas y control de infraestructura para evitar el colapso del modelo.

El entrenamiento multimodal nativo evita los adaptadores posteriores que desestabilizan el modelo. La inclusión de datos naturales intercalados permite escalar el rendimiento visual y textual simultáneamente.

Aplicaciones globales y futuro del código abierto

  • Las aplicaciones de Minimax cubren a más de 300 millones de personas en 200 países y a un millón de empresas.
  • El código abierto continuará porque los comentarios y las solicitudes de extracción de la comunidad mejoran las versiones posteriores.
  • Los sistemas de múltiples agentes representan la próxima frontera para resolver tareas complejas.

El ecosistema de aplicaciones precedió al desarrollo del modelo actual y demostró una adopción global masiva. La retroalimentación de la comunidad de código abierto alimenta directamente las iteraciones futuras de los modelos de la compañía.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기