Por que Agentes de IA Precisam de Contexto de Um Milhão de Tokens — Thomas Wolf & Olive Song, MiniMax
AAI Engineer
컴퓨터/소프트웨어AI/미래기술
스크립트
00:00:00Conosco no palco está o cofundador e diretor científico da Hugging Face, Thomas Wolfe.
00:00:30Olá a todos. Olá, Olive. É um prazer recebê-la no palco. Obrigada pelo convite. Bem, acho que vocês vão ter uma surpresa hoje, porque acabaram de ver o GLM, que atualmente é o número dois na análise artificial. Eu tiro isso de lá porque ninguém pode usar. E agora temos o número quatro. Basicamente, vocês terão todos os melhores modelos, pelo menos o principal modelo de código aberto, em sequência.
00:00:57E temos muita sorte de ter a Olive, que tem uma trajetória de vida bastante incrível. Ela veio para os Estados Unidos, Pensilvânia. Ela estava estudando e fazendo o doutorado na NYU, no laboratório de Yann LeCun, trabalhando com JPA. Mas decidimos que não vamos falar sobre JPA hoje, certo? Fica para outro dia. E então, em vez de entrar na Hugging Face, que também estava em Nova York na época, ela decidiu ir para a Minimax.
00:01:26Então, para aqueles que talvez não conheçam todos os novos laboratórios ao redor do mundo, vocês estão perdoados porque acho que existem cerca de 64 novos laboratórios agora, a Minimax é um dos principais chamados dragões de IA na China. Então estes são os novos, tem o DeepSeek, que é muito conhecido agora, a Moonshot, que faz o Kimi, o Zhipu e o GLM que vocês acabaram de ver.
00:01:51Então aqui está o novo modelo, e agora temos a Minimax. Todos eles são extremamente bons, uma equipe extremamente talentosa lutando pelo primeiro lugar.
00:01:58Portanto, o lançamento mais recente da Minimax foi o M3, no início de junho, que era o principal modelo naquele momento, o principal modelo de código aberto.
00:02:08Muito impressionante. Há muitas coisas muito interessantes sobre este modelo, então vamos mergulhar nelas rapidamente e depois falar um pouco sobre o que é específico da Minimax, o que há de ótimo nele.
00:02:20Sim. Então, talvez, Olive, para começar um pouco, você pode nos dar, sabe, um pouco da sua visão sobre o M3, o que você gosta neste modelo, como foi o lançamento?
00:02:32Sim, o M3, nós lançamos o M3 no início deste mês, e ele é um modelo menor com 400, em torno de 400 bilhões de parâmetros totais, e 20 bilhões ativados.
00:02:45Mas ele é muito capaz em termos de desempenho de codificação e também compreende visão.
00:02:52Então, o que os modelos de código aberto geralmente não têm é que eles podem -- o modelo não apenas lida com código, mas também consegue entender vídeos, imagens, e possui um contexto super longo de um milhão.
00:03:09Com a nossa nova arquitetura chamada MSA, Minimax Sparse Attention. Então, realmente juntamos essas três coisas, porque sabemos que elas são -- serão muito importantes em futuras aplicações de IA, capacidades de codificação,
00:03:26capacidades agênticas, contexto mais longo e compreensão multimodal. Sim, acho que isso seria muito interessante sobre o modelo.
00:03:35Sim, então há muito o que explorar neste modelo, e ele ainda é, eu acho, o único modelo entre os cinco melhores de código aberto que é realmente multimodal, então precisamos falar sobre isso.
00:03:45Mas talvez primeiro sobre o contexto longo, porque também foi o primeiro que realmente teve esse contexto longo real de um milhão de tokens, que realmente funciona.
00:03:54E vocês também tiveram a Minimax Sparse Attention, que é essa técnica para tornar isso eficiente, que vocês também publicaram e compartilharam extensivamente,
00:04:04então você pode falar um pouco sobre isso, talvez como foi o projeto a partir da atenção, como fazer esse contexto longo?
00:04:11Sim, eu diria que a história sobre o contexto longo remonta ao Minimax M1 e ao Minimax 01, onde o modelo na verdade -- era capaz de lidar com tarefas de um contexto de 10 milhões de tokens.
00:04:25Dez milhões. Dez milhões, sim. Mas então ele não era um modelo agêntico, certo? Era apenas, por exemplo, despejar um livro, ele seria capaz de dar opiniões sobre ele, coisas assim.
00:04:37Portanto, o que percebemos foi que um contexto mais longo na verdade desbloqueia muitas capacidades, especialmente ao interagir com os usuários.
00:04:47E agora, quando o agente está interagindo com todo o ambiente e obtendo todas as respostas de ferramentas, obtendo várias rodadas, o contexto mais curto não seria suficiente para executar as tarefas complexas.
00:05:03Então, para esta versão, dissemos, oh, nós temos que ter o nosso contexto mais longo de volta.
00:05:09E então o que buscamos foi com a nossa Minimax Sparse Attention, que, você sabe, era a arquitetura que era escalável e tinha um design simples.
00:05:23Então, eu diria de um nível superior, certo? Ela tem um ramo de índice que, você sabe, seleciona em um nível superior o que é -- o que importa mais no contexto.
00:05:36E então temos um ramo de Atenção Esparsa que calcula -- realiza o cálculo nos blocos selecionados para realmente executar as tarefas.
00:05:44E então, sim, assim nós realmente projetamos uma arquitetura elegante para que possamos dimensionar o comprimento e depois dimensionar o tamanho do modelo no futuro com isso.
00:05:57Isso é lindo. Eu gosto de como, para aqueles que estão na área há bastante tempo, tivemos muito trabalho sobre atenção, certo?
00:06:03Esse N-quadrado, e havia muita atenção linear.
00:06:06Sim.
00:06:06E então de alguma forma tudo isso desapareceu em algum momento.
00:06:09Quando o Flash Attention surgiu, descobrimos que precisávamos apenas de um kernel mais eficiente.
00:06:13E agora eu gosto de como voltamos a pensar, sabe, no princípio fundamental, o que é atenção?
00:06:18Como podemos tornar isso mais eficiente?
00:06:20Então, um milhão de tokens é loucura, certo? O GPT-2 tinha 1.024, e todo mundo pensava: “Oh, isso é realmente grande. Nunca precisaremos de mais.”
00:06:28Onde você vê isso chegando, tipo, indo no futuro? O Jeff Dean estava me propondo outro dia uma atenção de um trilhão de tokens.
00:06:35Você acha que devemos ir para uma atenção de um trilhão de tokens?
00:06:38Isso é definitivamente algo para o qual podemos explorar, certo, ultra-comprimento do contexto, com certeza.
00:06:45Isso é algo muito emocionante para explorar, e algo para o qual o design de arquitetura, junto com o hardware, exigiria muita pesquisa.
00:06:54Sim.
00:06:55Você acha que ainda há muitos frutos fáceis de colher?
00:06:57Tipicamente hoje vimos a OpenAI realmente reduzindo, quer dizer, não sabemos exatamente como, mas reduzindo sua fatura de inferência pela metade, provavelmente tendo algum processamento mais eficiente em torno das atenções.
00:07:08Você acha que ainda há muitos frutos fáceis de colher em como podemos processar isso?
00:07:14Portanto, uma coisa que ainda é muito interessante sobre o M3 é o quão barato ele é, em particular por causa dessa atenção esparsa, ou em parte porque é pequeno, mas também é muito eficiente.
00:07:22Exato.
00:07:23Você acha que podemos ir ainda muito mais longe?
00:07:25Talvez como vocês inventaram a MinMax Sparse Attention?
00:07:29Foi um agente que teve a ideia?
00:07:31Ainda foi um humano que teve a ideia?
00:07:33Conte-nos um pouco sobre isso.
00:07:35Sim.
00:07:36Então, nós achamos que ainda há muito trabalho que pode entrar na arquitetura e na otimização de inferência para que o modelo possa ser mais eficiente, especialmente se houver tarefas que são muito sensíveis a tarefas, mas exigem capacidades muito fortes, certo?
00:07:52E para esse tipo de tarefa, nós realmente queremos que o modelo seja eficiente.
00:07:56E quem teve essa ideia?
00:07:59Na verdade, acho que foi um estagiário da nossa equipe que trabalhou nisso.
00:08:02Eu também.
00:08:03Ainda não somos um estagiário.
00:08:04Isso geralmente não acontece em muitos laboratórios, porque acho que em alguns laboratórios, os estagiários não têm acesso aos dados, ao trabalho e às coisas.
00:08:15Mas sim, estamos abertos a qualquer pessoa que queira contribuir para o nosso modelo.
00:08:20Portanto, a arquitetura foi realmente projetada por um estagiário.
00:08:23Isso é muito bom.
00:08:24Ainda há trabalho para estagiários aqui.
00:08:26Boa notícia.
00:08:27Isso também é uma boa transição para como a MinMax funciona internamente.
00:08:32Então, estávamos discutindo antes de subir ao palco sobre como todos podem propor um projeto.
00:08:37Você pode nos contar um pouco sobre como vocês se organizam, como fazem pesquisas?
00:08:41Acho que isso é muito diferente até mesmo da escola ou de antes, você sabe,
00:08:49as empresas de tecnologia anteriores.
00:08:51É bem diferente.
00:08:53O que garantimos é que temos uma boa base e uma boa infraestrutura para que qualquer pessoa possa brincar com o modelo
00:09:04e possa pensar no que pode melhorar com o modelo.
00:09:07E então, após os lançamentos dos modelos, quando estão livres, certo, eles podem brincar com o modelo.
00:09:13Eles podem pensar em suas próprias avaliações.
00:09:15Eles podem encontrar suas próprias fraquezas e propor algo que desejam melhorar no modelo.
00:09:21E então outras pessoas que estão interessadas nisso, você sabe, se oferecem para entrar no projeto.
00:09:26E elas vão trabalhar nisso por algumas semanas ou até alguns meses.
00:09:29E quando dão certo, a versão final é enviada para o nosso modelo.
00:09:33É, você sabe, nós usamos isso em nosso treinamento final e é lançado para o público.
00:09:39Interessante.
00:09:39Então vocês podem ter pessoas trabalhando por realmente muito tempo em um projeto.
00:09:42Quando você diz alguns meses, pode ser uma exploração realmente profunda do que é possível.
00:09:46Sim.
00:09:47E eu diria, por exemplo, que a arquitetura pode exigir mais tempo de investigação, pesquisa,
00:09:53experimentos, até mesmo refazer as avaliações para o pré-treinamento.
00:09:57Sim.
00:09:58Portanto, pode exigir mais tempo.
00:10:00Isso é muito legal.
00:10:01Sim.
00:10:02E eu sei que você também é muito fã de avaliação.
00:10:03Concordo.
00:10:04Poderíamos falar sobre isso.
00:10:05Uma coisa provavelmente relacionada a isso é essa especificidade única que o M3 e sua equipe têm em relação
00:10:11à multimodalidade.
00:10:12Então, não apenas texto, mas este modelo também consegue entender imagem e vídeo.
00:10:16E pelo que entendi, mas por favor explique melhor, quando lemos o cartão do modelo na Hugging Face,
00:10:21diz que o modelo foi treinado desde o primeiro passo como um modelo multimodal, não apenas como um usuário
00:10:26como pós-fonte, certo?
00:10:27Sim.
00:10:28Você pode nos contar um pouco mais sobre isso e por que acha que é importante e por que
00:10:33vocês começam desde o primeiro passo no treinamento multimodal e não apenas nesse treinamento?
00:10:37Então, nós chamamos de multimodalidade nativa.
00:10:41E, portanto, é de certa forma típico para os laboratórios de modelos treinar o modelo multimodal, digamos, capacidades de compreensão de visão
00:10:50depois que o pré-treinamento de texto é concluído.
00:10:54Eles colocam adaptadores e depois treinam essa parte.
00:10:57Mas o que descobrimos foi que isso na verdade prejudicaria o desempenho do texto.
00:11:02E o desempenho de compreensão de visão não convergiria tão bem porque o modelo meio que
00:11:08converge em direção à compreensão de texto.
00:11:11E simplesmente não é o mais ideal e também não é o mais escalável.
00:11:17Se você pensar bem, queremos dimensionar os dados, certo?
00:11:20E também podemos, alguns laboratórios treinam essa capacidade a partir da metade do pré-treinamento.
00:11:27Por exemplo, pré-treinamento continuado.
00:11:29Mas o que descobrimos é que isso seria muito, você sabe, sensível à receita.
00:11:35É diferente para, a receita seria diferente para diferentes arquiteturas, diferentes, você sabe,
00:11:41misturas de dados, diferentes taxas de aprendizado.
00:11:43É difícil de controlar, difícil de, você sabe, dimensionar para o seu, você realmente não pode dimensionar os resultados dos seus experimentos
00:11:52e conclusões para um modelo maior.
00:11:54E então, você sabe, o que pensamos foi: por que não apenas treinar desde o primeiro passo?
00:12:01Isso parece o mais natural.
00:12:03Sabemos que muitos laboratórios encontram problemas ao fazer isso.
00:12:07O modelo entraria em colapso após alguns passos de treinamento, você sabe, tanto na compreensão de texto quanto de visão.
00:12:15Mas conseguimos resolver esse problema.
00:12:18Fizemos muito trabalho na TI e fizemos muito trabalho nos dados que estamos realmente treinando.
00:12:26Por exemplo, fazemos dados intercalados, o que chamamos de dados intercalados.
00:12:30Na verdade, são dados naturais, mas mantemos as imagens e vídeos em vez de mascará-los.
00:12:38E fazemos uma limpeza e filtragem muito boas nos dados.
00:12:42E criamos um excelente modelo de recompensa para treiná-lo desde o primeiro passo e escalá-lo bastante.
00:12:50Sim, ele não entra em colapso.
00:12:52Isso é realmente impressionante.
00:12:53Impressionante.
00:12:54Devemos esperar um modelo muito maior no futuro?
00:12:57Então este ainda é relativamente pequeno, certo?
00:12:59São 428 bilhões de parâmetros, com 23 bilhões ativos.
00:13:04Bem, você acha que ultrapassarão a marca de um trilhão?
00:13:08Com certeza.
00:13:09Sim, com certeza no futuro.
00:13:12Há muitas tarefas que o modelo não conseguiria realizar muito bem com menos parâmetros.
00:13:21Definitivamente estamos mirando mais alto do que isso.
00:13:25Isso é ótimo.
00:13:26Ansioso para ver.
00:13:27E outra coisa interessante que sempre acho fascinante na Minimax é como vocês também têm toda essa gama de aplicativos e produtos, certo?
00:13:36Então, lembro que a Minimax começou a disponibilizar conteúdos em código aberto na plataforma Hugging Face em janeiro do ano passado.
00:13:43Isso foi há 18 meses.
00:13:45E conversamos um pouco com a equipe para entender o que vocês estavam fazendo.
00:13:48E me lembro que vocês já tinham um uso enorme em alguns desses aplicativos.
00:13:54Pode nos contar um pouco de como isso começou?
00:13:57Basicamente, vocês tinham vários aplicativos e pensaram: temos todos esses dados.
00:14:02Por que não treinar um modelo?
00:14:03E então montaram uma equipe de pesquisa.
00:14:05Como foi essa história?
00:14:07Nossa história começou focada em modelos desde o primeiro dia.
00:14:11Acredito que um modelo multimodal, capaz de compreender todas as visões e gerar todas as modalidades,
00:14:19foi a primeira coisa que nosso CEO planejou no primeiro dia, antes mesmo de a empresa ser fundada.
00:14:25Esse era o sonho da IGA.
00:14:27Acho que isso foi muito, muito cedo, antes mesmo do ChatGPT ser lançado.
00:14:30Nossa.
00:14:31Sim.
00:14:32E os aplicativos surgiram como consequência.
00:14:35Como você tem certas capacidades de modelo, você quer que as pessoas experimentem isso bem.
00:14:40Poucas pessoas conseguem usá-lo via API, certo?
00:14:43Não podemos esperar que todos o experimentem por API.
00:14:46Portanto, precisamos de boas interfaces de interação com o usuário, bons aplicativos e cenários adequados para que as pessoas possam experimentar o modelo.
00:14:57Acho que esses aplicativos abrangeram mais de 300 milhões de pessoas em cerca de 200 países globalmente.
00:15:06E acredito que mais de um milhão de empresas também.
00:15:09Sim.
00:15:10Isso foi impressionante quando soube da escala.
00:15:12E muitas vezes não percebemos a magnitude desse tipo de uso atualmente.
00:15:17E isso me leva à questão sobre o modelo de negócios de código aberto e tudo mais, que é a dúvida eterna: agora é ótimo disponibilizar modelos em código aberto, mas você também precisa ter alguma fonte de receita, certo?
00:15:33E imagino que o M3 seja algo que vocês decidiram fornecer de graça, por exemplo.
00:15:38E acho que isso é excelente para o mundo.
00:15:41Como você vê isso?
00:15:42Vocês também usam modelos específicos para o aplicativo?
00:15:45Vocês acham que no futuro continuarão — é provável que seja difícil afirmar com certeza —, mas acham que continuarão lançando modelos em código aberto?
00:15:52Como está a cultura em torno do código aberto agora?
00:15:55Pessoalmente, e também para a equipe de pesquisa de modelos, sempre esperamos abrir o código dos modelos.
00:16:01Esse é o nosso plano, porque vemos claramente como a comunidade de código aberto pode ajudar a construir um modelo melhor em conjunto.
00:16:09Por exemplo, recebemos muitos feedbacks sobre o desempenho do modelo vindos dessa grande comunidade e recebemos contribuições (PRs) em tudo o que abrimos, certo?
00:16:20E isso é muito, muito valioso e é incorporado em nossas versões futuras.
00:16:24Portanto, o código aberto é definitivamente excelente.
00:16:27Isso é ótimo.
00:16:28E na verdade, vocês têm algum pedido para o público, para as pessoas que estão usando o M3 ou o Minimax?
00:16:33Há algo que adorariam que eles enviassem de volta como feedback?
00:16:37Vocês leem, por exemplo, quando as pessoas tentam modificar os modelos ou fazer ajustes?
00:16:43Ou qual é a melhor coisa que acham que podem aproveitar da comunidade para os futuros modelos?
00:16:51Eu diria que quaisquer problemas que as pessoas estejam enfrentando, especialmente com a multimodalidade, certo?
00:16:57Esta é a primeira vez que estamos combinando isso.
00:16:59Certamente seremos mais ambiciosos com isso no futuro.
00:17:03Pode haver algumas falhas agora, mas estamos melhorando isso.
00:17:06Portanto, qualquer feedback de que o modelo não está indo tão bem será definitivamente aprimorado nas versões futuras.
00:17:13E também quaisquer recursos que as pessoas queiram.
00:17:17Digamos, por exemplo, esforço de pensamento, certo?
00:17:21Algumas pessoas pedem por isso.
00:17:23Qualquer um pode pedir e tentaremos implementar isso nos modelos futuros.
00:17:28Sim.
00:17:29Você vê muitos usuários agora mesmo usando multimodalidade em termos de agentes de programação?
00:17:33Sinto que isso ainda é um pouco subexplorado.
00:17:37É verdade.
00:17:38De fato.
00:17:39Mas isso pode realmente desbloquear muitas capacidades e diversas aplicações de agentes.
00:17:47Digamos, por exemplo, que você queira que o modelo leia apresentações em PowerPoint, certo?
00:17:51Ou que leia alguns relatórios que não são muito estruturados.
00:17:55E você quer que ele compreenda um vídeo muito longo.
00:17:58Digamos que você gravou um vídeo longo e quer que o modelo aja usando algumas ferramentas após compreendê-lo.
00:18:07Isso abre uma ampla variedade de casos de uso para agentes.
00:18:12Então o agente poderia finalmente assistir ao meu tutorial no YouTube e entender como usar minhas ferramentas de programação e como eu as descrevo?
00:18:18É algo assim?
00:18:19Hã?
00:18:20O agente poderia finalmente assistir a tutoriais no YouTube e entender as coisas por meio deles?
00:18:24Sim.
00:18:25Sim.
00:18:26Acho que sim.
00:18:27Vocês usam muitas ferramentas de codificação baseadas em agentes internamente?
00:18:30É tipo — digo, para codificação com certeza, mas também já é aplicado em termos de pesquisa?
00:18:34É automatizado?
00:18:35Sim.
00:18:36Em parte?
00:18:37Ou não?
00:18:38Como isso funciona?
00:18:39Sim.
00:18:40Temos nossos próprios ambientes de pesquisa.
00:18:42Construímos nossos próprios ambientes que automatizam nossos fluxos de trabalho.
00:18:46Eu diria que muitos dos nossos fluxos de trabalho são automatizados.
00:18:49Você pode ver como os modelos de fronteira mais recentes buscam a otimização de kernels sem perda de capacidade, certo?
00:18:57Tipo, deixar o modelo criar posturas para outros modelos.
00:19:00Deixar o modelo gerar dados, dados automáticos e coisas do tipo.
00:19:05Você pode ver como mais e mais modelos são capazes de fazer isso, incluindo o M3.
00:19:10Na verdade, éramos muito bons nesses casos, em horizontes mais longos e otimizações de kernel.
00:19:16E assim podemos usar essa capacidade do modelo, integrá-la e ajudar em nossa rotina diária,
00:19:24tornando nossas iterações ainda mais rápidas.
00:19:26O M3 já está construindo o M4?
00:19:30Construindo o M3.1.
00:19:31M3.1?
00:19:32Sim.
00:19:33Entendi.
00:19:34Ainda não o principal.
00:19:35Já.
00:19:36Eu gostaria de encerrar falando sobre o que você acha animador para o próximo mês.
00:19:41O que você acha?
00:19:42Pode ser em termos de recursos, coisas que você quer ver acontecendo na IA, ou de forma mais geral
00:19:49sobre o que realmente está em sua mente e que vai acontecer.
00:19:54Muitas coisas são muito empolgantes.
00:19:58Mas o que recentemente achei mais empolgante são os múltiplos agentes, pois acho que muitas
00:20:04aplicações de IA estão usando roteamento de modelos e multiagentes, o que libera ainda mais capacidades
00:20:11e tarefas ainda mais complexas.
00:20:13E também nos mostra do que os modelos são capazes e do que não são.
00:20:19E você pode fazer muitas coisas com isso.
00:20:22É bem empolgante.
00:20:24Muito obrigado, Alive.
00:20:25Foi um prazer recebê-lo.
00:20:26Obrigado pelo convite.
00:20:27Obrigado a todos.
00:20:28Obrigado a todos.
00:20:29Obrigado a todos.
00:20:29Obrigado.
00:20:29Obrigado a todos.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기