스크립트
00:00:00欢迎Hugging Face的联合创始人兼首席科学官托马斯·沃尔夫(Thomas Wolfe)登台。
00:00:30大家好。你好,Olive。很高兴你能来到现场。谢谢邀请。我想今天大家有福了,因为你们刚看到了GLM,它目前在Artificial Analysis上排名第二。我之所以不提它,是因为大家还用不上。而现在我们有了排名第四的模型。基本上,你们将连续了解所有顶级模型,至少是最顶级的开源模型。
00:00:57我们非常幸运能请到Olive,她的人生经历相当精彩。她来到美国宾夕法尼亚州,曾在纽约大学杨·勒昆(Yann LeCun)的实验室攻读博士学位,研究JPA。不过我们决定今天不聊JPA,对吧?留着改天再聊。后来,她没有加入当时也在纽约的Hugging Face,而是决定加入MiniMax。
00:01:26所以对于那些可能不太了解世界各地新实验室的人来说,没关系,因为我觉得现在大概有 64 个新实验室,而 MiniMax 是中国所谓的 AI 四小龙(AI dragons)中的顶尖企业之一。所以这些是新兴的,现在非常知名的 DeepSeek,还有做 Kimi 的 Moonshot、智谱(Zhipu),以及你刚刚看到的 GLM。
00:01:51这就是新模型,现在我们有了MiniMax。它们都极其优秀,拥有极具天赋的团队,正在争夺榜首的位置。
00:01:58MiniMax的最新版本是6月初发布的M3,它当时是排名第一的顶级开源模型。
00:02:08非常令人印象深刻。这个模型有很多非常有趣的地方,我们将快速深入探讨,然后聊聊MiniMax的独特性和优秀之处。
00:02:20好的。那么Olive,首先能不能请你谈谈你对M3的看法,你喜欢这个模型的哪些方面,发布情况如何?
00:02:32是的,我们在本月早些时候发布了M3,它是一个较小的模型,总参数量约为4000亿,激活参数量为200亿。
00:02:45但它在代码性能方面非常出色,同时还能理解视觉内容。
00:02:52这也是开源模型通常不具备的,即该模型不仅能处理代码,还能理解视频、图像,并且拥有高达一百万的超长上下文。
00:03:09借助我们名为MSA(MiniMax Sparse Attention,稀疏注意力机制)的新架构。我们真正将这三者结合在了一起,因为我们知道它们对未来的AI应用至关重要:代码能力、
00:03:26智能体能力、更长的上下文以及多模态理解。是的,我认为这是该模型非常有趣的地方。
00:03:35是的,这个模型有很多值得探讨的地方,而且我认为它仍然是前五大开源模型中唯一真正实现多模态的模型,所以我们得好好聊聊这一点。
00:03:45但或许我们可以先聊聊长上下文,因为这也是第一个真正拥有这种真正实用的一百万Token长上下文的模型。
00:03:54你们还推出了MiniMax稀疏注意力机制,这是实现高效长上下文的技术之一,你们也进行了广泛的发表和分享,
00:04:04所以能简单谈谈这个项目吗?比如这个注意力机制是如何发展而来的,又是如何实现长上下文的?
00:04:11好的,关于长上下文的故事可以追溯到MiniMax M1和MiniMax 01,当时的模型实际上就已经能够处理1000万Token上下文的任务了。
00:04:251000万。1000万,是的。但当时它还不是一个智能体模型,对吧?它只是能够处理比如输入一整本书,然后给出书评之类的事情。
00:04:37所以我们意识到,更长的上下文实际上释放了许多能力,尤其是在与用户交互时。
00:04:47而现在,当智能体与整个环境交互、获取所有工具响应、进行多轮对话时,较短的上下文将不足以执行复杂的任务。
00:05:03所以在这一版本中,我们说,哦,我们必须把更长的上下文找回来。
00:05:09因此我们通过MiniMax稀疏注意力机制进行了探索,你知道,这是一种具有可扩展性且设计简洁的架构。
00:05:23从更高层次来看,它有一个索引分支,能够在更高层次上筛选出上下文中更重要的内容。
00:05:36接着我们有一个稀疏注意力分支,在选定的块上进行计算,以实际执行任务。
00:05:44所以,通过这种方式,我们确实设计出了一种优雅的架构,以便未来能够在此基础上扩展长度和模型规模。
00:05:57太棒了。对于那些在这个领域待了很长时间的人来说,我喜欢我们过去在注意力机制上做的大量工作,对吧?
00:06:03这种平方复杂度的注意力,以及大量的线性注意力。
00:06:06是的。
00:06:06然后不知为何,所有这些在某个阶段都消失了。
00:06:09当Flash Attention出现时,我们发现我们只需要更高效的内核。
00:06:13而现在我喜欢我们回归第一性原理的思考方式:什么是注意力?
00:06:18我们如何让它更高效?
00:06:20所以100万Token太疯狂了,对吧?GPT-2只有1024,当时每个人都觉得:“哇,这真的好大,我们永远不需要更多了。”
00:06:28你认为未来会朝什么方向发展?比如杰夫·迪恩(Jeff Dean)前几天跟我谈到过一万亿Token的注意力机制。
00:06:35你觉得我们应该迈向一万亿Token的注意力吗?
00:06:38这绝对是我们未来可以探索的方向,比如超长上下文,肯定的。
00:06:45这是一个非常令人兴奋的探索方向,而且架构设计与硬件的结合将需要在这方面投入大量研究。
00:06:54是的。
00:06:55你认为还有很多唾手可得的成果吗?
00:06:57通常今天我们看到OpenAI确实在削减成本,虽然我们不知道具体作为一家公司是怎么做到的,但大概是通过在注意力周围进行更高效的处理,将推理成本降低了一半。
00:07:08你认为在如何处理这些方面,是否还有很多唾手可得的低垂果实?
00:07:14M3非常有趣的一点在于它的成本有多么低,部分原因正是由于这种稀疏注意力,或者部分是因为它体量小,但它同时也非常高效。
00:07:22没错。
00:07:23你觉得我们还能走得更远吗?
00:07:25或许你们是怎么发明MiniMax稀疏注意力机制的?
00:07:29是智能体想出来的点子?
00:07:31还是依然由人类想出来的点子?
00:07:33给我们讲讲这个吧。
00:07:35好的。
00:07:36我们确实认为在架构和推理优化方面还有很多工作可做,以便让模型更加高效,特别是对于那些对特定任务敏感但又需要极强能力的任务,对吧?
00:07:52对于这类任务,我们真心希望模型能够保持高效。
00:07:56那这个部分是谁想出来的呢?
00:07:59其实,我觉得是我们团队的一位实习生做出来的。
00:08:02我也是。
00:08:03我们还不是实习生。
00:08:04这在很多实验室里通常不会发生,因为我认为在某些实验室里,实习生接触不到数据、核心工作之类的东西。
00:08:15但对我们而言,我们对任何想要为模型做出贡献的人都持开放态度。
00:08:20所以这个架构实际上是由一位实习生设计的。
00:08:23这太棒了。
00:08:24实习生在这里还是有用武之地的。
00:08:26好消息。
00:08:27这也是一个很好的切入点,可以聊聊MiniMax内部是如何工作的。
00:08:32我们在上台前讨论过,每个人都可以提出一个项目。
00:08:37你能给我们简单介绍一下你们是如何组织、如何做研究的吗?
00:08:41我认为这与学校里,甚至与早期的,你知道的,
00:08:49早期科技公司有很大不同。
00:08:51确实挺不一样的。
00:08:53我们确保拥有良好的基础和基础设施,这样任何人都可以使用模型进行尝试,
00:09:04并思考他们可以如何改进模型。
00:09:07然后在模型发布后,当他们有空时,就可以摆弄模型。
00:09:13他们可以构思自己的评估方法。
00:09:15他们可以找出模型的弱点,并提出他们想要对模型进行改进的方案。
00:09:21接着,其他对该项目感兴趣的人就会申请加入这个项目。
00:09:26他们会为此工作几周甚至几个月。
00:09:29当成果出来后,最终的成果就会被整合到我们的模型中。
00:09:33我们在最后的训练中使用它,并将其发布给广大用户。
00:09:39很有意思。
00:09:39所以你们可以让人在项目上投入很长的时间。
00:09:42当你说是几个月时,那可能就像是对可能性的深度探索。
00:09:46是的。
00:09:47我想说,例如架构可能需要更长时间的调研、研究、
00:09:53实验,甚至是重新进行预训练的评估。
00:09:57是的。
00:09:58所以它可能会需要更多的时间。
00:10:00这真的很好。
00:10:01是的。
00:10:02而且我知道你们也非常重视评估。
00:10:03我同意。
00:10:04我们可以聊聊这个。
00:10:05可能与此相关的一点是M3和你们团队所具有的独特特性,也就是关于
00:10:11多模态。
00:10:12所以不仅仅是文本,这个模型还能理解图像和视频。
00:10:16据我了解——请纠正我如果说得不对,当我们阅读Hugging Face上的模型卡片时,
00:10:21上面说该模型从第一步起就是作为多模态模型训练的,而不仅仅是在文本之后加上去,对吧?
00:10:26是的。
00:10:27是的。
00:10:28你能给我们多讲讲这一点吗?以及为什么你认为这很重要,为什么
00:10:33你们要从第一步就开始进行多模态训练,而不是后期的训练?
00:10:37我们称之为原生多模态。
00:10:41因此,模型实验室通常的做法是在文本预训练完成后,再训练多模态,比方说视觉理解能力。
00:10:50他们会加上适配器(adapters),然后训练那部分。
00:10:54但我们发现,这样做实际上会损害文本性能。
00:10:57而且视觉理解性能也不会收敛得那么好,因为模型本身
00:11:02是朝着文本理解的方向收敛的。
00:11:08这并不是最优的,也不是最具可扩展性的。
00:11:11如果你仔细想想,我们希望扩展数据规模,对吧?
00:11:17而且某些实验室会在预训练进行到一半时才开始训练这种能力。
00:11:20例如,持续预训练。
00:11:27但我们发现,这会非常依赖配方。
00:11:29对于不同的架构、不同的数据混合、不同的学习率,配方都会有所不同。
00:11:35这很难控制,很难将你的实验结果和结论扩展到更大的模型上。
00:11:41因此,我们当时的想法是:为什么不直接从第一步开始训练呢?
00:11:43这感觉最自然。
00:11:52我们知道很多实验室在这样做时遇到了问题。
00:11:54在训练了几个步骤之后,模型就会崩溃,无论是文本还是视觉理解能力。
00:12:01但我们成功解决了这个问题。
00:12:03我们在IT(基础设施)上做了大量工作,并且在我们实际训练的数据上也下了很大功夫。
00:12:07例如,我们使用交错数据(interleaved data),我们称之为交错数据。
00:12:15它实际上是自然数据,但我们保留了图像和视频,而不是将其遮盖掉。
00:12:18并且我们对数据做了非常好的清洗和遮盖工作。
00:12:26我们做了非常出色的奖励建模(reward modeling),以便从第一步就开始训练并大幅扩展规模。
00:12:30是的,它没有崩溃。这真的令人印象深刻。印象深刻。我们是否应该期待未来有更大规模的模型?所以这个仍然相当小,对吧?有4280亿参数,230亿激活参数。嗯,你认为你们会超越一万亿吗?肯定的。
00:12:38我们会对数据进行相当不错的清洗和掩码处理。
00:12:42并且构建非常优秀的奖励模型,从第一步开始训练,从而实现极大的规模扩展。
00:12:50对,它没有崩溃。
00:12:52这真的令人印象深刻。
00:12:53令人印象深刻。
00:12:54我们未来可以期待规模大得多的模型吗?
00:12:57所以这个模型目前还是相当小,对吧?
00:12:59它有4280亿总参数,230亿激活参数。
00:13:04那么,你认为你们会突破万亿参数吗?
00:13:08肯定的。
00:13:09是的,未来绝对会的。
00:13:12有很多任务在参数较小时,模型是无法表现得很出色的。
00:13:21我们的目标肯定会比现在更加雄心勃勃。
00:13:25太棒了。
00:13:26拭目以待。
00:13:27我一直觉得MiniMax另一个非常有趣、吸引人的地方在于,你们还拥有整整一系列的应用和产品,对吧?
00:13:36所以我也记得,MiniMax从去年1月开始就在Hugging Face平台上开源各种东西了。
00:13:43那已经是18个月前的事了。
00:13:45我们当时和团队聊了聊,想了解你们都在做些什么。
00:13:48我记得当时你们的一些应用就已经拥有了巨大的使用量。
00:13:54能跟我们简单讲讲这一切是怎么开始的吗?
00:13:57是不是基本上因为你们有很多应用,然后心想:我们有这么多数据,
00:14:02为什么不训练一个模型呢?
00:14:03然后他们才建立了一个研究团队。
00:14:05背后的故事是怎样的?
00:14:07我们的故事从第一天起就是为了做模型。
00:14:11所以我相信多模态模型——一个能够理解所有视觉并输出所有模态的模型,
00:14:19是我们CEO在第一天、甚至在公司成立之前就规划好的事情。
00:14:25所以那是关于AGI的梦想。
00:14:27我觉得那真的非常非常早,甚至在ChatGPT问世之前。
00:14:30哇。
00:14:31是的。
00:14:32而应用则是随之顺理成章出现的东西。
00:14:35因为既然你拥有了某些模型能力,你就会希望人们能很好地体验它。
00:14:40并不是所有人都能通过API来使用它,对吧?
00:14:43我们不能指望每个人都通过API来获得体验。
00:14:46所以我们需要良好的用户交互界面、优秀的应用以及丰富的使用场景,让人们能够体验到模型的魅力。
00:14:57我想实际上这些应用在全球大约200个国家覆盖了超过3亿人。
00:15:06而且我认为还服务了超过一百万家企业。
00:15:09是的。
00:15:10当我听到这个规模时,真的感到非常震撼。
00:15:12我们往往没有意识到这种类型的使用规模已经这么大了。
00:15:17这就让我联想到了关于开源商业模式之类的问题,这也是一直存在的问题:目前开源模型固然很好,但你也需要有一些收入来源,对吧?
00:15:33所以我想比如M3就是你们决定免费提供给大众的产品。
00:15:38而且我认为这对全世界来说都是一件好事。
00:15:41你是怎么看待这一点的?
00:15:42你们在应用中是否也使用了一些特定的模型?
00:15:45你觉得未来你们会继续——虽然现在很难打包票——但你认为你们会继续开源模型吗?
00:15:52现在开源周围的文化氛围是怎样的?
00:15:55就我个人以及模型研究团队而言,我们一直都希望能够开源这些模型。
00:16:01这就是我们的计划,因为我们切实地看到开源社区如何能够齐心协力帮助模型打造得更好。
00:16:09例如,我们从伟大的社区那里收到了许多关于模型性能的反馈,并且在我们开源的任何项目上都能收到PR(拉取请求),对吧?
00:16:20这些都非常非常有价值,并且融入到了我们后续的版本中。
00:16:24所以开源绝对是一件很棒的事。
00:16:27那太好了。
00:16:28事实上,对于广大观众,也就是那些正在使用M3或MiniMax的人,你们有什么诉求吗?
00:16:33有没有什么东西是你们很希望他们作为反馈发送给你们的?
00:16:37比如,当人们尝试修改模型或进行各种把玩、调整时,你们会去阅读这些内容吗?
00:16:43或者你认为从社区中能获取到的、对未来模型最有帮助的东西是什么?
00:16:51我想说,不管是人们遇到的什么问题,尤其是多模态方面的问题,对吧?
00:16:57这是我们第一次将它们结合在一起。
00:16:59未来我们绝对会在这方面抱有更大的雄心。
00:17:03它现在可能还存在一些瑕疵,但我们正在不断改进。
00:17:06所以无论模型表现得不够好的反馈是什么,我们绝对会在未来的版本中进行改进。
00:17:13还有人们想要什么样的功能。
00:17:17比如,比方说思考强度(Thinking effort),对吧?
00:17:21有些人就提出了这个要求。
00:17:23所有人都可以提出需求,我们会在未来的模型中努力实现它。
00:17:28是的。
00:17:29你觉得现在在编码智能体方面,已经有很多用户在应用多模态了吗?
00:17:33我觉得这块还略显开发不足。
00:17:37确实如此。
00:17:38确实。
00:17:39但它实际上可以释放出大量的功能以及众多的智能体应用。
00:17:47比方说,你希望模型去阅读PPT,对吧?
00:17:51或者阅读一些结构不太清晰的报告。
00:17:55并且你希望它能够理解很长的视频。
00:17:58假设你录制了一个很长的视频教程,然后你希望模型在理解之后利用某些工具来执行操作。
00:18:07这就开启了丰富多样的智能体使用场景。
00:18:12所以,就好像智能体终于可以观看我的YouTube教程,并理解如何使用我的编码工具以及我是如何描述它们的?
00:18:18是类似这样的吗?
00:18:19啊?
00:18:20智能体终于可以观看YouTube教程并从中理解事物了吗?
00:18:24对。
00:18:25是的。
00:18:26我想是的。
00:18:27你们内部会使用很多智能体编码工具吗?
00:18:30我的意思是,编码肯定是有的,但比如在研究方面也已经用上了吗?
00:18:34是自动化的吗?
00:18:35是的。
00:18:36部分实现了吗?
00:18:37还是没有?
00:18:38这到底是怎么运作的?
00:18:39是的。
00:18:40我们有自己的研究工具套件(harnesses)。
00:18:42我们构建了自己的研究工具套件来自动执行工作流。
00:18:46可以说我们很多工作流都是自动化的。
00:18:49你可以看到最新的前沿模型是如何追求无需能力的内核优化的,对吧?
00:18:57比如,让模型去促成或训练其他模型。
00:19:00让模型构建数据、自动生成数据之类的。
00:19:05你可以看到越来越多的模型有能力做到这些,包括M3在内。
00:19:10实际上,我们在这些方面——更长的上下文和内核组织——非常擅长。
00:19:16因此我们可以利用该模型的强大功能,将它们组合在一起,辅助我们的日常常规工作,
00:19:24并让我们的迭代速度变得更快。
00:19:26M3团队已经在构建M4了吗?
00:19:30在构建M3.1。
00:19:31M3.1?
00:19:32是的。
00:19:33好的。
00:19:34还不是那个。
00:19:35已经开始了。
00:19:36我很乐意以你对接下来几个月最期待的事物来作为结束。
00:19:41你觉得呢?
00:19:42可以是在功能方面,或是在你希望看到AI领域发生的事件,或者更广泛地讲,
00:19:49不管是什么真正让你挂在心上的、即将发生的事情。
00:19:54有很多事情都非常令人兴奋。
00:19:58但我最近觉得最让人兴奋的,会是多智能体(multi-agents),我认为现在很多
00:20:04AI应用正在使用模型路由、多智能体,这释放了更强大的功能,
00:20:11能够处理更复杂的任务。
00:20:13而且它也让我们知道了模型能做什么、不能做什么。
00:20:19你可以利用它做出很多事情。
00:20:22这相当令人兴奋。
00:20:24非常感谢你,Alive。
00:20:25很高兴你能来。
00:20:26谢谢邀请我来。
00:20:27谢谢大家。
00:20:28谢谢大家。
00:20:29谢谢大家。
00:20:29谢谢。
00:20:29谢谢大家。
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기