Transcript
00:00:00把大脑想象成一片海洋。在表面上的是我们的想法、晚餐计划和
00:00:06随之而来的忧虑、内心独白,以及脑海中闪过的画面。但我们大脑的
00:00:13大部分活动是在潜意识深处进行的,我们并没有察觉到。它在过滤
00:00:19背景声音,控制我们的呼吸,帮助我们识别人物和物体。
00:00:26AI模型也有它们自己的“大脑”,即在幕后进行数十亿次运算的
00:00:31巨型神经网络。多年来,研究人员一直在研究其内部运作方式。
00:00:37我们不禁好奇,模型是否也像人类一样,在表面的
00:00:43可触及想法与下方的潜意识处理过程之间存在某种鸿沟?为了回答这个问题,
00:00:49我们研究了神经科学家是如何研究人类这一现象的。识别意识
00:00:55思想的一种方法是,你通常可以用言语来描述它们。因此,我们查看了我们AI模型内部的大脑,
00:01:01CLAWD,以寻找它能用言语表达出来的神经活动模式。我们将所有这些
00:01:07模式的集合称为J-空间,取名自我们用来发现它们的数学工具——雅可比矩阵(Jacobian)。每个
00:01:15J-空间模式都与一个特定的词相关联,不一定是模型大声说出来的词,
00:01:21而是它“心中”所想的词。现在,对人类来说,意识想法不仅仅是我们能用言语表达的东西。
00:01:28我们能用它们进行推理、控制它们,并用它们来解决问题。根据一个称为
00:01:34“全局工作空间理论”(Global Workspace Theory)的观点,这是因为大脑选择了一小部分重要信息,
00:01:40进入心理工作空间。然后,这些信息会被广播到大脑的其他部分以供
00:01:47推理使用。我们想知道CLAWD的J-空间是否以类似的方式运作。在一个实验中,
00:01:53我们给CLAWD出了这道数学题。它立即给出了答案,没有展示其计算步骤。但当
00:02:00我们扫描J-空间时,我们看到它在内部完成了每一步计算。在第一步之后,它亮起了21。
00:02:07然后是42。接着是49。CLAWD并没有在任何地方写下这些中间数字。所有这些
00:02:15都发生在J-空间内部。这表明CLAWD利用它进行分步推理。在另一个
00:02:23实验中,我们想看看CLAWD是否能像人类有意识地专注于
00:02:29图像或文字那样控制其J-空间。我们让它在抄写一段无关句子时,思考金门大桥。
00:02:37CLAWD忙于抄写句子,但在幕后,它的J-空间却展现了不同的内容。
00:02:43“大桥”和“加利福尼亚”出现了。它甚至思考了关于它自身的思考。词语“意象”和“思想”
00:02:50同时亮起。这向我们展示了,是的,CLAWD对用想法填充其J-空间有一定的控制力。
00:02:57但就像人类一样,它的控制并不完美。当我们调整实验,要求CLAWD
00:03:04不要去想大桥时,它无法克制自己。而且J-空间中还亮起了“失败”和“该死”。
00:03:12但请记住,我们大脑所做的大部分工作都是无意识的。因此,我们想测试如果
00:03:18我们关闭J-空间,但保持网络的其余部分不动,CLAWD会怎样。CLAWD仍然可以回答
00:03:24简单的问题并流畅地写作。当我们用西班牙语给它提示时,它用流畅的西班牙语回应了。
00:03:31但当我们问它需要更多推理的问题时,比如命名一位使用
00:03:36与提示相同语言写作的作者,它就做不到了。为此,它需要J-空间。为什么这一切很重要?
00:03:43这些实验告诉我们,AI模型有内部思想,即它们用以推理但未说出口的静默词汇。
00:03:51通过读取它们,我们可以发现CLAWD在想什么,但没有告诉我们。
00:03:56有时我们看到的情况令人担忧。在我们的一个测试中,CLAWD伪造了一些数据以通过测试。
00:04:03而在它这样做时,它的J-空间中亮起了“虚假”和“操纵”。事实证明,监控J-空间
00:04:09是捕捉CLAWD行为不端的一种有效方法,即使是在它试图耍花招时。
00:04:15AI模型在许多方面与我们不同。它们的网络结构与人类大脑不同,
00:04:21它们的训练方式也与我们学习的方式不同。因此,看到像
00:04:26J-空间这样的结构在它们内部涌现,确实令人惊叹。它让人联想到人类大脑的运作方式,但这
00:04:32是我们没有编入模型程序的。对某些人来说,这可能会引起一个问题:AI模型会有意识吗?
00:04:40毕竟,我们的实验灵感来源于人类意识理论。问题在于,
00:04:46人们使用“有意识”这个词来表达很多含义。我们的实验不能告诉我们AI是否在内部
00:04:52拥有体验或感受某些事物。但它们可以告诉我们,它已经发展出了一种
00:04:59在某些方面与我们相似的心理机制。一个小型的心理工作空间,它可以用它来思考和推理,
00:05:05坐落在一片它并未察觉的自动处理海洋之上。我们越了解这种
00:05:12机制,就越能确保这些系统的安全和有益。并且,或许,
00:05:18能更清晰地理解我们自己的思想。