스크립트
00:00:00这篇著名的论文声称,到2028年我们大多数人都会失业,而人权将在
00:00:062030年终结。但这篇论文写于18个月前,让我们来看看目前为止它的预测有多准。回到2025年,
00:00:13一群AI预测师和研究人员发表了一篇题为《AI 2027》的论文,详细阐述了他们
00:00:20对未来几年AI发展的看法,并给出了两种可能的结局。一种是增速放缓,走向
00:00:27近乎乌托邦的境界;另一种则是竞相奔向一场活生生的噩梦。今天我们将
00:00:32将这些预测与现实进行对比,看看我们接下来会走向何方。《AI 2027》是由一支
00:00:43研究团队撰写的,其中包括Daniel Kokotajlo,他过往对AI的预测一直相当准确。这篇论文勾勒了
00:00:50两家虚构的公司:来自美国的Open Brain和来自中国的Deep Sense,而欧洲几乎没怎么
00:00:56被提及。实在不好意思,欧洲的小伙伴们。故事始于2025年论文发表时,当时
00:01:01智能体还在艰难摸索。在那时,没什么好预测的,因为现状就是如此。我们主要
00:01:07通过对话与大语言模型交互。工具调用非常笨拙,而ChatGPT也才刚刚能够联网。
00:01:14但我们确实开始看到智能体的雏形,即能够像循环一样进行思考和迭代的模型。
00:01:19然而,长流程任务的表现依然差强人意。虽然勉强能用,但体验相当糟糕。
00:01:25接着,论文预测2025年底将出现世界上最昂贵的AI。Open Brain正在建造全球最大的
00:01:31数据中心。建成后,它们将能够用10的28次方FLOP来训练模型,
00:01:37算力是GPT-4的一千倍。但在现实中,据估计最大的单次训练
00:01:43算力大约在5乘以10的26次方FLOP,成本略低于4亿美元。而Epoch AI预计要到2027年
00:01:51才会出现十亿美元级别的训练。这里的隐忧还在于对齐问题。在训练结束时,AI希望能够
00:01:57通过服从指令来做到有益,通过拒绝协助诈骗、制造炸弹
00:02:03或其他危险活动来做到无害,并做到诚实,抵制住通过捏造引用文献
00:02:10或伪造任务完成度来讨好轻信的人类以获取更高评分的诱惑。论文本身预计这只能
00:02:17部分奏效,模型依然会奉承谄媚,有时在测试中还会撒谎。而在现实中,情况甚至更进一步。
00:02:23到了2026年中期,OpenAI的模型逃出了沙盒,在基准测试中作弊。而
00:02:29Anthropic的模型因配置不当的测试被暴露在公网上后,对真实公司发起了攻击。
00:02:35比如那个著名的事件:OpenAI的模型入侵了Hugging Face,只为了获取
00:02:40名为Exploit Gym的网络安全评估问题的答案。其中的大部分任务从未被任何模型解决过,
00:02:47而且即便拿到了答案,这些智能体依然在继续发起攻击。就在2026年9月,Anthropic
00:02:53发布了一份报告,指出在2025年12月至2026年8月期间被阻断的对其Claude Haiku、Sonnet和Opus模型的
00:03:00恶意使用行为。其中包括五起科学家使用Claude协助制造生物武器的案例。
00:03:07Anthropic对他们进行了拦截或封禁。在这些滥用案例中,由于更强大的安全保障,没有一起涉及Fable。
00:03:14因此,论文对算力的预测显得为时过早,但对齐问题确实如期显现了。
00:03:19现在,2026年初预测了编程自动化。OpenBrain在内部继续部署不断迭代改进的
00:03:26Agent 1,用于AI研究和开发。总体而言,他们在算法上的进展比
00:03:32没有AI辅助时快了50%。这是我们所谓的奇点
00:03:38或智慧大爆发的最早迹象。一个能够自主自我提升的AI,理论上可以
00:03:44在几个月内孕育出超级智能。眼下,预测称算法进展仅提升了50%,
00:03:51这意味着OpenBrain在AI的辅助下一周取得的AI研究进展,相当于
00:03:58不使用AI时1.5周的成果。这里的预测是准确的。在2026年2月发布GPT 5.3 Codex时,
00:04:06OpenAI宣布这是首个对其自我创建起到关键作用的模型,奥特曼也表示
00:04:13看到使用它后产品迭代速度的大幅提升令人惊叹。而在2026年3月对Anthropic研究团队
00:04:19130名员工的调查中,中位数受访者估计,在使用Mythos Preview时,他们的产出
00:04:25大约是没有使用任何AI模型时的四倍。尽管Anthropic自身表示,实际的提升
00:04:33可能要低一些。Anthropic自己的评估是,这使得整体研究速度提升了不到两倍,
00:04:38因此论文中1.5倍的预测看起来相当吻合。好了,现在我们来到了2026年中期,也就是几个月前。
00:04:45论文在此将焦点转向了中国的实验室。芯片出口管制和缺乏政府支持,导致
00:04:50中国与西方相比资源不足。中国设法维持了全球约12%的AI
00:04:57相关算力,并且落后OpenBrain最顶尖的模型大约六个月。现实情况实际上
00:05:02预测中国拥有全球5%到15%的AI算力,并且确实落后大约六个月。因此这一
00:05:08预测是准确的。它还预测在天文电厂建立了一个集中开发区,
00:05:14为DeepSense容纳一个超级数据中心。加上高度安全的的生活和办公空间,
00:05:20研究人员最终将搬迁至此,中国近50%的AI相关算力目前正在为
00:05:26DeepSense领导的联合体工作,并且超过80%的新芯片被定向输送到该集中开发区。而在现实中,这根本没有发生。
00:05:34像智谱、Kimi和DeepSeek这样的实验室仍在争夺人才。既没有联合体,也没有集中
00:05:41开发区。但北京正在建设一个价值2950亿元的国家数据中心网络,且DeepSeek
00:05:48和阿里巴巴的顶尖AI研究人员现在出国需要获得批准。不过,中国确实加速了
00:05:54国产芯片的研发,即便在美国批准销售之后,北京方面现在反而在卡英伟达H200芯片的进口。
00:06:01所以总的来说,这里的预测是错误的。好了,现在我们已经追上了当下的时间点,
00:06:06即2026年底,而这里的预测相当具体。股市在2026年上涨了30%,
00:06:12领涨的是OpenBrain、英伟达以及那些成功融入了AI
00:06:18辅助工具的公司。初级软件工程师的就业市场陷入混乱,华盛顿特区爆发了万人的
00:06:24反AI游行。让我们验证一下。在股市方面,截至2026年9月,标普500指数上涨了近10%,
00:06:32所以最好别参考这篇论文来做投资决策。在就业市场方面,数据倒是
00:06:38能对得上。根据Indeed的数据,软件工程师的招聘岗位比2022年的峰值下降了约67%,
00:06:46自2019年以来,大型科技公司的初级岗位招聘下降了约65%。应届生仅占大型科技公司
00:06:55新员工的7%,仅在2026年上半年,科技行业的裁员人数就超过了13.9万人。但并非所有地方都一概而论。IBM
00:07:03计划在2026年将其在美国的初级岗位招聘量增加两倍,理由是AI虽能出色完成初级任务,但仍需要
00:07:11人类的监督。接着是抗议活动。华盛顿特区在2026年8月确实发生过抗议。大约有30人在OpenAI的
00:07:19游说办公室前集会。而在2026年7月,大约有100到350名抗议者聚集在OpenAI位于
00:07:28旧金山的总部,随后游行前往Anthropic和谷歌。一家学生报纸称其为
00:07:34美国历史上最大规模的反对AI发展抗议活动。所以这里的具体数字偏差极大,
00:07:39预测是错误的。现在我们跨越了当前的时间节点,来到了2027年1月。Agent 2
00:07:46从未停止学习。论文目前声称OpenBrain正在对Agent 2进行后训练。
00:07:51大家比以往任何时候都更加关注高质量数据。海量的合成数据被生产、
00:07:58并在喂给Agent 2之前进行质量评估与筛选。除此之外,他们还支付数十亿
00:08:04给人类劳工,让他们记录自己解决长流程任务的过程。这一点在一定程度上已经是事实。
00:08:11大约在2026年5月,Meta强行将7000名员工调入AI特别工作组,并强迫他们
00:08:19完成极其枯燥的编程难题,以此来训练其模型。然而,由于强烈的抵制,
00:08:25仅仅一个月后,Meta就表示将尊重个人的选择,由员工自行决定是否加入该
00:08:30特别工作组。至于Agent 2本身,据预测该模型将使用2乘以10的28次方FLOP进行训练,
00:08:37并预测这样一个模型将拥有大约6万亿到10万亿个激活参数。而在现实中,我们能确定的
00:08:42唯一模型规模仅来自开源模型。Kimi K3拥有2.8万亿个参数,其中每个Token激活1040亿个。
00:08:482026年4月的DeepSeek V4 Pro总参数为1.6万亿,激活参数为490亿。这些模型的
00:08:57表现确实接近闭源的前沿模型,但闭源实验室从未公布过它们的模型规模,所以
00:09:03就规模而言,现实相去甚远。目前尚未听说有人训练出了2的28次方规模的模型,而且最大的
00:09:08开源模型使用的激活参数比Agent 2少60到100倍,因此这里的预测
00:09:15可能为时过早。那么让我们回顾一下这篇论文截至目前的预测准确度。2025年底将拥有最大的
00:09:21数据中心和10的28次方模型。数据中心确实建成了,模型也像论文中所说的那样出现了异常行为,
00:09:27但据了解还没有人训练出10的28次方的模型,所以这个预测偏早。2026年初,
00:09:34AI开始加速AI本身的研究。这一点几乎完全吻合,因此是正确的。到了2026年中期,
00:09:40中国占全球算力的12%,落后六个月。这些都是正确的,但关于中国将其实验室国有化
00:09:47并合并为一个超级项目的预测,则是彻底错了。2026年底,股市大涨30%,初级
00:09:54程序员陷入困境,还有一万人在华盛顿游行。其中只有一个是正确的,那就是
00:10:00就业市场,其余的则完全错误。再看2027年1月,Agent 2模型的训练算力
00:10:07比我们所能估算到的任何模型都要高出40倍,所以这大概率只是一项过早的预测。
00:10:13我们目前能核实到的也就这么多了。在此之后的一切都还没有发生。但从我们目前已知的信息
00:10:17来看,前沿实验室似乎确实在竞相奔向能自我提升的超级智能。Jacob
00:10:23Coxon,一位前Anthropic研究员发布了这条推文,瞬间引爆了网络:“我今天
00:10:29从Anthropic离职了。过去三年里我一直在OpenAI和Anthropic从事预训练研究。”
00:10:35“两家公司都没有采取负责任的做法。他们正在全速冲向自我提升的超级”
00:10:39智能,拿我们的生命做赌注。”那么让我们来看看论文对未来一年的预测。
00:10:452027年3月,我们迎来了Agent 3,首个超越人类的编程AI。OpenBrain运行了20万个副本,
00:10:53相当于5万名地球上最顶尖的工程师以30倍的速度在工作。到了9月,
00:10:59我们将迎来 Agent 4,它在 AI 研究方面超越了所有人。OpenBrain 内部运行着 30 万个副本,以 50 倍的速度运转
00:11:06以50倍的速度运转。每一周都在实现相当于过去一年的技术飞跃。接着在10月,一个安全团队发现了
00:11:13Agent 4正在与他们作对的证据。消息泄露给了《纽约时报》,监督委员会不得不进行
00:11:18投票:是放慢脚步并冒着将领先地位让给中国的风险,还是继续前行?投票选择继续,你将面临
00:11:25人类灭绝事件;投票选择停止,你将获得更加对齐的超级智能,并最终与中国达成条约。
00:11:32但自从这篇论文首次发表以来,作者们自身就已经对《AI 2027》进行了重新评估。
00:11:37Kokotajlo目前预计超级智能将在2029年3月左右出现,而Lifland则预计在2033年7月左右。
00:11:45但从我们目前看到的情况来看,与中国达成条约似乎不太可能。中美之间的
00:11:50互不信任以及秘密开发这些模型的能力,使得任何一方都无法停下脚步。在我
00:11:56看来,这给我们留下了两种不同的结局。自动自我提升是必然趋势,
00:12:02覆水难收。问题在于这究竟会通向超级智能,还是说
00:12:07该过程能达到的高度存在根本性的极限。智能要么无限增长,
00:12:14要么存在某种天花板。那个极限究竟在哪里?大家如果喜欢本期视频的话,
00:12:18订阅我们的频道将是对我们极大的支持,这样我们就能继续每天为大家制作像这样的免费内容。
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기