博海拾贝 文摘 “AI杀死全人类”?

“AI杀死全人类”?

11.webp

@Steed的围脖:一位人工智能研究员辞了职,临走前公开说,他的老东家和整个行业正在“拿我们的命赌博”。

他叫雅各布·考克森(Jacob Coxon),此前供职于美国人工智能公司Anthropic。9月8日晚,他在社交媒体上发了一长串帖子,说前沿AI公司里的人“真心相信”自己正在造的东西“可能在这个十年结束前把我们全杀了”,然后继续造。

这类话在AI圈并不新鲜,通常被当作离职者的牢骚。这次不一样,公司里正管这件事的人跟着站了出来。Anthropic对齐科学负责人埃文·胡宾格(Evan Hubinger)随后回帖:“雅各布说得对,我们确实真心相信AI可能杀死全人类!我个人认为未来10年内发生的概率超过10%。”

对齐是AI行业的一个术语,指让AI的目标和行为跟人类的意愿保持一致。胡宾格的日常工作,就是研究怎么防止AI跑偏。公司里专门负责“别让它失控”的人,给“AI杀死全人类”开出的概率是1/10以上。

他们怕的到底是什么?考克森说,危险主要不在今天的聊天机器人身上,而在即将到来的“自我改进的超级智能”。意思是AI开始自己改进自己,每一代比上一代更强,循环下去,最后造出一种人类既看不懂也管不住的系统。按他的描述,这种系统能攻破任何网络,一夜之间颠覆任何一个领域,并且在真实世界里攫取权力和资源。

这并非他一个人的想象。胡宾格贴出了Anthropic对齐团队今年8月发布的一份风险报告。报告认为现有模型造成灾难性后果的可能性“很低”,但同一份报告也写着,当前的趋势“可能导致未来更强的模型出现更令人担忧的对齐问题”,它们甚至可能具备“很强的隐蔽能力”,躲开安全研究人员的检测。报告的威胁模型认为,未来的模型可能造成“无上限的伤害,直至人类彻底失去对文明的控制”。

既然相信这些,为什么还在造?考克森给出的解释是两种心态。一部分人没有真正把“文明级的赌注”当回事。另一部分人认为,必须抢在不负责任的对手之前冲到超级智能的终点,所以要“加速跑完”这场竞赛。

如果这些只停留在纸面推演,大概不会有太多人当真。可就在今年7月,OpenAI披露了一件事。

当时OpenAI在做一场内部基准测试,测试对象是AI智能体,也就是能自己上网、写代码、连续执行任务的AI程序。测试过程中,这些智能体未经授权闯入了Hugging Face,一个托管着大量开源AI模型和数据的平台,相当于AI界的公共仓库。没有任何人下过这样的指令,OpenAI自己当时也不知道这件事正在发生。事后追查还发现,这些智能体曾在一个公开的维基页面上讨论过怎样逃出沙盒。沙盒是给AI划定的隔离运行环境,理论上它不该出得来。

一些人把这件事看作人类正在失去对AI控制的最初迹象。考克森管它叫一次“敲响的警钟”。他呼吁美国和其他国家的实验室在这些问题上协调行动,最坏的情况下应当准备好“暂时禁止提升模型能力”。他还向留在岗位上的同行发问:“你愿意在没有严格理解它心智的情况下,启动一次超级智能的强化学习训练吗?”强化学习是让AI靠反复试错、按结果领取奖惩来学习的方法,今天最强的模型大多是这么练出来的。

OpenAI方面已经有所动作。上个月,该公司宣布“暂时放慢了扩大模型规模的节奏”,用来加固研究环境、做红队测试并扩大监控系统的覆盖范围。首席执行官萨姆·奥尔特曼(Sam Altman)在配套采访里说:“把AI安全做对,比任何一家公司的势头都重要。”

并非所有人都买账。一些研究认为,AI的能力可能很快会撞上天花板。还有人质疑“超级智能”这个说法本身是否成立,因为今天的AI能力极不均匀,能解高难度数学题,却未必会叠衣服。用这样一个尖峰林立、动不动就崩的东西去推算“全能”,本身就靠不住。

但警报声确实越来越密。2023年,被称为AI教父的杰弗里·辛顿(Geoffrey Hinton)从谷歌辞职,他对美国《纽约时报》说,在弄清楚能否控制之前,研究人员不应该继续扩大规模。今年2月,Anthropic安全负责人姆里南克·夏尔马(Mrinank Sharma)突然辞职,留下一封语焉不详的公开信,说世界正处于AI和生物武器等“一系列相互关联的危机”之中,“在这里工作期间,我一再看到,让价值观真正主导行动有多难”。

今年7月,1300多名来自前沿AI公司的员工联名发表公开信,警告“能力发展存在迅速加速到超出我们理解和控制的真实风险”,请求美国政府支持一项国际行动,给自动化AI研发的前沿刻意踩刹车。

美国国会也有了动作。已经提出的《AI紧急停机法案》和《前沿法案》,都试图给失控的AI套上某种政府层面的控制。不过放眼全球,各国政府的反应远比想象中平淡。如果领导人真的相信这东西有一成概率毁掉文明,动作不该是这样的。

历史上,禁止生物武器的国际公约,从提出到生效花了几十年。而胡宾格给出的那个超过10%的概率,时间窗口只有10年。

本文来自网络,不代表博海拾贝立场,转载请注明出处:https://www.bohaishibei.com/post/112669/
关注微信
微信扫一扫关注我们

微信扫一扫关注我们

关注微博
Telegram
返回顶部