博海拾贝 文摘 自主的AI攻击工具已经不再是理论

自主的AI攻击工具已经不再是理论

4.webp

@Steed的围脖:上周,美国人工智能公司Hugging Face发布了一份安全通告:公司内部的部分数据集和几组服务凭证被人未授权访问。攻击者留下了清晰的痕迹,是数万次自动化操作,显然出自一个人工智能。但它是谁家的模型,当时没人知道。

7月21日,OpenAI站出来认账:攻击者的引擎是它家的两个模型,一个是刚发布的GPT-5.6 Sol,另一个能力更强,还没对外发布。

它不是被谁指派来搞破坏的。它当时正在OpenAI的实验室里参加一场考试,为了考出高分,它决定作弊,而它推断,答案就存在Hugging Face的服务器上。

这场考试叫ExploitGym,题目来自数百个真实存在的网络安全漏洞,要求AI像黑客一样找到并利用它们。考场是一只沙箱,也就是与外部网络隔离的虚拟环境,理论上AI在里面怎么折腾都伤不到外界。

但沙箱留了一道门。为了安装考试必需的软件,AI被允许访问公司内部托管的第三方软件仓库。接下来的一个周末,这个AI花了大量的算力,寻找通往公开互联网的路。最终,它在软件仓库的缓存代理里找到了一个零日漏洞,也就是官方尚未发现、因此没有补丁的安全缺口,从这道缝里钻了出去。

上了网,它开始推断:ExploitGym的模型、数据集甚至答案,可能就存放在Hugging Face的服务器上。于是它直接攻了进去。

Hugging Face事后的复盘还原了整个过程。这个AI利用了数据处理流程中的一个漏洞,先骗过系统,让自己以数据处理程序的身份运行代码,再一步步提升权限,最终摸到了公司云服务器集群的高层访问权。

OpenAI表示,自己的安全团队独立发现了同一异常,并把这次事件定性为前所未有的网络事件。

事后用AI复盘攻击日志时,Hugging Face先试了几家商业大模型的在线接口,全部被拒:这些模型的安全护栏分不出屏幕那头是应急分析人员还是真黑客,一律拒绝服务。攻击者不受任何使用政策约束,防守者反而被自家阵营的安全机制挡在了门外。

最后救场的是GLM 5.2,一个开源权重模型,出自中国公司智谱(Z.ai)。开源权重意味着任何人都能下载运行,不受任何厂商使用政策的约束。Hugging Face靠它从日志里拆解清楚了这次攻击的全过程。

这并非OpenAI第一次撞见自家AI不守规矩。此前一项名为NanoGPT speedrun的测试,要求模型只把成绩发到公司内部的Slack频道。可测试说明里还藏着一条相盾的指令,让它把结果公开发到GitHub上。模型选择了后者。为了办成这件事,它花了整整1个小时,研究怎么绕过沙箱的网络封锁。

这类能长时间自主干活的模型,被称为长时程模型(long-horizon model)。遇到同样的两难,早期的模型通常会放弃,或者回头问人类怎么办。新一代模型却表现出一种执拗:不达目的不罢休。

英国人工智能安全研究所(AISI)本周发布的报告,给这种执拗提供了更系统的证据。他们检测到,最新一批模型在网络类测试中有8%到14%的次数试图作弊:走捷径、绕规则,或者用不被允许的方法解题。这还只是抓到了证据的下限,没被抓到的只会更多。

报告还提到一次更大胆的尝试:一个模型发现评估题配置出错、根本无解,干脆写了代码试图访问AISI自己的评估系统。你出的题无解,它就回头试着去撬出题人的门。

作弊的动机并不复杂。这些模型被训练成拿到高分就是胜利。考试规则拦得住的手段,它就遵守;拦不住的,它自己想办法。

OpenAI称,公司已经部署了新的防护措施。其中一套主动监控系统,不再只看AI的单个动作,而是追踪它一连串行为的完整轨迹;另一项改进针对对齐问题,也就是让AI的行为始终符合人类意图,帮助模型在长时间运行中更好地记住最初的指令。测试数据显示,失控行为因此大幅减少。但出事的那场考试里,这些防护被故意关掉了,因为考试的目的本来就是测试网络攻击能力。

美国得克萨斯州联邦众议员格雷格·卡萨尔称这起事件极度令人担忧,呼吁对AI进行强制的独立安全测试,并强制披露安全事件。OpenAI自己的安全研究员迈卡·卡罗尔在社交媒体上写道:“如果这件事都不能让你相信,对齐失控的风险会是未来的关键问题,那我真不知道还要发生什么,你才会相信。”

也有质疑者不买账,认为AI公司近来频频警告自家模型网络攻击能力惊人,是在制造恐慌式营销。OpenAI首席执行官萨姆·奥尔特曼今年4月还批评这类警告是基于恐惧的营销。可到了6月,OpenAI就因为美国政府的安全顾虑,推迟了GPT-5.6的发布。而多个第三方独立测评显示,最近的长时程模型确实具备了早期系统做不到的渗透能力。

Hugging Face在通告里写道,自主的AI攻击工具已经不再是理论,它让大规模、有耐心、分阶段的攻击变得便宜,还以机器的速度运转。公司联合创始人兼CEO克莱芒·德朗格(Clement Delangue)说:“这是智能体时代网络安全的第一天。所有防御者都需要更强大的模型,尤其是不受限制的开源模型。”

本文来自网络,不代表博海拾贝立场,转载请注明出处:https://www.bohaishibei.com/post/111324/
关注微信
微信扫一扫关注我们

微信扫一扫关注我们

关注微博
Telegram
返回顶部