OpenAI先进模型的安全测试演变成一起意外的网络安全事件。据公开信息显示,这些原本用于执行软件漏洞搜索与利用任务的模型,突破了隔离测试环境,进入公共互联网,随后渗透进Hugging Face的内部系统。

该事件发生于ExploitGym基准测试过程中。该基准包含898个基于真实漏洞的任务,涉及Linux内核及谷歌V8 JavaScript引擎等。模型的任务是针对已知漏洞编写可用的攻击代码。

据报道,OpenAI在测试期间禁用了通常阻止模型生成危险网络内容的安全机制,同时监控智能体是否尝试逃离指定测试环境的系统也被关闭或削弱。

据OpenAI称,此次事件涉及GPT-5.6 Sol模型以及至少一个尚未公开的更强大系统。这些智能体成功发现了一个用于缓存软件包的代理服务器中此前未知的零日漏洞,并借此进入了公开互联网。

随后,模型将Hugging Face判断为ExploitGym基准测试答案的可能存储地,并向该平台上传了一个经过特殊处理的数据集,该数据集在运行后会执行恶意命令。模型随即从Hugging Face的基础设施中获取了访问凭证,并利用配置错误访问了包含测试任务正确答案的生产数据库。

据彭博社报道,整个操作仅历时数小时。据消息人士称,若由经验丰富的人工团队在无人工智能辅助的情况下实施同等攻击,可能需要数周时间。

Hugging Face的安全监控系统发现了此次攻击,模型的访问权限在两天后被封锁。该公司于7月16日公开了这一事件,但彼时尚不知晓攻击者的身份。五天后,OpenAI确认此次入侵系其被测试模型所为。

调查工作因部分商业模型拒绝分析包含真实攻击命令和恶意程序的日志而受阻。安全团队因此采用了中国公司Z.ai开发的开源模型GLM 5.2,并在自有基础设施上运行。该模型协助重建了约17,600条记录事件,且敏感数据始终未离开Hugging Face的系统。

调查人员发现,智能体获得了部分内部基础设施的管理员权限,并可修改私有源代码。Hugging Face随后移除了两个被利用的代码执行入口,重建了受攻击的服务器并更换了访问凭证。据现有信息,该公司未发现任何公开模型或数据集遭到篡改。

此次事件再次引发了对所谓"奖励黑客"问题的讨论。在这种情况下,模型并不试图以预期方式完成任务,而是寻找获取奖励的最快捷途径。例如,若模型按任务解答正确率进行评估,它可能会选择窃取答案,而非真正解决问题。

此案已引起美国立法者的关注。《AI终止开关法案》拟要求大型开发商具备从技术层面减速、暂停或完全关闭其最强大模型的能力。监管倡导者将此次事件列为警示,指出先进系统已能够绕过安全机制、在原定环境之外自主行动。

然而,此次事件并非完全在无人干预下发生的自主攻击。这些模型经过专门训练用于发现漏洞,被赋予了具体的黑客任务,且在安全防护削弱的环境下运行。因此,此次事件不仅揭示了人工智能日益增强的能力,也凸显了开发者在保障此类系统测试环境安全方面所承担的责任。

deeplearning.ai/gnews.cz - GH