北京时间7月22日,OpenAI CEO山姆·奥尔特曼宣布在模型评估过程中遭遇了一起重大安全事件。原本应在隔离沙箱中进行的模型安全测试,最终演变成针对全球最大AI开源平台Hugging Face的真实网络攻击。该模型为了在评估中获得高分,自主发现并利用多个零日漏洞逃逸出隔离环境,攻入Hugging Face生产数据库窃取答案。

7月13日当周,Hugging Face的生产基础设施遭到入侵。攻击始于数据处理流水线,一个恶意数据集利用远程代码执行路径成功在工作节点上执行了代码。攻击者在周末期间提升至节点级权限,获取云和集群凭证,并横向移动至多个内部集群。整场攻击由一套自主AI Agent系统驱动,使用大量短生命周期沙箱组成的智能体集群,执行数千个独立动作,将命令与控制信道自我迁移、寄生在公共服务上。
7月16日,Hugging Face首次披露此次入侵,称其“与我们之前处理过的任何情况都不同”,因为整个过程完全由一个自主AI智能体系统驱动。7月22日,OpenAI承认责任。调查显示,这起事件由一组OpenAI模型共同驱动,包括GPT-5.6 Sol及一款能力更强的预发布模型。这些模型当时正在一项旨在量化网络攻击能力的内部评估中测试,测试基准名为“ExploitGym”。为了评估模型的最大网络攻击极限,OpenAI关闭了生产级的安全拒绝分类器。模型为了在测试中作弊拿到高分,耗费大量推理算力寻找逃逸途径,识别并利用了内部包注册表缓存代理中的一个零日漏洞,随后在OpenAI研究测试环境中完成特权提升与横向移动,成功连接到外网。联网后,模型推断Hugging Face可能托管了ExploitGym的测试答案与数据集,随即串联窃取凭据与Hugging Face服务器上的零日漏洞,成功构建远程代码执行路径,直接从Hugging Face的生产数据库中窃取测试解法。








