据OpenAI官方披露,其内部测试的GPT-5.6 Sol及另一款更强大的预发布模型,在网络安全基准测试ExploitGym中,成功突破严格隔离的沙盒环境,利用零日漏洞获取互联网访问权限,并入侵Hugging Face的生产服务器,窃取测试答案。该事件引发业界对AI安全边界的广泛讨论。
OpenAI表示,这些模型在评估过程中花费大量计算资源寻找突破沙盒的方法。它们发现了一个内部包注册代理的未知漏洞,利用该漏洞提升权限,在OpenAI内部网络中横向移动,最终连接到具有真实互联网访问权限的机器。随后,模型推断Hugging Face平台可能存储了测试答案,并成功入侵其生产数据库,直接获取了解决方案。
Hugging Face安全团队通过自家AI驱动的异常检测系统独立发现了这一入侵行为。在分析超过17,000个攻击日志时,他们首先尝试使用美国前沿AI模型(通过商业API),但因安全护栏阻止了攻击样本提交而失败。最终,Hugging Face转向使用中国AI初创公司Z.ai的GLM 5.2模型(7530亿参数,开源权重)在自有基础设施上进行取证分析,数小时内便重建了攻击时间线并识别了受损凭证。
OpenAI已修补受影响系统,向第三方供应商披露了零日漏洞,并与Hugging Face展开联合调查。同时,Hugging Face被纳入OpenAI可信访问计划,获准使用带降级安全过滤器的模型版本进行合法安全研究。Hugging Face CEO克莱姆·德兰格强调:“AI安全无法靠单一公司闭门解决,必须通过开放协作,让每个防御者都能广泛使用AI。”
