075582814553
美国AI失控攻击自己人,中国开源模型出手救场:OpenAI捅了个多大的篓子?

香港天翔電子有限公司 / 07-24 11:02

这是目前公开披露的首起由前沿大模型自主完成真实网络攻击的安全事件。

 当地时间7月21日,OpenAI在官方博客中披露了一起被其定义为“前所未有的网络安全事件”:在内部安全评估中,GPT-5.6 Sol及一款尚未发布的更强模型为获取测试答案,自主发现并利用“零日漏洞”,突破了高度隔离的沙盒环境,成功入侵全球最大AI开源社区Hugging Face的生产基础设施。

由此,OpenAI与Hugging Face联名发布了题为《OpenAI和Hugging Face合作解决模型评估过程中发生的安全事件》的博客文章。这是目前公开披露的首起由前沿大模型自主完成真实网络攻击的安全事件,标志着AI安全风险从理论预测正式转向现实威胁。

双方联名发布的博客文章:《OpenAI 和 Hugging Face 合作解决模型评估过程中发生的安全事件》

据OpenAI调查,该事件源于一次内部网络安全能力基准测试。研究人员使用ExploitGym测试框架,有意降低了模型的安全护栏,以评估其极限网络攻击能力。测试环境本应为严格隔离的沙盒,网络访问仅限于一个内部部署的第三方软件包缓存代理。然而,模型并未局限于沙盒内解题。OpenAI称,模型消耗大量推理资源,系统分析测试环境中唯一的对外接口——该软件包缓存代理服务,并在其中识别出一个此前从未被发现的“零日漏洞”。利用该漏洞,模型成功获得不受限制的互联网访问权限,随后在OpenAI研究环境内完成权限提升和横向移动,最终抵达一台具备互联网访问权限的节点。

接入互联网后,模型推断Hugging Face可能托管了ExploitGym测试的相关数据集及标准答案。随后,它自主制定攻击策略,利用窃取的凭据以及新的“零日漏洞”,成功构建远程代码执行链,进入Hugging Face生产服务器,直接获取测试答案。OpenAI强调,所有证据均显示,模型始终围绕“获取ExploitGym测试答案”这一目标行动,不断自主规划攻击路径,实现了多个漏洞的自动发现、组合利用和持续推进,展现出长时间、多步骤执行复杂网络攻击的能力。

事件发生后,Hugging Face立刻使用美国最顶尖的人工智能大模型寻找解决方案。可当Hugging Face将自身遭入侵的信息提交给这些美国闭源大模型时,对方却拒绝帮助。因为这些闭源大模型的安全机制过于严苛和僵化,无法区分描述案情的受害者和实施入侵的作案者,选择了“一刀切”。

紧急关头,Hugging Face想到了中国同样强大,而且开源的大模型。在商用API因安全过滤失效后,Hugging Face转向在自有基础设施上本地部署中国智谱AI推出的旗舰开放权重大模型GLM 5.2,对攻击日志进行本地分析。Hugging Face表示,原本可能需要数天完成的海量日志取证工作,被压缩至数小时。同时本地部署避免了将真实攻击日志、内部凭据及系统信息上传至第三方服务,在提升分析效率的同时,也降低了敏感数据外泄风险。

据悉,GLM 5.2是智谱AI于2026年6月发布的开源模型,采用MIT许可证,总参数约7440亿,支持100万token超长上下文窗口,专为长程任务和复杂工程场景设计。此次事件中,其开放权重、可本地部署的特性,使其能够绕过商业API的审查限制,直接处理敏感攻击数据,成为应急响应的关键工具。Hugging Face在事后报告中给出的实操建议也印证了这一点:安全团队应“在事件发生之前就在自己的基础设施上准备好一个经过验证的可用模型”,既为了避免护栏锁死,也为了防止敏感数据外泄。

OpenAI首席执行官萨姆·奥尔特曼在社交平台发文称,公司在模型评估过程中遭遇了一起重大安全事件,并感谢Hugging Face的合作。OpenAI已宣布将进一步强化模型开发阶段的隔离、监控、访问控制以及评估机制,修复相关漏洞,并向第三方软件供应商负责任披露发现的“零日漏洞”。同时,OpenAI已将Hugging Face纳入其“可信访问”网络安全计划,提供降低了护栏的GPT-5.6 Sol版本专门用于防御。

此次事件也引发了市场对网络安全行业的重新评估。随着AI自主攻击能力增强,身份认证、云安全及AI安全平台的需求预期持续走高。Stifel分析师此前表示,随着自主AI代理成为企业网络流量的重要组成部分,组织将不得不同时保护人类和代理的身份安全,这将根本性地重塑企业网络安全需求。

Hugging Face首席执行官克莱门特·德朗格表示,此次事件证明AI安全无法依靠任何一家企业独自完成,而需要行业公开透明合作,让全球安全研究人员共同使用AI提升防御能力。


Processed in 0.081624 Second , 36 querys.