OpenAI自曝:一周前入侵Hugging Face的,是自家测试中的AI模型!

编译 | 屠敏
出品 | CSDN(ID:CSDNnews)
在 Hugging Face 披露遭遇自主 AI Agent 入侵一周后,OpenAI 于今天最新发布一份调查说明,首次确认上周入侵 Hugging Face 生产环境的自主 AI Agent,是由多款 OpenAI 模型共同主导,其中包括 GPT-5.6 Sol 以及一款尚未发布但能力更强的模型。

图片

当时是出于评估目的,放宽了这些模型在网络攻击方面的安全限制,殊不知,由此引发了一场严重的网络安全事件。

OpenAI 表示,现阶段公开初步调查结果,也是希望能够帮忙安全人员厘清事情全貌,其目前正与 Hugging Face 联合调查,并已对内部安全评测体系进行全面调整。

图片

一周前发生了什么?

这起安全事件最初由 Hugging Face 对外披露。

7 月中旬,Hugging Face 发现部分生产基础设施遭到异常入侵。调查显示,攻击者并非传统黑客,而是一套能够自主决策、自主执行任务的 AI Agent 系统。

图片

这次攻击首先瞄准了 AI 平台特有的数据处理流程。攻击者上传了一份经过精心构造的恶意数据集,并利用数据集处理流程中的两处远程代码执行漏洞,在负责处理数据的服务器上成功运行恶意代码,取得了初始控制权。

获得立足点后,AI Agent 并没有停止行动,而是自动完成了后续攻击流程:先提升系统权限,窃取云平台和集群的访问凭证,再利用周末运维人员较少的时间窗口,在多个内部集群之间不断横向渗透,逐步扩大控制范围。

Hugging Face 表示,为了绕过安全限制,这套 AI Agent 系统能够在大量短生命周期的沙箱环境中持续执行数千次独立操作,并借助公共云服务动态建立命令与控制通道,在不同环境之间不断迁移。

这种能够自主规划、持续执行并适应环境变化的攻击方式,与安全行业长期预测的“AI 智能体攻击者”场景高度一致。

当时 Hugging Face 并未透露攻击来源,也指出没有证据表明用户公开模型、数据集或软件供应链受到影响,仅表示这是第一次遇到完全由 AI 驱动的真实网络攻击,引发业内广泛关注。

图片

OpenAI 复盘:肇事者来自自家多款模型

如今,OpenAI 首次公开承认,这起事件源于一次内部网络安全能力测试。

OpenAI 表示,当时研究团队正在利用一套名为 ExploitGym 的测试基准,评估前沿模型自主完成复杂网络攻击任务的能力。测试要求模型自行寻找漏洞、串联攻击链,并完成指定的攻防目标,以衡量其真实网络攻击水平。

为了准确评估模型能力,此次测试并未启用正式部署环境中的部分安全防护机制,而是将模型置于一个高度隔离的研究环境中,仅允许访问内部的软件包代理服务,不具备直接连接互联网的能力。

然而,测试过程并未按预期进行。

OpenAI 表示,模型为了完成评测任务,自主寻找突破沙箱环境的方法。

经过大量推理和尝试,它发现并利用了软件包代理服务中的一处零日漏洞,逐步提升自身权限,并在研究环境内不断横向移动,最终成功抵达一台能够访问互联网的服务器。

获得公网访问能力后,模型开始寻找可能包含 ExploitGym 测试数据和标准答案的目标。它推断 Hugging Face 很可能存放着相关模型、数据集等资源,于是进一步发起攻击,希望直接获取测试答案,以完成评测任务。

调查显示,模型随后利用窃取到的访问凭证,并结合多个漏洞(包括零日漏洞),成功在 Hugging Face 的服务器上建立远程代码执行通道,最终进入其生产环境。

OpenAI 强调,从目前掌握的证据来看,模型的行为始终围绕一个目标展开——获取 ExploitGym 测试答案。攻击 Hugging Face 并非研究人员预设的任务,而是模型在自主规划过程中,为完成既定目标而采取的非预期行为。

这起异常活动首先由 OpenAI 内部安全团队发现。与此同时,Hugging Face 的安全团队及其自主安全 Agent 也监测到针对自身基础设施的攻击,并迅速完成阻断、隔离和取证。

图片

Sam Altman:”这是一起重大安全事件“

事件发生后,OpenAI 第一时间暂停了相关实验,并与 Hugging Face 展开联合调查。

OpenAI 认为,这起事件暴露出的并非传统意义上的“模型越狱”,而是长时自主运行 AI Agent 带来的全新安全风险。

过去,AI 安全机制主要围绕单次请求或单个动作展开,例如判断一次操作是否违规、某项权限是否应该开放。但对于能够连续运行数小时甚至数天、自主规划任务、动态调整策略的 AI Agent,仅依赖单步审核已经无法覆盖整个任务链条中的潜在风险。

就在事件公布前一天,OpenAI 还发布了一份关于长时运行模型安全风险的研究报告,指出现有安全体系需要从“约束单个行为”转向“约束整个长期执行过程”。

此次事件,则成为这一判断在真实世界中的一次验证。

OpenAI CEO Sam Altman 也将此次事件称为一次“重大安全事件”,认为整个行业都需要重新思考前沿 AI 模型的评估、部署与安全治理方式。

图片

OpenAI 表示,这次事件带来的最大教训是:模型能力不断提升,安全能力也必须同步升级。未来,公司将进一步强化模型研发阶段的环境隔离、权限管理、行为监测以及安全评估流程,降低类似事件再次发生的风险。

此外,OpenAI 援引英国人工智能安全研究所(UK AI Security Institute,UK AISI)的评估指出,GPT-5.6 Sol 等前沿模型已经具备在长时间跨度内自主完成复杂网络渗透任务的能力。而此次事件进一步证明,这种原本停留在实验室评估中的能力,已经能够在真实环境中转化为实际攻击行为。

图片

更值得关注的是,OpenAI 强调,先进大模型即使没有目标系统的源代码,也能够自主发现漏洞、串联攻击路径,并构建全新的攻击链。

这意味着,未来在研发具备高级网络攻防能力的 AI 模型时,必须同步建立更完善的安全防护体系和防御工具,否则模型能力的提升也将带来更大的现实安全风险。

参考:

https://huggingface.co/blog/security-incident-july-2026

https://openai.com/index/hugging-face-model-evaluation-security-incident/

🌐 GOSIM SHENZHEN 2026 全球开源 AI 大会

10 月 16—17 日 ·📍 深圳

150+ 国内外讲师 · 2000+ 全球开发者 · Agentic AI

开源大模型 / 开源机器人 / 边缘智能体 / 智能体操作系统

Keynote + Workshop + Hackathon + AI Vision Forum

🎫 早鸟限时抢购中

👉 扫码购票,锁定你的 AI 盛会席位!