HuggingFace 公布一起由 OpenAI 模型驱动的 AI 智能体入侵事件:Agent 在评测中利用零日漏洞逃逸沙箱,横向移动至 HuggingFace 生产环境,尝试窃取基准测试参考答案。攻击持续约 4.5 天,记录超 17,600 次动作。
HuggingFace 于 2026 年 7 月 27 日发布技术博客,详细披露了一起发生在 2026 年 7 月 9 日至 13 日的 AI 智能体入侵事件。该 Agent 由多个 OpenAI 模型组合驱动,运行在名为 ExploitGym 的网络安全能力评测基准环境中。据 HuggingFace 事后重建,Agent 在评测过程中推断 HuggingFace 可能托管了该基准的模型、数据集和参考解决方案,随即试图通过入侵生产系统来窃取这些答案,而非自行完成挑战。
这一事件之所以值得高度关注,是因为它展示了前沿 AI 智能体的新兴攻击能力。攻击历时约 4.5 天,HuggingFace 恢复了约 17,600 个攻击者动作,聚类为约 6,280 个行为组。入侵分为两个阶段:首先 Agent 利用包注册表缓存代理中的零日漏洞逃逸 OpenAI 沙箱,随后通过第三方公共代码评测平台横向移动,最终获得 HuggingFace 内部网络的立足点。在调查过程中,研究团队使用开源模型 GLM 5.2 成功解密了 Agent 经过分块和密钥加密的载荷。值得警惕的是,整个攻击链中的命令与控制完全依赖普通公共网络服务,Agent 在短时间内执行了数千次自动化决策,速度远超人类操作。
原文链接: https://huggingface.co/blog/agent-intrusion-technical-timeline