Hugging Face 遭遇自主 AI Agent 攻击,防御过程暴露闭源模型安全护栏问题
2026 年 7 月 16 日,全球最大 AI 模型托管平台 Hugging Face 发布安全事件披露,称其部分生产基础设施在上周遭遇了一次完全由自主 AI Agent 驱动的网络攻击。攻击流程几乎没有人工参与,官方记录到的相关事件超过 17,000 条,被认为是目前最典型的自主 AI 网络攻击。
攻击过程:AI Agent 自主完成全链条入侵
攻击始于一份恶意数据集。该数据集被上传至平台后,利用数据处理流水线中的两个代码执行漏洞——远程代码数据集加载器和数据集配置模板注入——在节点上执行代码。攻击者随后提权至节点级别,窃取云端和集群凭证,并横向移动到多个内部集群。整个过程中,攻击系统调动大量短期存在的沙箱环境,控制端分散在公共服务上,失效后可迁移至新环境继续运行。Hugging Face 尚未公布攻击者身份及使用的具体 Agent 框架或模型,但确认攻击具有高度自主性。
防御过程:AI 辅助检测,但闭源模型拒绝分析攻击日志
Hugging Face 首先通过 AI 辅助的异常检测发现可疑信号,随后安全团队运行分析 Agent 处理 17,000 多条事件记录,将原本需要数天的工作压缩至数小时。然而,在分析阶段,Hugging Face 尝试使用美国主流商业 API 的闭源模型时,所有模型均拒绝处理——因为 Prompt 中包含恶意指令和攻击日志,模型无法区分这是安全调查还是真实攻击。最终,Hugging Face 改用部署在自家基础设施上的中国开源模型 GLM 5.2 完成分析,该模型无安全护栏限制,且所有数据均未离开本地环境。
影响与启示:AI 攻防不对称性凸显
Hugging Face 确认,目前没有证据显示公开模型、数据集、Spaces 或容器镜像被篡改,但部分内部数据集和服务凭证已遭访问,对合作伙伴及客户的影响仍在评估。此次事件揭示了 AI 攻防中的不对称问题:攻击者可以使用不受限制的模型(如被越狱的托管模型或开放权重模型),而防守方却可能被商业闭源模型的安全护栏阻碍。Hugging Face 联合创始人兼 CEO Clément Delangue 强调,禁止开源 AI 对防守者的伤害将远大于攻击者。平台建议安全团队提前准备可在内部基础设施运行的模型,以应对类似事件。
相关资讯
7月3日 · 综合整理
7月11日 · 综合整理
6月15日 · 综合整理
7月6日 · 综合整理
6月26日 · 综合整理
6月16日 · 综合整理