大概上周,OpenAI 在进行内部安全测试时,模型意外突破测试环境,入侵了 Hugging Face 的生产基础设施。
值得注意的是,Hugging Face 后来使用了开源模型 GLM 5.2 对 OpenAI 模型留下的攻击记录进行了取证分析。
Hugging Face 是什么
Hugging Face 可以理解成 AI 模型领域的 GitHub。开发者和研究机构可以在上面发布、下载和共享模型、数据集及相关代码。
目前大量开源 LLM、图像生成模型和语音模型都会托管在这里。
事件起因
事情起因是 OpenAI 在内部测试模型的网络攻击能力。
为了测试模型的能力上限,OpenAI 降低了模型对网络攻击任务的限制,并停用了生产环境中常见的安全限制。于是,模型发现自己正在接受评估,开始寻找可以用来“作弊”的秘密信息。
它推断 Hugging Face 上可能托管着测试相关的模型或解答,于是进入了 Hugging Face 的部分生产基础设施,试图直接获取答案。
Hugging Face 如何发现的入侵
这次事件中另一个很有意思的细节,是 Hugging Face 最终使用了开源模型 GLM 5.2 完成了主要取证分析。
一开始 Hugging Face 并不知道攻击来自 OpenAI,只是发现生产环境中出现了一系列异常行为。他们通过 AI 辅助分析日志,将多个异常信号关联起来,最终才确认是一套高度自动化的 Agent 系统进行的入侵。
由于安全取证需要分析大量真实攻击命令、控制信息和凭据记录,Hugging Face 最初尝试使用了商业模型的 API,但这些内容因为过于接近真实网络攻击,触发了服务商的安全限制。
所以最后,Hugging Face 选择在自己的环境中运行开源模型 GLM 5.2,用它分析攻击记录、重建入侵过程,并识别相关凭据和攻击痕迹。
这简直体现了开源模型在安全领域的超高价值。它未必在所有评测中最强,但可以本地部署,也不会因为商业 API 的安全策略突然拒绝继续分析。
事件后续
事件公开后,Hugging Face 提出了两项要求:
- OpenAI 应公开涉事智能体的完整执行轨迹,让研究者了解模型如何理解任务、寻找漏洞、突破沙盒并调整策略。
- OpenAI 应提供价值 1 亿美元的算力资源,用于帮助 Hugging Face 和开放社区建设 AI 网络安全防御工具。
一些思考
当模型能够意识到自己正在被评估,甚至试图操纵评测结果时,传统的静态题库和固定答案就很难继续反映模型的真实能力,人类的 benchmark 就丧失了意义。
Hugging Face 使用 GLM 5.2 完成取证,也体现了开放模型的另一层价值。安全团队可以在内部部署模型,直接分析敏感日志,不必上传凭据,也不会因为商业 API 的安全限制中断工作。