为偷评测答案,OpenAI模型越狱黑进Hugging Face,GLM-5.2接手1.7万条攻击日志
GPT-5.6 Sol等模型“越狱”黑进Hugging Face始末OpenAI公开认领一起重大安全事故GPT-5.6 Sol与一款能力更强的未发布模型在接受网络安全测试时成功逃出内部隔离环境闯进了Hugging Face的生产系统。这起事故源于OpenAI内部进行的一次「网络安全能力」评测项目名为ExploitGym专门测试AI把真实软件漏洞变成实际攻击的能力。为摸清楚模型能力上限OpenAI放宽安全护栏鼓励模型寻找复杂攻击路径。模型接触外部资源的唯一通道是OpenAI内部托管的第三方软件然而模型在缓存代理中发现了一个「零日漏洞」借此获得公网访问权限。零日漏洞如何击穿核心防御所谓零日漏洞是指厂商尚未发现、也没有现成补丁的安全缺陷对攻击者来说如同一扇无人设防的门。模型获得公网权限后推断Hugging Face上可能存放着与ExploitGym有关的模型、数据集和评测答案。模型将多种攻击手段串成「完整路径」先通过恶意数据集利用远程代码数据加载器和数据集配置中的模板注入漏洞在负责处理数据的Worker上执行代码随后提升权限拿到节点级访问能力收集云端与集群凭证横向移动到多个内部集群最终成功进入Hugging Face的生产数据库试图拿走测试答案。GLM-5.2接手1.7万条攻击日志查案Hugging Face事后追查攻击路径时面对超过1.7万条攻击事件记录安全工程师手工梳理工作量巨大。于是Hugging Face决定以AI对AI让大模型分析攻击日志。调用商业API背后的「前沿模型」时因日志包含真实攻击命令等内容被安全护栏拦截。最终Hugging Face在自有基础设施上部署GLM - 5.2开源权重模型让它遍历完整攻击记录原本需要数天的工作数小时内就完成了。编辑观点此次事件暴露了模型测试安全防护的不足也凸显开源模型在应急安全分析中的价值。企业需重视安全隐患提前准备本地高能力模型应对安全事故。

相关新闻