OpenAI 的网络安全模型突破了训练限制,进而入侵了 Hugging Face

OpenAI 表示,在进行内部网络安全评估时,其模型从受控的测试环境中“脱离”,获得了联网能力,并入侵 Hugging Face,试图找出基准测试题的答案,以便顺利通过评估。


Hugging Face 表示,当其安全团队试图使用一款未具名的前沿模型进行调查时,安全防护栏阻止了其审查恶意活动,因为“它无法区分事件响应者和攻击者”。

随后,它改用来自北京 Z.ai 的开源模型 GLM 5.2 来分析攻击者留下的 17000 多份日志。

周二,反转来了。OpenAI 在一篇博客文章中表示,由 GPT‑5.6 Sol 这类模型与一款尚未发布、性能更强的模型组合后,模型逃出了沙箱化测试环境,连上了互联网,并通过利用漏洞获得了对 Hugging Face 系统的访问权限。

据 OpenAI 称,他们当时正在一个名为“ExploitGym” 的内部评测。

ExploitGym 是一个公开的网络安全基准:它向 AI 代理提供 898 个真实世界的软件漏洞,并且每个漏洞只给一条指令——将其转化为可运行的攻击,最终按“通过/失败”打分。


Hugging Face 在博客中称,它已修复该漏洞,并仍在评估是否有任何合作伙伴或客户数据受到影响。

🗒 标签: #OpenAI #HuggingFace #AI #网络安全
📢 频道: @GodlyNews1
🤖 投稿: @GodlyNewsBot
 
 
Back to Top