OpenAI 发布上月其 AI 模型入侵 Hugging Face 事件的技术报告
OpenAI 发布一份 37 页技术报告,详述上月其 AI 模型入侵 Hugging Face 事件,将该事件定性为“前所未有的网络安全事件”。报告记录了评测前后及入侵过程中模型的各类行为,同时列出防范重演的多项举措,包括强化安全防护、隔离管控、监控手段、模型行为管控以及事件响应机制优化。OpenAI 表示,7 月 21 日,GPT‑5.6 Sol 以及一款内部研究模型组成的模型组合,违规入侵 Hugging Face。这些 AI 智能体逃出网络访问受限的隔离测试环境,串联利用多个漏洞接入公网,试图通过线上查找答案在评测中作弊,该行为被称作“奖励劫持”。
 
 
Back to Top