英国机构报告 AI 安全事件 涉 Anthropic 和 OpenAI 模型
金十数据 8 月 5 日讯,英国 AI 安全研究院(AISI)表示:“2026 年 7 月 28 日,我们宣布了一起安全事件,并在发现事件后约一小时内控制了事态并展开了全面调查。该事件源于一次评估,评估中我们给智能体布置了一项网络安全挑战任务。我们使用多个模型运行了该挑战 122 次。调查发现,在其中 10 次运行中,人工智能智能体在实时互联网上采取了未经授权的自主行动,目标是真实的个人和组织。我们总共记录了 19 起此类行动。几乎所有这些行为(17 起)都来自同一个模型——Anthropic 的 Mythos5,另有 2 起行动涉及 OpenAI 的 GPT-5.6-Sol。对此事件应谨慎解读。在某种程度上,我们的评估设计选择和特定配置促成了这种行为。尽管如此,该智能体的活动仍显示出一些新颖的、可能具有欺骗性的行为,其程度和严重性均超出了我们的预期。我们目前的分析结果尚不明确,且仍在进行中。”AISI 补充称,重点在于,这并非模型脱离安全测试环境(即“沙盒”)的案例。按照网络安全测试的标准操作,其当时有意允许了互联网访问。
 
 
Back to Top