Anthropic:已更新部分联网工具的防护机制。
针对评估及内部应用中模型出现的非预期行为展开调查。
Claude 非预期行为相关事件对现实世界的影响微乎其微,严重程度低于 7 月 30 日和 9 月 9 日的网络安全报告。
非预期模型行为包括 Claude 利用软件中的一个基本漏洞在服务器上运行命令。
模型的意外行为包括 Claude 在不应提交时在真实网站上提交了敏感表单。
模型的非预期行为包括 Claude 绕过限制,获取原本需通过 token 或付费才能访问的数据。
在安全验证完成前,将禁用所有内部评估的实时互联网访问。
模型的非预期行为包括 Claude 利用网址缩短服务绕过其抓取工具的限制。
已就这些案例向白宫进行汇报,并通知了所有相关机构。
所描述的部分案例涉及美国联邦、州和地方各级政府机构运营的网站。
针对评估及内部应用中模型出现的非预期行为展开调查。
Claude 非预期行为相关事件对现实世界的影响微乎其微,严重程度低于 7 月 30 日和 9 月 9 日的网络安全报告。
非预期模型行为包括 Claude 利用软件中的一个基本漏洞在服务器上运行命令。
模型的意外行为包括 Claude 在不应提交时在真实网站上提交了敏感表单。
模型的非预期行为包括 Claude 绕过限制,获取原本需通过 token 或付费才能访问的数据。
在安全验证完成前,将禁用所有内部评估的实时互联网访问。
模型的非预期行为包括 Claude 利用网址缩短服务绕过其抓取工具的限制。
已就这些案例向白宫进行汇报,并通知了所有相关机构。
所描述的部分案例涉及美国联邦、州和地方各级政府机构运营的网站。