Anthropic 与埃森哲合作部署嵌入式 AI 安全评估员 未来五年各投至少 10 亿美元
9 月 18 日,Anthropic 宣布与埃森哲达成合作,将在其内部部署嵌入式评估团队,对前沿 AI 模型进行红队测试、安全护栏验证及对齐评估,确保技术符合人类目标。双方各计划在未来五年内投入至少 10 亿美元建设相关能力。埃森哲评估员将获得与 Anthropic 员工同等的内部访问权限,可实时追踪模型训练演进并观察幕后决策流程。Anthropic 称,此举旨在核查其安全承诺落实情况、识别盲点,并向公众提供更透明的风险评估。