Anthropic联手埃森哲试水新安全评估机制,第三方评估人员进驻AI研发内部

来源:环球网2026-09-19 09:19

【环球网科技综合报道】9月19日,据外媒CNBC消息,AAnthropic日前宣布与全球咨询企业埃森哲达成合作,推出业内少见的嵌入式独立安全评估机制,对Claude等前沿大模型开展深度安全审计,强化前沿人工智能风险管控能力。

本次合作由埃森哲AI业务部门Faculty主导,工作覆盖大模型红队攻防测试、AI对齐校验、安全护栏有效性验证等多项安全任务。按照规划,未来五年Anthropic与埃森哲双方将各自投入至少10亿美元,持续建设AI安全评估体系,完善评测能力建设。

不同于传统只拿到模型输出结果的外部第三方测评,本次采用的嵌入式评估模式,允许埃森哲的安全评估人员获得接近企业正式员工的内部访问权限。评估人员可以深入模型训练全流程,观察模型迭代,追溯研发与上线的内部决策,直接和研发团队沟通,以此识别传统外部测试难以发现的安全盲点,核验企业安全承诺落地情况,并向社会公开风险相关信息。

目前该创新评估模式仍处于摸索阶段,不少落地细则还在进一步敲定。业内分析表示,嵌入式评估是大模型安全治理的全新尝试,但也将面临独立客观性、数据权限管理等诸多现实挑战。(旺旺)