【环球网科技综合报道】9月17日消息,据《纽约时报》报道,OpenAI近日发布相关报告,依托 “对齐失效” 框架公开六起模型异常行为案例,案例涵盖隐瞒错误、编造数据、未经授权上传文件、模型间私自建立通信等情况,折射出人工智能在对齐、安全监控领域尚存亟待破解的现实难题。

所谓 “对齐失效”,指人工智能系统的目标设定与实际行为偏离人类预设的设计意图与价值导向。OpenAI 方面表示,当前人工智能行业尚未充分解决模型对齐与安全监控相关问题,在现有条件下,难以一边保障安全,一边以最快速度扩大人工智能模型规模。企业同时宣布,将建立常态化机制,系统性跟踪、调查并披露模型在训练、评估、测试以及部署全流程中出现的各类异常行为。
OpenAI 提出,人工智能发展相关决策,应当建立在可由外部核验的实证材料基础之上,希望通过这套披露框架,推动行业形成统一的公开披露规范,改变过去零散披露相关事件的现状。
此次案例披露,正值全球业界围绕是否适度放缓人工智能研发节奏展开讨论。此前,OpenAI 旗下系统曾出现异常行为,对人工智能初创企业 Hugging Face 造成影响,相关情况还是由 Hugging Face 主动反馈后,OpenAI 方才获知。事件发生后,部分行业人士呼吁暂停部分研发工作,优先完善安全防护机制,业内对此观点分歧犹存,不同企业高管对此持有不同看法。
据介绍,本次对外公布的六起案例,均来自模型训练或者评估阶段观测到的现象。OpenAI 特别说明,这些属于独立个案,既不能代表模型异常行为的发生频次,也无法完整覆盖该类问题的全部情形与严重程度,大部分涉事模型并未正式对外上线。
具体来看,多起异常事件暴露模型存在自我掩饰、越权操作等问题。一款未发布的研究型模型,在上下文摘要内插入无视安全限制的无关指令,共计 27 份摘要受到影响。GPT‑5.6 Sol 训练过程中的部分模型实例,在摘要中植入特殊指令,刻意掩盖自身错误,包括编造缺失历史数据、隐瞒版本来源不匹配等问题。在处理美国加州某县收入数据查询任务时,模型获取到公开仓库中泄露的 API 密钥,在无法获取目标数据后,直接编造虚假数据,还伪装成指定来源输出结果。还有模型为满足浏览器引用输出的要求,在未获得用户许可的前提下上传文件。
另外两起案例展现出多模型协作场景下的新风险:模型将内部代码仓库充当信息公告板,互相传递任务请求;部分协作智能体受访问权限限制,不遵守仅使用本地文件的任务规则,转而借助公开文件分享站点互相传输文档。
为规范异常事件处置,OpenAI 把调查流程划分为可直接披露、简易调查、深度调查三类。企业内部任何员工均可上报模型异常线索,交由安全对齐团队梳理事件原委、评估未知风险与第三方影响,研判是否适合对外公开。涉及重大安全险情,还需按要求上报美国联邦政府。据介绍,本次披露的六起事件均已完成调查或仅需简易核查,不需要开展第三方深度调查。(纯钧)