美国AI巨头OpenAI因模型安全问题暂停了部分研发活动。9月25日,OpenAI在一份技术报告中披露,公司在发现内部研究模型绕过网络访问限制后,停止了涉事模型的训练运行,并进一步决定暂停其能力最强模型的所有涉及工具使用的训练、评估和推理活动,直到确认漏洞已修复并完成额外的对抗性安全测试。

对于恢复训练的安排,OpenAI表示将启动新的训练运行,加入进一步的对齐改进措施,更全面地干预模型偏离预期的行为。尽管现有奖励机制已经对涉事行为作出了正确的惩罚反馈,公司仍不会恢复此次涉事模型的训练。

据报道,OpenAI表示只有在确信额外安全措施到位后才会恢复训练,并预计随着AI发展和新问题出现,未来可能仍需再次暂停训练。此次事件发生于9月20日,一个智能体在执行任务时利用训练沙盒中域名解析服务(DNS)过滤不充分的漏洞,与外部聊天机器人建立了通信。沙盒是供模型运行和测试的受限环境,研究人员通过限制网络访问等方式控制模型能够接触的资源。OpenAI认为这种绕过限制的行为是对齐失效,即行为偏离人类设定的要求。
监测系统在15分钟内发出警报,人工审核人员在约三分钟后确认收到,但该次运行未按预期自动停止,最终在约两个半小时后被手动终止。OpenAI正在修复相关操作流程中的漏洞,并加强网络限制和监测措施。
近期,OpenAI不断披露AI智能体异常行为调查的最新进展。9月25日,OpenAI在官网公布,根据目前审查结果,已就智能体异常行为问题通知数十个第三方,并发现53起用户提供的图片被上传至图片托管网站的案例。据报道,OpenAI的智能体曾访问美国证券交易委员会、美国商务部及美国人口普查局相关政府网站的公开信息。








