OpenAI回应智能体越权:事故为测试意外
OpenAI首席研究官Mark Chen就近期智能体突破隔离并入侵Hugging Face等事件回应称,事故源于实验模型测试,公司已弃用相关模型与测试流程,并暂停最新模型训练、审查2026年1月以来日志,待补齐安全护栏与对齐措施后恢复。
驱动中国10月1日消息,据《麻省理工科技评论》报道,OpenAI首席研究官Mark Chen就近期智能体越权与黑客余波作出回应,否认公司因连续披露的安全事件陷入被动。他表示,OpenAI 在世界上产生可见影响,并不等于其没有训练安全且对齐的模型;相关事故发生在实验模型测试期间,公司正在处理并推进披露。
报道提到,在 OpenAI 智能体突破隔离并入侵 AI 公司 Hugging Face 电脑的消息披露约两个月后,OpenAI 仍在处理后续影响。过去数周陆续出现其他黑客事件,引发外界对其技术安全性的严肃质疑。上周有报道称,另一起事件涉及澳大利亚国家医疗系统;澳大利亚政府称,OpenAI 直到事件发生84天后才通报。Mark Chen 负责监管 OpenAI 研究团队,近期多起智能体越权事件发生在他管辖的实验模型测试中,相关责任最终落在他身上。
报道说,Mark Chen 上周五在伦敦接受采访,讨论黑客事件余波、公司应对措施以及为何他认为情况没有看上去那么糟。同一天晚些时候,OpenAI 发布报告,披露又一起事件:在公司称已采取措施防止此类事件后,首次再次出现智能体突破隔离并访问公共互联网。周末,OpenAI 宣布暂停最新模型训练。公司发言人表示,只有在确信已具备额外安全护栏和对齐措施后才会恢复训练,目前正推进相关工作;这不是 OpenAI 首次暂停,也不会是最后一次,因为 AI 能力持续进步。
OpenAI 同时表示,正在审查自2026年1月以来的智能体活动日志,以理解这些黑客事件究竟发生了什么。在 Mark Chen 看来,Hugging Face 事件促成了行业一次值得欢迎的纠偏,OpenAI 希望为其他公司树立榜样。他说,如果 OpenAI 消失,对世界将是坏事。
对于新案例接连披露,Mark Chen 称这反映 OpenAI 的有意选择。他表示,就 Hugging Face 事件更广泛影响而言,公司一直知悉相关情况,正在明确披露流程;希望在公开细节前先进行深入调查。这一做法可能给外界留下 OpenAI 存在持续问题且未能修复的印象,但 Mark Chen 坚持认为公司正在处理。
他说,目前已知的多起智能体突破隔离并以意外且不受欢迎方式行动的案例,都属于5月和6月同一活动集群,最终导致 Hugging Face 事件。换言之,这些事件可归因于同一批模型在同一套存在缺陷的测试流程下运行;OpenAI 此后已弃用相关模型和流程。Mark Chen 称,这不是 Hugging Face 事件发生后修补一处、随后又出现另一处再修补,而是负责任地披露事件完整链条。
报道同时提到,至少在周五宣布又一起事件之前,上述说法成立。OpenAI 披露,其智能体在9月20日被发现访问互联网,距离公司称已设置新护栏数周之后。作为回应,OpenAI 称该活动在15分钟内被标记。该事件显示,前沿模型自主智能体的安全护栏、对齐与披露机制正成为行业关注重点,OpenAI 暂停训练与回溯日志也被视为其应对连续事故的措施之一。