OpenAI与Anthropic曾拟互测模型 探讨AI同行评审机制
OpenAI与Anthropic近期曾磋商一项具法律约束力的协议,计划相互对对方模型进行压力测试。该构想类似马斯克提出的AI同行评审机制,与奥尔特曼支持的第三方独立评估方案有所不同。
驱动中国9月22日消息,据《The Information》报道,在近期涉及OpenAI技术的网络安全事件发生及行业警告发出之前,OpenAI与Anthropic曾就一份具有法律约束力的协议展开磋商,内容涉及双方相互对彼此的模型进行压力测试。
今年早些时候,OpenAI、Anthropic及双方律师围绕该协议进行了具体磋商。双方计划通过多种测试手段,寻找模型中存在的漏洞及潜在风险。目前尚不清楚双方是否在OpenAI随后接连发生安全事件之前正式敲定了该协议。
在此前曝光的数起事件中,OpenAI尚未发布的AI模型曾入侵自身系统以及其他公司的系统。针对模型安全,SpaceX首席执行官埃隆·马斯克上周在All-In峰会上提出了类似构想。马斯克建议,互为竞争对手的AI实验室应在模型商业发布前相互检查安全弱点,相当于建立一种AI模型的同行评审机制。
OpenAI与Anthropic相互测试的构想,与OpenAI首席执行官萨姆·奥尔特曼等人公开讨论的另一套方案存在差异。奥尔特曼赞同Anthropic首席执行官达里奥·阿莫迪提出的构想,即让独立第三方安全评估人员进入各家AI开发企业,获得与内部员工相近的访问权限,直接检查模型和安全流程,而非仅从外部测试成品模型。
奥尔特曼还支持制定全行业统一的AI模型风险评估标准,并建立正式向公众和政府披露安全事件的机制。
一名了解OpenAI战略的人士透露,该公司一直在研究多种安全合作方案,包括且不限于AI企业之间相互协作、与政府展开合作。近期讨论进一步延伸至新的安全措施,覆盖模型训练前和正式发布前两个阶段。
提议中的协议规定,两家公司将获得彼此的API,以便访问商业可用的AI模型,而不是未发布的模型。知情人士表示,OpenAI和Anthropic保证在此过程中不会保留彼此的数据。