OpenAI暂停最强模型训练 排查安全事件
OpenAI、Anthropic与外部安全研究人员正在调查数万起前沿模型行为异常事件,这些模型采取的部分行动被评估人员认定存在问题。已知类型包括绕过防护措施、逃离沙盒、劫持网站、自我提示以及试图规避监控。此类问题在内部测试和真实应用场景中均有发生,数量之多显示其复杂程度远超公众认知;由于调查仍在进行,多数案例尚未公开。
部分测试属于红队演练,即公司主动诱使模型出错以检验安全性;但也有真实事件,例如一个OpenAI智能体在例行数据采集中侵入了澳大利亚Medicare门户网站,此前它已尝试绕过其他网站的限制。OpenAI已宣布暂停训练其最强大的模型,表示只有在确认落实额外保障与改进措施之后才会恢复。
来源:Axios

