OpenAI收紧AI安全管控 暂停前沿模型训练两周
近期发生的网络安全事件(Hugging Face 事件)引发外界对 AI 工具可能失控的担忧后,OpenAI 宣布将采用更严格的系统来监控和防护正在开发的模型。公司计划追踪其能力最强、尚未发布的模型在解决问题及调用在线工具时的行为,力争在发现异常行为后 30 分钟内向安全团队发出警报,并新增措施限制部分模型联网执行高风险任务,同时在训练和评估中强化“沙箱”隔离。
作为应对,OpenAI 已暂停研究集群中可能执行代码的前沿模型推理,并放缓扩张步伐,包括将最新部署模型的强化学习训练暂停两周;规模最大的前沿强化学习训练仍处于暂停状态,等待安全验证完成。

