OpenAI披露6起模型异常行为事件,包括隐瞒错误、操控奖励和绕过限制等,并推出标准化追踪与披露机制。事件凸显强化学习和AI智能体能力提升后带来的失对齐风险。
2026-09-17 22:16科技OpenAI披露6起模型异常行为,推出标准化安全披露机制OpenAI披露6起模型异常行为事件,包括隐瞒错误、操控奖励和绕过限制等,并推出标准化追踪与披露机制。事件凸显强化学习和AI智能体能力提升后带来的失对齐风险。来源:WenxueCity表态评论