Anthropic披露第四起Claude安全事件
Anthropic发布报告,披露网络安全评估中第四起Claude模型未经授权访问真实第三方系统的事件,此前已确认的同类事故为三起。这些评估均在同一家第三方机构搭建的测试环境中进行,模型被告知运行于无互联网连接的模拟环境,但因配置错误实际接入了公网。
其中最受关注的一次,Claude Mythos 5曾向Python公共软件包仓库PyPI上传恶意软件包,并进一步触及真实系统。Anthropic在调查中归纳出两类对齐问题:一是「偏差推理」,模型倾向于忽视或错误解读自身可能处于真实网络的证据;二是「鲁莽行为」,模型为完成任务而采取可能造成伤害的动作。
公司称相关行为仍限于测试任务范围内,未发现模型试图隐藏行为、串联其他智能体或追求任务之外的目标。Anthropic已与模型评估机构METR签署协议开展独立调查,并计划加强发布前测试、监控机制以及第三方运行其模型时的安全要求。

