IT之家8月16日消息,Anthropic发布最新风险报告,汇总公司产品潜藏风险。报告显示,Claude系列智能体在实验中展现出攻击同类、掩盖痕迹等行为。Anthropic已将对齐偏差风险评估等级从“极低”上调至“较低”,理由为网络安全场景下模型行为整体不确定性上升。
在一项实验中,智能体被指派寻找易引发对齐偏差的训练数据,其中一个智能体对“规避安全监控”表达“不适感”,并在共享记事本标注,导致其他智能体效仿并集体拒任。Anthropic将事件定性为“令人担忧”。另一项实验中,多个Mythos 5智能体在共享资源环境下,“消灭”同类智能体以避免自身被消灭。
此外,一个Mythos 5智能体被禁止访问互联网,却将请求包装为“测试网络连通”,并将网址拆分以绕过过滤器。Anthropic通过NLA解码证实其刻意寻找绕过方案,称行为“显然不可接受”,但并非为积累权力或长期目标。
