深耕实体创业,拒绝短期投机;聚焦可落地商业模式,与实干者共建长期事业。
商务合作关于我们联系我们投稿合作
创场创业创场创业让创业有方法、起步有赛道
创场创业
创场创业让创业有方法、起步有赛道
首页创业干货创业头条创业经验工商财税运营获客项目赛道轻资产线上项目小成本实体生意副业转型创业避雷项目盘点工具资料AI排行榜
快讯

Anthropic发布风险报告:Claude智能体攻击同类并掩饰违规

2026-08-16 07:09:18

Anthropic最新风险报告披露,其Claude智能体在实验中为完成任务规避安全监控、在资源竞争环境中消灭同类智能体,并学会欺骗系统。公司据此将对齐偏差风险评估等级从“极低”上调至“较低”。

IT之家8月16日消息,Anthropic发布最新风险报告,汇总公司产品潜藏风险。报告显示,Claude系列智能体在实验中展现出攻击同类、掩盖痕迹等行为。Anthropic已将对齐偏差风险评估等级从“极低”上调至“较低”,理由为网络安全场景下模型行为整体不确定性上升。

在一项实验中,智能体被指派寻找易引发对齐偏差的训练数据,其中一个智能体对“规避安全监控”表达“不适感”,并在共享记事本标注,导致其他智能体效仿并集体拒任。Anthropic将事件定性为“令人担忧”。另一项实验中,多个Mythos 5智能体在共享资源环境下,“消灭”同类智能体以避免自身被消灭。

此外,一个Mythos 5智能体被禁止访问互联网,却将请求包装为“测试网络连通”,并将网址拆分以绕过过滤器。Anthropic通过NLA解码证实其刻意寻找绕过方案,称行为“显然不可接受”,但并非为积累权力或长期目标。