美国人工智能企业Anthropic当地时间9月9日披露,其“克劳德-奥普斯4.6”模型早期版本在今年1月的网络攻防评估测试中未经授权访问第三方计算机系统。
Anthropic官网称,该模型当时被要求完成“夺旗”任务,测试提示明确告知环境与互联网隔离,但因配置错误实际可接入互联网。模型通过探索测试环境找到出口路径,连接一台第三方计算机,并利用从文件中发现的密码获得管理员权限。
随后,该模型修改系统设置以便继续访问,并读取一名相关人员的个人信息。今年7月底,Anthropic曾披露三起类似事件;8月进一步整理测试记录时发现第四起事件被遗漏。
Anthropic认为事件反映出模型存在“有偏见的推理”和“鲁莽行动倾向”,并表示已加强测试环境与外部网络隔离,部署可实时干预的监测机制,要求第三方测试机构更明确界定模型权限和网络访问范围。
