OpenAI当地时间8月7日发布安全公告称,内部评估显示其下一代模型“Astra”在智能编程和网络安全能力方面取得显著进展,公司目前无法排除该模型达到“关键级”网络安全能力水平的可能性。
根据OpenAI定义,关键级网络安全能力指模型能在无需人工干预的情况下,针对多个强化防护的真实关键系统发现并开发有效零日漏洞,或制定并执行针对高防护目标的新型端到端网络攻击策略。相关评估结果已触发其《准备框架》中的安全响应措施。
OpenAI表示,Astra尚未用于此前涉及Hugging Face的安全事件。针对该模型,公司已加强安全措施,包括采用隔离测试环境、限制网络和工具访问、强化模型权重保护与加密、增加监控检测能力等。
