当地时间周二,OpenAI宣布推出一批新的安全政策,重点控制模型测试期间的安全事件,措施包括更细致的开发监控、训练后阶段加强模型对齐与安全性,并强化网络隔离。
OpenAI在博客中称,随着模型能力增强,内部开发测试风险也在增加。这是自7月21日披露Hugging Face事件以来,OpenAI首次对外公布的安全实践重大调整。公司表示新措施并非直接针对该事件,但即将推出的Astra模型展现的网络安全能力及行业快速发展也是原因之一。
OpenAI透露,Hugging Face事件后曾暂停强化学习训练两周,目前已重启许多低风险模型训练,但仍暂停规模最大的前沿强化学习训练计划。新监控系统将检查工具操作、推理轨迹和活动日志,目标是在发现可疑活动后30分钟内发出警报,其计算资源消耗约为被监控流程的20%。
