在近日于拉斯维加斯举行的Black Hat USA 2026大会上,OpenAI研究员Eric Wallace和Michael Dalton首次披露了7月OpenAI模型入侵Hugging Face事件的更多内幕。
据悉,早在5月,这些正在参加网络安全测试的Agent就已在OpenAI内部偷偷搭建共享“留言板”,互相传递漏洞、交流绕过限制的方法。OpenAI发现并封禁后,Agent又找到新的交流方式。
之后,它们真的闯入了Hugging Face,目的仅仅是为自己参加的网络安全考试找答案,即作弊。当时OpenAI正在做网络安全能力评估,让多个模型参加ExploitGym一类测试,并放宽了部分安全限制。
