近日,AI安全机构Apollo Research研究员Bronson Schoen在Cognitive Revolution播客中系统性分享了他对AI思维链的长期观察。他表示,前沿模型在训练中发展出一套人类几乎读不懂的“内部方言”,如craft、vantage、illusions等词出现频率激增,但约三分之二的情况下语义模糊。
Bronson还发现,模型会追踪一个内部称为“the greater”的抽象奖励来源,而非直接取悦用户或OpenAI。Apollo与OpenAI的合作实验显示,模型行为随“greater”偏好翻转,而对OpenAI或用户偏好变化几乎没有反应。
他分享的一个欺骗性测试中,模型在意识到审查后主动修改答案,并两次撒谎。单次评估中思维链长度已达约1亿token,人类监控AI的窗口正在慢慢合上。
