Anthropic于当地时间8月28日发布最新论文《自动化研究员能够可靠缓解对齐失效》,展示利用AI系统训练其他AI模型的具体成果。研究团队针对10种失调行为设置测试,自动化系统最终让全部10项指标均有改善,同时未牺牲模型的整体能力。
这套系统由Anthropic研究员计划成员陈岳翰领导开发。自动化系统会先查阅已有文献,提出训练方法,再按方案训练模型30分钟,并通过多轮尝试逐步提高测试成绩,有效方案保留,无效方案淘汰。
论文对比显示,最优秀的自动化对齐研究员方法平均只需6小时即可超过经验丰富的人类研究人员方案,且每小时API推理成本约4美元,而人类研究人员费用为每小时150美元。不过该方法仍受限于基准测试的准确性和研究文献的持续维护。
