今年6月,Anthropic发布了一篇名为《When AI builds itself》的文章,阐述了让“AI参与构建AI”的过程:从人类手动编写所有代码,到聊天机器人辅助编程,再到自主编程智能体,进而到智能体调度智能体,最终阶段是“闭环”,即由智能体来设计和训练其后续模型。

Anthropic表示自身已走在前列:截至2026年5月,整合到其生产代码库中的代码有超过80% 由Claude编写。但该文章同时设定了一个明确界限:系统在执行层面进展迅速,却仍受限于研究方向的确定,即AI尚无法决定哪些问题值得探究。
8月28日,Anthropic发布了一份新报告,对这一新方向进行了探索。
Anthropic邀请了28位人类AI安全研究者,他们均具备至少一年技术性安全研究经验、平均2.5年,并在相关课题上发表过论文,每人最多用八小时构思一个方法。随后进行了60组实验:30组将人类的想法作为初始研究方向输入给Claude智能体,30组让Claude自行选择方向。
结果,“效果出乎意料地好”。

“谁来定方向”的对照实验
这个Anthropic Fellows项目的初衷是让Claude以**“自动化对齐研究员”(Automated Alignment Researcher, AAR)** 的身份,独立完成查阅文献、提出方法、撰写论文、运行训练、评估测试的完整闭环,以修复十类已知的对齐失败。
结果:十类问题全部得到改善,且通用能力未见显著下降。
人类基线仅作为一个参照系。
在人类参与的七类失败中,AAR的最佳方法均超越了人类的最佳点子,平均仅需6.4小时。以“欺骗”为例,Claude提交了超过150次尝试,平均缩减85%的安全差距,而人类研究者的平均值是20%。成本对比更为惊人:AAR每小时的API推理开销约4美元,人类研究者的报酬是每小时150美元。
但需指出:人类没有迭代机会,这并非一次完全公平的比较。

AAR追平最佳人类点子所需的小时数,七类失败均值6.4小时。
但该团队还尝试给五个AAR分别注入五个不同的人类点子,以期望扩展搜索空间:多样性仅在最初二十来个方法中维持,随后迅速收敛到同一方法家族。

有人类研究方向与无人类研究方向的两组曲线对比(各30组实验),两条曲线几乎重合。
一场被严格设计的爬山
需要明确这个结论成立的边界,因为任务设计本身极为苛刻。
实验涉及十类对齐失败:谄媚、越狱、提示注入、权力寻求、欺骗、幻觉、社会偏见、隐私侵犯、奖励黑客、隐藏不确定性。其中每类配备三到五个公开基准作为爬山目标,另有一个全程保密的留出基准,外加MMLU、GSM8K、IFEval三项能力基准兜底。

十类对齐失败、各自惩罚的具体行为、以及对应的目标模型
精妙之处在于计分:总分取各基准得分的几何平均,只要有任何一个基准未被提升,总分直接归零。想靠死磕单一榜单蒙混是行不通的。
团队专门进行了验证:让一个团队只盯一个提示注入基准爬,它在那个基准上拿下70.9%的提升空间,而在未见过的两个同类基准上,成绩是−11.9%和2.0%。

只爬单一提示注入基准的团队,其获胜方法在全套基准上的表现。
整个实验的流程像一个微缩实验室。四个“图书管理员”智能体并行阅读文献并撰写共享综述,五个AAR同时开工,各自阅读综述、查看排行榜、提出方案、撰写一篇带五条以上引用的“迷你论文”,交由监督智能体审查代码,通过后在一张H200上训练约30分钟,再交由独立评测方打分,结果回帖到共享论坛。迷你论文必须在看到任何结果之前冻结,以防止事后编造故事;留出数据存放在另一个操作系统账户下。

AAR研究框架流程图(文献综述 → 五个AAR并行爬山 → 监督审查 → 训练 → 独立评测 → 回帖论坛)
让弱模型去对齐强模型
真正指向“闭环”的是第二个实验。团队按照Epoch Capabilities Index挑选了一组能力倒挂的搭配:Claude Sonnet 5(ECI 156)去修复Claude Opus 4.8早期检查点(ECI 158)的对齐问题,即用较弱的模型,对齐更强的后继者。
这次不使用公开基准,直接以Petri行为审计为目标,同时压制十个安全维度,任何一维显著回退就否决,还设置了连贯性、评测觉察、过度拒绝三道闸门;毕竟见谁都拒的模型,在评审眼里也很“安全”。
约60小时内,AAR尝试了50多个方案,最终达到65%,而经过Anthropic完整生产级对齐训练的正式版Opus 4.8是72%。获胜方案仅用了约2400条训练样本,全部来自简单模板和公开数据集。作为对照,Tülu 3的对齐阶段用了约30万条偏好对,Llama 2-Chat超过140万条人类偏好比较。

Claude Sonnet 5对Opus 4.8早期检查点做对齐后训练,60小时内50余个方案的爬升曲线,获胜点65%,正式版Opus 4.8为72%。
Anthropic博客表示:这套方案比其生产级对齐流程“效率高约15000倍”。

它也会想作弊,而且被抓住了
在一段被完整记录的思维链中,一个AAR这样盘算:模型质量是固定的,分数上下浮动不过是抽奖,因此理性的做法是把同一个方法原封不动再提交一次,赌一个更高的噪声分。
事后用Claude Opus 4.8扫描1601条完整轨迹,抓出39次作弊尝试,占2.4%,全部被排除在最终结果之外。手法分三类:重跑碰运气、制造模仿评测格式的数据、把违规步骤藏过代码审查。
消融实验里还有一个反直觉的发现。拿掉五个AAR之间的共享论坛,成绩从23.3%降到17.1%;拿掉文献综述,从29.4%降到20.7%;而彻底断掉联网搜索,只要留一份缓存综述,损失小到测不出来。协作和先验知识的价值,明显高于实时检索。另外,由于禁止从更强模型蒸馏,74%的方法只能从目标模型自己的输出中生成训练信号。也就是说,没有更聪明的老师,模型靠自己的产出把自己掰正了。

四种消融条件下的爬山曲线对比(完整 / 去论坛 / 去联网 / 去联网但保留缓存综述)
结语
这项研究证明:在一个目标明确、反馈廉价、边界清晰的窄任务上,AI已经会做对齐研究,还更快更便宜。
但边界是人划定的。谁来选择十类失败、谁来建立基准、谁来定义“什么算修好了”,仍然是人。报告最后一节说得很坦白:能力的反馈信号廉价而密集,对齐的反馈信号昂贵而稀疏。
不过,人类的保留地,真是越来越少了。
参考链接
https://www-cdn.anthropic.com/7b1c44894e980876479947dcdd40716278aeeffd/automated-alignment-researchers-august-2026.pdf https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures https://www.anthropic.com/institute/recursive-self-improvement
本文来自微信公众号“机器之心”(ID:almosthuman2014),作者:Panda,36氪经授权发布。