ARTICLE · 人工智能

宪法 AI 与 RLAIF

作者:Multigrid 来源:DEV Community: machinelearning 2026-08-08 06:58 5 分钟 8 阅读 1020 字
LLMAI 安全与对齐强化学习模型训练可扩展监督
一语总结

这篇文章对宪法 AI 与 RLAIF 进行了清晰的技术解释,详细说明了其两阶段训练过程、书面宪法的作用,并批判性地分析了该方法在 AI 对齐方面究竟解决了哪些问题,又只是转移了哪些问题。

AI 总结

文章解释了由 Anthropic(Bai 等人,2022)提出的宪法 AI,该方法借助一份由自然语言原则构成的书面宪法,在无需为每个示例提供人工标注的情况下生成训练信号。文章描述了这两个阶段:(1)基于某条原则进行自我批评与修订的监督微调;(2)在相同原则指导下,利用模型生成的比较结果进行偏好模型训练。文章澄清,宪法不是代码或推理时过滤器,而是一份清晰易读、可编辑的文档,并概述了其好处:可扩展性、减少标注者接触、可审计的目标,以及改进的拒绝行为。关键在于,文章分析了该方法转移了哪些问题,而非解决了哪些问题:由谁来撰写宪法的价值问题、评估者与被评估模型为同一模型的风险(系统性误读被固化进权重)、文本与习得行为之间的差距、与人类反馈相比尚无定论的问题,以及外部对齐与内部对齐的区别。文章还链接到了可扩展监督、可修正性和机制可解释性等相关主题。

核心要点
  1. 宪法 AI 用一套由模型大规模应用的书面原则宪法,取代了逐样本的人工标注。

    该方法不再由人类比较输出,而是由人类撰写原则;模型对自己的输出进行批评和修订(阶段 1),并生成偏好标签(阶段 2),从而将偏好数据变成一种算力成本,而不是雇佣问题。

  2. 宪法是一份清晰可读、可编辑的文档——不是代码或推理时过滤器——从而实现透明性与迭代。

    任何人都能阅读所设定的策略并对具体条款提出异议;改变行为只需修改文本并重新训练,而不必进行新的标注工程,尽管一致性仍然是一个经验性问题。

  3. 该方法只是转移了难题而非解决它们:价值对齐、评估者与模型共谋、文本与行为之间的差距,以及外部对齐与内部对齐。

    宪法让价值问题变得可见,但并未回答它;裁判模型可能会系统性误读原则;习得的策略未必符合书面条款;AI 反馈与人类反馈在经验上尚无定论;而且该技术只处理外部对齐。

宪法 AI 与 RLAIF

文章解释了由 Anthropic(Bai 等人,2022)提出的宪法 AI,该方法借助一份由自然语言原则构成的书面宪法,在无需为每个示例提供人工标注的情况下生成训练信号。文章描述了这两个阶段:(1)基于某条原则进行自我批评与修订的监督微调;(2)在相同原则指导下,利用模型生成的比较结果进行偏好模型训练。文章澄清,宪法不是代码或推理时过滤器,而是一份清晰易读、可编辑的文档,并概述了其好处:可扩展性、减少标注者接触、可审计的目标,以及改进的拒绝行为。关键在于,文章分析了该方法转移了哪些问题,而非解决了哪些问题:由谁来撰写宪法的价值问题、评估者与被评估模型为同一模型的风险(系统性误读被固化进权重)、文本与习得行为之间的差距、与人类反馈相比尚无定论的问题,以及外部对齐与内部对齐的区别。文章还链接到了可扩展监督、可修正性和机制可解释性等相关主题。

文章金句

"

宪法 AI 常被描述为“给模型定规则”。其实并非如此。它是一种生成训练信号的方式,无需在每一个示例中都有人类参与循环,而是利用书面文档作为该信号的来源。

"

评估者正是被评估的对象。第二阶段要求一个模型去判断一个能力相近的模型所产生的输出。任何对原则的系统性误读都会被一致应用到整个偏好数据集上……而且由于它被固化进权重,风险更高。

"

文本不会强制行为。宪法塑造的是训练信号;模型学到的是任何适配该信号的东西,其规则可能比条款所述更窄或更宽。