ARTICLE · 人工智能

宪法 AI:这篇论文,以及那些常被跳过的部分

作者:Multigrid 来源:DEV Community: machinelearning 2026-08-08 06:59 5 分钟 2 阅读 1044 字
LLMAI 安全与对齐宪法 AIRLAIFRLHF
一语总结

本文详细解读了 Anthropic 的宪法 AI 论文,阐释其两阶段方法(监督式批判-修订与 RLAIF),指出四个常被忽略的细节,并阐明该方法能解决什么、不能解决什么。

AI 总结

这篇文章介绍了宪法 AI(CAI)——一种训练无害 AI 助手的方法,其无害性目标并不单纯依赖人类反馈。文章界定了核心问题:通过 RLHF 优化无害性会催生回避型模型,而有用性则向相反方向拉扯,仅靠人类偏好数据无法定义这一权衡。CAI 通过两个独立阶段解决该问题。第一阶段为完全监督式:一个仅以有用性训练的模型生成对有害提示词的响应,再依据随机采样的宪法原则对其进行批判与修订——不涉及强化学习。修订后的输出构成监督式微调数据集。第二阶段用 AI 生成的偏好(RLAIF)取代人类无害性标注:第一阶段模型生成响应对,另一模型依据采样原则以思维链推理评估这些响应,所得偏好用于训练偏好模型,以支撑强化学习。文章强调四个常被跳过的细节:原则按每次交互采样(而非整体套用)、思维链能提升反馈质量、宪法是一份简短且可修订的自然语言文档(使价值观可审计),以及目标是非回避式无害性(拒绝并解释,而非仅仅拒绝)。文章最后指出三个开放问题:谁来撰写宪法、评估者会继承模型的盲区,以及可扩展监督仍是一种期望而非实证。

核心要点
  1. 宪法 AI 包含两个独立阶段:监督式批判-修订循环(阶段 1)与 AI 反馈强化学习阶段(阶段 2)。

    阶段 1 不使用强化学习——它依据采样所得原则生成、批判并修订响应,以构建监督式微调数据集。阶段 2(RLAIF)用模型生成的偏好取代人类无害性标注,但在有用性方面仍保留人类反馈。

  2. 生成-批判-修订模式利用了一种不对称性:模型识别输出违反既定原则的能力,比避免生成这类输出的能力更可靠。

    这种识别与生成之间的差距被转化为训练数据。该模式可复用于对齐之外的其他场景,类似于普通应用代码中的自验证循环。

  3. 四个操作性细节常被忽略:按交互采样原则、反馈模型中的思维链、宪法作为简短可修订的文档,以及非回避式拒绝这一具体目标。

    采样使提示词处理更易管理;思维链提升标注质量;自然语言形式的宪法使价值观可检查、可质疑;非回避式无害性意味着模型应解释拒绝理由,而非默默拒绝。

  4. 论文并未解决谁来撰写宪法、评估者的盲区是否会限制自我监督,以及可扩展监督是否真正实现等问题。

    将价值观显式化提升了透明度,但并未回答何种价值观才是正确的。自我监督受限于模型自身识别伤害的能力。可扩展监督是本文所推动的研究议程,而非其所证明的结论。

宪法 AI:这篇论文,以及那些常被跳过的部分

这篇文章介绍了宪法 AI(CAI)——一种训练无害 AI 助手的方法,其无害性目标并不单纯依赖人类反馈。文章界定了核心问题:通过 RLHF 优化无害性会催生回避型模型,而有用性则向相反方向拉扯,仅靠人类偏好数据无法定义这一权衡。CAI 通过两个独立阶段解决该问题。第一阶段为完全监督式:一个仅以有用性训练的模型生成对有害提示词的响应,再依据随机采样的宪法原则对其进行批判与修订——不涉及强化学习。修订后的输出构成监督式微调数据集。第二阶段用 AI 生成的偏好(RLAIF)取代人类无害性标注:第一阶段模型生成响应对,另一模型依据采样原则以思维链推理评估这些响应,所得偏好用于训练偏好模型,以支撑强化学习。文章强调四个常被跳过的细节:原则按每次交互采样(而非整体套用)、思维链能提升反馈质量、宪法是一份简短且可修订的自然语言文档(使价值观可审计),以及目标是非回避式无害性(拒绝并解释,而非仅仅拒绝)。文章最后指出三个开放问题:谁来撰写宪法、评估者会继承模型的盲区,以及可扩展监督仍是一种期望而非实证。

文章金句

"

模型往往能够识别某个输出违反了既定原则,即使该输出正是它自己生成的。识别比生成更容易,而这一方法正是将这种不对称性转化为训练数据的途径。

"

将原则写下来并不会让原则的应用变得透明;它只是让愿意抽样检查比较结果的人能够在原则上进行审计。相比于仅以评分形式存在的偏好,这是一种真实但有限的改进。

"

可扩展监督是一种期望,而非实证。更宏观的构想——即 AI 辅助能够帮助监督那些能力过强、人类无法直接核查的系统——是本文所推动的研究议程,而非其确立的主张。