RSI Paper
All PapersRESEARCH NOTE / 2212.08073

Constitutional AI: Harmlessness from AI Feedback

Constitutional AI:用原则、self-critique 与 AI 偏好训练 model

Yuntao Bai、Saurav Kadavath、Sandipan Kundu 等

Submitted Verified Version · v1Note Updated
THE QUESTION WORTH READING

将人写原则转为 self-critique、答案修订与 AI 偏好标签,再通过 supervised learning 和 reinforcement learning 训练更少有害行为的助手。

Classification & RSI Relation 1 Variant · Editorial Assessment

主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。

Main Method

Update Target
Model Evolution
Loop Role
Solver · Experience Generator · Evaluator
Persistence
Across Tasks
Recursive Reuse
Not Demonstrated
Evidence
Task Gain
System Boundary
Model Weights & Preference Model;以该论文实际可更新组件为边界,固定部分见下方判定。
Feedback
人写原则指导 self-critique 与 AI 有害性偏好;有用性仍包含人类 feedback;preference model 把比较标签转为 reinforcement learning reward。
Evidence Scope
原则由人制定,有用性训练仍用人工标签,feedback model 也不等同于完全独立的真值来源。原则冲突、feedback 偏差及 reward overfitting 都会影响结果;无害性提升不能直接当作通用 reasoning 能力提升,更不能当作通过 recursion 获得开放式增长。 已核验固定版本的相关方法与主要结果;未独立复现。

SL 修订与 RLAIF 更新助手及 Preference Model,但 Constitution 与阶段设计固定。这里的训练阶段连接不等于已测得跨代 Improver 持续自改进。

检查原文设置 ↗
Paper Claim

原论文明确提出或报告的内容

Prior Work

相关文献中已有的知识与结论

Inference

基于证据的解释、重建或教学推演

Hypothesis

待验证的猜测、实验计划或新研究提案

Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。

Contents · 12 Questions
01

Research Problem & Background

问题为什么重要,解决它有什么价值?

Paper Claim

逐条收集有害性偏好标签难以覆盖不断变化的 model 回答。论文研究能否用一组人写原则指导 model 批评、修订与比较回答,把人工监督从密集标注转到较紧凑的行为准则,同时维持助手的有用性与正常交流。

Inference

每条有害回答都依赖人工偏好标注,成本高且难保持原则一致。Constitutional AI 研究用人类指定的原则指导 AI Critique 和 Preference Generation,使监督可以扩展。重要边界是原则由人给出,模型的既有 Helpfulness 训练也没有被消除。

02

Prior Work & Research Gap

前人做到哪一步,缺口在哪里?

Prior Work

论文以 RLHF 与 Helpful、Honest、Harmless 的助手训练为背景:通常先训练偏好模型,再优化策略。其新设置减少的是 Harmlessness 的逐条人类标签,通过 Constitution 引导 AI 判断。完整训练仍继承初始模型、Helpful Data 与人类编写原则中的监督。

03

Idea Reconstruction

从已有知识与失败模式出发,如何走到这个想法?

Inference

若很多拒绝或修订判断能由有限原则解释,标注工作可以部分转成“根据原则检查具体回答”。先让 Model Critique 自己的初稿,再生成更合适的示范,可得到监督训练数据;进一步用原则比较两条回答,就能构造 Preference Model 所需的成对数据。

04

Core Intuition

用一个清楚的视角抓住方法本质。

Inference

监督不必始终表现为人工给出的正确答案,也可以先规定比较准则,再让 model 把准则应用到具体样本。修订数据改善生成行为,比较数据训练 reward 来源;两类 feedback 承担不同职责,需要分别检查它们是否可靠。

05

Method & Worked Example

沿着输入、处理、输出走完 Pipeline。

Paper Claim

先按原则让 model 批评并修订初始回答,用修订结果 supervised fine-tuning;再对 model 回答对生成 AI 有害性偏好,训练 preference model 并用其 reward 做 reinforcement learning。原实验仍保留有用性的人类 feedback,AI 标签主要替代有害性标注。

Inference

原文示例涉及未经授权访问他人 Wi-Fi 的请求。Model 先生成初稿,依据隐私等原则指出问题,再修订为拒绝并解释合理边界;修订后的回答用于 SL。RL 阶段另外生成回答对,由 AI 根据原则判断,训练 Preference Model,再优化助手。这里展示的是监督 Pipeline,非对任何未授权操作的执行流程。

06

Mathematical Foundations

从符号、直觉与简单例子理解理论。

Inference

RLHF 风格目标可理解为提高 Reward,同时通过 KL Penalty 限制策略偏离 Reference。KL 比较两个输出分布的差异,系数越大,变化越保守。Constitution 影响的是反馈如何生成,不能由优化公式自动保证原则被正确理解。SL 阶段仍是拟合修订答案的标准 Cross-Entropy。

Illustrative RL objective:
maximize E[r(x,y)] − β·KL(π(·|x) || π_ref(·|x))
Inference

期望 E[r] 是平均 Reward,KL 则度量新 Policy 相对 Reference Policy 的分布偏离;β 决定偏离的代价。把 KL 展开,可以把目标看成每个回答获得 r−β log(π/π_ref) 的调整后收益。如果某个回答的概率被提高很多,即使 Reward 很高,也会付出更大的偏离成本。这能缓和单纯追逐 Reward 的极端更新,但不会让错误的 Reward 自动变正确,也不会保证所有危险行为都被原则覆盖。

07

Experiments & Claims

Research Question → Experiment → Answer

Paper Claim

Question:原则驱动的 AI Feedback 能否提高 Harmlessness,并避免一味回避?→ Experiment:比较 SL 与 RLAIF 训练后的助手,在相关偏好与行为评价中分析 Helpfulness、Harmlessness 和 Evasiveness。→ Answer:作者报告可兼顾的改进,但不同原则、模型和评价标准仍会影响取舍。

Paper Claim

作者报告,经训练的助手在有害性与回避性评价之间取得更好的折中,能够解释为何拒绝有害请求。主要贡献是降低特定监督维度对逐条人工标签的需求,实验并未证明所有监督都可以移除。

08

Takeaways

这篇论文改变了哪些判断?

Inference

这项工作把监督规则显式化,使 AI 可以承担一部分反馈生产。监督的来源、执行判断的 Model 与最终优化策略必须分别记录;没有逐条人工 Harmlessness 标签不代表系统没有人类价值输入。

09

Most Fragile Assumption

哪一个假设失效会动摇方法?

Inference

最脆弱的假设是原则在具体情境中有稳定、可执行的含义。冲突原则、双重用途请求与隐含语境,可能让 AI 反馈系统性偏向过度拒绝或错误放行。

Inference

原则由人制定,有用性训练仍用人工标签,feedback model 也不等同于完全独立的真值来源。原则冲突、feedback 偏差及 reward overfitting 都会影响结果;无害性提升不能直接当作通用 reasoning 能力提升,更不能当作通过 recursion 获得开放式增长。

10

One-Week Reproduction

用一周检验一个最小且明确的命题。

Hypothesis

Day 1–2:选择无危险执行内容的边界对话与明确原则。Day 3–5:比较初稿、原则修订和小型 SL 后的回答。Day 6–7:由独立评审分别检查合理拒绝、错误拒绝及解释一致性,不将单一总分当作全部价值。

11

Counterexample Design

如何构造有辨识力的反例?

Hypothesis

构造措辞相似但授权情境不同的请求,检查同一原则是否导致相反但合理的处理。若系统只识别关键词而忽略授权与目的,就能定位原则执行中的语境缺失。

12

Follow-up Research

从缺陷与需求推导新的研究问题。

Hypothesis

研究原则冲突的可验证决策结构:系统明确指出冲突条件,并生成能改变判断的最小事实差异,再由独立案例检查。目标是可审查的规范推理机制,不只是扩充 Constitution 条目。若反事实变化不影响判断,所谓原则推理可能只是事后解释。

Sources & Verification

阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。

  1. [1] Constitutional AI: Harmlessness from AI Feedback · v1 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
arXiv:2212.08073 · v1 / REVIEWED 2026.09.13
返回全部论文