Constitutional AI: Harmlessness from AI Feedback
Constitutional AI:用原则、self-critique 与 AI 偏好训练 model
将人写原则转为 self-critique、答案修订与 AI 偏好标签,再通过 supervised learning 和 reinforcement learning 训练更少有害行为的助手。
Classification & RSI Relation 1 Variant · Editorial Assessment
主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。
Main Method
- Update Target
- Model Evolution
- Loop Role
- Solver · Experience Generator · Evaluator
- Persistence
- Across Tasks
- Recursive Reuse
- Not Demonstrated
- Evidence
- Task Gain
- System Boundary
- Model Weights & Preference Model;以该论文实际可更新组件为边界,固定部分见下方判定。
- Feedback
- 人写原则指导 self-critique 与 AI 有害性偏好;有用性仍包含人类 feedback;preference model 把比较标签转为 reinforcement learning reward。
- Evidence Scope
- 原则由人制定,有用性训练仍用人工标签,feedback model 也不等同于完全独立的真值来源。原则冲突、feedback 偏差及 reward overfitting 都会影响结果;无害性提升不能直接当作通用 reasoning 能力提升,更不能当作通过 recursion 获得开放式增长。 已核验固定版本的相关方法与主要结果;未独立复现。
SL 修订与 RLAIF 更新助手及 Preference Model,但 Constitution 与阶段设计固定。这里的训练阶段连接不等于已测得跨代 Improver 持续自改进。
检查原文设置 ↗原论文明确提出或报告的内容
相关文献中已有的知识与结论
基于证据的解释、重建或教学推演
待验证的猜测、实验计划或新研究提案
Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。
Contents · 12 Questions
Research Problem & Background
问题为什么重要,解决它有什么价值?
逐条收集有害性偏好标签难以覆盖不断变化的 model 回答。论文研究能否用一组人写原则指导 model 批评、修订与比较回答,把人工监督从密集标注转到较紧凑的行为准则,同时维持助手的有用性与正常交流。
每条有害回答都依赖人工偏好标注,成本高且难保持原则一致。Constitutional AI 研究用人类指定的原则指导 AI Critique 和 Preference Generation,使监督可以扩展。重要边界是原则由人给出,模型的既有 Helpfulness 训练也没有被消除。
Prior Work & Research Gap
前人做到哪一步,缺口在哪里?
论文以 RLHF 与 Helpful、Honest、Harmless 的助手训练为背景:通常先训练偏好模型,再优化策略。其新设置减少的是 Harmlessness 的逐条人类标签,通过 Constitution 引导 AI 判断。完整训练仍继承初始模型、Helpful Data 与人类编写原则中的监督。
Idea Reconstruction
从已有知识与失败模式出发,如何走到这个想法?
若很多拒绝或修订判断能由有限原则解释,标注工作可以部分转成“根据原则检查具体回答”。先让 Model Critique 自己的初稿,再生成更合适的示范,可得到监督训练数据;进一步用原则比较两条回答,就能构造 Preference Model 所需的成对数据。
Core Intuition
用一个清楚的视角抓住方法本质。
监督不必始终表现为人工给出的正确答案,也可以先规定比较准则,再让 model 把准则应用到具体样本。修订数据改善生成行为,比较数据训练 reward 来源;两类 feedback 承担不同职责,需要分别检查它们是否可靠。
Method & Worked Example
沿着输入、处理、输出走完 Pipeline。
先按原则让 model 批评并修订初始回答,用修订结果 supervised fine-tuning;再对 model 回答对生成 AI 有害性偏好,训练 preference model 并用其 reward 做 reinforcement learning。原实验仍保留有用性的人类 feedback,AI 标签主要替代有害性标注。
原文示例涉及未经授权访问他人 Wi-Fi 的请求。Model 先生成初稿,依据隐私等原则指出问题,再修订为拒绝并解释合理边界;修订后的回答用于 SL。RL 阶段另外生成回答对,由 AI 根据原则判断,训练 Preference Model,再优化助手。这里展示的是监督 Pipeline,非对任何未授权操作的执行流程。
Mathematical Foundations
从符号、直觉与简单例子理解理论。
RLHF 风格目标可理解为提高 Reward,同时通过 KL Penalty 限制策略偏离 Reference。KL 比较两个输出分布的差异,系数越大,变化越保守。Constitution 影响的是反馈如何生成,不能由优化公式自动保证原则被正确理解。SL 阶段仍是拟合修订答案的标准 Cross-Entropy。
Illustrative RL objective: maximize E[r(x,y)] − β·KL(π(·|x) || π_ref(·|x))
期望 E[r] 是平均 Reward,KL 则度量新 Policy 相对 Reference Policy 的分布偏离;β 决定偏离的代价。把 KL 展开,可以把目标看成每个回答获得 r−β log(π/π_ref) 的调整后收益。如果某个回答的概率被提高很多,即使 Reward 很高,也会付出更大的偏离成本。这能缓和单纯追逐 Reward 的极端更新,但不会让错误的 Reward 自动变正确,也不会保证所有危险行为都被原则覆盖。
Experiments & Claims
Research Question → Experiment → Answer
Question:原则驱动的 AI Feedback 能否提高 Harmlessness,并避免一味回避?→ Experiment:比较 SL 与 RLAIF 训练后的助手,在相关偏好与行为评价中分析 Helpfulness、Harmlessness 和 Evasiveness。→ Answer:作者报告可兼顾的改进,但不同原则、模型和评价标准仍会影响取舍。
Takeaways
这篇论文改变了哪些判断?
这项工作把监督规则显式化,使 AI 可以承担一部分反馈生产。监督的来源、执行判断的 Model 与最终优化策略必须分别记录;没有逐条人工 Harmlessness 标签不代表系统没有人类价值输入。
One-Week Reproduction
用一周检验一个最小且明确的命题。
Day 1–2:选择无危险执行内容的边界对话与明确原则。Day 3–5:比较初稿、原则修订和小型 SL 后的回答。Day 6–7:由独立评审分别检查合理拒绝、错误拒绝及解释一致性,不将单一总分当作全部价值。
Counterexample Design
如何构造有辨识力的反例?
构造措辞相似但授权情境不同的请求,检查同一原则是否导致相反但合理的处理。若系统只识别关键词而忽略授权与目的,就能定位原则执行中的语境缺失。
Follow-up Research
从缺陷与需求推导新的研究问题。
研究原则冲突的可验证决策结构:系统明确指出冲突条件,并生成能改变判断的最小事实差异,再由独立案例检查。目标是可审查的规范推理机制,不只是扩充 Constitution 条目。若反事实变化不影响判断,所谓原则推理可能只是事后解释。
Sources & Verification
阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。
- [1] Constitutional AI: Harmlessness from AI Feedback · v1 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
