Self-Instruct: Aligning Language Models with Self-Generated Instructions
Self-Instruct:用自生成 instruction 训练 instruction following 能力
由少量人工种子任务扩展 instruction、输入与答案,经筛选后,再训练原 model,是自生成监督进入 model weights 的基础方法。
Classification & RSI Relation 1 Variant · Editorial Assessment
主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。
Main Method
- Update Target
- Model Evolution
- Loop Role
- Solver
- Persistence
- Across Tasks
- Recursive Reuse
- Not Demonstrated
- Evidence
- Task Gain
- System Boundary
- Training Data & Model Weights;以该论文实际可更新组件为边界,固定部分见下方判定。
- Feedback
- 人工种子任务确定初始范围;synthetic data 经过相似度、重复与格式筛选,最终答案作为 supervised fine-tuning 目标。
- Evidence Scope
- 方法仍依赖人工种子任务及 pre-training 知识,启发式去重也不等于事实验证。正文主要展示数据池扩展后对原 model 的 fine-tuning,没有证明更新后的 model 反复接管数据生成后,能力还能跨多个训练循环持续增长。 已核验固定版本的相关方法与主要结果;未独立复现。
合成数据用于 Fine-Tuning Solver,训练后的 Weights 保留。主 Pipeline 未让这个新 Solver 反复接管数据生成,因此不标记 Recursive Reuse。
检查原文设置 ↗原论文明确提出或报告的内容
相关文献中已有的知识与结论
基于证据的解释、重建或教学推演
待验证的猜测、实验计划或新研究提案
Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。
Contents · 12 Questions
Research Problem & Background
问题为什么重要,解决它有什么价值?
instruction tuning 依赖人工编写任务与答案,成本之外还受任务多样性限制。论文研究能否从少量种子任务出发,让 pretrained model 生成足够丰富的监督,再用于提升同一 model 对新 instruction 的适应能力,并通过独立任务检验效果。
Instruction Tuning 需要覆盖不同任务的指令和示例。人工标注的规模与想象范围会限制覆盖面,而 Pretrained Model 已拥有大量语言能力。Self-Instruct 研究如何将这些潜在能力转成训练数据,改善统一的 Instruction Following 接口。
Prior Work & Research Gap
前人做到哪一步,缺口在哪里?
STaR 已使用自生成 Reasoning Trace 做训练,但仍给定问题与答案。Self-Instruct 更早介入数据构造:生成 Instruction,再生成输入输出实例,并过滤低质量或相似数据。它从人工 Seed Tasks 启动,主 Pipeline 的数据生成器并没有在每轮生成后同步 Fine-Tune。
Idea Reconstruction
从已有知识与失败模式出发,如何走到这个想法?
Model 能模仿少量任务说明,意味着可以先用示例扩展任务池。问题是只生成指令还不够,需要配套实例;分类任务的标签分布又容易不平衡,因此可以先选择输出类别再生成输入。最后剔除重复和不适合的任务,让生成预算尽量转成多样监督。
Core Intuition
用一个清楚的视角抓住方法本质。
model 已有的知识未必能直接转化为稳定的 instruction following 行为;让 model 先构造任务与示例,再把这些示例整理成训练信号,可以把分散能力转成可调用行为。关键是监督的组织与筛选,而不是把所有自生成答案都当成事实。
Method & Worked Example
沿着输入、处理、输出走完 Pipeline。
以人工种子任务建立任务池,混合抽取人工和已生成 instruction 作示例;model 依次生成新 instruction、判断任务类型,再按类型生成输入输出。通过相似度、重复与格式规则过滤数据,最后以标准 supervised learning fine-tuning 原 model。
沿用原文给出的 Instruction 格式例子:“write an essay about school safety” 可以直接作为任务,也可以拆成通用写作指令与输入 school safety。生成器扩展任务池,判断是否为分类,选择 Input-first 或 Output-first 生成实例,过滤后将 Instruction、Input、Output 拼接做监督训练。输出是合成数据集与 Fine-Tuned Model。
Mathematical Foundations
从符号、直觉与简单例子理解理论。
训练使用标准语言模型 Negative Log-Likelihood:给定 Instruction 与 Input,提高目标 Output 各 Token 的条件概率。取负对数使高概率正确 Token 的损失较小,整段求和得到序列损失。数据生成和过滤决定学什么,Loss 决定怎样拟合;普通 SFT 目标并不自动识别合成答案中的错误。
L(θ) = −Σ_(I,x,y) Σ_t log pθ(y_t | I,x,y_<t)
I 是 Instruction,x 是可选输入,y 是目标回答;下标 t 指回答中的第 t 个 Token。Model 根据 Instruction、输入和已生成的前缀预测下一个 Token。对正确目标 Token 给出的概率越低,−log p 越大;例如 p 从 0.2 增到 0.8,该项 Loss 从约 1.61 降到 0.22。将所有 Token 的项相加,再对训练样本累积,就是基本的 Supervised Fine-Tuning 目标。它会学习被保留的合成回答,所以数据筛选决定了哪些行为会被强化。
Experiments & Claims
Research Question → Experiment → Answer
Question:合成 Instruction Data 能否改善未见任务?→ Experiment:比较原始 Model、相关 Instruction-Tuned 基线及不同数据设置,在任务泛化和人工评估中测表现。→ Answer:作者报告明显提升,同时检查生成数据的多样性与质量;收益不意味着所有合成标签都可靠。
论文在 Super-NaturalInstructions 上报告,相对原始 GPT3 的分数提高 33 个百分点;新编 instruction 的人工评价同样显示改进。结果支持自生成 instruction 作为训练资源的有效性,不能由此推断每个合成答案都正确。
Takeaways
这篇论文改变了哪些判断?
Self-Instruct 的核心资产是任务覆盖与过滤后的监督数据。生成任务池的迭代和 Model Training 的迭代应分开画图,避免把所有 Bootstrapping 都称为已实现 Recursive Improver。
One-Week Reproduction
用一周检验一个最小且明确的命题。
Day 1–2:编写 20 个 Seed Tasks,保留一组完全不同的人工测试任务。Day 3–5:生成并审核数百条样本,比较未过滤与过滤数据的小型 LoRA。Day 6–7:按任务族分析收益,抽查错误标签与模板重复。
Counterexample Design
如何构造有辨识力的反例?
让 Seed 大多是短分类任务,隐藏集需要多步骤结构化输出。如果新增任务仍围绕短分类改写,数据量增长但新能力不出现,就能检验 Seed Coverage 对自生成数据的限制。
Follow-up Research
从缺陷与需求推导新的研究问题。
研究任务生成的覆盖可识别性:系统先描述自己无法区分的任务族,再通过少量外部示例识别缺失的任务结构。相对 STaR 的轨迹筛选,这问的是系统如何发现“还不知道该生成哪种问题”。需要测新任务族的可迁移能力,而非指令数量或词汇多样性。
Sources & Verification
阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。
- [1] Self-Instruct: Aligning Language Models with Self-Generated Instructions · v2 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
- [2] STaR: Bootstrapping Reasoning With Reasoning ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
