对齐
1 篇文章
- Stanford CS336 第十五讲精读:Alignment——人类怎么把自己的偏好装进模型,从 SFT 到 RLHF斯坦福 CS336(Language Modeling from Scratch, Spring 2025)第十五讲完整讲义,主讲 Tatsunori Hashimoto。这一讲回答一个问题:GPT-3 已经很强了,但那支从 GPT-3 指向 ChatGPT 的箭到底是怎么射出去的?前半程拆三种完全不同的 SFT 数据(FLAN 的 NLP 任务聚合、OpenAssistant 的人类众包、Alpaca 的模型生成),讲为什么『完全正确且非常详细』的数据反而会教模型编造引用、安全微调如何在拒绝与过度拒绝之间走钢丝、mid-training 如何把指令数据塞回预训练;后半程进入 RLHF:成对偏好数据怎么收、标注员是谁为什么重要、生成-验证差距,最后把 InstructGPT 的目标函数、Bradley-Terry 奖励模型、PPO 的三次渐近尝试与 DPO 的完整推导一步步走完。