强化学习
2 篇文章
- Stanford CS336 第十六讲精读:Alignment——从 PPO 到 GRPO,再到 R1 / Kimi / Qwen3 的可验证奖励 RL斯坦福 CS336(Language Modeling from Scratch, Spring 2025)第十六讲完整讲义,主讲 Tatsunori Hashimoto。这一讲先把 RLHF 收尾(DPO 的梯度形状、SimPO 与长度归一化、过优化与校准度崩塌),然后正式转向 RL from verifiable rewards:从最朴素的策略梯度推到 PPO、再推到删掉 value model 与 GAE 的 GRPO;接着逐条拆解 GRPO 的两个理论瑕疵(除以标准差、按长度归一化)以及 Dr. GRPO 的修正;最后用三个案例——DeepSeek-R1、Kimi k1.5、Qwen3——对比同一套思路下不同的配方:奖励怎么设、数据怎么筛、思维链长度怎么控、thinking 模式怎么融合。
- Stanford CS336 第十七讲精读:Alignment——把策略梯度和 GRPO 的机制拆到底斯坦福 CS336(Language Modeling from Scratch, Spring 2025)第十七讲完整讲义,主讲 Percy Liang,也是全课最后一讲。这一讲不引入新内容,而是把第十六讲 RL from verifiable rewards 的算法机制拆开重讲:从状态/动作/奖励与结果奖励的设定出发,推朴素策略梯度为什么是「被奖励加权的 SFT」、为什么稀疏奖励会让梯度消失;用两个状态的玩具例子讲清方差问题与基线(baseline)的等价变换,再接到优势函数;然后把 GRPO 的代码从头走一遍——排序任务与部分分奖励、compute_deltas 的三种选择、冻结参数与 no_grad、裁剪的重要性比率、低方差 KL 估计,最后用一次真实的小实验说明「损失曲线为什么会骗人」。