后训练笔记 04:GRPO 变体,从归一化、ratio 到 group-aware reward
GRPO 之后出现了很多相关的改进算法。 这篇文章围绕四个问题整理 GRPO 变体: reward 如何变成 advantage; token loss 如何聚合与归一化; importance ratio 在什么粒度上计算,surrogate 又如何约束 policy shift; 哪些 prompt、response 和 token 真正进入梯度。 按照这个坐标系,本文精读六项代表性工作: