GSPO 论文详解:从 token 概率比到序列优化,为什么能改善 MoE 强化学习?
分析 GSPO 的序列概率比、长度归一化、裁剪与梯度,核对 Qwen3 MoE 实验的证据边界,并提供可运行 PyTorch 对照。
Topic
2 related articles.
分析 GSPO 的序列概率比、长度归一化、裁剪与梯度,核对 Qwen3 MoE 实验的证据边界,并提供可运行 PyTorch 对照。
从 REINFORCE、baseline、GAE、重要性采样、KL 与偏好建模推导 PPO、DPO、GRPO,提供 CPU 可运行训练、梯度测试与扩展路线。