GSPO 论文详解:从 token 概率比到序列优化,为什么能改善 MoE 强化学习?
分析 GSPO 的序列概率比、长度归一化、裁剪与梯度,核对 Qwen3 MoE 实验的证据边界,并提供可运行 PyTorch 对照。
Topic
6 related articles.
分析 GSPO 的序列概率比、长度归一化、裁剪与梯度,核对 Qwen3 MoE 实验的证据边界,并提供可运行 PyTorch 对照。
从 REINFORCE、baseline、GAE、重要性采样、KL 与偏好建模推导 PPO、DPO、GRPO,提供 CPU 可运行训练、梯度测试与扩展路线。
建立训练显存账本,解释 DDP、NCCL、ZeRO 与 FSDP 的数据所有权,并梳理混合精度、重计算和 OOM 排查。
从 Q/K/V、张量形状与掩码理解注意力和 Transformer,进一步讨论多头、位置编码、KV Cache 与实现验证。
从前向加噪与反向去噪推导 DDPM,串联 CFG、DDIM、Latent Diffusion 和 DiT,并提供二维 PyTorch 示例。
用 pytorch_kinematics 构建独立 FK–IK–FK 检查,明确批量维度、关节顺序、重试筛选、坐标转换和可微边界。