Light-Loco-Parkour 深度解析:从地形配对参考、多技能蒸馏到自主衔接与深度视觉控制
结合原论文与 lucidrains 实现,拆解地形配对参考增强、多专家 DAgger、阶段条件 AMP 和深度 GRU 策略,并用 CPU 实验核对奖励、PPO、蒸馏与时序接口。
Topic
6 related articles.
结合原论文与 lucidrains 实现,拆解地形配对参考增强、多专家 DAgger、阶段条件 AMP 和深度 GRU 策略,并用 CPU 实验核对奖励、PPO、蒸馏与时序接口。
分析 GSPO 的序列概率比、长度归一化、裁剪与梯度,核对 Qwen3 MoE 实验的证据边界,并提供可运行 PyTorch 对照。
从 REINFORCE、baseline、GAE、重要性采样、KL 与偏好建模推导 PPO、DPO、GRPO,提供 CPU 可运行训练、梯度测试与扩展路线。
从 InternVL 3.5 官方模型集合出发,详解视觉 token、MPO/GSPO、ViCO 路由、检查点选择、显存预算与可验证推理流程。
从 MDP、回报和价值函数理解强化学习,串联策略评估与更新,并区分随机策略、环境随机性和训练验证。
使用 Gymnasium 运行 LunarLander 随机交互与录像,讲清 reset、step、随机种子以及终止和截断的差别。