PPO、DPO 与 GRPO 详解:从策略梯度原子模块到可运行 Python 实验
从 REINFORCE、baseline、GAE、重要性采样、KL 与偏好建模推导 PPO、DPO、GRPO,提供 CPU 可运行训练、梯度测试与扩展路线。
写作与研究笔记
机器人、人工智能与工程实践。按问题查找文章,或沿专题路线系统阅读。
从 REINFORCE、baseline、GAE、重要性采样、KL 与偏好建模推导 PPO、DPO、GRPO,提供 CPU 可运行训练、梯度测试与扩展路线。
结合 RynnBrain 1.0/1.1 论文、模型配置和官方示例,解析时空定位、接触点、3D Grounding、跨本体动作建模及复现边界。
从 InternVL 3.5 官方模型集合出发,详解视觉 token、MPO/GSPO、ViCO 路由、检查点选择、显存预算与可验证推理流程。
用几何直觉和 Pinocchio 理解关节速度到末端 twist 的映射,解释参考系、奇异与阻尼最小二乘校验。
从质量—弹簧—阻尼关系推导机器人阻抗控制,连接操作空间动力学、Pinocchio、整定和分阶段安全验证。
从同步采样和激励轨迹建立动力学回归,讨论物理一致性、在线估计、独立验证与候选参数安全部署。
建立训练显存账本,解释 DDP、NCCL、ZeRO 与 FSDP 的数据所有权,并梳理混合精度、重计算和 OOM 排查。
从 Q/K/V、张量形状与掩码理解注意力和 Transformer,进一步讨论多头、位置编码、KV Cache 与实现验证。
从前向加噪与反向去噪推导 DDPM,串联 CFG、DDIM、Latent Diffusion 和 DiT,并提供二维 PyTorch 示例。
用一致的残差与 Jacobian 解释 Pink 微分 IK,区分任务权重和严格优先级,说明限位、积分与求解失败处理。
没有找到匹配文章。试试更短的关键词,或点击“清除筛选”。