VLA 发展详解:从 RT-2、OpenVLA、π0 到 π0.5 与 π0.7
沿 RT-2、OpenVLA、π0 到 π0.5、π0.6 与 π0.7,解释机器人每步输入、动作编码、连续生成、数据与训练配方,以及泛化、强化学习和多模态引导的演进。
Topic
21 related articles.
沿 RT-2、OpenVLA、π0 到 π0.5、π0.6 与 π0.7,解释机器人每步输入、动作编码、连续生成、数据与训练配方,以及泛化、强化学习和多模态引导的演进。
从参数量、权重体积和显存预算出发,解释大语言模型预训练、SFT、DPO 与强化学习后训练的核心指标,并用可复算案例设计评估和消融实验。
结合 LeRobot 源码,梳理机器人数据与策略接口,推导 ACT 的动作分块、CVAE 和时间集成,并给出数据检查、训练、部署及排错流程。
从 PICO 遥操作、主从机械臂、UMI 与人类视频,到 BEHAVIOR、RoboCasa 和空间世界模型,比较数据监督、动作迁移、采集工程与截至 2026 年 9 月的研究进展。
结合原论文与 lucidrains 实现,拆解地形配对参考增强、多专家 DAgger、阶段条件 AMP 和深度 GRU 策略,并用 CPU 实验核对奖励、PPO、蒸馏与时序接口。
从官方论文与源码理解 X-VLA 的软提示、多视角编码、动作生成与两阶段适应,逐项核对 EE6D、旋转排列、数据接口和 LIBERO 部署。
结合三篇论文与 Kinetix 官方实现,解释 RTC 的时间对齐、软掩码、VJP 引导、训练时前缀条件,以及高延迟世界动作模型的实时部署。
分析 GSPO 的序列概率比、长度归一化、裁剪与梯度,核对 Qwen3 MoE 实验的证据边界,并提供可运行 PyTorch 对照。
解读 GEN-1.5 的示范上下文与少步适应,区分任务提示、参数更新和轨迹重放,并提供上下文预算与评测统计练习。
从 REINFORCE、baseline、GAE、重要性采样、KL 与偏好建模推导 PPO、DPO、GRPO,提供 CPU 可运行训练、梯度测试与扩展路线。
结合 RynnBrain 1.0/1.1 论文、模型配置和官方示例,解析时空定位、接触点、3D Grounding、跨本体动作建模及复现边界。
从 InternVL 3.5 官方模型集合出发,详解视觉 token、MPO/GSPO、ViCO 路由、检查点选择、显存预算与可验证推理流程。
建立训练显存账本,解释 DDP、NCCL、ZeRO 与 FSDP 的数据所有权,并梳理混合精度、重计算和 OOM 排查。
从 Q/K/V、张量形状与掩码理解注意力和 Transformer,进一步讨论多头、位置编码、KV Cache 与实现验证。
从前向加噪与反向去噪推导 DDPM,串联 CFG、DDIM、Latent Diffusion 和 DiT,并提供二维 PyTorch 示例。
从 MDP、回报和价值函数理解强化学习,串联策略评估与更新,并区分随机策略、环境随机性和训练验证。
排查 Isaac Lab 中 UsdContext 导入失败,核对 AppLauncher 启动顺序、环境和完整异常,避免误删安装扩展。
依据 Being-0 论文梳理分层具身智能系统与实验结果,区分论文报告、概念示意和个人工程解读。
使用 Gymnasium 运行 LunarLander 随机交互与录像,讲清 reset、step、随机种子以及终止和截断的差别。
区分标准 A* 与视线裁剪,说明目标弹出、三维线段碰撞、路径简化以及最优性成立的条件。
给出可独立编译的三维栅格 A*,统一 6/26 邻接、欧氏边权、穿角检查和失败返回,并与 Dijkstra 验证路径代价。