从仿真 RL 运动跟踪到全身 VLA loco-manipulation 的完整技术栈梳理:五层分类体系、路线 A(监督跟踪)与路线 B(无监督表征)的本质分野、35 项核心工作的九字段深度解析。
读者定位:人形机器人运控工程师(已通读 SONIC,具备强化学习与机器人动力学基础) · 整合日期 2026-09-11
35 个核心工作按五层抽象着色,节点形状区分路线(圆=路线 A 监督跟踪,方=路线 B 无监督表征)。边按关系类型区分线型。点击节点查看详情,悬停高亮关联,顶部按钮按类别 / 路线筛选。
人形机器人运控技术按"从底层执行到高层决策"的抽象层次分为五层。阅读顺序即自底向上:先理解小脑怎么训,再看数据、范式、感知,最后看大脑 VLA 如何调用小脑。
| 维度 | 路线 A · 监督式动作跟踪 | 路线 B · 无监督表征学习 |
|---|---|---|
| 训练范式 | on-policy PPO;参考动作逐帧稠密监督(DeepMimic 一脉) | off-policy URL;无任务奖励,replay buffer 大规模复用经验 |
| 数据需求 | 大规模重定向 mocap:SONIC 611h/1 亿+帧;RGMT 极致精选 3.5h | 少量无标签 mocap 仅作正则;主数据来自机器人自身在线无奖励探索(UFO 约 2–3h) |
| 表征方式 | 显式参考帧序列(未来 10–21 帧关节角),SONIC 额外学 FSQ 动作 token 接口 | 潜向量 z:FB 前后向映射 + 后继特征;对比时序距离嵌入;z 同时编码动作/目标/奖励 |
| 如何下指令 | 上游给一段参考动作序列(回放片段/规划器/VR 流),策略跟随 | 上游给一个潜向量:参考片段编码/目标姿态/奖励加权和;同空间可线性组合插值 |
| 训练成本 | 两极分化:SONIC 21k GPU·h(128 GPU×7 天);MimicLite 92、RGMT 单卡可用 | 普遍低:UFO 8×4090 6–12h,比 SONIC 省近两个数量级 GPU·h 与样本 |
| 跟踪精度 | 高:关节 MPJPE 数十 mm 级;RGMT 自称 mocap 成功率 98.3% | 略低:全轨迹含摔倒恢复段时 URL 反超 SONIC(0.2916 vs 0.15) |
| 泛化能力 | 泛化到训练分布内新动作片段;靠重定向+噪声鲁棒 | 泛化到分布外新目标姿态/新奖励函数;支持非连续目标切换、摔倒自恢复 |
| 摔倒恢复 | 需专门设计:Any2Track 两阶段 adapter、RGMT 恢复 curricula 并入训练 | 天然内建:潜空间覆盖躺/坐/站恢复状态,无需单独微调即可爬起 |
| 可组合性 | 参考动作即接口直观,但要求上游先生成可执行动作;lookahead 0.90s | z 空间可组合/插值/被 VLA 直接优化;同一策略零样本切换,但潜向量人不可读 |
| 工程成熟度 | 高:PPO on-policy 稳定、工具链成熟、实机验证充分 | 中:表征学习对超参敏感、训练不稳,但复现门槛正被快速打下 |
| 典型短板 | 任务写死在参考分布;非连续切换生硬;摔后易死机;规模路线算力贵 | 单帧精度不如专用跟踪器;FB 长时程根漂移;动作风格偏保守 |
已通读 SONIC,按"入门 → 进阶 → 数据层 → 感知层 → 终局"组织 16 篇,标注难度、预计时间与核心收获。