人形机器人运动控制技术全景研究报告

从仿真 RL 运动跟踪到全身 VLA loco-manipulation 的完整技术栈梳理:五层分类体系、路线 A(监督跟踪)与路线 B(无监督表征)的本质分野、35 项核心工作的九字段深度解析。

40+
覆盖代表性工作
5
技术抽象层次
35 / 28
全景图节点 / 关系边
9
每工作字段维度

读者定位:人形机器人运控工程师(已通读 SONIC,具备强化学习与机器人动力学基础) · 整合日期 2026-09-11

技术全景关系图

35 个核心工作按五层抽象着色,节点形状区分路线(圆=路线 A 监督跟踪,方=路线 B 无监督表征)。边按关系类型区分线型。点击节点查看详情,悬停高亮关联,顶部按钮按类别 / 路线筛选。

类别 全部 运控基座 数据重定向 学习范式 感知运控 全身VLA
路线 全部 路线 A 路线 B
运控基座 数据重定向 学习范式 感知运控 全身VLA 圆=路线A 方=路线B 继承/延伸 改进/演化 竞争/对照 执行层调用

五层分类体系

人形机器人运控技术按"从底层执行到高层决策"的抽象层次分为五层。阅读顺序即自底向上:先理解小脑怎么训,再看数据、范式、感知,最后看大脑 VLA 如何调用小脑。

第一层
运控基座与动作跟踪
仿真中 RL 训练的全身运动跟踪策略,输入本体感+参考动作/潜向量,输出关节目标角给 PD 控制器。物理执行底座。
7 项工作
第二层
数据生成与动作重定向
把人类动捕(SMPL/MoCap)转成机器人可执行运动学参考轨迹,并在物体/地形/本体维度系统增广。路线 A 的燃料来源。
9 项工作
第三层
学习范式
连接纯模仿跟踪与泛化/适应/组合的算法范式:tracking+AIL 混合、引导扩散、视频端到端、先理解再模仿。
5 项工作
第四层
感知运控
引入外感知(深度/高程/点云),自主选落脚点、适应非结构化地形、完成跑酷。视觉+本体输入,无语言接口。
9 项工作
第五层
全身 VLA 与 loco-manipulation
VLA 模型直接输出全身运动指令,实现边走边操作。大脑做语义理解,小脑做运动执行。技术栈顶层。
14 项工作

路线 A(监督跟踪式) vs 路线 B(无监督表征式)

维度路线 A · 监督式动作跟踪路线 B · 无监督表征学习
训练范式on-policy PPO;参考动作逐帧稠密监督(DeepMimic 一脉)off-policy URL;无任务奖励,replay buffer 大规模复用经验
数据需求大规模重定向 mocap:SONIC 611h/1 亿+帧;RGMT 极致精选 3.5h少量无标签 mocap 仅作正则;主数据来自机器人自身在线无奖励探索(UFO 约 2–3h)
表征方式显式参考帧序列(未来 10–21 帧关节角),SONIC 额外学 FSQ 动作 token 接口潜向量 z:FB 前后向映射 + 后继特征;对比时序距离嵌入;z 同时编码动作/目标/奖励
如何下指令上游给一段参考动作序列(回放片段/规划器/VR 流),策略跟随上游给一个潜向量:参考片段编码/目标姿态/奖励加权和;同空间可线性组合插值
训练成本两极分化:SONIC 21k GPU·h(128 GPU×7 天);MimicLite 92、RGMT 单卡可用普遍低:UFO 8×4090 6–12h,比 SONIC 省近两个数量级 GPU·h 与样本
跟踪精度高:关节 MPJPE 数十 mm 级;RGMT 自称 mocap 成功率 98.3%略低:全轨迹含摔倒恢复段时 URL 反超 SONIC(0.2916 vs 0.15)
泛化能力泛化到训练分布内新动作片段;靠重定向+噪声鲁棒泛化到分布外新目标姿态/新奖励函数;支持非连续目标切换、摔倒自恢复
摔倒恢复需专门设计:Any2Track 两阶段 adapter、RGMT 恢复 curricula 并入训练天然内建:潜空间覆盖躺/坐/站恢复状态,无需单独微调即可爬起
可组合性参考动作即接口直观,但要求上游先生成可执行动作;lookahead 0.90sz 空间可组合/插值/被 VLA 直接优化;同一策略零样本切换,但潜向量人不可读
工程成熟度高:PPO on-policy 稳定、工具链成熟、实机验证充分中:表征学习对超参敏感、训练不稳,但复现门槛正被快速打下
典型短板任务写死在参考分布;非连续切换生硬;摔后易死机;规模路线算力贵单帧精度不如专用跟踪器;FB 长时程根漂移;动作风格偏保守
趋势判断:两条路线正在收敛——路线 A 靠动作 token 空间往可组合性走(SONIC FSQ token 喂 VLA),路线 B 靠直接跟踪目标往精度走(TeCH E_mae 已逼近 SONIC 未终止段水平)。短期"监督跟踪器做小脑 + token 接口接大脑 VLA"最现实;中期 URL 可提示行为空间更像基座该有的形态,且训练成本正下探到单卡可用。

推荐阅读路线

已通读 SONIC,按"入门 → 进阶 → 数据层 → 感知层 → 终局"组织 16 篇,标注难度、预计时间与核心收获。

L1

第一层:运控基座与动作跟踪

本层 7 项工作,构成所有上层能力的物理执行底座。每条工作标注路线 A(监督跟踪式)或路线 B(无监督表征式)。技术谱系主线:DeepMimic → PHC/ExBody → GMT → SONIC 规模化顶点;路线 B 主线:FB → FB-CPR → BFM-Zero → UFO。
L2

第二层:数据生成与动作重定向

把人类动捕数据转换为人形机器人可执行训练数据的全部技术环节。Any2Any 已在第一层完整梳理(跨本体迁移),此处交叉引用。核心问题:重定向的天花板不是关节对齐,而是别把"人-物-环境"接触关系弄丢。
L3

第三层:学习范式

连接"纯模仿跟踪"与"泛化/适应/组合"的算法范式:tracking+AIL 混合、引导扩散合成技能、人类视频端到端、先理解再模仿。
L4

第四层:感知运控

在跟踪/运动策略基础上引入外感知(深度图/高程图/点云),自主选落脚点、适应非结构化地形、完成跑酷。核心输入是视觉+本体,无语言接口。AME-2/SOLO/PHP 原调研曾误标为全身 VLA,实际纯深度+本体输入,本层如实归入。
L5

第五层:全身 VLA 与 loco-manipulation

视觉-语言-动作模型直接输出全身运动指令,实现"边走边操作"。大脑做语义理解,小脑做运动执行。SONIC 已成为 loco-manipulation 的事实底层控制器——ω-0、OpenHLM、GR00T N1.7 均接 SONIC 作为执行层。