2026 年最适合做 RL Locomotion 的四款四足机器人对比
想做强化学习 locomotion 研究,四足机器人选哪台?本文横评 Unitree A1、Unitree Go2、ANYmal C、Spot 四款主流四足机器人的 DOF、重量、速度、负载、价格与仿真生态,给出 RL 训练场景的选型建议。
在所有机器人形态里,四足机器狗几乎是强化学习 locomotion 研究的"标配战场"。原因有三:
- 接触丰富:四条腿交替触地、离地,步态本质是一个高维、非连续、含碰撞的决策过程,正好是 RL 擅长的连续控制问题。
- Sim-to-real 闭环可行:相比双足,四足稳定性更高;相比轮式,动力学更复杂——是验证 sim-to-real 的甜点难度。
- 生态成熟:MuJoCo、Isaac Gym、legged_gym 等主流 RL 训练框架都把四足作为一等示例,论文复现成本低。
但真正要"上手机器狗仿真 + 实体验证"时,多数人卡在第一步:市面上四足这么多,到底买哪台做 RL locomotion? 本文横评四款最常出现在顶会论文里的四足机器人——Unitree A1、Unitree Go2、ANYmal C、Boston Dynamics Spot,从参数、价格到仿真生态一次说清,给出不同研究阶段的选型建议。
四款四足机器人速览
Unitree A1
Unitree A1 是过去几年里出现在 RL locomotion 论文里频率最高的平台之一。12 自由度、约 12 kg、性价比极高,是 legged_gym、Isaac Gym 教程默认示例机器人。虽然官方已逐步被 Go2 取代,但作为"算法基准平台",它的论文复现量和社区资料仍然最丰富。
Unitree Go2
Go2 是 Unitree 当前主力消费/教育级四足,12 DOF、约 15 kg、最高速度冲到 5.0 m/s,机载 4D LiDAR + AI 算力,是这个价位里少有的"既能跑 RL 训练又能做感知"的全能选手。性价比目前在售四足里几乎无对手。
ANYmal C
ANYmal C 出自 ETH Spin-off ANYbotics,定位工业巡检。约 50 kg、IP67 防护、模块化关节设计。它是 ETH RSL 实验室的"亲儿子"——大量 learning-based locomotion 前沿工作(teacher-student distillation、terrain adaptation、robustness benchmark)都以它为载体。sim-to-real 鲁棒性的标杆。
Boston Dynamics Spot
Spot 不需要多介绍,工业巡检的事实标准。约 32 kg、负载 14 kg、自主导航成熟。SDK 开放(PySpot),但学术 RL 生态相对封闭——大多数 Spot 用户做的是部署而非训练,把它当 RL 训练平台的论文远少于前三款。
关键参数对比表
| 机器人 | DOF | 重量 | 最高速度 | 负载 | 续航 | 价格区间 | 定位 |
|---|---|---|---|---|---|---|---|
| Unitree A1 | 12 | ~12 kg | 1.0 m/s | 1.5 kg | 1–2 h | 已停产 / 二手 ~$2k | 教育/科研,RL locomotion 经典平台 |
| Unitree Go2 | 12 | ~15 kg | 5.0 m/s | 3–5 kg | 1–4 h | ~$1600 起 | 教育/科研,机载 4D LiDAR + AI |
| ANYmal C | 12 | ~50 kg | 1.0 m/s | — | 90 min | ~$100k+ | 工业巡检,IP67 防护 |
| Boston Dynamics Spot | 12 | ~32 kg | 1.6 m/s | 14 kg | — | ~$75k+ | 工业巡检,自主导航 |
几条快速读表结论:
- 自由度(DOF)四款都是 12:每条腿 hip-yaw + hip-pitch + knee,3 关节 × 4 腿,是四足 RL locomotion 的事实标准配置。
- 速度差异巨大:Go2 凭借新关节模组把最高速度拉到 5 m/s,A1/ANYmal C 都只有 1 m/s 量级——做高动态 locomotion(弹跳、奔跑)Go2 占优。
- 价格差两个数量级:消费级 Go2 ~$1600,工业级 ANYmal C/Spot 在 $75k+,决定了它能落到谁手里。
- 负载与防护:要做带载巡检或户外恶劣环境,只能上 ANYmal C(IP67)或 Spot。
仿真与 RL 生态对比
参数只是表面,真正决定 RL locomotion 训练效率的是仿真生态。下面拆开看。
Unitree A1 / Go2:开源 RL 生态最活跃
- MuJoCo 官方支持:A1 和 Go2 的 MJCF 模型都在 mujoco_menagerie 里由官方维护,开箱即可在 MuJoCo / MJX 上跑。
- 训练框架:NVIDIA
legged_gym/legged_lab、ETHrsl_rl、社区omniverse-legged都原生支持 A1/Go2,PPO 训练脚本几乎 clone 即跑。 - Isaac Gym / Gymnasium:GPU 大规模并行采样对 A1/Go2 有现成示例,几小时训出 stable walking 不难。
- 论文复现量:从 RMA、DreamWaQ、Walk-these-ways 到各类 sim-to-real 工作大量基于 A1,社区教程最厚。
ANYmal C:ETH 血统的鲁棒性标杆
- RSL RL framework:ETH RSL(Robotic Systems Lab)维护的训练栈,teacher-student、privileged learning、地形自适应的原始实现都在这里。
- 论文最多:learning-based locomotion 顶会论文里,ANYmal 出镜率长期第一。
- 仿真模型公开:官方 URDF/MJCF 可获取,但因为关节扭矩大、惯量大,sim-to-real 难度高于消费级机型。
Spot:SDK 开放但学术 RL 生态相对封闭
- PySpot SDK:Boston Dynamics 提供完整 Python SDK,控制和感知接入成熟。
- RL 训练门槛高:官方不鼓励外部重新训练底层 locomotion policy,仿真模型公开度不如 Unitree/ANYmal。Spot 用户更多在做"上层应用"而非"底层步态学习"。
RL Locomotion 选型建议
不同预算和研究阶段,最优解不同。给出一份决策指南:
- 预算有限 / 入门科研 → Unitree Go2。性价比最高,速度最快,仿真生态活跃,机载算力够跑 inference,sim-to-real 上手友好。
- 经典算法复现 / 教学 → Unitree A1。legged_gym 原生示例就是 A1,论文基准代码几乎全在 A1 上验证,复现成本最低。
- sim-to-real 前沿研究 / 工业级 → ANYmal C。ETH 血统,鲁棒性、地形适应、外部扰动恢复的标杆平台,顶会论文友好。
- 工业部署 / 自主巡检 → Boston Dynamics Spot。生态成熟,但 RL 底层训练门槛高,更适合做应用层而非算法层研究。
- 纯仿真研究(无实体) → 任选机型 + MuJoCo / Isaac。推荐 Go2 或 A1 的 MJCF,模型质量和复现资料都最好。
一句话:没有"最好"的四足,只有"最匹配你研究阶段"的四足。
上手 RL Locomotion 的第一步
如果读完上面你决定从 Go2 或 A1 起步,推荐的成长路径是:
- 先在仿真里把步态跑通:MuJoCo + legged_gym,PPO 训练一个 stable walking policy。
- 再做 sim-to-real:把仿真训好的 policy 部署到实体机上,观察并修 domain gap(电机延迟、摩擦、传感器噪声)。
- 逐步加难度:地形适应、外部扰动恢复、跳跃/奔跑、感知融合。
第一步要拿到机器人模型,最快的方式是从 mujoco_menagerie 直接 clone:
# 获取官方维护的 MJCF 模型(A1 / Go2 都在里面)
git clone https://github.com/google-deepmind/mujoco_menagerie
# 进入对应的机器人目录
cd mujoco_menagerie/unitree_a1 # 或 unitree_go2
ls *.xml # 拿到 MJCF 即可在 MuJoCo / MJX 中加载站内每个机器人详情页也整理好了对应的模型获取命令——比如在 /robots/unitree-go2 页面可以直接复制模型下载与启动命令,省去来回翻文档的时间。
小结
四足机器人选型的本质,是 "预算 × 研究阶段 × sim-to-real 需求" 三者的权衡:
- 预算决定你能不能上工业级机型;
- 研究阶段决定你更需要"算法基准平台"还是"前沿验证平台";
- sim-to-real 需求决定你是纯仿真即可,还是必须有实体机闭环。
对绝大多数读到这里的朋友,Go2(入门)/ A1(复现)/ ANYmal C(前沿) 这条递进路径会是性价比最高的选择。机器狗仿真和强化学习 locomotion 的红利期还在,越早把 sim-to-real 这条路走通,越能在接下来的具身智能浪潮里占住身位。