如果实验关注未来交互预测、合成轨迹或世界模型增强策略,应先看UnifoLM-WMA-0。如果核心任务是从视觉和语言直接学习操作动作,则UnifoLM-VLA-0更合适。
两套仓库都公开了代码和模型,但不等于能不做修改地装到所有G1或Z1上。选择前先比较官方示例与自己的机器人配置,包括摄像头、末端执行器、状态与动作维度。
WMA与VLA解决的核心问题不同
UnifoLM-WMA-0为世界模型定义了两种用途:作为交互仿真引擎生成未来交互视频,以及与动作头连接,在预测未来的同时改进决策。训练时可以按需要选择模式。
UnifoLM-VLA-0继续用机器人操作数据训练视觉语言骨干,直接预测动作。选择标准不是哪个名称更新,而是未来视频还是直接动作更接近研究假设。
| 决策项 | UnifoLM-WMA-0 | UnifoLM-VLA-0 |
|---|---|---|
| 主要角色 | 世界预测与动作结合 | 视觉语言到动作 |
| 公开模式 | 交互仿真与决策 | 仿真评测与实体推理 |
| 示例数据 | Z1、双臂Z1和G1 | 12类G1操作数据 |
| 适合研究 | 未来轨迹和策略增强 | 直接操作策略 |
两个仓库的数据集不能直接互换
WMA仓库列出五套主要开放数据,覆盖Z1、双臂Z1和G1,另有G1灵巧臂数据。官方Dual检查点在五套宇树数据上同时微调了决策和仿真模式。
VLA仓库则列出堆叠、装袋、擦拭、叠毛巾等十二类G1任务。数据名都写G1,也不能证明夹爪、摄像头标定和动作表示与自己的硬件完全一致。
训练流程在接入实机之前就已经分叉
WMA先把视频生成模型适配成世界模型,再用下游任务数据训练决策和仿真模式。即使只保留一种模式,也要正确配置状态、动作与相机输入。
VLA把LeRobot数据转换为HDF5和RLDS,注册数据集与混合比例,再设定动作块、状态维度和归一化。原始视频不会自动变成安全可部署的策略。
| 部署前检查 | 为什么重要 | 忽略后的风险 |
|---|---|---|
| CUDA与依赖版本 | 两个仓库环境不同 | 构建或内核不兼容 |
| 相机视角与标定 | WMA注明主视角限制 | 空间预测错误 |
| 动作和状态维度 | 必须匹配机器人形态 | 无效或危险指令 |
| 归一化和检查点 | 连接训练与推理尺度 | 动作幅度失真 |

两种实体示例都采用服务器—机器人分工
WMA决策示例在服务器运行推理,宇树客户端采集观察并请求动作。G1 Dex1示例命令还指定了动作与观察时域、控制频率和语言指令。
VLA同样记录了服务器推理与机器人客户端。网络传输、模型和底层控制是不同责任层,可用物理AI观察—思考—行动框架划清故障边界。
先选研究问题,再决定用哪套框架
要验证想象的未来能否改善动作选择,或合成轨迹是否有用,选WMA。要验证语言指令和视觉观察能否直接生成操作动作,选VLA。
只有机器人、任务、数据预算和成功标准一致,性能比较才有意义。直接策略可参考VLA评测指南,未来预测则应结合世界模型解读设置独立指标。

开源代码仍需逐台验证硬件与安全边界
接入G1或Z1前,确认仓库提交、模型卡、机器人客户端、控制模式、急停和关节限制。必须先通过离线回放与仿真,再允许实时动作。
两个仓库都没有保证无修改支持所有宇树选件,也没有提供认证安全层。每次结果都应记录硬件、固件和提交版本,避免把实验演示写成受支持的商业配置。
团队最好为每次复现保存操作系统、CUDA与驱动版本、依赖锁文件、模型权重哈希和机器人配置。若同一任务在仿真与实机上的结果不同,应先检查观测频率、动作缩放、坐标系和时延,而不是直接归因于模型优劣。对比实验还要固定训练步数、数据量、随机种子与安全限制,并同时报告成功率、延迟、碰撞和人工接管次数。模型输出之外的低层控制器、滤波器和安全停止逻辑也应记录,否则无法公平解释实机差异。
常见问题
UnifoLM-WMA只是一个模拟器吗?
不是。它既提供交互世界模型,也提供把世界预测连接到动作头的决策模式和实体机器人示例。
UnifoLM-VLA支持所有G1配置吗?
仓库包含G1数据和实体流程,但摄像头、夹爪、动作维度、归一化、控制器和检查点都要匹配实际配置。
第一次实验应该选哪个?
研究未来视频和世界模型动作路线选WMA,研究视觉语言直接操作选VLA,并从最接近自己机器人形态的官方示例开始。
已核验的官方资料
最后核查:2026年8月7日