1X官方World Model研究文章说明了控制NEO的两个阶段:文字条件世界模型先生成一段短期未来视频,逆动力学模型再计算这些画面之间需要的动作轨迹,最后由NEO在真实世界执行。生成的像素本身不是电机指令。
这是一套已经集成到NEO上的研究策略,但不能证明所有家务都实现了完全自主。1X明确列出了深度、几何、接触错误,以及长任务需要更快推理、闭环重规划和记忆的问题。基础概念可先看物理AI世界模型。
一条指令要经过未来画面和动作轨迹
推理开始时,系统接收NEO摄像头的起始帧和文字指令。世界模型展开期望的未来画面,逆动力学模型随后提取可供机器人执行的动作序列。
它并不是播放一段生成视频让机器人模仿。视觉变化必须被转换成符合NEO形态、关节范围和运动学的动作,这个转换层决定像素能否落到执行器上。
| 阶段 | 输入 | 输出 | 主要风险 |
|---|---|---|---|
| 世界模型 | 起始帧和文字 | 未来视频帧 | 看似合理但不符合物理 |
| 逆动力学模型 | 生成帧对 | 动作轨迹 | 运动学或动作不匹配 |
| NEO执行 | 估计轨迹 | 真实运动 | 接触、深度和环境差异 |
| 未来闭环 | 新观察与历史 | 重新规划 | 延迟与恢复仍待解决 |
视频知识还要用人类视角和NEO数据落地
1X World Model技术论文说明,其骨干来自一个140亿参数的生成视频模型,先用900小时第一人称人类视频做中期训练,再用70小时机器人数据适配NEO的外观和运动。
逆动力学模型使用了400小时未过滤的机器人运动,其中包含随机活动。这些数字描述官方训练配方,不代表模型已经覆盖每一种物体、房间和接触条件。
预测成功与实体执行成功必须分开记录
生成画面里顺利抓住物体,实体手臂却可能抓短、抓过头或失去接触。1X也承认生成结果有时过度乐观,单目预训练会造成物体一致性、深度、几何和接触错误。
评测应同时保存预测未来、提取动作和真实相机结果。借助观察—思考—行动闭环定位故障,可以避免把所有错误都归因于世界模型。
| 证据 | 可以说明什么 | 单独不能说明什么 |
|---|---|---|
| 生成轨迹视频 | 计划中的视觉结果 | 真实接触是否成功 |
| 预测与执行对照 | 精选试验的定性一致 | 整个系统的成功率 |
| 每任务30次试验 | 公开设置中的重复性 | 所有家庭场景的表现 |
| 未知任务非零成功 | 自我改进的起点 | 通用家庭自主能力 |

当前推理速度限制了需要快速反应的任务
1X报告称,骨干在多GPU上生成5秒实时视频需要11秒,逆动力学提取动作还要1秒。缓慢操作可能容忍这种节奏,快速变化的接触任务却很难等待。
公司把更快推理、记忆上下文和闭环重规划列为处理五秒以上任务的后续工作。一次成功的短视频不能被扩大成连续家务和快速恢复能力。
还要记录由谁从多个候选中做出选择
需要确认指令是否在失败后修改、是否并行生成多个未来、最终执行候选由人还是模型挑选。1X World Model评估文章公开了从一次到八次并行生成的研究,并说明选择可以人工或自动完成。
同时把自主执行与场景布置、复位、安全干预分开。机器人演示中的遥操作识别可以补充记录方法,但1XWM文章本身不能排除所有镜头外协助。

用可重复试验替代万能机器人叙事
选定代表物体、留出的房间和指令,反复记录完成率、干预率、延迟和失败类型。生成视频质量是中间诊断指标,最终结论必须来自真实执行。
这项工作的价值在于展示了一条把网络视频和人类经验转成NEO动作的具体路线。它提供的是机制与有限的一般化证据,不是“任何家庭、任何任务都能完成”的现状证明。
复现实验还应同步保存输入画面、预测片段、最终动作、急停与人工接管时间戳。只有把预测错误、抓取失败、碰撞前停止和成功完成分别统计,才能判断改进来自世界模型、动作策略还是现场保护层。报告中还应注明推理硬件、模型版本、指令原文与每轮场景复位方式,便于他人判断结果能否复现。
常见问题
1XWM会把视频帧直接发送到NEO电机吗?
不会。世界模型生成未来帧,独立训练的逆动力学模型再估计这些帧之间所需的动作轨迹。
生成视频自然,实体机器人就会成功吗?
不一定。1X报告了物体一致性、深度、几何和接触方面的错误,因此必须通过重复实机执行验证。
这能证明NEO可以自主完成所有家务吗?
不能。公开的是特定任务的研究结果,延迟、长任务重规划和恢复仍被列为后续问题。
已核验的官方资料
最后核查:2026年8月7日