Physical Intelligence官方π0.7研究文章介绍的π0.7是一种可以调控执行方式的视觉语言动作模型。除了任务目标,系统还能接收中间语言步骤、期望质量或速度等策略信息,以及描述未来状态的子目标图像。
公司报告了未见任务组合、跨机器人形态迁移,以及在指定任务上接近专用策略的结果。这些结论要限定在测试机器人和任务内。想先理解模型类别,可阅读VLA与VLM对比。
可调控的关键是同时说明目标和做法
“整理厨房”没有规定先后顺序、速度和策略。π0.7可以接收下一步语言、质量或速度元数据、视觉子目标,从混合数据中的不同执行方式里选择更明确的行为。
这不是普通聊天提示直接修改电机参数。模型在训练阶段就接触这些上下文,并随机省略部分信号,因此推理时动作策略能对不同条件作出响应。
| 上下文信号 | 规定内容 | 示例 |
|---|---|---|
| 任务指令 | 整体目标 | 擦拭台面 |
| 子任务语言 | 下一语义步骤 | 打开抽屉 |
| 片段元数据 | 质量、速度、策略 | 采用快速且成功的方式 |
| 子目标图像 | 近期未来状态 | 展示期望物体位置 |
多种经验需要带着上下文一起学习
论文描述的数据包括机器人示范、含失败的自主执行、人类第一人称视频和网络多模态数据。详细上下文标签帮助模型区分好坏策略,而不是把互相冲突的动作平均在一起。
架构延续π*0.6与Recap路线和MEM路线,组合VLM骨干、视频历史记忆和动作专家。轻量世界模型生成的子目标图像,用来补充语言难以准确表达的空间状态。
人工语言辅导与后续自主执行是两段证据
π0.7论文的空气炸锅实验中,一条简短零样本指令只完成了部分操作。逐步语言辅导提高了表现,团队随后用这些辅导记录微调高层策略,让它自动生成子任务。
因此,人工边教边做的试验和后续自主运行必须分开描述。把辅导阶段剪进视频,再声称基础模型从一开始就独立规划了全部步骤,会夸大结果。
| 公开实验 | 观察到的能力 | 需要保留的限制 |
|---|---|---|
| 空气炸锅 | 借助语言辅导组合新设备任务 | 最初零样本没有完成 |
| 双臂UR5e叠衣 | 目标机器人无该任务数据时迁移 | 只覆盖指定形态和任务 |
| 咖啡、叠衣、纸箱 | 通用模型对比指定专用策略 | 不代表所有操作任务领先 |
| 多样语言指令 | 细粒度指令跟随 | 不是无限制安全自然语言控制 |

未见任务仍然来自已有知识的重新组合
即使评测机器人没有见过完整任务,相关物体、动作和语义也可能存在于其他机器人、人类或网络数据中。组合泛化是重新拼接已有元素,不是脱离所有先验知识行动。
阅读结果时应问清:被留出的是指令、物体、场景、机器人形态,还是完整任务组合。机器人VLA评测指南能帮助判断不同划分的证据强度。
详细论文公开不等于通用商业API上线
2026年4月的官方文章和论文介绍了模型与实验,并邀请研究或应用合作。它们没有宣布面向所有开发者的自助商业API、完整支持机器人列表或服务等级。
集成方需要询问模型或检查点的获取方式、算力、控制频率、安全接口和机器人适配工作。公开视频和论文不能被写成已经可以买到的标准产品。

本地测试既要看完成率,也要看是否真的可调
设计成对提示:任务目标保持不变,只改变速度、策略或子目标。测量实体轨迹是否按要求变化,同时保持成功率并遵守工作空间限制。
再对留出物体和环境做重复试验,记录恢复与干预。机器人动作数据指南可帮助设计轨迹日志,避免把精选视频当成稳定的调控能力。
评估时应固定起始姿态、物体位置、相机视角和安全限制,只改变一项控制指令。随后比较轨迹差异、峰值速度、完成时间、成功率和人工介入次数,并报告异常值,才能证明模型确实按指令改变行为,而不是随机波动。每个条件至少重复多轮,并公开失败样本、停止规则与置信区间;否则一次顺利演示无法区分可控策略和偶然成功。跨机器人比较时还要说明末端执行器、控制频率与任务容差,不能只比较剪辑后的完成视频。
常见问题
π0.7为什么被称为可调控?
因为它把子任务语言、策略元数据和子目标图像作为训练上下文,提示既能规定任务,也能规定执行方式。
π0.7是否零样本完成了所有未见任务?
没有。官方把结果称为组合泛化的早期迹象,空气炸锅的首次零样本尝试也未完成,后来通过语言辅导改进。
开发者现在能调用公开的π0.7 API吗?
官方文章和论文邀请合作,但没有宣布面向公众的自助商业API。
已核验的官方资料
- Physical Intelligence π0.7研究文章
- Physical Intelligence π0.7论文
- Physical Intelligence π*0.6与Recap文章
- Physical Intelligence多尺度具身记忆论文
最后核查:2026年8月7日