MolmoAct 2检查点应按机器人形态和动作模式选择,而不是按名称强弱排序。官方MolmoAct2仓库把MolmoAct2与Think列为继续适配的基础检查点,把DROID、BimanualYAM、SO100/101和LIBERO列为特定平台或基准的微调模型。
新形态通常先用Base;当明确的三维结构推理可能解决任务瓶颈时再测Think。即使目标接近Franka DROID、YAM、SO机械臂或LIBERO,也要先匹配摄像头、状态向量和控制表示。机器人基础模型指南解释了适配边界。
用形态、模式、任务和深度需求缩小选择
先问目标是实机还是仿真,是单臂、双臂还是SO系列,动作是关节位置还是末端姿态,以及深度推理是否值得额外计算与延迟。
官方仓库也把Base称为基础检查点而非通用部署策略。关节顺序、相机顺序、归一化和单位不一致就不能直接执行。
| 检查点 | 官方用途 | 接近目标 | 注意 |
|---|---|---|---|
| MolmoAct2 | 微调基础 | 新形态新任务 | 需目标数据适配 |
| MolmoAct2-Think | 深度推理基础 | 三维关系重要任务 | 测计算与延迟 |
| DROID | 推理或继续微调 | Franka DROID | 绝对关节姿态模式 |
| BimanualYAM | 双臂推理适配 | YAM双臂 | 相机顺序与14维状态 |
| SO100_101或LIBERO | 指定硬件数据或基准 | SO机械臂或LIBERO | 区分仿真与实机 |
Base是通用起点而不是任意机器人的现成控制器
Base被描述为带连续flow-matching动作专家的post-trained模型,是面向目标机器人继续微调的默认起点。
直接接新夹爪会遇到维度、单位、归一化和安全范围不匹配。VLA模型指南中的Action必须对应具体机体接口。
Think把计算用于可能需要深度推理的场景
Ai2官方发布说明Think加入深度感知标记,并在预计有帮助时自适应路由深度预测,适合遮挡、插入和复杂空间关系。
名称不表示所有任务都更好。应在相同数据与硬件上比较Base和Think的成功、p95延迟和恢复。

任务微调模型只有在模式匹配时才是有力起点
DROID对应Franka绝对关节姿态,YAM对应双臂,SO100_101对应SO数据,LIBERO对应多个训练套件,Think-LIBERO加入深度路径。
复用前核对关节、状态维度、相机名称与顺序、夹爪、控制周期、动作长度和归一化,任何不一致都需要转换或微调。
| 兼容层 | 必须匹配 | 忽略风险 |
|---|---|---|
| 形态 | 关节数量、顺序与范围 | 命令发给错误关节 |
| 观测 | 相机数名称顺序分辨率 | 视角混淆与分布偏移 |
| 状态 | 维度单位坐标归一化 | 条件输入错误 |
| 动作 | 关节末端夹爪表示 | 策略与控制器不一致 |
| 时间 | 控制频率与action horizon | 旧动作和不稳定 |
选硬件前固定运行要求
官方Hugging Face模型卡和仓库提供模型元数据、依赖、dtype与服务器模式,这些会更新,应记录具体版本。
按目标dtype、相机数、分辨率、批处理和action horizon实测峰值显存与延迟,不要用单一数字购买GPU。

基准数字只在作者协议内成立
MolmoAct2论文报告7项仿真与实机基准和13项具身推理基准,博客给出LIBERO微调后Base 97.2%、Think 98.1%。
这些是作者报告,不保证其他机器人现场。应按机器人VLA评测指南记录完整试验、失败、介入和延迟。
安全选择流程从模式验证开始
先文档化观测、状态、动作,离线验证维度单位,再在仿真测试限制与停车,最后用低速低力进行实机试验。
速度、工作空间、扭矩和接触力应由策略外的独立安全层限制,并保持急停与人员监督。
常见问题
新机器人应该从Base还是Think开始?
通常先用Base建立基线,当深度、遮挡或空间关系是实际瓶颈时,再在同条件比较Think。两者都需要目标机器人适配。
DROID检查点可以直接用于其他机械臂吗?
通常不能直接使用。它假设Franka式绝对关节姿态及特定状态和相机模式,需要核对关节、坐标、夹爪、归一化与时序。
LIBERO 98.1%代表实机也能达到吗?
不代表。该数字是Ai2报告的Think在LIBERO微调平均,实机还有形态、传感器、延迟、接触、安全和恢复条件。
已核验的官方资料
最后核查:2026年8月7日