一、论文信息

论文标题:π0: A Vision-Language-Action Flow Model for General Robot Control
作者:Physical Intelligence
论文核心关键词:机器人基础模型、VLA、Flow Matching、跨本体训练、动作块生成、预训练/后训练


二、先说结论:这篇论文到底想解决什么问题?

这篇论文要解决的不是“让机器人学会一个具体技能”,而是更大的问题:能不能像大语言模型那样,先训练一个通用机器人基础模型,再通过提示或少量高质量数据,把它适配到不同机器人、不同任务、不同场景中去。 作者认为,机器人领域长期存在三个核心瓶颈:数据不足、泛化能力弱、鲁棒性不够。为了解决这三个问题,他们提出了 π0:一个把预训练视觉语言模型(VLM)和连续动作生成结合起来的通用机器人控制模型。

论文的核心判断非常清楚:只靠小规模、单任务的数据,机器人很难学到真正的通用能力;必须引入类似 LLM 的“大规模预训练 + 高质量后训练”范式。 因此,π0 不是单纯的控制网络,而是一整套方法框架:VLM 语义骨干 + Action Expert 动作专家 + Flow Matching 连续动作生成 + Cross-Embodiment 跨机器人联合训练 + Pre-training/Post-training 两阶段训练配方。


三、论文的整体思路:一句话概括

π0 的本质,是在预训练 VLM 的语义理解能力之上,增加一个专门面向机器人状态和动作的 Action Expert,并用 Flow Matching 来生成连续动作块,从而让模型既“看得懂、听得懂”,又“动得准、动得连贯”。

论文首页 Figure 1 就已经把整体路线图画出来了:左边是多机器人、多任务的数据;中间是基于 VLM 的 π0 模型;右边是三类能力:

  1. 直接提示就能做一部分任务;

  2. 高质量后训练后能做复杂多阶段任务;

  3. 还能用较少数据迁移到新任务。


四、为什么这篇论文值得关注?

过去很多 VLA 方法虽然也把视觉、语言和动作放在一起建模,但常见做法是把动作离散化,像语言 token 一样去做自回归预测。这种方式在简单任务、低频控制里能工作,但一旦面对高频、连续、精细的操作,比如折衣服、装鸡蛋、组装盒子,就会暴露出动作表达能力不足的问题。π0 的关键突破,就是不再把动作当作离散 token 分类问题,而是把动作看成连续分布,用 Flow Matching 来直接建模未来动作块。作者强调,这使模型可以支持最高 50Hz 的高频控制,并显著提升灵巧操作能力。

同时,π0 不是只在一个机器人上训练,而是采用 Cross-Embodiment Training,把单臂机器人、双臂机器人、移动机械臂等不同平台的数据放进同一个模型学习。作者使用了 7 种机器人配置、68 个任务、约 10,000 小时机器人数据,并额外混合了 OXE、DROID、Bridge 等开源数据。这种规模使它更接近“机器人基础模型”而不是传统的“单任务策略网络”。


五、模型结构详解:π0 是怎么搭起来的?

1. 输入是什么?

2. 主干为什么是 VLM?

π0 的主干不是从零开始训练,而是基于 PaliGemma。作者明确说,这样做的目的是让模型天然继承互联网规模预训练带来的通识语义、问题求解能力和视觉语言对齐能力。换句话说,π0 不是先教机器人“什么是盘子、什么是纸巾、什么叫 fold shirt”,而是直接站在已有 VLM 的知识上继续训练,把“懂图像和语言”扩展到“会输出机器人动作”。

3. Action Expert 是什么?

这篇论文最有代表性的结构创新,就是 Action Expert。作者发现,图像和文本属于 VLM 预训练时已经见过的模态,而机器人状态和动作是新模态。如果直接让原始 VLM 主干处理所有 token,效果并不好。于是他们给机器人相关 token 单独设计了一套较小的参数子网络,也就是 Action Expert。

从实现上看,π0 可以理解成一个双专家 Transformer

  • 图像和语言 token 走较大的 VLM backbone;

  • 本体状态和动作 token 走较小的 Action Expert;

  • 两边通过 self-attention 发生信息交互。

这并不是传统稀疏门控 MoE,而是“同一 Transformer 内部的双参数通道”设计。作者还说明,PaliGemma 主干基于 Gemma 2B,而 Action Expert 被缩小到 width=1024, mlp dim=4096,大约 300M 参数,其目的很明确:机器人动作部分在推理时需要反复前向多次,所以必须尽量轻量。


六、Flow Matching 到底在做什么?

这是整篇论文最关键的方法点。

传统模仿学习通常直接回归动作值,或者把动作离散化做分类;π0 不这么做。它采用 Conditional Flow Matching 来建模连续动作分布。核心思想是:不让模型直接输出最终动作,而是让模型学习一个“从噪声动作逐渐流向真实动作”的向量场


七、推理过程:π0 是怎么从噪声变成动作的?


八、Appendix B 的关键实现细节:这部分最容易被忽视,但最值钱

3. 为什么说动作块内部是双向注意力?

正文提到 Action Expert 对动作 token 使用全双向注意力,这意味着 50 个未来动作不是彼此独立预测,而是联合建模为一整段轨迹。因此,第 1 步动作可以参考第 10 步,第 10 步也可以反过来参考第 1 步,这对复杂灵巧操作中的连续协调非常关键。


九、训练配方:为什么作者一直强调 Pre-training / Post-training?

论文反复强调,结构很重要,但训练配方更重要。 作者将训练明确拆成两个阶段。

1. 预训练阶段:追求广度

预训练的目标是让模型见尽可能多的任务、场景、动作模式和失败恢复方式。作者的预训练混合数据中,约 9.1% 来自 OXE、Bridge、DROID 等开源数据,其余来自他们自有的大规模机器人操作数据,总计约 903M timesteps。这些数据覆盖 7 种机器人配置和 68 个任务。作者还说明,为了避免某些任务过度主导训练,他们对每个 task-robot 组合按 (n^{0.43}) 做重加权;为了统一不同机器人输入输出维度,他们采用zero-padding 和图像位点 masking

2. 后训练阶段:追求质量

后训练的目标不是再去扩充广度,而是让模型学会一个任务的高质量、稳定、流畅的执行风格。作者明确指出:

  • 只用高质量数据,模型不容易学会错误恢复;

  • 只用大规模但杂乱的数据,模型又不够高效和流畅;

  • 两者结合,才会出现“既能恢复、又能熟练”的行为。

这其实就是把 LLM 里的“预训练负责知识,后训练负责对齐”思想迁移到了机器人领域。


十、实验设计:作者到底验证了什么?

论文的实验设计非常完整,主要回答四个问题:

  1. 预训练后的基础模型,直接提示就能做多少事?

  2. 模型到底能不能真正跟随语言指令?

  3. 面对新灵巧任务,微调后的 π0 比已有方法强多少?

  4. π0 能否适应复杂、长时程、多阶段任务?


十一、实验结果总结:这篇论文真正强在哪?

1. 零样本/直接提示结果很强

在 shirt folding、bussing easy/hard、grocery bagging、toast out of toaster 等任务上,作者把 π0 与 OpenVLA、Octo,以及去掉 VLM 预训练的 π0-small 做了比较。结果显示:完整 π0 在所有 out-of-box 任务上都明显优于基线,甚至只训练 160k steps 的“compute parity”版本也超过所有基线。 作者认为,这说明三件事同时成立:

  • Flow Matching 的连续动作建模比动作离散化更适合高频控制;

  • 大模型容量依然重要;

  • VLM 预训练确实带来了实质性收益。

2. 语言跟随能力显著提升

在 bussing、table setting、grocery bagging 三个语言条件任务中,π0 比 π0-small 的语言跟随准确率显著更高。更重要的是,这种语言能力不是停留在“听懂了文字”,而是能转化为更好的任务表现:无论是人类给出中间步骤指令,还是高层 VLM 自动生成子指令,π0 都表现更好。作者据此得出结论:VLM 预训练不仅让模型“懂语言”,还让它能把语言更有效地映射成动作。

3. 新任务微调后也更强

在 stack bowls、towel folding、Tupperware in microwave、paper towel replacement、items in drawer 等新灵巧任务上,π0 与 OpenVLA、Octo、ACT、Diffusion Policy 进行了比较。作者总结认为:π0 整体上优于其它方法,特别是在数据较少时,预训练带来的收益更明显;而越接近预训练分布的任务,迁移效果越好。 这说明 π0 不只是“大数据吃满”,而是真正学到了一些可迁移的物理操作先验。

4. 最亮眼的是复杂多阶段任务

论文最有说服力的部分,其实是复杂任务评测。作者展示了 laundry folding、mobile laundry、dryer unloading、table bussing、box building、packing eggs、to-go box 等任务,并指出这些任务通常持续 5 到 20 分钟,包含大量连续动作、物体交互和高层决策。Figure 13 显示,完整预训练后的 π0 在所有复杂任务上都能达到超过 50% 的最大得分,并且通常优于各种去预训练或从头训练的消融版本,尤其在最困难任务上优势更明显。作者甚至直言,这样的自主表现已经接近 learned dexterous manipulation 的新 SOTA。


十二、推理效率:为什么它能真正跑在机器人上?

论文不仅讲准确率,也给了推理时间。作者在 Appendix D 中报告,在 RTX 4090 上,3 相机输入时:

  • 图像编码约 14 ms

  • 观测前向约 32 ms

  • 10 次动作 flow 前向约 27 ms

  • 板载总推理约 73 ms

  • 离板(Wi-Fi)总推理约 86 ms

同时,由于模型一次生成一个 (H)-step 动作块,所以并不需要每个控制周期都重新推理。作者最终采用开环执行动作块的策略,而没有使用 temporal ensembling,因为后者在实验里反而损害了性能。对于 20Hz 机器人,模型大约每 0.8 秒重新推理一次;对于 50Hz 机器人,大约每 0.5 秒推理一次。


十三、这篇论文的真正创新点

结合整篇论文,我觉得 π0 的创新点可以总结为四个层面。

第一个创新点,是把 VLM 和连续动作生成真正耦合起来。
过去很多方法停留在“语言高层规划 + 低层传统控制”的松耦合形式,而 π0 直接把语义理解和动作生成统一在一个 VLA 框架里。

第二个创新点,是用 Flow Matching 替代离散动作 token 预测。
这使动作表达不再受限于离散桶,而能够直接生成高频、连续、复杂的动作块。

第三个创新点,是 Action Expert 结构。
它让模型既能保留 VLM 的互联网语义能力,又能专门适配机器人状态和动作这种新模态。

第四个创新点,其实不是网络,而是训练 recipe。
作者用实验很明确地证明:机器人基础模型的价值,不只来自模型做大,更来自“预训练学广度、后训练学质量”的两阶段策略。


十四、这篇论文的局限性

虽然论文很强,但它也有明显局限。

首先,它依赖极大规模的自有数据。作者虽然混合了开源集,但主体数据仍然来自他们内部采集,这意味着外部研究者很难完整复现。

其次,论文虽然证明了“大规模预训练 + 高质量后训练”有效,但没有彻底回答一个更根本的问题:到底哪些数据最重要、哪些机器人最有迁移价值、不同任务之间为什么会出现正迁移。 这部分更多还是经验性结论。

最后,π0 依然主要聚焦于 manipulation。它离真正意义上的“通用具身智能”还有距离,比如长期记忆、环境建模、任务规划闭环、失败恢复层级控制等,都还有进一步扩展空间。


十五、我的理解:这篇论文最重要的启发是什么?

在我看来,π0 最重要的价值不只是“性能更强”,而是它很清楚地给出了一个未来机器人基础模型的发展方向:

机器人不应该继续停留在“小数据、单任务、单平台、从头训练”的范式里,而应该像语言模型一样,先通过海量异构数据学到通用知识,再通过高质量后训练把这些知识变成任务执行能力。

同时,这篇论文也说明了一个关键事实:机器人领域的“语义理解”和“动作生成”不能只做表面拼接。 真正可行的方案,必须在结构上区分语义主干和动作专家,在训练上区分广泛预训练和任务对齐,在推理上考虑实际控制频率与计算缓存。π0 之所以强,不是因为它只做对了一个点,而是它在这三层上都做了系统整合。


十六、总结

π0 这篇论文的核心贡献,可以用一句话概括:

它把“预训练 VLM 的语义能力”真正落到了“机器人连续动作生成”上,并通过 Action Expert、Flow Matching、Cross-Embodiment 和两阶段训练配方,构建出一个更像机器人基础模型的通用控制框架。

如果只看方法层,π0 最值得记住的是:

  • 动作不再离散化,而是用 Flow Matching 建模连续动作块;

  • 图文 token 和机器人 token 分开走不同专家;

  • 输入序列用 blockwise causal mask 兼顾预训练分布与推理效率;

  • 训练分为 pre-training 和 post-training,两者分别负责“广度”和“质量”。

如果只看趋势层,这篇论文真正传递的信息是:
机器人基础模型时代,可能真的开始了。

π0 不是单纯把 VLM 接到机械臂上,而是系统性地回答了“通用机器人基础模型该怎么做”这个问题。它基于预训练 VLM,引入 Action Expert 和 Flow Matching 来生成连续动作块,再通过大规模跨本体预训练和高质量后训练,让模型同时具备语义理解能力、动作生成能力和任务迁移能力。实验表明,π0 不仅在直接提示、语言跟随和新任务微调上表现优于现有方法,还能完成折衣服、清桌子、组装盒子、装鸡蛋等复杂长时程任务。这篇论文最重要的意义,不只是提出了一个更强的模型,而是给机器人基础模型的发展提供了一条比较完整的路线。

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐