课程主题:具身智能与视觉-语言-动作(VLA)模型

一、学习概述

本周系统学习了具身智能的核心概念、系统架构与关键技术,深入剖析了视觉-语言-动作(VLA)模型的基本原理与典型实现,重点掌握了开源VLA模型OpenVLA和轻量级VLA模型SmolVLA的架构特点,并初步了解了世界模型的分类体系与发展趋势。这些内容构成了当前人工智能从"感知智能"向"具身智能"演进的核心技术基础。

二、具身智能基础

2.1 具身智能的定义与本质

  • 定义:具身智能是指主体(机器)在自体、对象与环境等要素间相互作用(信息感知、转化和响应)的过程中,建构符合各要素物理实存及其关系演化趋势的认知模型,达成问题解决或价值实现的人工智能方法。
  • 与非具身智能的本质区别
特征 非具身智能(Internet AI) 具身智能(Embodied AI)
存在形式 无物理身体 有物理身体并支持物理交互
学习方式 被动接受人类采集的数据 主动与环境交互,自主学习
认知模式 第三人称智能(别人告诉我) 第一人称智能(我亲身体验)
典型代表 ChatGPT、文心一言 服务机器人、无人车、人形机器人
  • 核心学习循环:感受世界 → 对世界建模 → 采取行动 → 验证并调整模型

2.2 具身智能系统结构

类似人脑结构和躯体,具身智能系统分为三个核心层面:

  1. 感知智能:多模态识别,是机器人获取环境信息的基础
  2. 认知智能:理解、分析、决策,是系统的"大脑"
  3. 行为智能:执行并优化动作,是系统与物理世界交互的接口

2.3 智能机器人关键技术

机器人是具身智能最突出的实体形式,其关键技术包括:

  1. 多模态感知技术:利用深度相机、激光雷达等传感器构建空间映射
  2. 自主学习与决策:由环境模型、动作集、奖励函数和决策模型组成
  3. 运动控制和规划:将高级指令转化为具体执行器动作,解决路径规划、避障等问题
  4. 人机交互:通过自然语言指令控制机器人完成复杂任务

2.4 机器视觉与具身感知

机器视觉是机器人的"眼睛",具身感知与传统机器视觉的核心区别在于:

  • 要求智能体在物理世界中移动并与环境互动
  • 需要对3D空间和动态环境有更深的理解
  • 关键技术包括主动视觉感知(VSLAM)、3D视觉感知和视觉语言导航(VLN)

2.5 具身智能仿真环境

仿真环境是具身智能研究的重要工具,具有成本低、安全、可扩展等优点,主要分为两类:

  1. 基于底层模拟的通用模拟器:Isaac Sim、Gazebo、Pybullet、MuJoCo等
  2. 基于真实场景的模拟器:AI2-THOR、Habitat(Meta)、iGibson(斯坦福)等

2.6 典型实例:ALOHA系统

  • ALOHA:A Low-cost Open-source Hardware System for Bimanual Teleoperation,用于双手遥控操作的低成本开源硬件系统
  • 核心算法:ACT(Action Chunking with Transformers)
    • 动作分块:将任务分成若干动作块,减少累积误差
    • 时间集成:对不同动作块的重叠预测进行加权平均,提高动作平滑性
  • Mobile ALOHA:增加了移动底盘,扩展了工作空间,支持更大范围的任务

三、视觉-语言-动作(VLA)模型

3.1 VLA模型概述

  • 定义:将视觉信息和语言信息转化为机器人可执行动作的模型,是连接感知、语言和动作的桥梁
  • 发展里程碑
    • 2023年:RT-2发布,首次将大语言模型与机器人控制结合
    • 2023年:Open X-Embodiment数据集发布,包含超过200万条机器人轨迹
    • 2024年:OpenVLA发布,首个高性能开源VLA模型

3.2 VLA模型基本原理

VLA模型主要由三个部分组成:

  1. 预训练模块
    • 视觉编码器:从视觉输入中提取特征(CNN、Vision Transformer等)
    • 动力学学习:预测机器人与环境的交互动态
    • 世界模型:构建环境的长期表示与预测
  2. 控制策略模块:接收短期任务指令并生成可执行的动作
  3. 任务规划器模块:将复杂的长期任务分解为可由低级控制策略执行的子任务

3.3 VLA模型面临的挑战

  • 数据集问题:数据收集成本高、时间投入大、不同机器人配置差异大
  • 机器人数据稀缺:现实数据收集困难,模拟与现实存在"现实鸿沟"
  • 运动规划:缺乏处理复杂环境和高精度操作的灵活性
  • 泛化能力:对未知场景、物体和指令的泛化能力不足

3.4 OpenVLA模型详解

OpenVLA是由斯坦福大学、UC Berkeley等机构联合开发的开源视觉-语言-动作模型,在通用机器人操作方面设立了新的业界标杆。

  • 模型架构

    • 视觉编码器:DINOv2 + SigLIP,并行提取低层次空间细节和高层次语义信息
    • 语言模型:Llama 2 7B参数
    • 动作解码器:将生成的动作tokens转化为机器人可执行的连续控制信号(Δx, Δθ, ΔGrip等)
  • 训练数据:基于Open X-Embodiment数据集,包含970k机器人轨迹

  • 性能表现

    • 视觉泛化:87.0%(RT-2-X为52.0%)
    • 物理泛化:76.7%(RT-2-X为26.7%)
    • 语言接地:90.0%(RT-2-X为85.0%)
    • 整体平均:70.6%(RT-2-X为50.6%)
  • 优势

    • 完全开源:数据、权重、代码全部开放
    • 多机器人控制:能直接控制多种不同类型的机器人
    • 高效微调:只需10-150个演示样本即可适应新任务

四、轻量级VLA模型:SmolVLA

4.1 SmolVLA简介

  • 开发者:Intel等机构
  • 参数规模:约4.5亿,显著小于OpenVLA的70亿参数
  • 核心特点:开源轻量、高效、可在消费级设备上训练和部署,降低了具身智能的入门门槛

4.2 SmolVLA架构与优化

  • 核心组件

    1. 视觉-语言主干网络:SmolVLM-2(SigLIP视觉编码器 + SmolLM2语言模型)
    2. 动作专家模块:采用流匹配方法,将感知数据和指令转化为平滑的机器人动作
  • 关键优化策略

    • 全局图像处理:处理512×512像素的全局图像,避免分块处理的开销
    • 减少视觉token:使用PixelShuffle技术将每帧图像的视觉token限制在约64个
    • 层跳跃加速推理:动作专家模块以VLM中间层(总层数的一半)特征作为输入
    • 异步推理:PolicyServer与RobotClient分离,机器人执行动作的同时异步预测下一个动作块

4.3 训练与部署

  • 环境要求:RTX 3080Ti(12GB显存)显卡即可运行,批次大小为44
  • 数据集:使用LeRobot社区驱动的开源数据集,包含22.9K个任务片段
  • 实验结果
    • 抓取与放置:成功率75%
    • 堆叠立方体:成功率90%
    • 颜色分类:成功率70%
    • 未见过的SO101平台:50%的分布外成功率

五、世界模型

5.1 核心定义与思想源头

  • Yann LeCun的定义:世界模型接收当前状态S(t)与动作A(t),预测下一刻状态S’(t+1),同时持续接收外部观察O(t)以动态更新内部认知,形成闭环的智能推演系统。

  • 思想源头

    • Kenneth Craik(1943):“心智的主要功能是成为世界或其一部分的模型”
    • Richard Feynman:“我不能创造的东西,我就不理解”
  • 预测的两种形式

    1. 抽象表征:类似大脑"想象"未来,聚焦于本质规律的概念性预测
    2. 具象表征:生成具体的感官数据,如视频帧、音频等

5.2 世界模型的两大分类

5.2.1 表征世界模型

核心是构建对世界的抽象理解与预测,主要包括:

  1. 心智模型:大脑对外部现实的内在表达,通过抽象概念理解世界
  2. 直觉物理引擎:赋予快速模拟物理场景的能力,处理日常物理推理
  3. 视觉预测:将高维视觉信息压缩到低维潜在空间,预测环境动态
    • 经典范式:World Models(Ha & Schmidhuber, 2018)
    • LeCun的JEPA框架:预测隐藏表示而非原始像素
  4. 语言预测:关于LLM是否具备世界模型的讨论
    • 结论:LLM模拟了世界模型的输出形式,但缺乏对世界本质的具身认知与因果锚点
5.2.2 生成世界模型

核心是创造和模拟世界的具体表现,主要包括:

  1. 基于规则的模拟:自上而下预先定义系统运行规则,如游戏引擎、数字孪生
  2. 数据驱动的生成:自下而上从海量数据中自主挖掘规律,如OpenAI Sora、Google DeepMind Genie等视频世界模型

5.3 未来发展方向

  • 表征与生成的融合:生成世界模型需以表征世界模型为根基,二者互为补充
  • 规则与数据的结合:在数据驱动生成中引入物理规则约束,增强输出的一致性与合理性
  • 跨模态联合训练:在通用文本、图像、视频和机器人数据上联合训练,提升泛化能力
Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐