神经网络与深度学习第六周学习笔记
·
课程主题:具身智能与视觉-语言-动作(VLA)模型
一、学习概述
本周系统学习了具身智能的核心概念、系统架构与关键技术,深入剖析了视觉-语言-动作(VLA)模型的基本原理与典型实现,重点掌握了开源VLA模型OpenVLA和轻量级VLA模型SmolVLA的架构特点,并初步了解了世界模型的分类体系与发展趋势。这些内容构成了当前人工智能从"感知智能"向"具身智能"演进的核心技术基础。
二、具身智能基础
2.1 具身智能的定义与本质
- 定义:具身智能是指主体(机器)在自体、对象与环境等要素间相互作用(信息感知、转化和响应)的过程中,建构符合各要素物理实存及其关系演化趋势的认知模型,达成问题解决或价值实现的人工智能方法。
- 与非具身智能的本质区别:
| 特征 | 非具身智能(Internet AI) | 具身智能(Embodied AI) |
|---|---|---|
| 存在形式 | 无物理身体 | 有物理身体并支持物理交互 |
| 学习方式 | 被动接受人类采集的数据 | 主动与环境交互,自主学习 |
| 认知模式 | 第三人称智能(别人告诉我) | 第一人称智能(我亲身体验) |
| 典型代表 | ChatGPT、文心一言 | 服务机器人、无人车、人形机器人 |
- 核心学习循环:感受世界 → 对世界建模 → 采取行动 → 验证并调整模型
2.2 具身智能系统结构
类似人脑结构和躯体,具身智能系统分为三个核心层面:
- 感知智能:多模态识别,是机器人获取环境信息的基础
- 认知智能:理解、分析、决策,是系统的"大脑"
- 行为智能:执行并优化动作,是系统与物理世界交互的接口
2.3 智能机器人关键技术
机器人是具身智能最突出的实体形式,其关键技术包括:
- 多模态感知技术:利用深度相机、激光雷达等传感器构建空间映射
- 自主学习与决策:由环境模型、动作集、奖励函数和决策模型组成
- 运动控制和规划:将高级指令转化为具体执行器动作,解决路径规划、避障等问题
- 人机交互:通过自然语言指令控制机器人完成复杂任务
2.4 机器视觉与具身感知
机器视觉是机器人的"眼睛",具身感知与传统机器视觉的核心区别在于:
- 要求智能体在物理世界中移动并与环境互动
- 需要对3D空间和动态环境有更深的理解
- 关键技术包括主动视觉感知(VSLAM)、3D视觉感知和视觉语言导航(VLN)
2.5 具身智能仿真环境
仿真环境是具身智能研究的重要工具,具有成本低、安全、可扩展等优点,主要分为两类:
- 基于底层模拟的通用模拟器:Isaac Sim、Gazebo、Pybullet、MuJoCo等
- 基于真实场景的模拟器:AI2-THOR、Habitat(Meta)、iGibson(斯坦福)等
2.6 典型实例:ALOHA系统
- ALOHA:A Low-cost Open-source Hardware System for Bimanual Teleoperation,用于双手遥控操作的低成本开源硬件系统
- 核心算法:ACT(Action Chunking with Transformers)
- 动作分块:将任务分成若干动作块,减少累积误差
- 时间集成:对不同动作块的重叠预测进行加权平均,提高动作平滑性
- Mobile ALOHA:增加了移动底盘,扩展了工作空间,支持更大范围的任务
三、视觉-语言-动作(VLA)模型
3.1 VLA模型概述
- 定义:将视觉信息和语言信息转化为机器人可执行动作的模型,是连接感知、语言和动作的桥梁
- 发展里程碑:
- 2023年:RT-2发布,首次将大语言模型与机器人控制结合
- 2023年:Open X-Embodiment数据集发布,包含超过200万条机器人轨迹
- 2024年:OpenVLA发布,首个高性能开源VLA模型
3.2 VLA模型基本原理
VLA模型主要由三个部分组成:
- 预训练模块:
- 视觉编码器:从视觉输入中提取特征(CNN、Vision Transformer等)
- 动力学学习:预测机器人与环境的交互动态
- 世界模型:构建环境的长期表示与预测
- 控制策略模块:接收短期任务指令并生成可执行的动作
- 任务规划器模块:将复杂的长期任务分解为可由低级控制策略执行的子任务
3.3 VLA模型面临的挑战
- 数据集问题:数据收集成本高、时间投入大、不同机器人配置差异大
- 机器人数据稀缺:现实数据收集困难,模拟与现实存在"现实鸿沟"
- 运动规划:缺乏处理复杂环境和高精度操作的灵活性
- 泛化能力:对未知场景、物体和指令的泛化能力不足
3.4 OpenVLA模型详解
OpenVLA是由斯坦福大学、UC Berkeley等机构联合开发的开源视觉-语言-动作模型,在通用机器人操作方面设立了新的业界标杆。
-
模型架构:
- 视觉编码器:DINOv2 + SigLIP,并行提取低层次空间细节和高层次语义信息
- 语言模型:Llama 2 7B参数
- 动作解码器:将生成的动作tokens转化为机器人可执行的连续控制信号(Δx, Δθ, ΔGrip等)
-
训练数据:基于Open X-Embodiment数据集,包含970k机器人轨迹
-
性能表现:
- 视觉泛化:87.0%(RT-2-X为52.0%)
- 物理泛化:76.7%(RT-2-X为26.7%)
- 语言接地:90.0%(RT-2-X为85.0%)
- 整体平均:70.6%(RT-2-X为50.6%)
-
优势:
- 完全开源:数据、权重、代码全部开放
- 多机器人控制:能直接控制多种不同类型的机器人
- 高效微调:只需10-150个演示样本即可适应新任务
四、轻量级VLA模型:SmolVLA
4.1 SmolVLA简介
- 开发者:Intel等机构
- 参数规模:约4.5亿,显著小于OpenVLA的70亿参数
- 核心特点:开源轻量、高效、可在消费级设备上训练和部署,降低了具身智能的入门门槛
4.2 SmolVLA架构与优化
-
核心组件:
- 视觉-语言主干网络:SmolVLM-2(SigLIP视觉编码器 + SmolLM2语言模型)
- 动作专家模块:采用流匹配方法,将感知数据和指令转化为平滑的机器人动作
-
关键优化策略:
- 全局图像处理:处理512×512像素的全局图像,避免分块处理的开销
- 减少视觉token:使用PixelShuffle技术将每帧图像的视觉token限制在约64个
- 层跳跃加速推理:动作专家模块以VLM中间层(总层数的一半)特征作为输入
- 异步推理:PolicyServer与RobotClient分离,机器人执行动作的同时异步预测下一个动作块
4.3 训练与部署
- 环境要求:RTX 3080Ti(12GB显存)显卡即可运行,批次大小为44
- 数据集:使用LeRobot社区驱动的开源数据集,包含22.9K个任务片段
- 实验结果:
- 抓取与放置:成功率75%
- 堆叠立方体:成功率90%
- 颜色分类:成功率70%
- 未见过的SO101平台:50%的分布外成功率
五、世界模型
5.1 核心定义与思想源头
-
Yann LeCun的定义:世界模型接收当前状态S(t)与动作A(t),预测下一刻状态S’(t+1),同时持续接收外部观察O(t)以动态更新内部认知,形成闭环的智能推演系统。
-
思想源头:
- Kenneth Craik(1943):“心智的主要功能是成为世界或其一部分的模型”
- Richard Feynman:“我不能创造的东西,我就不理解”
-
预测的两种形式:
- 抽象表征:类似大脑"想象"未来,聚焦于本质规律的概念性预测
- 具象表征:生成具体的感官数据,如视频帧、音频等
5.2 世界模型的两大分类
5.2.1 表征世界模型
核心是构建对世界的抽象理解与预测,主要包括:
- 心智模型:大脑对外部现实的内在表达,通过抽象概念理解世界
- 直觉物理引擎:赋予快速模拟物理场景的能力,处理日常物理推理
- 视觉预测:将高维视觉信息压缩到低维潜在空间,预测环境动态
- 经典范式:World Models(Ha & Schmidhuber, 2018)
- LeCun的JEPA框架:预测隐藏表示而非原始像素
- 语言预测:关于LLM是否具备世界模型的讨论
- 结论:LLM模拟了世界模型的输出形式,但缺乏对世界本质的具身认知与因果锚点
5.2.2 生成世界模型
核心是创造和模拟世界的具体表现,主要包括:
- 基于规则的模拟:自上而下预先定义系统运行规则,如游戏引擎、数字孪生
- 数据驱动的生成:自下而上从海量数据中自主挖掘规律,如OpenAI Sora、Google DeepMind Genie等视频世界模型
5.3 未来发展方向
- 表征与生成的融合:生成世界模型需以表征世界模型为根基,二者互为补充
- 规则与数据的结合:在数据驱动生成中引入物理规则约束,增强输出的一致性与合理性
- 跨模态联合训练:在通用文本、图像、视频和机器人数据上联合训练,提升泛化能力
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐




所有评论(0)