🧠 “AI教母”李飞飞的终极野望:从ImageNet到World Labs,她用50亿美金估值定义空间智能的下一个十年

摘要:李飞飞提出AI五大进化方向:空间智能、具身智能、世界模型、从看到做、以人为本。她创办的World Labs仅用16个月即完成10亿美元融资,估值达50亿美元。本文深度解析李飞飞的AI世界观、World Labs的技术路线与产品矩阵,以及这场“世界模型大战”背后的产业变革。(全文约3800字,阅读需12分钟)

标签#李飞飞 #WorldLabs #空间智能 #具身智能 #世界模型 #Marble #AGI #3D生成

在这里插入图片描述

一、引言:那个让AI“看见”的女人,正在让AI“理解”整个物理世界

2009年,她带领团队耗时三年手工标注了1400万张图片,打造出改变AI历史的ImageNet——这个数据集直接催生了2012年的AlexNet和随后的深度学习革命,让AI第一次真正“看见”世界。

她就是李飞飞(Fei-Fei Li) ,斯坦福大学终身教授、前Google Cloud AI首席科学家、被全球科技界尊称为“AI教母”的传奇人物。

当全世界还在为大语言模型(LLM)的参数规模和文字生成能力狂欢时,李飞飞抛出了一个更宏大、更具颠覆性的命题:

“若AI无法理解物体的深度、距离、遮挡与重力,就永远无法真正‘具身’。”

在CES 2026的演讲中,她用一个绝妙的比喻道破LLM的根本局限:“一只苍蝇没有万亿级参数,却能在杂乱空间中极速避障、精准着陆。 ”她笃定地告诉世界:大语言模型终究受制于语言本身,无法通往AGI,空间智能才是最优路径

本文将从李飞飞的AI五大发展方向切入,深度拆解她为此创办的World Labs公司的技术路线、产品矩阵与资本布局。

二、李飞飞的AI五大进化方向

2.1 方向一:空间智能(Spatial Intelligence)

核心判断:当前大语言模型本质上是“在黑暗中工作的文字匠人”——能言善辩却缺乏经验,知识渊博却缺乏根基。

从进化论的视角来看,李飞飞提出了一个极具洞察力的观点:感知先于语言。在生物进化史上,视觉感知系统比语言能力早出现了数亿年。空间智能要求AI能够真正理解:

  • 三维空间中的位置、关系、结构、拓扑
  • 物理世界的深度、遮挡、重力、碰撞、材质属性
  • 从2D图像/文字到3D世界的映射推理与物理一致性保持

2.2 方向二:具身智能(Embodied Intelligence)

“智能的真正力量不仅仅在于思考,更在于运用思想驱动行动。”

从“被动感知”进化到“主动行动”:

  • AI看到桌上快掉落的杯子 → 不仅识别出“这是杯子”
  • 而是产生 “快伸手抓住它” 的行动冲动与运动规划
  • 在数字或物理的3D空间中具备创造、理解、推理和交互的完整能力闭环

2.3 方向三:世界模型(World Models)

世界模型是一种新型生成模型,其核心是构建对真实/虚拟环境的物理基础理解

  • 理解、推理并交互于语义、物理、几何、动态四个维度
  • 远超现有LLM纯文本处理的范畴
  • 被广泛认为是通往AGI的必由之路

💡 “世界模型”与LLM的根本区别:LLM在文字符号空间中操作,而世界模型要求在三维物理空间中操作——这不仅是维度的增加,更是智能范式的根本转变。

2.4 方向四:从“看到做”(From Seeing to Doing)

李飞飞用阶梯理论描述AI的进化路径:

🧗 AI智能进化阶梯:
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
第1层:感知(Perception)     — 计算机识别“这是什么”
第2层:理解(Understanding)  — 场景图、关系推理、因果推断
第3层:生成(Generation)     — 扩散模型生成2D图片/视频
第4层:交互(Interaction)    — AI与世界实时互动 ← 我们正站在这一层的门槛上

2.5 方向五:以人为本的AI(Human-Centered AI)

在技术乐观主义盛行的硅谷,李飞飞同时挑战了对AGI的过度痴迷:

  • AI发展应以人类福祉为中心
  • 关注AI解决现实社会问题的潜力(医疗健康、农业制造、教育公平)
  • 而非单纯追求通用人工智能的技术指标和参数规模竞赛

李飞飞在访谈中透露,World Labs的目标是让空间智能技术真正进入医疗健康、农业制造等各个垂直行业。“希望在2026年,我们能看到拥有了空间智能的AI,真正走出屏幕,与物理世界产生美妙的交互”。

三、World Labs:全球首个空间智能“世界模型”公司

3.1 基本信息与融资历程

项目 详情
成立时间 2024年初成立,2024年9月正式公开亮相
联合创始人 Justin Johnson(前Meta/密歇根大学教授)、Ben Mildenhall(NeRF技术的发明者之一)、Christoph Lassner(3D图形学专家)
总融资 2024年成立之初融超2.3亿美元;2026年2月完成10亿美元新一轮融资
估值 投后估值约50亿美元,跻身全球AI独角兽前列
投资方 由设计软件巨头Autodesk领投2亿美元,NVIDIA、AMD罕见联手参投,其他参与者包括a16z、NEA、Fidelity、Emerson Collective
定位 全球首个专注“空间智能”与“世界模型”的基础设施公司

📈 估值增长:从2024年的10亿美元估值到2026年的50亿美元,不到两年翻了5倍。作为对比,Anthropic花了25个月才达到50亿美元估值。

3.2 核心产品:Marble(大理石)—— 一张图生成一个世界

2025年11月,World Labs正式发布了首款商用世界模型产品Marble,基于领先的生成式3D世界模型技术构建:

输入方式(四选一即可):

  • 🗣️ 一句话(自然语言描述)
  • 🖼️ 一张图片
  • 🎬 一段视频
  • 📐 3D布局图/粗略结构框架

输出能力

  • 高保真、可编辑、可探索的3D世界
  • 导出格式:高斯斑点(Gaussian Splatting)、Mesh网格、视频等工业标准格式
  • 可直接导入Unity、Unreal Engine、游戏引擎和影视后期制作流程

内置AI编辑器:Chisel

Marble是业内首款原生集成AI编辑工具的世界模型,配备混合式3D编辑器:用户可先手动构建空间结构框架(如墙体、体块或平面),再由AI填充视觉细节。这一设计将“人的创意控制”与“AI的高效生成”有机结合。

# Marble工作流程概念示例
input = "一个阳光充足的现代客厅,落地窗外是海景,有米色布艺沙发和原木茶几"
scene = marble.generate(input)          # 一步生成3D世界
scene.edit("把沙发换成深蓝色天鹅绒材质")  # 自然语言交互式编辑
scene.expand("延伸到阳台区域")            # 场景扩展
scene.export(format="gaussian_splat")   # 导出为高斯斑点格式
scene.export(format="unity_package")    # 直接导入Unity引擎

3.3 开源技术:Forge渲染器

World Labs同步开源的Forge渲染器解决了AI生成3D内容后的实时渲染瓶颈:

  • 可在桌面端、低功耗移动设备、XR设备上实时流畅渲染AI生成的复杂3D世界
  • 降低了空间智能技术在消费级设备上的部署门槛
  • 为开发者生态建设奠定了基础

四、技术路线深度对比:显式3D建模 vs 抽象预测

World Labs的技术路线,与图灵奖得主Yann LeCun的JEPA体系存在本质上的哲学分歧:

维度 World Labs路线 Yann LeCun JEPA路线
方法 显式3D几何建模 抽象预测编码
优势 视觉完成度极高,空间结构清晰可编辑 对物理规律理解更深,因果推断能力更强
局限 复杂物理因果推理能力仍需加强 3D生成细节不如前者丰富
代表产品 Marble / SpatialLM Meta V-JEPA
核心哲学 “先建模,再理解” “先理解,再建模”

当前技术局限:长距离探索时可能出现视觉“幻觉”(场景一致性下降),对复杂物理交互(如流体、碰撞、变形)的理解仍需进化。

五、商业化方向:六大核心场景矩阵

领域 应用场景与价值
🎮 游戏开发 快速生成3D游戏场景与关卡原型,一键导出至Unity/Unreal,提升开发效率数倍
🎬 影视特效 为VFX从业者提供3D世界构建工具,替代部分昂贵的实景搭建,降低制作成本
🏗️ 建筑设计 辅助建筑师快速构建可视化空间与方案迭代,从概念草图到3D呈现大幅提速
🤖 机器人训练 提供物理正确的3D仿真环境,为具身智能提供训练数据与测试环境
🥽 AR/VR 为元宇宙与空间计算提供“内容创世引擎”,降低3D内容生产门槛
🔬 科学发现 三维推理与科学模拟,应用于材料科学、药物分子结构分析等领域

🤝 生态合作里程碑:Autodesk领投2亿美元后,双方计划将World Labs的AI模型与Autodesk的CAD软件深度整合,共同探索建筑、工程和娱乐领域的新型应用场景。

六、战略对比:李飞飞 vs 群核科技——中美空间智能双雄

有趣的是,中美两家“空间智能”领军者在战略方向上高度一致,但实现路径各有千秋:

维度 World Labs(李飞飞) 群核科技(黄晓煌)
核心概念 空间智能 + 世界模型 空间智能
底层模型 世界模型(Marble) SpatialLM + SpatialGen
产品形态 3D世界生成工具(Marble + Forge) 酷家乐/Coohom + SpatialVerse + SpatialTwin
商业模式 to Creator(游戏/影视/建筑/开发者) to B(设计SaaS + 工业孪生 + 机器人训练)
技术路线 显式3D建模 + 生成式世界模型 空间编辑工具 → 海量数据 → 大模型飞轮
资本背景 硅谷明星VC + 英伟达/AMD/欧特克产业资本 港交所上市 + 产业资本

本质区别

  • World Labs = 底层世界模型 + 消费级/创意工具(定位更接近“3D领域的OpenAI”)
  • 群核科技 = 设计软件SaaS + 数据飞轮 + 产业应用(定位更像“Autodesk + World Labs的结合体”,从产业端切入向上游模型层渗透)

七、总结:空间智能,AI的下一个“iPhone时刻”?

李飞飞的空间智能愿景,可以用一句话概括:

“让AI从‘会说’进化到‘会做’,从‘理解文字’进化到‘理解世界’。”

从ImageNet让AI“看见”,到World Labs让AI“理解空间”,李飞飞始终在推动AI与物理世界的深度连接。

而World Labs的50亿美元估值,不仅仅是对一家公司的认可,更是整个资本市场对**“空间智能与世界模型是AI下一个主战场”** 这一判断的集体投票。

🔮 未来展望:据市场研究数据,Spatial AI市场预计从2026年的46亿美元增长至2032年的142亿美元,年复合增长率达17.5%。随着World Labs、群核科技、Meta、Google DeepMind等玩家的全面入局,空间智能赛道正在迎来爆发前夜。

写在最后

如果说LLM是AI的“大脑”,那么空间智能就是AI的“身体”和“手”。没有空间智能,AI将永远无法真正走进工厂、走进家庭、走进物理世界的每一个角落。

李飞飞正在做的,就是给AI装上这具“身体”——而World Labs的征程,才刚刚开始。

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐