“AI教母”李飞飞的终极野望:从ImageNet到World Labs,她用50亿美金估值定义空间智能的下一个十年
🧠 “AI教母”李飞飞的终极野望:从ImageNet到World Labs,她用50亿美金估值定义空间智能的下一个十年
摘要:李飞飞提出AI五大进化方向:空间智能、具身智能、世界模型、从看到做、以人为本。她创办的World Labs仅用16个月即完成10亿美元融资,估值达50亿美元。本文深度解析李飞飞的AI世界观、World Labs的技术路线与产品矩阵,以及这场“世界模型大战”背后的产业变革。(全文约3800字,阅读需12分钟)
标签:#李飞飞 #WorldLabs #空间智能 #具身智能 #世界模型 #Marble #AGI #3D生成

一、引言:那个让AI“看见”的女人,正在让AI“理解”整个物理世界
2009年,她带领团队耗时三年手工标注了1400万张图片,打造出改变AI历史的ImageNet——这个数据集直接催生了2012年的AlexNet和随后的深度学习革命,让AI第一次真正“看见”世界。
她就是李飞飞(Fei-Fei Li) ,斯坦福大学终身教授、前Google Cloud AI首席科学家、被全球科技界尊称为“AI教母”的传奇人物。
当全世界还在为大语言模型(LLM)的参数规模和文字生成能力狂欢时,李飞飞抛出了一个更宏大、更具颠覆性的命题:
“若AI无法理解物体的深度、距离、遮挡与重力,就永远无法真正‘具身’。”
在CES 2026的演讲中,她用一个绝妙的比喻道破LLM的根本局限:“一只苍蝇没有万亿级参数,却能在杂乱空间中极速避障、精准着陆。 ”她笃定地告诉世界:大语言模型终究受制于语言本身,无法通往AGI,空间智能才是最优路径。
本文将从李飞飞的AI五大发展方向切入,深度拆解她为此创办的World Labs公司的技术路线、产品矩阵与资本布局。
二、李飞飞的AI五大进化方向
2.1 方向一:空间智能(Spatial Intelligence)
核心判断:当前大语言模型本质上是“在黑暗中工作的文字匠人”——能言善辩却缺乏经验,知识渊博却缺乏根基。
从进化论的视角来看,李飞飞提出了一个极具洞察力的观点:感知先于语言。在生物进化史上,视觉感知系统比语言能力早出现了数亿年。空间智能要求AI能够真正理解:
- 三维空间中的位置、关系、结构、拓扑
- 物理世界的深度、遮挡、重力、碰撞、材质属性
- 从2D图像/文字到3D世界的映射推理与物理一致性保持
2.2 方向二:具身智能(Embodied Intelligence)
“智能的真正力量不仅仅在于思考,更在于运用思想驱动行动。”
从“被动感知”进化到“主动行动”:
- AI看到桌上快掉落的杯子 → 不仅识别出“这是杯子”
- 而是产生 “快伸手抓住它” 的行动冲动与运动规划
- 在数字或物理的3D空间中具备创造、理解、推理和交互的完整能力闭环
2.3 方向三:世界模型(World Models)
世界模型是一种新型生成模型,其核心是构建对真实/虚拟环境的物理基础理解:
- 理解、推理并交互于语义、物理、几何、动态四个维度
- 远超现有LLM纯文本处理的范畴
- 被广泛认为是通往AGI的必由之路
💡 “世界模型”与LLM的根本区别:LLM在文字符号空间中操作,而世界模型要求在三维物理空间中操作——这不仅是维度的增加,更是智能范式的根本转变。
2.4 方向四:从“看到做”(From Seeing to Doing)
李飞飞用阶梯理论描述AI的进化路径:
🧗 AI智能进化阶梯:
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
第1层:感知(Perception) — 计算机识别“这是什么”
第2层:理解(Understanding) — 场景图、关系推理、因果推断
第3层:生成(Generation) — 扩散模型生成2D图片/视频
第4层:交互(Interaction) — AI与世界实时互动 ← 我们正站在这一层的门槛上
2.5 方向五:以人为本的AI(Human-Centered AI)
在技术乐观主义盛行的硅谷,李飞飞同时挑战了对AGI的过度痴迷:
- AI发展应以人类福祉为中心
- 关注AI解决现实社会问题的潜力(医疗健康、农业制造、教育公平)
- 而非单纯追求通用人工智能的技术指标和参数规模竞赛
李飞飞在访谈中透露,World Labs的目标是让空间智能技术真正进入医疗健康、农业制造等各个垂直行业。“希望在2026年,我们能看到拥有了空间智能的AI,真正走出屏幕,与物理世界产生美妙的交互”。
三、World Labs:全球首个空间智能“世界模型”公司
3.1 基本信息与融资历程
| 项目 | 详情 |
|---|---|
| 成立时间 | 2024年初成立,2024年9月正式公开亮相 |
| 联合创始人 | Justin Johnson(前Meta/密歇根大学教授)、Ben Mildenhall(NeRF技术的发明者之一)、Christoph Lassner(3D图形学专家) |
| 总融资 | 2024年成立之初融超2.3亿美元;2026年2月完成10亿美元新一轮融资 |
| 估值 | 投后估值约50亿美元,跻身全球AI独角兽前列 |
| 投资方 | 由设计软件巨头Autodesk领投2亿美元,NVIDIA、AMD罕见联手参投,其他参与者包括a16z、NEA、Fidelity、Emerson Collective |
| 定位 | 全球首个专注“空间智能”与“世界模型”的基础设施公司 |
📈 估值增长:从2024年的10亿美元估值到2026年的50亿美元,不到两年翻了5倍。作为对比,Anthropic花了25个月才达到50亿美元估值。
3.2 核心产品:Marble(大理石)—— 一张图生成一个世界
2025年11月,World Labs正式发布了首款商用世界模型产品Marble,基于领先的生成式3D世界模型技术构建:
输入方式(四选一即可):
- 🗣️ 一句话(自然语言描述)
- 🖼️ 一张图片
- 🎬 一段视频
- 📐 3D布局图/粗略结构框架
输出能力:
- 高保真、可编辑、可探索的3D世界
- 导出格式:高斯斑点(Gaussian Splatting)、Mesh网格、视频等工业标准格式
- 可直接导入Unity、Unreal Engine、游戏引擎和影视后期制作流程
内置AI编辑器:Chisel
Marble是业内首款原生集成AI编辑工具的世界模型,配备混合式3D编辑器:用户可先手动构建空间结构框架(如墙体、体块或平面),再由AI填充视觉细节。这一设计将“人的创意控制”与“AI的高效生成”有机结合。
# Marble工作流程概念示例
input = "一个阳光充足的现代客厅,落地窗外是海景,有米色布艺沙发和原木茶几"
scene = marble.generate(input) # 一步生成3D世界
scene.edit("把沙发换成深蓝色天鹅绒材质") # 自然语言交互式编辑
scene.expand("延伸到阳台区域") # 场景扩展
scene.export(format="gaussian_splat") # 导出为高斯斑点格式
scene.export(format="unity_package") # 直接导入Unity引擎
3.3 开源技术:Forge渲染器
World Labs同步开源的Forge渲染器解决了AI生成3D内容后的实时渲染瓶颈:
- 可在桌面端、低功耗移动设备、XR设备上实时流畅渲染AI生成的复杂3D世界
- 降低了空间智能技术在消费级设备上的部署门槛
- 为开发者生态建设奠定了基础
四、技术路线深度对比:显式3D建模 vs 抽象预测
World Labs的技术路线,与图灵奖得主Yann LeCun的JEPA体系存在本质上的哲学分歧:
| 维度 | World Labs路线 | Yann LeCun JEPA路线 |
|---|---|---|
| 方法 | 显式3D几何建模 | 抽象预测编码 |
| 优势 | 视觉完成度极高,空间结构清晰可编辑 | 对物理规律理解更深,因果推断能力更强 |
| 局限 | 复杂物理因果推理能力仍需加强 | 3D生成细节不如前者丰富 |
| 代表产品 | Marble / SpatialLM | Meta V-JEPA |
| 核心哲学 | “先建模,再理解” | “先理解,再建模” |
当前技术局限:长距离探索时可能出现视觉“幻觉”(场景一致性下降),对复杂物理交互(如流体、碰撞、变形)的理解仍需进化。
五、商业化方向:六大核心场景矩阵
| 领域 | 应用场景与价值 |
|---|---|
| 🎮 游戏开发 | 快速生成3D游戏场景与关卡原型,一键导出至Unity/Unreal,提升开发效率数倍 |
| 🎬 影视特效 | 为VFX从业者提供3D世界构建工具,替代部分昂贵的实景搭建,降低制作成本 |
| 🏗️ 建筑设计 | 辅助建筑师快速构建可视化空间与方案迭代,从概念草图到3D呈现大幅提速 |
| 🤖 机器人训练 | 提供物理正确的3D仿真环境,为具身智能提供训练数据与测试环境 |
| 🥽 AR/VR | 为元宇宙与空间计算提供“内容创世引擎”,降低3D内容生产门槛 |
| 🔬 科学发现 | 三维推理与科学模拟,应用于材料科学、药物分子结构分析等领域 |
🤝 生态合作里程碑:Autodesk领投2亿美元后,双方计划将World Labs的AI模型与Autodesk的CAD软件深度整合,共同探索建筑、工程和娱乐领域的新型应用场景。
六、战略对比:李飞飞 vs 群核科技——中美空间智能双雄
有趣的是,中美两家“空间智能”领军者在战略方向上高度一致,但实现路径各有千秋:
| 维度 | World Labs(李飞飞) | 群核科技(黄晓煌) |
|---|---|---|
| 核心概念 | 空间智能 + 世界模型 | 空间智能 |
| 底层模型 | 世界模型(Marble) | SpatialLM + SpatialGen |
| 产品形态 | 3D世界生成工具(Marble + Forge) | 酷家乐/Coohom + SpatialVerse + SpatialTwin |
| 商业模式 | to Creator(游戏/影视/建筑/开发者) | to B(设计SaaS + 工业孪生 + 机器人训练) |
| 技术路线 | 显式3D建模 + 生成式世界模型 | 空间编辑工具 → 海量数据 → 大模型飞轮 |
| 资本背景 | 硅谷明星VC + 英伟达/AMD/欧特克产业资本 | 港交所上市 + 产业资本 |
本质区别:
- World Labs = 底层世界模型 + 消费级/创意工具(定位更接近“3D领域的OpenAI”)
- 群核科技 = 设计软件SaaS + 数据飞轮 + 产业应用(定位更像“Autodesk + World Labs的结合体”,从产业端切入向上游模型层渗透)
七、总结:空间智能,AI的下一个“iPhone时刻”?
李飞飞的空间智能愿景,可以用一句话概括:
“让AI从‘会说’进化到‘会做’,从‘理解文字’进化到‘理解世界’。”
从ImageNet让AI“看见”,到World Labs让AI“理解空间”,李飞飞始终在推动AI与物理世界的深度连接。
而World Labs的50亿美元估值,不仅仅是对一家公司的认可,更是整个资本市场对**“空间智能与世界模型是AI下一个主战场”** 这一判断的集体投票。
🔮 未来展望:据市场研究数据,Spatial AI市场预计从2026年的46亿美元增长至2032年的142亿美元,年复合增长率达17.5%。随着World Labs、群核科技、Meta、Google DeepMind等玩家的全面入局,空间智能赛道正在迎来爆发前夜。
写在最后
如果说LLM是AI的“大脑”,那么空间智能就是AI的“身体”和“手”。没有空间智能,AI将永远无法真正走进工厂、走进家庭、走进物理世界的每一个角落。
李飞飞正在做的,就是给AI装上这具“身体”——而World Labs的征程,才刚刚开始。
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐




所有评论(0)