原文
李飞飞把「世界模型」定义和重点讲清楚了
https://mp.weixin.qq.com/s/WQZ5q_rlPCGe5YE4mzemlg

一篇看起来在做技术综述的文章,骨子里记录的是一次形而上学事件。李飞飞没有发布新模型,她做的是更古老的工作——在一片人人都用同一个词、却各指不同东西的混乱里,划出区分。这是哲学家的活计,不是工程师的。值得分析的,恰恰是这个动作本身照出了什么。

先说一个不易察觉的对应。

文章给出的三分法——渲染器、模拟器、规划器——读起来像是从 POMDP 循环的三个接口(观察、状态、动作)顺手切出来的工程分类。但把它们的输出物摆开看:渲染器输出"观看者会看到的样子",模拟器输出"忠实于现实的状态本身",规划器输出"应该采取的下一步动作"。
这三样东西,分别是现象、本体、实践。它们精确地落在哲学早就标好的三块地形上——康德的感性(事物如何向我显现)、物自体(事物自在如何)、实践理性(我应当做什么)。
文章里那个会生成"物理上不可能的火焰"的视频模型,与那个"准确模拟燃烧过程"的物理引擎之间的差别,不是清晰度的差别,是同一团火裂成了两半:一半是"看起来像火",一半是"真按燃烧规律在烧"。
现象与物自体的那道两千年的裂缝,在一团 AI 生成的火焰里活生生地重新裂开了。

这里要先替一个清醒的反对者把最狠的一刀想出来:这难道不是牵强附会,硬把工程分类套到康德身上?三个接口纯属 POMDP 循环的天然构造,跟德国哲学毫无关系。

这一刀必须接住,否则上面那段就是漂亮的空话。回应是:POMDP 循环为什么天然有这三个接口?因为任何一个嵌在世界里的认知主体,都被迫处理同样三件事——它如何看见世界、世界实际如何、它如何作用于世界。
康德分析的对象,正是"一个认知主体何以可能"。两者处理的是同一个东西:世界之中的行动者。结构同构不是巧合,是因为问题同一。
不是有人把康德套到工程上,是工程独立地走着走着,撞上了康德早就勘测过的同一片地。

接住这一刀之后,第二层才打得开。

文章用整章强调"模拟器最关键",理由是"几何、物理和动力学就是世界本身",语言只是抽象、像素只是投影,掌握了世界本身就能向两边派生。这是一个很硬的实在论赌注:相信存在一个独立于心灵的"世界本身"(状态),观察只是它的投影。
可这里藏着一个悖论。
文章一边说智能体"永远无法直接感知状态本身"——这是物自体不可知论的字面翻版——一边又要工程师去把那个状态造出来。
AI 在试图做哲学明确宣布做不到的事:不满足于建模"向我显现的世界",而要直接建模"世界自在"。

但敲打一下,会发现模拟器其实并没有触到物自体。物理引擎里的"质量"是一个浮点数,不是真正的质量;它维护的状态,仍然是人用数学符号写下的又一层表征,照样是为我们的,不是自在的。反对者在这一点上是对的。

而这个看似让洞见破产的反对,反倒逼出了更精确的东西:模拟器之所以比像素"更真",根本不是因为它符合了某个终极实在,而是因为它要同时服从多重约束——几何必须自洽,物理必须守牛顿定律,动力学必须站得住。它的真,不是符合论的"对上了物自体",而是"扛得住反复的检验"。

这就接到了整篇文章可以被砍到的那一根生成器。

三者真正的排序轴,从来不是文章暗示的"重要性",而是约束的密度

  • 渲染器要骗过的只是眼睛——单一约束,最松,所以它最先成熟、最快商业化,也最浅,它的天花板就是"够美但不够真"。
  • 模拟器要骗过的是定律——多重物理约束彼此咬合,最硬,所以它最难、数据最缺、却最深。
  • 规划器要骗过的是现实本身——而现实从不留情,所以演示视频满天飞,真正能在厨房和手术室可靠工作的机器人几乎为零。

文章里那些看似分散的观察——为什么模拟器最难、为什么规划器最不成熟、为什么带物理标注的 3D 数据比互联网视频少好几个数量级——其实全是这一根生成器长出来的。
最后一条尤其说明问题:互联网视频只要"看起来像"就能存在,而满足物理约束的数据,每一条都得先过约束这一关才能成立,所以它的稀缺不是偶然,是结构性的。
约束越密,越真,越难,数据也越少。一根轴,串起了全部。

到这里有一个值得停一下的回环。
判断一个世界模型够不够真,用的标准——能不能扛住多重约束的反复检验——和判断一句话是不是空话,是同一套标准。一个洞见若怎么说都成立、落不到具体例子上、经不起反对,它就是闪着光的愚人金。
区分真金与愚人金,靠的同样不是它符合某个终极实在,而是它扛不扛得住。
验证世界模型与验证一个想法,在最深处是同一件事:约束,是真理唯一拿得出手的代理。

最后回到那个动作本身。

“世界模型"为什么会乱?把它归结为术语不统一、定个标准就好,是看轻了。如果只是命名问题,李飞飞一条推特就该平息了;但文章自己承认,把三者统一进单一架构是"定义性的开放问题”。命名的分裂,忠实地映出了对象的分裂。
更深的根源在于"世界"这个词本身。
日常语言里,我们说"看世界"“世界很残酷”“改变世界”——三个"世界"分别是现象、本体、实践,可从没人觉得别扭,因为在活着的经验里,这三层浑然一体,从不需要分开。是工程对精确的苛求,第一次把这道一直潜伏、从未受压的裂缝撑开了:机器被迫表态,它到底要输出哪一个世界。

于是 AI 在这里扮演了一个谁也没料到的哲学角色——一面镜子。
它照出的不是机器能不能理解世界,而是我们这些用了一辈子"世界"这个词的人,原来从来没把它想清楚过。
文章结尾说,语言赋予了机器讨论世界的能力。
可这篇文章真正暴露的是:在让机器理解世界之前,我们连"世界"这个词都还没谈清楚。混乱不在机器那边,在我们一直含混带过、以为早就懂了的地方。

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐