EN

世界模型入门:从视频生成到物理推理,理解 AI 如何建模现实

厘清概念、分类与评估方法,揭示世界模型在具身智能与视频生成中的核心挑战

返回教程列表
进阶25 分钟

世界模型入门:从视频生成到物理推理,理解 AI 如何建模现实

厘清概念、分类与评估方法,揭示世界模型在具身智能与视频生成中的核心挑战

世界模型是当前 AI 最热门的术语之一,但概念混乱、评估标准不一。本文从定义出发,梳理世界模型的三种类型——渲染器、模拟器和规划器,介绍 AdaJEPA 等自适应模型与 LingBot-World 2.0 等实时交互系统的技术突破,并重点解读以 MemoBench 为代表的评测框架。文章还讨论了世界模型在机器人、自动驾驶、游戏等领域的应用,以及评估中容易被忽视的“记忆”与“因果推理”能力。

引言:世界模型为何成为 AI 新焦点

过去两年,“世界模型”从学术圈的小众概念一跃成为 AI 行业最热门的标签。视频生成公司宣称自己的模型是“世界模拟器”,机器人团队将世界模型视为具身智能的核心组件,自动驾驶、游戏引擎、3D 生成等领域也纷纷向这个词靠拢。热钱涌入——Yann LeCun 的 AMI 实验室融资 10.3 亿美元,李飞飞的 World Labs 融资超 10 亿美元——但概念却越来越模糊。

正如李飞飞近期撰文指出的,“世界模型”已成为当今 AI 领域最被过度使用的术语之一。不同的系统被冠以同一个名字,但它们实际解决的是完全不同的问题:有的渲染像素,有的模拟物理,有的规划行动。这种混乱阻碍了技术交流、评估和落地。

本文旨在为中文开发者提供一份清晰、深入的世界模型入门指南。我们将从核心定义出发,梳理世界模型的不同类型与技术路线,介绍代表性系统与评估方法,最后讨论当前瓶颈与未来方向。

什么是世界模型?核心定义与边界

从强化学习循环理解世界模型

要理解世界模型,最好的起点是强化学习中的经典循环:Agent 采取行动 → 行动影响世界状态 → Agent 接收观测 → 循环往复。世界模型正是对这个循环中“状态预测”环节的建模。

更正式地说,世界模型是一种交互式预测模型,它根据动作来模拟时空环境。给定当前状态 s(t) 和动作 a(t),世界模型预测下一个状态 s(t+1)。这与视频生成模型有本质区别:视频模型预测的是 P(x(t+1) | x(t)),即下一帧像素的概率分布;而世界模型预测的是 P(s(t+1) | s(t), a(t)),即下一个世界状态,其中 a(t) 是关键——模型必须对用户的干预做出响应。

李飞飞的分类:渲染器、模拟器与规划器

李飞飞在其文章中提出了一个简洁而有力的分类框架,将当前被称为“世界模型”的系统分为三类:

类型输出核心能力典型代表

渲染器观测(像素)视觉保真度Sora, Veo 3, Kling 模拟器状态(几何/物理)结构精确性NVIDIA Omniverse, MoWorld 规划器行动决策支持VLA 模型, AdaJEPA

  • 渲染器输出的是供人眼观看的像素,核心指标是视觉保真度。视频生成模型属于此类,它们能生成美轮美奂的画面,但无法保证物理精确性——你无法在 Sora 生成的视频中“驾驶”汽车,因为那只是像素的流动。
  • 模拟器输出的是世界的结构化表征——几何、物理、动力学。它们可以被计算机程序用于计算和交互,是连接像素与行动的结构性脊梁。NVIDIA Omniverse 和魔芯科技的 MoWorld 属于此类。
  • 规划器输出的是行动序列。给定观测和目标,规划器回答“下一步该做什么”。视觉-语言-行动模型(VLA)和基于模型的控制系统属于此类。
  • 这三类并非互斥,一个完整的智能系统可能需要三者协同。但这种分类帮助我们看清:当不同团队说“我们在做世界模型”时,他们可能在做完全不同的事情。

    世界模型 vs 视频生成模型:关键区别

    许多人将世界模型等同于视频生成模型,这是一个常见的误解。两者的核心区别在于:

  • 交互性:世界模型必须支持动作输入,并基于动作改变预测结果。视频模型只是单向生成。
  • 因果性:世界模型建模的是“因为做了 A,所以发生 B”的因果链条,而视频模型只学习“通常接下来会发生什么”的统计关联。
  • 状态持久性:世界模型需要在视野外维护物体的状态(物体恒存),视频模型没有这种要求。
  • 当然,边界正在模糊。Runway 的 GWM-1 从视频生成起步,但已加入交互控制;Google DeepMind 的 Genie 3 基于 Veo 构建,目标是可交互的游戏世界。这些系统正在从渲染器向模拟器演进。

    世界模型的技术路线与代表性系统

    基于潜态预测的 JEPA 范式

    Yann LeCun 提出的联合嵌入预测架构(JEPA)是世界模型领域的重要范式。其核心思想是:不在像素空间做预测,而是将观测编码到紧凑的潜空间,在潜空间学习环境动力学。

    JEPA 由三个组件构成:

  • 感官编码器 ε_s:将高维观测映射到潜态 z
  • 动作编码器 ε_a:将动作映射到潜态 u
  • 动力学预测器 f:基于当前潜态和动作预测下一潜态
  • 训练时,模型基于无奖励的离线轨迹优化潜态预测损失(如均方误差),无需像素级重建。测试时,搭配模型预测控制(MPC)完成规划:MPC 基于模型推演未来状态,优化动作序列,执行首个动作,然后基于新观测重新规划。

    AdaJEPA:测试时自适应世界模型

    杨立昆团队提出的 AdaJEPA 解决了传统 JEPA 在测试分布偏移下性能崩溃的问题。传统世界模型训练后参数冻结,一旦环境发生变化(如光照、摩擦力、物体外观),预测误差会沿规划时域累积,导致规划失败。

    AdaJEPA 的核心创新是在 MPC 闭环内执行测试时自适应

  • 基于当前模型用 MPC 求解动作序列
  • 执行首个动作,采集环境新观测
  • 将转移样本存入缓冲区,计算潜态预测损失
  • 局部参数单步梯度更新模型(仅微调编码器与预测器末尾少量层)
  • 用更新后的模型重新规划,循环往复
  • 该方案极其轻量化:每轮仅执行 1 次梯度更新,单轮仅增加 0.01~0.03 秒延迟。在 PushT、PointMaze 等基准上,AdaJEPA 在分布外任务中大幅提升规划成功率,尤其在训练数据稀缺时效果显著。

    AdaJEPA 的局限在于:自适应效果受预训练表征覆盖范围约束,对于完全陌生的底层特征无法彻底修复。未来可结合持续学习拓展模型的环境适配能力。

    LingBot-World 2.0:实时交互世界模型

    如果说 AdaJEPA 代表了世界模型在“自适应”方向的突破,那么 LingBot-World 2.0 则展示了“实时交互”的可能性。这个由中国团队打造的系统,首次实现了小时级、720p/60fps 的实时交互世界生成。

    其核心技术架构是“教师-学生”两阶段设计:

  • 教师模型:一个能长时间稳定、可被动作精确控制的因果世界模型。采用 MoBA(双向与自回归混合)注意力掩码,在保证因果性的同时抑制长序列漂移。
  • 学生模型:通过一致性蒸馏和分布匹配蒸馏(DMD)从教师模型蒸馏而来,大幅压缩去噪步数,实现 60fps 实时推理。
  • LingBot-World 2.0 还引入了“Agentic Harness”——一套“大脑-小脑”协同架构:

  • Pilot Agent:负责规划和执行角色行为
  • Director Agent:像隐形导演一样,基于世界状态实时生成新事件与环境元素
  • 这使得世界不再是被动的——你不操作,它也会自己演化:天气会变,角色会动,新事件会不请自来。

    MoWorld:国产全栈实时世界模型

    魔芯科技联合浙江大学、华为推出的 MoWorld,是首个全栈基于国产 NPU 的实时交互世界模型。其核心亮点在于:

  • 推理速度:在国产 NPU 上实现最高 50 FPS 实时推理
  • 部署成本:仅为同规模 GPU 方案的 30%
  • 训练能力:支持 2000 帧的超长训练和推理
  • MoWorld 采用 MoE(混合专家)架构,14B 参数。在数据层面,它构建了包含相机轨迹、空间深度等三维信息的可扩展数据生产体系。在系统层面,针对国产 NPU 硬件特点,引入超密集注意力并行和长序列 Token 并行策略。

    MoWorld 已经在游戏娱乐、具身智能训练、影视创作、数字孪生等场景展开应用,展示了世界模型从“技术验证”走向产业落地的路径。

    世界模型的评估:从视觉质量到决策价值

    当前评估的盲区:只测“看起来像”,不测“决策上可信”

    随着世界模型概念泛化,评估问题变得格外突出。南京大学团队近期发布的立场论文指出,当前评估实践存在严重的能力主张与评估证据之间的落差:

  • 大量研究用视频质量指标(FVD、PSNR、SSIM)评估世界模型
  • 但这些指标只能反映“生成得像不像”,无法回答模型是否真正理解动作与后果的关系
  • 一个能生成逼真视频的模型,可能在动作干预时表现迟钝,无法准确反映动作变化带来的后果
  • 7 级评估阶梯

    南京大学团队提出了从 L0 到 L7 的评估阶梯,覆盖从表面生成质量到真实决策价值的不同层次:

    层级评估内容核心问题

    L0视觉合理性生成结果看起来真实吗? L1已记录未来预测模型能预测日志轨迹的未来片段吗? L2语义对齐符合指令、任务和场景语义吗? L3物理合理性满足基本物理和几何一致性吗? L4动作可控性与干预保真动作变化能否引起正确的任务相关变化? L5奖励、价值与结果保真能否准确预测成功率、奖励和进度? L6策略评估与排序模型对候选策略优劣的判断是否与真实环境一致? L7规划与优化效用模型进入规划器或强化学习闭环后,能否真正提升决策质量?

    对于面向具身决策的世界模型,L4 到 L7 的评估证据强度更高,也更接近模型在真实系统中的作用方式。

    MemoBench:检验世界模型的“记忆”能力

    哈佛大学、MIT 等机构提出的 MemoBench 基准,专门针对世界模型的一个核心能力——物体恒存(object permanence)——进行评测。

    MemoBench 采用“可见-消失-重现”三段式范式:

  • 可见:目标物体在视野内,处于持续物理变化中
  • 消失:相机移动使物体完全离开视野,物理过程继续
  • 重现:相机转回,模型需准确还原物体更新后的状态
  • 基准包含 360 段高质量视频(合成 + 真实世界),覆盖溶解、燃烧、化学反应等多种物理变化。评测结果令人警醒:

  • 所有被测模型的“物体重现分数”均未超过 0.6(满分 1)
  • 最强模型的“记忆连续性”语义得分仅为 55.6 分(满分 100)
  • 常见失败类型包括:物体凭空消失、身份漂移、状态重置、位置跳变、背景幻觉
  • MemoBench 揭示了一个关键洞察:生成画面逼真 ≠ 真正理解世界。当前模型即使能生成视觉上完全连贯的画面,也几乎无法在物体重新出现时正确恢复它在“消失期间”本该经历的状态变化。

    应用场景与产业落地

    具身智能与机器人

    世界模型为机器人提供了“内部推演”能力:在行动前,模型可以模拟不同动作的后果,评估成功概率,选择最优策略。这比传统的“感知-规划-执行”流水线更灵活、更鲁棒。

    AdaJEPA 在 PushT 和 PointMaze 任务上的成功表明,自适应世界模型可以大幅提升机器人在分布外场景中的规划成功率。而 MoWorld 等实时模型则可以作为低成本、高保真的“数字演练场”,让机器人在虚拟世界中学习如何与现实环境交互。

    自动驾驶

    自动驾驶是世界模型的重要应用场景。世界模型可以:

  • 预测其他交通参与者的未来轨迹
  • 评估不同决策的风险
  • 生成极端场景用于训练
  • 在闭环仿真中测试策略
  • 目前,Wayve、Waymo 等公司都在探索基于世界模型的自动驾驶方案。实时性和因果保真度是主要挑战。

    游戏与虚拟世界

    LingBot-World 2.0 和 MoWorld 展示了世界模型在游戏领域的巨大潜力:实时生成可交互的开放世界,支持 6 自由度相机控制,甚至允许用户通过文本注入事件。这有望改变游戏开发的方式——从“预先设计一切”转向“让世界自己生长”。

    影视创作与数字孪生

    世界模型可以用于影视预演:创作者在生成的虚拟世界中调整视角、预览效果、编辑镜头。在数字孪生领域,MoWorld 生成的视频具有超越行业的几何一致性,可直接用于室内场景的三维重建。

    挑战与未来方向

    长时漂移与记忆问题

    即使是最先进的世界模型,在长时间生成中仍面临漂移问题:物体扭曲、细节塌陷、场景结构崩坏。MemoBench 进一步揭示,模型甚至无法在简单的“消失-重现”场景中维持物体的身份和状态。

    解决思路包括:

  • 更好的因果建模(如 JEPA 的潜态预测)
  • 显式的记忆模块(如 LingBot-World 的 Agentic Harness)
  • 测试时自适应(如 AdaJEPA)
  • 计算效率与实时性

    世界模型需要实时交互,这对计算效率提出了极高要求。MoWorld 通过国产 NPU 优化实现了 50 FPS,但更大规模、更高分辨率的实时生成仍需突破。蒸馏、量化、并行策略是主要优化方向。

    评估标准的统一

    当前世界模型评估标准混乱,不同论文使用不同指标,难以横向比较。建立统一的、面向决策价值的评估框架(如 7 级评估阶梯)是当务之急。

    从“生成”到“理解”的跨越

    世界模型的终极目标不是生成好看的视频,而是帮助智能系统理解世界的因果结构。这需要模型从“像素级预测”转向“状态级推理”,从“统计关联”转向“因果建模”。

    FAQ

    世界模型和视频生成模型有什么区别? 视频生成模型预测下一帧像素 P(x(t+1) | x(t)),世界模型则基于动作预测下一状态 P(s(t+1) | s(t), a(t))。核心区别在于交互性——世界模型必须对用户的动作做出响应,并建模动作与后果之间的因果关系。

    为什么世界模型需要测试时自适应? 传统世界模型训练后参数冻结,一旦测试环境发生变化(如光照、摩擦力、物体外观),预测误差会累积导致规划失败。测试时自适应允许模型在部署过程中基于交互数据持续校准,提升在分布外场景中的鲁棒性。

    当前世界模型的主要瓶颈是什么? 主要有三点:1)长时漂移——长时间生成中物体和场景会逐渐失真;2)物体恒存能力弱——物体离开视野后无法正确恢复其状态;3)计算效率——实时交互需要高帧率低延迟,对硬件要求高。

    如何评估一个世界模型的好坏? 应超越传统的视频质量指标。对于面向决策的世界模型,重点评估:动作干预保真度(改变动作是否能引起正确变化)、策略排序一致性(模型对策略优劣的判断是否与真实环境一致)、闭环规划效用(模型进入规划器后能否提升决策质量)。

    世界模型在具身智能中扮演什么角色? 世界模型为机器人提供“内部推演”能力——在行动前模拟不同动作的后果,评估成功概率,选择最优策略。它还可以作为低成本、高保真的训练环境,让机器人在虚拟世界中学习。

    世界模型的未来发展方向是什么? 主要方向包括:更好的因果建模和记忆机制、更高的计算效率和实时性、统一的评估标准,以及从“像素级预测”向“状态级推理”的跨越。结合持续学习和主动学习,世界模型有望逐步逼近对真实世界因果结构的理解。

    参考与延伸阅读

  • AdaJEPA 论文:arXiv:2606.32026
  • MemoBench 论文:arXiv:2606.27537
  • 南京大学世界模型评估立场论文:arXiv:2606.15032
  • 李飞飞世界模型分类文章:https://drfeifei.substack.com/p/a-functional-taxonomy-of-world-models
  • 想深入了解相关技术,可参考 AI Agent 与多智能体模型部署与优化评估与基准测试 等支柱主题。