世界模型入门:从视频生成到物理推理,理解 AI 如何建模现实
厘清概念、分类与评估方法,揭示世界模型在具身智能与视频生成中的核心挑战
世界模型入门:从视频生成到物理推理,理解 AI 如何建模现实
厘清概念、分类与评估方法,揭示世界模型在具身智能与视频生成中的核心挑战
世界模型是当前 AI 最热门的术语之一,但概念混乱、评估标准不一。本文从定义出发,梳理世界模型的三种类型——渲染器、模拟器和规划器,介绍 AdaJEPA 等自适应模型与 LingBot-World 2.0 等实时交互系统的技术突破,并重点解读以 MemoBench 为代表的评测框架。文章还讨论了世界模型在机器人、自动驾驶、游戏等领域的应用,以及评估中容易被忽视的“记忆”与“因果推理”能力。
引言:世界模型为何成为 AI 新焦点
过去两年,“世界模型”从学术圈的小众概念一跃成为 AI 行业最热门的标签。视频生成公司宣称自己的模型是“世界模拟器”,机器人团队将世界模型视为具身智能的核心组件,自动驾驶、游戏引擎、3D 生成等领域也纷纷向这个词靠拢。热钱涌入——Yann LeCun 的 AMI 实验室融资 10.3 亿美元,李飞飞的 World Labs 融资超 10 亿美元——但概念却越来越模糊。
正如李飞飞近期撰文指出的,“世界模型”已成为当今 AI 领域最被过度使用的术语之一。不同的系统被冠以同一个名字,但它们实际解决的是完全不同的问题:有的渲染像素,有的模拟物理,有的规划行动。这种混乱阻碍了技术交流、评估和落地。
本文旨在为中文开发者提供一份清晰、深入的世界模型入门指南。我们将从核心定义出发,梳理世界模型的不同类型与技术路线,介绍代表性系统与评估方法,最后讨论当前瓶颈与未来方向。
什么是世界模型?核心定义与边界
从强化学习循环理解世界模型
要理解世界模型,最好的起点是强化学习中的经典循环:Agent 采取行动 → 行动影响世界状态 → Agent 接收观测 → 循环往复。世界模型正是对这个循环中“状态预测”环节的建模。
更正式地说,世界模型是一种交互式预测模型,它根据动作来模拟时空环境。给定当前状态 s(t) 和动作 a(t),世界模型预测下一个状态 s(t+1)。这与视频生成模型有本质区别:视频模型预测的是 P(x(t+1) | x(t)),即下一帧像素的概率分布;而世界模型预测的是 P(s(t+1) | s(t), a(t)),即下一个世界状态,其中 a(t) 是关键——模型必须对用户的干预做出响应。
李飞飞的分类:渲染器、模拟器与规划器
李飞飞在其文章中提出了一个简洁而有力的分类框架,将当前被称为“世界模型”的系统分为三类:
这三类并非互斥,一个完整的智能系统可能需要三者协同。但这种分类帮助我们看清:当不同团队说“我们在做世界模型”时,他们可能在做完全不同的事情。
世界模型 vs 视频生成模型:关键区别
许多人将世界模型等同于视频生成模型,这是一个常见的误解。两者的核心区别在于:
当然,边界正在模糊。Runway 的 GWM-1 从视频生成起步,但已加入交互控制;Google DeepMind 的 Genie 3 基于 Veo 构建,目标是可交互的游戏世界。这些系统正在从渲染器向模拟器演进。
世界模型的技术路线与代表性系统
基于潜态预测的 JEPA 范式
Yann LeCun 提出的联合嵌入预测架构(JEPA)是世界模型领域的重要范式。其核心思想是:不在像素空间做预测,而是将观测编码到紧凑的潜空间,在潜空间学习环境动力学。
JEPA 由三个组件构成:
训练时,模型基于无奖励的离线轨迹优化潜态预测损失(如均方误差),无需像素级重建。测试时,搭配模型预测控制(MPC)完成规划:MPC 基于模型推演未来状态,优化动作序列,执行首个动作,然后基于新观测重新规划。
AdaJEPA:测试时自适应世界模型
杨立昆团队提出的 AdaJEPA 解决了传统 JEPA 在测试分布偏移下性能崩溃的问题。传统世界模型训练后参数冻结,一旦环境发生变化(如光照、摩擦力、物体外观),预测误差会沿规划时域累积,导致规划失败。
AdaJEPA 的核心创新是在 MPC 闭环内执行测试时自适应:
该方案极其轻量化:每轮仅执行 1 次梯度更新,单轮仅增加 0.01~0.03 秒延迟。在 PushT、PointMaze 等基准上,AdaJEPA 在分布外任务中大幅提升规划成功率,尤其在训练数据稀缺时效果显著。
AdaJEPA 的局限在于:自适应效果受预训练表征覆盖范围约束,对于完全陌生的底层特征无法彻底修复。未来可结合持续学习拓展模型的环境适配能力。
LingBot-World 2.0:实时交互世界模型
如果说 AdaJEPA 代表了世界模型在“自适应”方向的突破,那么 LingBot-World 2.0 则展示了“实时交互”的可能性。这个由中国团队打造的系统,首次实现了小时级、720p/60fps 的实时交互世界生成。
其核心技术架构是“教师-学生”两阶段设计:
LingBot-World 2.0 还引入了“Agentic Harness”——一套“大脑-小脑”协同架构:
这使得世界不再是被动的——你不操作,它也会自己演化:天气会变,角色会动,新事件会不请自来。
MoWorld:国产全栈实时世界模型
魔芯科技联合浙江大学、华为推出的 MoWorld,是首个全栈基于国产 NPU 的实时交互世界模型。其核心亮点在于:
MoWorld 采用 MoE(混合专家)架构,14B 参数。在数据层面,它构建了包含相机轨迹、空间深度等三维信息的可扩展数据生产体系。在系统层面,针对国产 NPU 硬件特点,引入超密集注意力并行和长序列 Token 并行策略。
MoWorld 已经在游戏娱乐、具身智能训练、影视创作、数字孪生等场景展开应用,展示了世界模型从“技术验证”走向产业落地的路径。
世界模型的评估:从视觉质量到决策价值
当前评估的盲区:只测“看起来像”,不测“决策上可信”
随着世界模型概念泛化,评估问题变得格外突出。南京大学团队近期发布的立场论文指出,当前评估实践存在严重的能力主张与评估证据之间的落差:
7 级评估阶梯
南京大学团队提出了从 L0 到 L7 的评估阶梯,覆盖从表面生成质量到真实决策价值的不同层次:
对于面向具身决策的世界模型,L4 到 L7 的评估证据强度更高,也更接近模型在真实系统中的作用方式。
MemoBench:检验世界模型的“记忆”能力
哈佛大学、MIT 等机构提出的 MemoBench 基准,专门针对世界模型的一个核心能力——物体恒存(object permanence)——进行评测。
MemoBench 采用“可见-消失-重现”三段式范式:
基准包含 360 段高质量视频(合成 + 真实世界),覆盖溶解、燃烧、化学反应等多种物理变化。评测结果令人警醒:
MemoBench 揭示了一个关键洞察:生成画面逼真 ≠ 真正理解世界。当前模型即使能生成视觉上完全连贯的画面,也几乎无法在物体重新出现时正确恢复它在“消失期间”本该经历的状态变化。
应用场景与产业落地
具身智能与机器人
世界模型为机器人提供了“内部推演”能力:在行动前,模型可以模拟不同动作的后果,评估成功概率,选择最优策略。这比传统的“感知-规划-执行”流水线更灵活、更鲁棒。
AdaJEPA 在 PushT 和 PointMaze 任务上的成功表明,自适应世界模型可以大幅提升机器人在分布外场景中的规划成功率。而 MoWorld 等实时模型则可以作为低成本、高保真的“数字演练场”,让机器人在虚拟世界中学习如何与现实环境交互。
自动驾驶
自动驾驶是世界模型的重要应用场景。世界模型可以:
目前,Wayve、Waymo 等公司都在探索基于世界模型的自动驾驶方案。实时性和因果保真度是主要挑战。
游戏与虚拟世界
LingBot-World 2.0 和 MoWorld 展示了世界模型在游戏领域的巨大潜力:实时生成可交互的开放世界,支持 6 自由度相机控制,甚至允许用户通过文本注入事件。这有望改变游戏开发的方式——从“预先设计一切”转向“让世界自己生长”。
影视创作与数字孪生
世界模型可以用于影视预演:创作者在生成的虚拟世界中调整视角、预览效果、编辑镜头。在数字孪生领域,MoWorld 生成的视频具有超越行业的几何一致性,可直接用于室内场景的三维重建。
挑战与未来方向
长时漂移与记忆问题
即使是最先进的世界模型,在长时间生成中仍面临漂移问题:物体扭曲、细节塌陷、场景结构崩坏。MemoBench 进一步揭示,模型甚至无法在简单的“消失-重现”场景中维持物体的身份和状态。
解决思路包括:
计算效率与实时性
世界模型需要实时交互,这对计算效率提出了极高要求。MoWorld 通过国产 NPU 优化实现了 50 FPS,但更大规模、更高分辨率的实时生成仍需突破。蒸馏、量化、并行策略是主要优化方向。
评估标准的统一
当前世界模型评估标准混乱,不同论文使用不同指标,难以横向比较。建立统一的、面向决策价值的评估框架(如 7 级评估阶梯)是当务之急。
从“生成”到“理解”的跨越
世界模型的终极目标不是生成好看的视频,而是帮助智能系统理解世界的因果结构。这需要模型从“像素级预测”转向“状态级推理”,从“统计关联”转向“因果建模”。
FAQ
世界模型和视频生成模型有什么区别? 视频生成模型预测下一帧像素 P(x(t+1) | x(t)),世界模型则基于动作预测下一状态 P(s(t+1) | s(t), a(t))。核心区别在于交互性——世界模型必须对用户的动作做出响应,并建模动作与后果之间的因果关系。
为什么世界模型需要测试时自适应? 传统世界模型训练后参数冻结,一旦测试环境发生变化(如光照、摩擦力、物体外观),预测误差会累积导致规划失败。测试时自适应允许模型在部署过程中基于交互数据持续校准,提升在分布外场景中的鲁棒性。
当前世界模型的主要瓶颈是什么? 主要有三点:1)长时漂移——长时间生成中物体和场景会逐渐失真;2)物体恒存能力弱——物体离开视野后无法正确恢复其状态;3)计算效率——实时交互需要高帧率低延迟,对硬件要求高。
如何评估一个世界模型的好坏? 应超越传统的视频质量指标。对于面向决策的世界模型,重点评估:动作干预保真度(改变动作是否能引起正确变化)、策略排序一致性(模型对策略优劣的判断是否与真实环境一致)、闭环规划效用(模型进入规划器后能否提升决策质量)。
世界模型在具身智能中扮演什么角色? 世界模型为机器人提供“内部推演”能力——在行动前模拟不同动作的后果,评估成功概率,选择最优策略。它还可以作为低成本、高保真的训练环境,让机器人在虚拟世界中学习。
世界模型的未来发展方向是什么? 主要方向包括:更好的因果建模和记忆机制、更高的计算效率和实时性、统一的评估标准,以及从“像素级预测”向“状态级推理”的跨越。结合持续学习和主动学习,世界模型有望逐步逼近对真实世界因果结构的理解。
参考与延伸阅读
想深入了解相关技术,可参考 AI Agent 与多智能体、模型部署与优化、评估与基准测试 等支柱主题。
相关教程
梳理世界模型(WAM、WVM、LoopWM)与具身智能(VLA、Skill)的最新进展,以及如何评估和落地
从 GeneBench-Pro 到 CJS 框架,系统梳理模型评测基准、安全攻击与对齐技术的全景与深度实践
五层技术堆栈深度拆解,VLA、世界模型、触觉感知与跨本体泛化全解析
系统梳理 AI 安全风险与防护手段,助力开发者构建可靠智能体
从数据架构角度出发,结合 Skill、语义层和知识库,解决 Agent 落地中的指标口径、实时数据和权限等卡点。
追踪收集、评估数据集、A/B 测试与回归检测