具身 AI 世界模型综述,提出三轴分类体系(功能性/时序建模/空间表示),覆盖机器人/自动驾驶/通用视频三大领域,2025年10月。
核心贡献
为具身 AI 中的世界模型建立统一框架,解决该领域缺乏系统性分类和对比的问题。
三轴分类体系(Taxonomy)
轴1:功能性(Functionality)
| 类型 | 说明 |
|---|---|
| Decision-Coupled(决策耦合型) | 世界模型与决策/控制紧耦合,模型预测直接驱动 Agent 行动 |
| General-Purpose(通用型) | 世界模型与下游任务解耦,专注于通用环境动态建模 |
轴2:时序建模(Temporal Modeling)
| 类型 | 说明 | 代表方法 |
|---|---|---|
| Sequential Simulation & Inference | 自回归/循环结构,逐步预测 | RNN、Autoregressive |
| Global Difference Prediction | 全局预测状态变化 | Global Prediction、Masked JEPA |
轴3:空间表示(Spatial Representation)
- Global Latent Vector:全局潜向量
- Token Feature Sequence:Token 序列(Transformer 友好)
- Spatial Latent Grid:空间潜格(保留位置信息)
- Decomposed Rendering Representation:分解渲染表示(如 NeRF/3DGS)
覆盖领域
- 机器人:操作任务、导航
- 自动驾驶:场景预测、规划
- 通用视频:视频生成与理解
评估维度
- Pixel Generation:像素预测质量(FID/FVD 等)
- Scene Understanding:状态级理解
- Control Tasks:下游控制任务性能
核心挑战(Open Challenges)
- 数据与评估:缺乏统一数据集;评估指标应关注物理一致性而非像素保真度
- 计算效率:高性能模型与实时控制所需计算效率之间的 trade-off
- 建模策略:长时域时序一致性 + 误差累积抑制
与相关工作的关系
- papers/latent-spatial-memory 是本综述中 General-Purpose × Spatial Latent Grid 方向的具体工作
- triposg、triposr 属于 Decomposed Rendering Representation 子类(3D Gaussian / implicit representation)
- agent-continual-learning 与本文 Decision-Coupled 世界模型的在线学习需求高度相关
作者
Xinqing Li, Xin He, Le Zhang, Min Wu, Xiaoli Li, Yun Liu(南开大学/天津理工大学/电子科技大学)
资源
- 论文:https://arxiv.org/abs/2510.16732
- HTML 全文:https://arxiv.org/html/2510.16732v1
- 参考文献列表:论文末尾维护的精选文献库
- 代码:暂未公开
From
功能维度上,世界模型呈现决策耦合与通用目的的分野。决策耦合模型与下游任务深度绑定,在特定领域数据上训练,以实时高效的控制为目标,代表如覆盖800+任务的DreamerV3、自动驾驶MILE、机器人操作ManiGaussian。通用目的模型则在大规模无标注数据上预训练通用物理规律,以跨域泛化为核心优势,典型如Sora、V-JEPA 2,但存在训练成本高、通用表示与具体决策衔接难的问题。
时间建模维度,核心是序列模拟与全局预测的权衡。序列模拟采用自回归方式逐帧推演,结构紧凑、样本效率高且天然支持闭环控制,从早期RNN到如今的Transformer 状态空间模型(TSSM)、状态空间模型(SSM)如 Mamba均属此类,但存在长时序误差累积的致命缺陷。全局差异预测并行估计完整未来序列,通过全局约束缓解误差,以JEPA系列为代表,却难以适配需要逐步决策的控制场景,当前研究正朝着融合两者优势的方向推进。
空间表示维度,呈现从低维抽象到高维几何的进化路径。全局隐向量计算高效但丢失细粒度空间信息,是早期模型的主流选择。令牌特征序列依托Transformer与LLM技术,成为当前跨模态建模的主流。空间隐网格凭借BEV、体素等几何先验,在自动驾驶领域广泛应用;分解渲染表示则基于3D 高斯溅射(3DGS)和神经辐射场(NeRF)等技术,通过可微渲染实现视角一致、物理可信的高保真预测,是当前最前沿的研究方向。