视频世界模型中的 Latent 空间持久化 3D 记忆,提出 Mirage 框架,生成速度提升 10.57x,显存减少 55x,2026年6月。

核心贡献

问题

现有保持 3D 空间一致性的视频世界模型(如 WonderWorld、UniSim)通常用**点云(point cloud)**作为场景记忆,存在两个根本缺陷:

  1. 计算昂贵:每次生成都需要重复渲染 + VAE 编码
  2. 信息有损:数据在 RGB 像素空间来回转换,丢失了扩散模型 latent 空间的丰富特征

方案:Latent Spatial Memory

在扩散 latent 空间直接维护持久化 3D 缓存,完全跳过像素空间重建:

  • 构建记忆:通过深度引导的反向投影(depth-guided back-projection),将 latent token 提升到 3D 空间
  • 查询记忆:通过直接 latent 空间变形(latent-space warping),合成新视角

Mirage 框架

输入帧(latent 空间)
    ↓ 深度引导反向投影
3D Latent 空间缓存(持久化,跨帧复用)
    ↓ latent 空间变形 + 新视角合成
输出帧(latent 空间)
    ↓ 单次 VAE 解码
最终视频帧

性能指标

指标Mirage vs 显式 3D 基线
端到端视频生成速度10.57x 更快
显存占用减少 55x
WorldScoreSOTA
RealEstate10K 重建质量强

关键洞察

利用扩散模型的几何先验:不是从头构建几何,而是借助扩散模型本身已学到的空间理解能力来处理 3D warping,省去了额外的几何模型。

与相关工作的关系

  • 解决了 2604.14228_dive-into-claude-code 中讨论的上下文压缩类问题在视觉世界模型中的对应挑战
  • 与 AI Memory 方向(mempalace、agentmemory)类似,都是”如何高效存储和检索历史信息”,只是场景从文本 Agent 变成了视频生成

作者

Weijie Wang, Haoyu Zhao, Yifan Yang, Feng Chen, Zeyu Zhang, Yefei He, Zicheng Duan, Donny Y. Chen, Yuqing Yang, Bohan Zhuang

资源