视频世界模型中的 Latent 空间持久化 3D 记忆,提出 Mirage 框架,生成速度提升 10.57x,显存减少 55x,2026年6月。
核心贡献
问题
现有保持 3D 空间一致性的视频世界模型(如 WonderWorld、UniSim)通常用**点云(point cloud)**作为场景记忆,存在两个根本缺陷:
- 计算昂贵:每次生成都需要重复渲染 + VAE 编码
- 信息有损:数据在 RGB 像素空间来回转换,丢失了扩散模型 latent 空间的丰富特征
方案:Latent Spatial Memory
在扩散 latent 空间直接维护持久化 3D 缓存,完全跳过像素空间重建:
- 构建记忆:通过深度引导的反向投影(depth-guided back-projection),将 latent token 提升到 3D 空间
- 查询记忆:通过直接 latent 空间变形(latent-space warping),合成新视角
Mirage 框架
输入帧(latent 空间)
↓ 深度引导反向投影
3D Latent 空间缓存(持久化,跨帧复用)
↓ latent 空间变形 + 新视角合成
输出帧(latent 空间)
↓ 单次 VAE 解码
最终视频帧
性能指标
| 指标 | Mirage vs 显式 3D 基线 |
|---|---|
| 端到端视频生成速度 | 10.57x 更快 |
| 显存占用 | 减少 55x |
| WorldScore | SOTA |
| RealEstate10K 重建质量 | 强 |
关键洞察
利用扩散模型的几何先验:不是从头构建几何,而是借助扩散模型本身已学到的空间理解能力来处理 3D warping,省去了额外的几何模型。
与相关工作的关系
- 解决了 2604.14228_dive-into-claude-code 中讨论的上下文压缩类问题在视觉世界模型中的对应挑战
- 与 AI Memory 方向(mempalace、agentmemory)类似,都是”如何高效存储和检索历史信息”,只是场景从文本 Agent 变成了视频生成
作者
Weijie Wang, Haoyu Zhao, Yifan Yang, Feng Chen, Zeyu Zhang, Yefei He, Zicheng Duan, Donny Y. Chen, Yuqing Yang, Bohan Zhuang
资源
- 论文:https://arxiv.org/abs/2606.09828
- 代码:暂未开源(2026年6月发布)