对应论文

Efficiently Reconstructing Dynamic Scenes One D4RT at a Time

视频简介

这篇论文提出 D4RT,用统一 transformer 从单目视频中同时推断深度、时空对应关系和完整相机参数,目标是把动态场景重建从重型优化/多解码器流程推进到一次前馈模型。 核心机制是新的 querying interface:模型可以独立查询任意时空点的 3D 位置,而不是对每帧做密集解码,也不需要为 depth、tracking、camera pose 等任务维护多套解码器。 这让 D4RT 在训练和推理上都更轻量,并覆盖动态 4D 重建、跟踪、相机估计等任务;项目页和 DeepMind 介绍强调其统一、快速、可扩展的 4D scene reconstruction and tracking 能力。 它值得收录,因为它把视频理解、3D/4D 表征、时空对应和相机几何统一成可查询的前馈表示接口,对机器人世界建模、视频世界模型和空间智能都有高外溢价值。

外部视频链接

论文链接