大规模视频扩散模型在视觉质量上取得了令人瞩目的成就,但它们在保持几何一致性方面往往力不从心。具体表现为:生成的视频常常出现几何漂移、摄像机轨迹不稳定以及场景结构不连贯等问题。这对于具身智能、世界动作模型等要求稳定摄像机运动和连贯 3D 几何的下游应用来说,是一个致命的缺陷。 以往为了解决这些问题,研究者们主要采取两种思路:一种是修改生成器架构,加入额外的模块或几何感知对齐;另一种是采用基于强化学习 ...
一些您可能无法访问的结果已被隐去。
显示无法访问的结果一些您可能无法访问的结果已被隐去。
显示无法访问的结果