香港中文大学与腾讯提出CubeComposer,普通相机视频自回归生成4K全景视频

PICO 4 Ultra

查看引用/信息源请点击:IntelligentOptics

4K全景视频

映维网Nweon 2026年08月10日)根据Intelligent Optics,香港中文大学与腾讯联合提出了CubeComposer,其核心思路不是一次性生成完整的高分辨率全景视频,而是将360°视频分解为六个cubemap面,沿时间窗口与空间面片逐步生成(spatio-temporal autoregression),从而在可控的计算开销下,首次实现了无需后处理超分的原生4K全景视频生成。

香港中文大学与腾讯提出CubeComposer,普通相机视频自回归生成4K全景视频

大多数的日常视频拍摄似乎默认了一个规则:镜头朝哪儿,世界就只到哪儿。身后的动静、头顶的光、脚下的纹理,它们和画面里的一切同时发生,却不会出现在录像里。这就是透视视频到360°全景视频生成(perspective-to-360 video generation)所要解决的问题:从一段有限视角的普通视频,重建完整球面的全景空间视频。目前已有方法通常受限于标准视频扩散模型的全注意力计算开销,生成的全景视频分辨率大多停留在 1K(1024×512)左右,而 VR 沉浸式体验需要的分辨率通常是 4K(3840×1920)甚至更高。虽然可以用额外的超分辨率模块提升,但依旧无法真正补充未观测区域的几何结构、外观纹理和运动信息。

鉴于此,香港中文大学与腾讯联合提出了CubeComposer。

CubeComposer的核心思想是:不再一次性生成完整高分辨率360°视频,而是把全景视频拆解为更易处理的空间-时间块,在扩散模型中逐步生成,并通过特别设计的上下文机制持续传递全局信息。

香港中文大学与腾讯提出CubeComposer,普通相机视频自回归生成4K全景视频

给定普通相机拍摄的透视视频,CubeComposer 首先估计每帧的球面旋转,将其投影到 equirectangular 全景格式,再转换为 cubemap 表示,即前、右、后、左、上、下六个面。相比 equirectangular,cubemap 减少了纬度方向的非均匀形变,更贴合视频基座模型的先验知识,也天然提供了可拆解的空间单元(图2-3)。

在生成阶段,CubeComposer 将目标 360° 视频划分为多个时间窗口,并在每个窗口内按 cubemap 面逐一生成。为减少早期不确定性,模型会计算输入的透视视频在各个 cube 面上的覆盖率,优先生成观测信息更充分的区域,再将几何、纹理和运动线索传播到条件较弱的区域。

香港中文大学与腾讯提出CubeComposer,普通相机视频自回归生成4K全景视频

在自回归生成中,CubeComposer 将上下文组织为历史生成结果、当前窗口内容与透视视频未来帧中的有效片段三部分,并通过稀疏上下文注意力设计将其计算复杂度从相对上下文长度的二次方复杂度降低到近似线性,使 4K 长序列上下文生成在计算上可行。

最后,若直接将 360° 视频拆成六个 cube 面逐步生成,在相邻面边界将会产生明显接缝。CubeComposer 通过 cube-aware positional encoding、拓扑对齐 padding 和边界 blending 显式建模 cube 面之间的邻接关系。具体而言,模型不再简单按照张量排列顺序赋予位置编码,而是根据 cubemap 的真实拓扑关系组织空间位置(图4);生成某个面时,也会从相邻面复制并旋转边界区域作为 padding,并在更新结果时对重叠区域进行融合。这些设计有效缓解了跨面不连续,使最终转换回 equirectangular 全景视频后仍能保持自然过渡。

香港中文大学与腾讯提出CubeComposer,普通相机视频自回归生成4K全景视频

为支持高分辨率360°视频生成的训练和评估,该研究基于开源数据集进一步构建了 4K360Vid 数据集,包含11,832段高质量4K-360°视频,并使用大型视觉语言模型生成全局 caption 与 face-wise caption。CubeComposer基于开源视频基座模型 Wan 2.2 5B 训练,通过随机合成透视输入和相机轨迹,模拟真实拍摄中的视角变化,在提出的自回归生成顺序和上下文构造方式上进行学习。

现有方法原生分辨率最高约为1K,即使叠加 VEnhancer 等外部视频超分辨率模型,也只能以后处理方式得到2K输出。相比之下,所述方案直接生成2K-和4K-360°视频,输出最高达到3840x1920。如图5所示,CubeComposer 在纹理细节和观感自然度上更佳,更接近真实参考帧。

香港中文大学与腾讯提出CubeComposer,普通相机视频自回归生成4K全景视频

CubeComposer 的贡献在于把 4K 360° 视频生成从“低分辨率生成后超分”的流程,推进到“原生高分辨率生成”(视频1)。对于透视视频到全景视频任务,模型需要根据有限视场推断不可见区域,并在整个球面上保持结构、外观和运动一致。后处理超分只能补纹理,无法修正全景补全本身的几何和时序错误;原生 4K 生成则能在高分辨率空间中直接完成内容推理。CubeComposer 也展示了一种扩展视频扩散模型能力的思路:面对高维、长时、全局一致性要求强的生成任务,单纯扩大模型输入token量直接套用 full attention 并不总是可行。将特定的任务结构显式嵌入生成顺序、上下文选择、注意力设计和位置编码,能够更有效地释放基础视频模型的先验知识。

值得注意地是,逐面、逐窗口的自回归推理也带来了额外的计算成本,未来可进一步探索更少扩散步数的流式生成方案,以及面向实时交互式 VR 场景的低延迟推理。

技术详见:https://lg-li.github.io/project/cubecomposer/
开源代码:https://github.com/TencentARC/CubeComposer

总的来说,CubeComposer 将高分辨率360° 视频生成重新表述为一个时空自回归扩散问题,通过逐 cubemap 拆分表示、覆盖率引导顺序、高效上下文、稀疏注意力和连续性感知设计,实现了原生4K全景视频生成。总体而言,CubeComposer 为高分辨率 360° 视频生成提供了一条兼顾质量、效率和结构一致性的技术路径,也为空间内容创作和沉浸式媒体中的视频生成应用提供了新的技术思路。

本文链接https://news.nweon.com/142265
转载须知:转载摘编需注明来源映维网并保留本文链接
素材版权:除额外说明,文章所用图片、视频均来自文章关联个人、企业实体等提供
QQ交流群苹果Vision  |  Meta Quest  |  AR/VR开发者  |  映维粉丝读者
XR Research Wechat Group/微信群

您可能还喜欢...

资讯