Stable Video 3D震撼登场：单图生成无死角3D视频、模型权重开放

3D 生成领域迎来新的「SOTA 级选手」，支持商用和非商用。Stability AI 的大模型家族来了一位新成员。昨日，Stability AI 继推出文生图 Stable Diffusion、文生视频 Stable Video Diffusion 之后，又为社区带来了 3D 视频生成大模型「Stable Video 3D」（简称 SV3D）。该模型鉴于 Stable Video Diffusion 打造，能够显著提升 3D 生成的质量和多视角一致性，效果要优于之前 Stability AI 推出的 Stable

3D 生成领域迎来新的「SOTA 级选手」，支持商用和非商用。

Stability AI 的大模型家族来了一位新成员。

昨日，Stability AI 继推出文生图 Stable Diffusion、文生视频 Stable Video Diffusion 之后，又为社区带来了 3D 视频生成大模型「Stable Video 3D」（简称 SV3D）。

该模型鉴于 Stable Video Diffusion 打造，能够显著提升 3D 生成的质量和多视角一致性，效果要优于之前 Stability AI 推出的 Stable Zero123 以及丰田研究院和哥伦比亚大学联合开源的 Zero123-XL。

目前，Stable Video 3D 既支持商用，需要加入 Stability AI 会员（Membership）；也支持非商用，用户在 Hugging Face 上下载模型权重即可。 Stable Video 3D震撼登场：单图生成无死角3D视频、模型权重开放

Stable Video 3D 的生成效果以下视频所示。 Stable Video 3D震撼登场：单图生成无死角3D视频、模型权重开放

Stability AI 提供了两个模型变体，分别是 SV3D_u 和 SV3D_p。其中 SV3D_u 鉴于单个图象输出生成路线视频，不需要相机调整；SV3D_p 通过适配单个图象和路线视角扩展了生成能力，允许沿着指定的相机路径创建 3D 视频。

目前，Stable Video 3D 的研究论文已经放出，核心作者有三位。

Stable Video 3D震撼登场：单图生成无死角3D视频、模型权重开放

论文地址：https://stability.ai/s/SV3D_report.pdf

博客地址：https://stability.ai/news/introducing-stable-video-3d

Huggingface 地址：https://huggingface.co/stabilityai/sv3d

技术概览

Stable Video 3D 在 3D 生成领域实现重大进步，尤其是在新颖视图生成（novel view synthesis，NVS）方面。

以往的方法通常倾向于解决有限视角和输出不一致的问题，而 Stable Video 3D 能够从任何给定角度提供连贯视图，并能够很好地泛化。因此，该模型不仅增加了姿态可控性，还能确保多个视图中对象外观的一致性，进一步改进了影响真实和准确 3D 生成的关键问题。

以下图所示，与 Stable Zero123、Zero-XL 相比，Stable Video 3D 能够生成细节更强、更忠实于输出图象和多视角更一致的新颖多视图。

Stable Video 3D震撼登场：单图生成无死角3D视频、模型权重开放

此外，Stable Video 3D 利用其多视角一致性来优化 3D 神经辐射场（Neural Radiance Fields，NeRF），以提高直接从新视图生成 3D 网格的质量。

为此，Stability AI 设计了掩码分数蒸馏采样损失，进一步增强了预测视图中未见过区域的 3D 质量。同时为了减轻烘焙照明问题，Stable Video 3D 采用了与 3D 形状和纹理共同优化的解耦照明模型。

下图为使用 Stable Video 3D 模型及其输出时，通过 3D 优化改进后的 3D 网格生成示例。

Stable Video 3D震撼登场：单图生成无死角3D视频、模型权重开放

下图为使用 Stable Video 3D 生成的 3D 网格结果与 EscherNet、Stable Zero123 的生成结果比较。

Stable Video 3D震撼登场：单图生成无死角3D视频、模型权重开放 架构细节

Stable Video 3D 模型的架构以下图 2 所示，它鉴于 Stable Video Diffusion 架构构建而成，包含一个具有多个层的 UNet，其中每一层又包含一个带有 Conv3D 层的残差块序列，以及两个带有注意力层（空间和时间）的 transformer 块。

Stable Video 3D震撼登场：单图生成无死角3D视频、模型权重开放

具体流程以下所示：

(i) 删除「fps id」和「motion bucket id」的矢量前提，原因是它们与 Stable Video 3D 无关；

(ii) 前提图象通过 Stable Video Diffusion 的 VAE 编码器嵌入到潜在空间，然后在通向 UNet 的噪声时间步 t 处连接到噪声潜在状态输出 zt；

(iii) 前提图象的 CLIPembedding 矩阵被提供给每个 transformer 块的交叉注意力层来充当键和值，而查询成为相应层的特征；

(iv) 相机轨迹沿着扩散噪声时间步被馈入到残差块中。相机姿态角度 ei 和 ai 以及噪声时间步 t 首先被嵌入到正弦位置嵌入中，然后将相机姿态嵌入连接在一起进行线性变换并增添到噪声时间步嵌入中，最后被馈入到每个残差块并被增添到该块的输出特征中。

此外，Stability AI 设计了静态路线和静态路线来研究相机姿态调整的影响，具体以下图 3 所示。

Stable Video 3D震撼登场：单图生成无死角3D视频、模型权重开放

在静态路线上，相机采用与前提图象相同的仰角，以等距方位角围绕对象旋转。这样做的缺点是鉴于调整的仰角，可能无法获得关于对象顶部或底部的任何信息。而在静态路线上，方位角可以不等距，每个视图的仰角也可以不同。

为了构建静态路线，Stability AI 对静态路线采样，向方位角增添小的随机噪声，并向其仰角增添不同频率的正弦曲线的随机加权组合。这样做提供了时间平滑性，并确保相机轨迹沿着与前提图象相同的方位角和仰角循环结束。

实验结果

Stability AI 在未见过的 GSO 和 OmniObject3D 数据集上，评估了静态和静态路线上的 Stable Video 3D 合成多视图效果。结果以下表 1 至表 4 所示，Stable Video 3D 在新颖多视图合成方面实现了 SOTA 效果。

表 1 和表 3 显示了 Stable Video 3D 与其他模型在静态路线的结果，表明了即使是无姿态调整的模型 SV3D_u，也比所有先前的方法表现得更好。

消融分析结果表明，SV3D_c 和 SV3D_p 在静态路线的生成方面优于 SV3D_u，尽管后者专门在静态路线上进行了训练。

Stable Video 3D震撼登场：单图生成无死角3D视频、模型权重开放

下表 2 和表 4 展示了静态路线的生成结果，包括姿态调整模型 SV3D_c 和 SV3D_p，后者在所有指标上实现了 SOTA。

Stable Video 3D震撼登场：单图生成无死角3D视频、模型权重开放

下图 6 中的视觉比较结果进一步表明，与以往工作相比，Stable Video 3D 生成的图象细节更强、更忠实于前提图象、多视角更加一致。

Stable Video 3D震撼登场：单图生成无死角3D视频、模型权重开放

更多技术细节和实验结果请参阅原论文。

{{userData.name}}已认证

Stable Video 3D震撼登场：单图生成无死角3D视频、模型权重开放

倒计时 5 天！2024 全球开发者先锋大会即将强势开启，科技狂欢盛典再燃上海

利物浦用DeepMind的AI制定战略已有三年了

细节表现超Sora，网友：真正的国产之光！MiniMax视频模型再上新

ChatGPT遇到这些人名开始自闭，OpenAI回应了

平安人寿ChatBI：大模型智能化报表的深度实践

字节跳动豆包 AI 文生图“喜提新技能”：App 可生成带有指定文字的图片

超越所有SOTA！最新UniScene：视频点云Occ三大生成任务全部暴力提升~

OpenAI 从谷歌 DeepMind 挖角三名高级工程师，专注于多模态 AI 研发

腾讯基于 RAG 和 Agent 技术的混元大模型业务落地实践

实测来了！Kimi发布k1视觉思考模型，实力颠覆K12教育赛道，涌现能力强得可怕，免费可用！网友：国产之光！