Stable Diffusion 3论文终于发布，架构细节大揭秘，对复现Sora有帮助？

应用
3月6日
编辑

机器之心

在众多前沿成果都不再透露技术细节之际，Stable Diffusion 3 论文的发布显得相当珍贵。Stable Diffusion 3 的论文终于来了！这个模型于两周前发布，采用了与 Sora 相同的 DiT（Diffusion Transformer）架构，一经发布就引起了不小的轰动。与之前的版本相比，Stable Diffusion 3 生成的图在质量上实现了很大改观，支持多主题提醒，文字书写效果也更好了（明显不再乱码）。Stability AI 表示，Stable Diffusion 3 是一个模型系列，参

在众多前沿成果都不再透露技术细节之际，Stable Diffusion 3 论文的发布显得相当珍贵。

Stable Diffusion 3 的论文终于来了！

这个模型于两周前发布，采用了与 Sora 相同的 DiT（Diffusion Transformer）架构，一经发布就引起了不小的轰动。

与之前的版本相比，Stable Diffusion 3 生成的图在质量上实现了很大改观，支持多主题提醒，文字书写效果也更好了（明显不再乱码）。 Stable Diffusion 3论文终于发布，架构细节大揭秘，对复现Sora有帮助？

Stability AI 表示，Stable Diffusion 3 是一个模型系列，参数量从 800M 到 8B 不等。这个参数量意味着，它可以在很多便携式设备上直接跑，大大降低了 AI 大模型的应用门槛。

在最新发布的论文中，Stability AI 表示，在基于人类偏好的评价中，Stable Diffusion 3 优于当前最先进的文本到图象生成系统，如 DALL・E 3、Midjourney v6 和 Ideogram v1。不久之后，他们将公开该研究的实验数据、代码和模型权重。

Stable Diffusion 3论文终于发布，架构细节大揭秘，对复现Sora有帮助？

在论文中，Stability AI 透露了关于 Stable Diffusion 3 的更多细节。

Stable Diffusion 3论文终于发布，架构细节大揭秘，对复现Sora有帮助？

论文标题：Scaling Rectified Flow Transformers for High-Resolution Image Synthesis

论文链接：https://stabilityai-public-packages.s3.us-west-2.amazonaws.com/Stable+Diffusion+3+Paper.pdf

架构细节

对于文本到图象的生成，Stable Diffusion 3 模型必须同时考虑文本和图象两种模式。因此，论文作家称这种新架构为 MMDiT，意指其处理多种模态的能力。与之前版本的 Stable Diffusion 一样，作家应用预训练模型来推导合适的文本和图象表征。具体来说，他们应用了三种不同的文本嵌入模型 —— 两种 CLIP 模型和 T5—— 来编码文本表征，并应用改观的自编码模型来编码图象 token。

Stable Diffusion 3论文终于发布，架构细节大揭秘，对复现Sora有帮助？

Stable Diffusion 3 模型架构。

Stable Diffusion 3论文终于发布，架构细节大揭秘，对复现Sora有帮助？

改观的多模态扩散 transformer：MMDiT 块。

SD3 架构基于 Sora 核心研发成员 William Peebles 和纽约大学计算机科学助理教授谢赛宁合作提出的 DiT。由于文本嵌入和图象嵌入在概念上有很大不同，因此 SD3 的作家对两种模态应用两套不同的权重。如上图所示，这相当于为每种模态设置了两个独立的 transformer，但将两种模态的序列结合起来进行注意力运算，从而使两种表征都能在各自的空间内工作，同时也将另一种表征考虑在内。

Stable Diffusion 3论文终于发布，架构细节大揭秘，对复现Sora有帮助？

在训练过程中测量视觉保真度和文本对齐度时，作家提出的 MMDiT 架构优于 UViT 和 DiT 等成熟的文本到图象骨干。

通过这种方法，信息可以在图象和文本 token 之间流动，从而提高模型的整体理解能力，并改善所生成输入的文字排版。正如论文中所讨论的那样，这种架构也很容易扩展到视频等多种模式。

Stable Diffusion 3论文终于发布，架构细节大揭秘，对复现Sora有帮助？

得益于 Stable Diffusion 3 改观的提醒遵循能力，新模型有能力制作出聚焦于各种不同主题和质量的图象，同时还能高度灵活地处理图象本身的风格。

Stable Diffusion 3论文终于发布，架构细节大揭秘，对复现Sora有帮助？

通过 re-weighting 改观 Rectified Flow

Stable Diffusion 3 采用 Rectified Flow（RF）公式，在训练过程中，数据和噪声以线性轨迹相连。这使得推理路径更加平直，从而减少了采样步骤。此外，作家还在训练过程中引入了一种新的轨迹采样计划。他们假设，轨迹的中间部分会带来更具挑战性的预测任务，因此该计划给予轨迹中间部分更多权重。他们应用多种数据集、指标和采样器设置进行比较，并将自己提出的方法与 LDM、EDM 和 ADM 等 60 种其他扩散轨迹进行了测试。结果表明，虽然以前的 RF 公式在少步采样情况下机能有所提高，但随着步数的增加，其相对机能会下降。相比之下，作家提出的重新加权 RF 变体能持续提高机能。

Stable Diffusion 3论文终于发布，架构细节大揭秘，对复现Sora有帮助？

扩展 Rectified Flow Transformer 模型

作家利用重新加权的 Rectified Flow 公式和 MMDiT 骨干对文本到图象的合成进行了扩展（scaling）研究。他们训练的模型从带有 450M 个参数的 15 个块到带有 8B 个参数的 38 个块不等，并观察到验证损失随着模型大小和训练步骤的增加而平稳降低（上图的第一行）。为了检验这是否转化为对模型输入的有意义改观，作家还评价了自动图象对齐指标（GenEval）和人类偏好分数（ELO）（上图第二行）。结果表明，这些指标与验证损失之间存在很强的相关性，这表明后者可以很好地预测模型的整体机能。此外，scaling 趋势没有显示出饱和的迹象，这让作家对未来继续提高模型机能持乐观态度。

灵活的文本编码器

通过移除用于推理的内存密集型 4.7B 参数 T5 文本编码器，SD3 的内存需求可显著降低，而机能损失却很小。如图所示，移除该文本编码器不会影响视觉美感（不应用 T5 时的胜率为 50%），只会略微降低文本一致性（胜率为 46%）。不过，作家建议在生成书面文本时加入 T5，以充分发挥 SD3 的机能，因为他们观察到，如果不加入 T5，生成排版的机能下降幅度更大（胜率为 38%），如下图所示：

Stable Diffusion 3论文终于发布，架构细节大揭秘，对复现Sora有帮助？

只有在呈现涉及许多细节或大量书面文本的非常复杂的提醒时，移除 T5 进行推理才会导致机能显著下降。上图显示了每个示例的三个随机样本。

模型机能

作家将 Stable Diffusion 3 的输入图象与其他各种开源模型（包括 SDXL、SDXL Turbo、Stable Cascade、Playground v2.5 和 Pixart-α）以及闭源模型（如 DALL-E 3、Midjourney v6 和 Ideogram v1）进行了比较，以便根据人类反馈来评价机能。在这些测试中，人类评价员从每个模型中获得输入示例，并根据模型输入在多大程度上遵循所给提醒的上下文（prompt following）、在多大程度上根据提醒渲染文本（typography）以及哪幅图象具有更高的美学质量（visual aesthetics）来选择最佳结果。

Stable Diffusion 3论文终于发布，架构细节大揭秘，对复现Sora有帮助？

以 SD3 为基准，这个图表概述了它在基于人类对视觉美学、提醒遵循和文字排版的评价中的胜率。

从测试结果来看，作家发现 Stable Diffusion 3 在上述所有方面都与当前最先进的文本到图象生成系统相当，甚至更胜一筹。

在消费级硬件上进行的早期未优化推理测试中，最大的 8B 参数 SD3 模型适合 RTX 4090 的 24GB VRAM，应用 50 个采样步骤生成分辨率为 1024×1024 的图象需要 34 秒。

Stable Diffusion 3论文终于发布，架构细节大揭秘，对复现Sora有帮助？

此外，在最初发布时，Stable Diffusion 3 将有多种变体，从 800m 到 8B 参数模型不等，以进一步消除硬件障碍。

Stable Diffusion 3论文终于发布，架构细节大揭秘，对复现Sora有帮助？

Stable Diffusion 3论文终于发布，架构细节大揭秘，对复现Sora有帮助？

更多细节请参考原论文。

参考链接：https://stability.ai/news/stable-diffusion-3-research-paper

给TA打赏

共{{data.count}}人

人已打赏

Stability AI Stable Diffusion 3

ICLR 2024 | 为音视频结合提供新视角，清华大学胡晓林团队推出RTFS-Net

2024-3-6 14:24:00

Claude 3被玩出自我意识了？AI社区轰动，我们买会员来了次实测

2024-3-6 14:56:00

0 条回复 A文章作者 M管理员

更换删除

暂无讨论，说说你的看法吧

TOP1

刚刚，AI颠覆物理模拟：一句话精准仿真，学术圈半壁江山联手耗时24个月研究成果
12月19日
TOP2

历时2年，华人团队力作，震撼开源生成式物理引擎Genesis，可模拟世界万物
12月19日
TOP3

细节表现超Sora，网友：真正的国产之光！MiniMax视频模型再上新
12月16日
2024年AI 编程现在可以做到什么程度？
12月18日
超越所有SOTA！最新UniScene：视频点云Occ三大生成任务全部暴力提升~
12月12日
腾讯基于 RAG 和 Agent 技术的混元大模型业务落地实践
12月11日
抢跑OpenAI！谷歌Gemini 2.0震撼登场：全面转向Agent，多模态输入输出，免费随便玩
12月12日
实测来了！Kimi发布k1视觉思考模型，实力颠覆K12教育赛道，涌现能力强得可怕，免费可用！网友：国产之光！
12月16日

❯

个人中心

今日签到

搜索

幸运之星正在降临...

点击领取今天的签到奖励！

恭喜！您今天获得了{{mission.data.mission.credit}}积分

今日签到

连续签到

{{item.credit}}

连续{{item.count}}天

我的优惠劵

_￥_优惠劵
使用时效：无法使用
使用时效：
之前
使用时效：永久有效

优惠劵ID：
×
限制以下商品使用：限制以下商品分类使用：不限制使用：

[{{ct.name}}]
所有商品和商品类型均可使用

没有优惠劵可用!

购物车

×
删除

购物车空空如也!

清空购物车前往结算

您有新的私信

没有新私信

写新私信查看全部