首个华文原生DiT架构！腾讯混元文生图大模型周到开源，免费商用

华文 AI 社区迎来了一个好消息：与 Sora 同架构的开源文生图大模型来了！5 月 14 日，腾讯宣布旗下混元文生图大模型周到进级并周到开源，目前已在 Hugging Face 平台及 GitHub 上发布，包含模型权重、推理代码、模型算法等完整模型，可供企业与个人开发者免费商用。官网地址：项目地址： Face 模型地址：：据了解，这是业内首个华文原生的 DiT 架构文生图开源模型，支援中英文双语输入及明白，参数量 15 亿。进级后的混元文生图大模型采用了与 Sora 一致的 DiT 架构，即全新的 Huny

华文 AI 社区迎来了一个好消息：与 Sora 同架构的开源文生图大模型来了！

5 月 14 日，腾讯宣布旗下混元文生图大模型周到进级并周到开源，目前已在 Hugging Face 平台及 GitHub 上发布，包含模型权重、推理代码、模型算法等完整模型，可供企业与个人开发者免费商用。

官网地址：https://dit.hunyuan.tencent.com/

GitHub 项目地址：https://github.com/Tencent/HunyuanDiT

Hugging Face 模型地址：https://huggingface.co/Tencent-Hunyuan/HunyuanDiT

技术报告地址：https://tencent.github.io/HunyuanDiT/asset/Hunyuan_DiT_Tech_Report_05140553.pdf

据了解，这是业内首个华文原生的 DiT 架构文生图开源模型，支援中英文双语输入及明白，参数量 15 亿。

进级后的混元文生图大模型采用了与 Sora 一致的 DiT 架构，即全新的 Hunyuan-DiT 架构，不仅可以支援文生图，也可以作为视频等多模态视觉生成的基础。

首个华文原生DiT架构！腾讯混元文生图大模型周到开源，免费商用

为了周到比较 Hunyuan-DiT 与其他文生图模型的生成才智，腾讯混元团队构建 4 个维度的测试集，邀请超过 50 名专业评估人员进行评估，包括文本图像一致性、排除 AI 伪影、主题清晰度、审美。

从下表结果可以看到，采用 Hunyuan-DiT 架构的腾讯混元文生图模型后果远超开源的 Stable Diffusion 模型，是目前后果最好的开源文生图模型，整体才智属于国际领先水平。

首个华文原生DiT架构！腾讯混元文生图大模型周到开源，免费商用

与其他 SOTA 模型的比较。

与这些 SOTA 模型的定性比较结果如下图所示。

首个华文原生DiT架构！腾讯混元文生图大模型周到开源，免费商用

全新 DiT 架构

腾讯混元文生图要做开源模型 No.1

大模型的优异表现，离不开领先的技术架构。

进级后的腾讯混元文生图大模型采用了全新的 DiT 架构（DiT 即 Diffusion With Transformer），这是 OpenAI Sora 和 Stable Diffusion 3 的同款架构和关键技术，是一种鉴于 Transformer 架构的扩散模型。

过去，视觉生成扩散模型主要鉴于 U-Net 架构，但随着参数量增加，鉴于 Transformer 架构的扩散模型展现了更好的扩展性，有助于进一步提升模型生成质量及效率。Sora 很好地说明了这一点。

腾讯混元是业界最早探索并应用大语言模型结合 DiT 结构的文生图模型之一。从 2023 年 7 月起，腾讯混元文生图团队就明确了鉴于 DiT 架构的模型方向，并启动了新一代模型研发。今年初，混元文生图大模型已周到进级为 DiT 架构。

Hunyuan-DiT 的模型结构如下图 7 所示，采用了创新的网络架构，结合了双语 CLIP 和多语言 T5 编码器，通过精心设计的数据管道进行训练和优化，支援多轮对话，能够根据上下文生成并完善图像。

首个华文原生DiT架构！腾讯混元文生图大模型周到开源，免费商用

在 DiT 架构之上，腾讯混元团队支援了中英双语文本提示生成图像，并在算法层面优化模型的长文本明白才智，能够支援最多 256 字符的内容输入，达到行业领先水平。

首个华文原生DiT架构！腾讯混元文生图大模型周到开源，免费商用

此外，混元文生图大模型在算法层面创新实现了多轮生图和对话才智，可实现在一张初始生成图片的基础上，通过自然语言描述进行调整，从而达到更满意的后果。

首个华文原生DiT架构！腾讯混元文生图大模型周到开源，免费商用

更多多轮对话生成示例如下图所示。

首个华文原生DiT架构！腾讯混元文生图大模型周到开源，免费商用

华文原生也是腾讯混元文生图大模型的一大亮点。此前，像 Stable Diffusion 等主流开源模型核心数据集以英文为主，对中国的语言、美食、文化、习俗都明白不够。

作为首个华文原生的 DiT 模型，混元文生图具备了中英文双语明白及生成才智，在古诗词、俚语、传统建筑、中华美食等中国元素的生成上表现出色。我们可以看以下一些生成示例。

首个华文原生DiT架构！腾讯混元文生图大模型周到开源，免费商用

腾讯混元文生图还更擅长细粒度文本提示生成。

首个华文原生DiT架构！腾讯混元文生图大模型周到开源，免费商用

评测结果显示，新一代腾讯混元文生图大模型视觉生成整体后果，相比前代提升超过了 20%，不仅在语义明白、画面质感与真实性方面周到提升，而且在多轮对话、多主体、中国元素、真实人像生成等场景下后果提升显著。

这一次

腾讯混元选择周到开源文生图模型

腾讯混元文生图才智，已经广泛被用于素材创作、商品合成、游戏出图等多项业务及场景中。今年初，腾讯广告鉴于腾讯混元大模型，发布了一站式 AI 广告创意平台腾讯广告妙思，可为广告主提供文生图、图生图、商品背景合成等多场景创意工具，有效提高了广告生产及投放效率。

腾讯混元文生图大模型的开源，填补了华文原生 DiT 文生图架构的缺失，有助于更多的开发者和创作者参与进来，一起探索、共创鉴于 DiT 架构的视觉生成生态，更好地去验证、挖掘这个技术架构的潜力。

腾讯文生图负责人芦清林表示：「腾讯混元文生图的研发思路就是实用，坚持从实践中来，到实践中去。此次把最新一代模型完整开源出来，是希望与行业共享腾讯在文生图领域的实践经验和研究成果，丰富华文文生图开源生态，共建下一代视觉生成开源生态，推动大模型行业加速发展。」

鉴于腾讯开源的文生图模型，开发者及企业无需从头训练，即可以直接用于推理，并可鉴于混元文生图打造专属的 AI 绘画应用及服务，能够节约大量人力及算力。透明公开的算法，也让模型的安全性和可靠性得到保障。

此外，鉴于开放、前沿的混元文生图基础模型，也有利于在以 Stable Diffusion 等为主的英文开源社区之外，丰富以华文为主的文生图开源生态，形成更多样原生插件，推动华文文生图技术研发和应用。

{{userData.name}}已认证

首个华文原生DiT架构！腾讯混元文生图大模型周到开源，免费商用

字节跳动发布豆包大模型，主力模型比行业价格低99.3%

Ilya官宣离职，超等对齐负责人Jan直接辞职，OpenAI还是走散了

刚刚，AI颠覆物理模拟：一句话精准仿真，学术圈半壁江山联手耗时24个月研究成果

历时2年，华人团队力作，震撼开源生成式物理引擎Genesis，可模拟世界万物

细节表现超Sora，网友：真正的国产之光！MiniMax视频模型再上新

2024年AI 编程现在可以做到什么程度？

实测来了！Kimi发布k1视觉思考模型，实力颠覆K12教育赛道，涌现能力强得可怕，免费可用！网友：国产之光！

超越所有SOTA！最新UniScene：视频点云Occ三大生成任务全部暴力提升~

腾讯基于 RAG 和 Agent 技术的混元大模型业务落地实践

抢跑OpenAI！谷歌Gemini 2.0震撼登场：全面转向Agent，多模态输入输出，免费随便玩