阿里全面开源文生视频模型万相2.1:14B和1.3B双版本上线

今日,阿里巴巴官方宣布全面开源旗下视频生成模型万相2.1模型,14B和1.3B双版本上线。 其中,专业版14B,高性能,提供业界顶尖的表现力可满足对视频质量有极高要求的场景;而极速版1.3B,适合消费级显卡,8.2GB显存即可生成480P高质量视频,适用于二次模型开发和学术研究。 据官方介绍,本次开源的 Wan2.1在处理复杂运动、还原真实物理规律、提升影视质感及优化指令遵循方面展现出显著优势,能够满足创作者、开发者和企业用户的多样化需求。

今日,阿里巴巴官方宣布全面开源旗下视频生成模型万相2.1模型,14B和1.3B双版本上线。其中,专业版14B,高性能,提供业界顶尖的表现力可满足对视频质量有极高要求的场景;而极速版1.3B,适合消费级显卡,8.2GB显存即可生成480P高质量视频,适用于二次模型开发和学术研究。

图片

据官方介绍,本次开源的 Wan2.1在处理复杂运动、还原真实物理规律、提升影视质感及优化指令遵循方面展现出显著优势,能够满足创作者、开发者和企业用户的多样化需求。借助于通义万相,用户可以轻松实现高质量的视频生成,尤其在广告和短视频领域,满足了对创意的高要求。

在权威评测集 VBench 中,通义万相以总分86.22% 高居榜首,远超 Sora、Minimax、Luma 等国内外其他视频生成模型。该评测基于主流的 DiT 和线性噪声轨迹 Flow Matching 范式,通过一系列技术创新提升了模型的生成能力。特别是自研的高效3D 因果 VAE 模块,成功实现256倍无损视频隐空间压缩,支持任意长度视频的高效编码与解码。

QQ_1740534242356.png

通义万相在生成视频的过程中,采用了基于主流 DiT 结构的 Full Attention 机制,有效建模时空依赖性,确保生成视频的高质量与一致性。模型的训练策略采用6阶段分步训练法,从初步的低分辨率数据训练逐步引入高分辨率数据,以保证模型在不同条件下的优异表现。此外,通义万相在数据处理方面也采取了严格的清洗流程,以确保训练数据的高质量。

在训练与推理效率优化方面,通义万相采用了多种先进技术,如分布式训练策略、激活值优化和显存管理,确保模型训练的稳定性与推理效率。通过与阿里云训练集群的智能调度结合,模型在训练过程中能够自动识别故障并快速重启,确保训练过程的顺利进行。

通义万相2.1已在 GitHub、Hugging Face 等平台开源,支持多种主流框架,为开发者和研究者提供了便利的使用体验。无论是快速原型开发还是高效生产部署,通义万相都能满足不同用户的需求,为视频生成技术的发展注入了新的活力。

QQ_1740534298370.png

魔塔社区入口:https://modelscope.cn/organization/Wan-AI

划重点: 

🌟 通义万相2.1开源,支持多样化视频生成需求。

🏆 在 VBench 评测中以86.22% 高分获胜,领先其他模型。

🚀 采用分步训练及多项技术优化,提升了生成效率和质量。

相关资讯

阿里通义万相视觉生成大模型升级,支持文生视频、图生视频等

在今日的 2024 云栖大会上,阿里云发布了通义万相 Wanx 视觉生成大模型的新升级,能力全面进化。通义万相除了此前的文生图能力,现已支持文生视频、图生视频等,还有插画设计、涂鸦作画、局部重绘、短片创作、配乐生成等场景化能力。据阿里云官方透露,通义万相累计创作图片数已达 7500 万 ,累计用户数已达 93 万 。通义万相官网显示,全新发布自研 AI 视频生成大模型,具备“强大的画面视觉动态生成能力”,擅长概念理解与组合生成,优化中式元素表现,同时支持多语言与可变分辨率生成。AI在线附体验链接:

超越DeepSeek-R1!阿里万相大模型登上全球开源榜首

今日,阿里巴巴股价在盘初阶段出现拉升,一度上涨超过4%,报价达到133.1港元。 这一市场表现与近期阿里巴巴在人工智能领域取得的显著进展密切相关。 据开源社区Hugging Face最新发布的榜单显示,阿里巴巴推出的万相大模型在开源仅6天后,便成功超越了DeepSeek-R1,一举登上了模型热榜和模型空间榜两大重要榜单的榜首。

开源仅6天,阿里万相大模型登上全球开源榜首

3月3日消息,开源社区Hugging Face最新榜单显示,开源仅6天的阿里万相大模型已反超DeepSeek-R1,登顶模型热榜、模型空间榜两大榜单,成为近期全球开源社区最受欢迎的大模型。 根据最新数据,万相2.1(Wan2.1)在Hugging Face及魔搭社区的总下载量已超百万,在Github的Star数超6k。 万相2.1登顶Hugging Face模型热榜和模型空间榜万相开源后迅速吸引了国内外开发者和用户的广泛关注。