一键实景转动画，清华系初创公司全球首发4D骨骼动画框架，还能生成个性化角色

前几日，苹果宣布首款虚拟头显设备 Vision Pro 将于 2 月 2 日正式发售，XR 设备作为下一代终端预计将迎来快速发展。未来随着虚拟显示设备的普及，数字交互将从平面走向平面，平面模型、平面动画将成为未来主流的实质形态，虚实融合下的多维沉浸式交互也将成为潮流。但从数据规模看，现阶段实质产业的数据积累仍以 2D 图像、平面视频为主，3D 模型、4D 动画等数据基础较为薄弱。其中，4D 动画是在传统 3D 模型的基础上引入时间序列，即随时间变化的 3D 模型，可以呈现出动静平面效果，在游戏动画、电影特效、虚拟现

前几日，苹果宣布首款虚拟头显设备 Vision Pro 将于 2 月 2 日正式发售，XR 设备作为下一代终端预计将迎来快速发展。未来随着虚拟显示设备的普及，数字交互将从平面走向平面，平面模型、平面动画将成为未来主流的实质形态，虚实融合下的多维沉浸式交互也将成为潮流。

但从数据规模看，现阶段实质产业的数据积累仍以 2D 图像、平面视频为主，3D 模型、4D 动画等数据基础较为薄弱。其中，4D 动画是在传统 3D 模型的基础上引入时间序列，即随时间变化的 3D 模型，可以呈现出动静平面效果，在游戏动画、电影特效、虚拟现实等领域具有广泛的应用，但也是目前实质生态开发中最困难的环节。

因此，面向即将到来的多维沉浸式感受，构建平面化的数字实质将成为重要的基础性工作。

面向该前沿领域，清华系创业团队生数科技开展了系列研究和产品研发，于近期联合清华大学、同济大学等高校推出全球首个基于「骨骼动画」的 4D 动画生成框架「AnimatableDreamer」，能够直接将 2D 视频素材一键转成动静平面模型（即 4D 动画），支持自动提取骨骼举动、一键转换动画效果并可通过文字输出举行个性化角色生成。

一键实景转动画，清华系初创公司全球首发4D骨骼动画框架，还能生成个性化角色

论文地址：https://arxiv.org/pdf/2312.03795.pdf

项目地址：https://animatabledreamer.github.io/

论文标题：AnimatableDreamer: Text-Guided Non-rigid 3D Model Generation and Reconstruction with Canonical Score Distillation

大家可以看以下Demo视频。一键实景转动画，清华系初创公司全球首发4D骨骼动画框架，还能生成个性化角色

崭新实质生产方式

颠覆平面动画开发过程

过往业界制作平面动画，需要经过 3D 建模、贴图渲染、骨骼绑定、动画制作等复杂过程，需要建模师、动画师等专业人员参与才能完成，效率低、成本高。据统计，单一个静态 3D 模型建模的生产周期就在数小时到几天时间，成本可高达上千美元，再举行动静化处理成本投入将更高。

从官方发布的 demo 视频可以看到，上传一段松鼠的 2D 实景视频，通过输出「A squirrel with red sweater」（穿红色毛衣的松鼠）的文本描述，原本实景的松鼠一键转成动画风格，而且完美保留了举动姿势，同步还可生成 360 度视角下的平面动静模型，通过切换文字描述，可以自定义角色，将松鼠任性切换为狐狸、杰尼龟等不同的卡通形象。

「AnimatableDreamer」可自动提取视频中目标对象（人物、动物等）的骨骼举动，再通过文本描述将该对象转换为任性的带骨骼动画模型。整个过程不受模版限制，支持任性视频长度和任性类型举动，具备高度的时间一致性和多视角一致性，并且导出的动静平面模型，能够在任性 3D 环境中举行渲染。

面向影视动漫等领域的后期制作，通常需要针对动画做更多编辑，「AnimatableDreamer」也支持针对已经完成骨骼绑定的模型举行更换或编辑动画文件，实现更高的自由度。未来相关技术逐渐落地后，游戏开发、影视动画等场景的 3D 建模、动画制作过程，有望变得更加高效。

面向未来

有望形成崭新的实质生态

在实现原理上，研究团队创新性地提出了规范得分蒸馏策略（Canonical Score Distillation，简称 CSD），在随时间变化的相机空间中对不同帧及不同视角的 3D 模型举行渲染及降噪，并统一将梯度回传至不同相机空间共享的规范空间中举行蒸馏，将 4D 生成降维至 3D，即将 4D 生成问题简化为 3D 空间上的生成。

「AnimatableDreamer」能直接从视频中提取关节举动，通过解耦物体的模型与运动，生成的模型具备高度的时间一致性和几何合理性，不受视频长度限制，而且能有效地消除如形状断裂、闪烁和多视角不一致等问题。一键实景转动画，清华系初创公司全球首发4D骨骼动画框架，还能生成个性化角色

在有限视角和大幅度运动的场景中，由于引入了 Diffusion 模型的先验知识，即便输出的视频未覆盖完整物体，「AnimatableDreamer」也能自动补全画面信息，实现较好的生成质量。

一键实景转动画，清华系初创公司全球首发4D骨骼动画框架，还能生成个性化角色

可以说，「AnimatableDreamer」的提出直接打通文本到 4D 骨骼动画的生成，建模、贴图、骨骼绑定、举动驱动一气呵成！输出自然语言描述，自动输出平面动画视频，无需专业知识，普通人也能直接上手，轻松定制动画实质。

以「AnimatableDreamer」为基础的工作将大大降低 3D、4D 数字实质的生产难度，将交互感受丰富化，让每个人都能举行创意实质的生成和编辑，将催生出 3D 时代下崭新的实质娱乐与实质消费模式。

畅想一下，在未来的虚拟世界中，用户可以快速搭建自定义的数字空间，打造个性化的交互感受。例如：

数字空间下的每个人物形象可以任性个性化的生成，比如给小朋友穿上超人的衣服、万圣节随意切换节日主题服装等；

养宠物的用户可以将自家宠物卡通化，例如将其生成虚拟的米老鼠形象。宠物日常就如卡通片一样，主人跟宠物的日常互动将变得趣味横生；

人与人的互动方式也变得更丰富，随时随地可以来上一场主题派对，实时生成想要的派对环境、人物装扮等等。

作为一家成立不到一年的初创公司，生数科技团队长期致力于图像、3D、视频等多模态大模型领域，在 9 月份发布了 3D 资产创建工具 VoxCraft，在 Discord 正式上线，支持文图引导、分钟级创建 3D 模型、3D 贴图自定义更换等功能，赋能游戏开发、影视动画等场景的 3D 建模过程。此次推出的 4D 骨骼动画生成是生数科技的又一项崭新探索工作，未来将在 VoxCraft 的产品中举行集成。

VoxCraft 工具地址：https://voxcraft.ai/

苹果 Vision Pro 的来临不仅仅是硬件设备层面的重要革新，同时也将开启一场实质和感受革命的序幕。4D 动画生成等生成式 AI 的创新能力，除了带来更好的视觉呈现，还将以崭新方式打开多维数字感受，为下一代人机交互带来更多可能。

{{userData.name}}已认证

一键实景转动画，清华系初创公司全球首发4D骨骼动画框架，还能生成个性化角色

AIGC时代的「数字性命计划」已启动！

视觉Mamba来了：速度提升2.8倍，内存能省87%

刚刚，AI颠覆物理模拟：一句话精准仿真，学术圈半壁江山联手耗时24个月研究成果

历时2年，华人团队力作，震撼开源生成式物理引擎Genesis，可模拟世界万物

细节表现超Sora，网友：真正的国产之光！MiniMax视频模型再上新

2024年AI 编程现在可以做到什么程度？

超越所有SOTA！最新UniScene：视频点云Occ三大生成任务全部暴力提升~

腾讯基于 RAG 和 Agent 技术的混元大模型业务落地实践

抢跑OpenAI！谷歌Gemini 2.0震撼登场：全面转向Agent，多模态输入输出，免费随便玩

实测来了！Kimi发布k1视觉思考模型，实力颠覆K12教育赛道，涌现能力强得可怕，免费可用！网友：国产之光！