谷歌推出多模态 VLOGGER AI：让静态肖像图动起来“说话”

谷歌近日在 GitHub 页面发布博文，介绍了 VLOGGER AI 模型，用户只需要输入一张肖像照片和一段音频实质，该模型可以让这些人物“动起来”，富有面部心情地朗诵音频实质。VLOGGER AI 是一种适用于虚拟肖像的多模态 Diffusion 模型，使用 MENTOR 数据库进行训练，该数据库中包含超过 80 万名人物肖像，以及累计超过 2200 小时的影片，从而让 VLOGGER 生成差别种族、差别年龄、差别穿着、差别姿势的肖像影片。研究人员表示：“和此前的多模态相比，VLOGGER 的优势在于不需要对每个

谷歌近日在 GitHub 页面发布博文，介绍了 VLOGGER AI 模型，用户只需要输入一张肖像照片和一段音频实质，该模型可以让这些人物“动起来”，富有面部心情地朗诵音频实质。

VLOGGER AI 是一种适用于虚拟肖像的多模态 Diffusion 模型，使用 MENTOR 数据库进行训练，该数据库中包含超过 80 万名人物肖像，以及累计超过 2200 小时的影片，从而让 VLOGGER 生成差别种族、差别年龄、差别穿着、差别姿势的肖像影片。

谷歌推出多模态 VLOGGER AI：让静态肖像图动起来“说话”

研究人员表示：“和此前的多模态相比，VLOGGER 的优势在于不需要对每个人进行训练，不依赖于人脸检测和裁剪，可以生成完整的图像（而不仅仅是人脸或嘴唇），并且考虑了广泛的场景（例如可见躯干或差别的主体身份），这些对于正确合成交换的人类至关重要”。

Google 将 VLOGGER 视为迈向“通用聊天机器人”的一步，之后 AI 就可以通过语音、手势和眼神交换以自然的方式与人类互动。

VLOGGER 的应用场景还包括可以用于报告、教育场域和旁白等，也可剪辑既有的影片，如果对影片中的心情不满意就能加以调整。

IT之家附上论文参考

VLOGGER: Multimodal Diffusion for Embodied Avatar Synthesis

{{userData.name}}已认证

谷歌推出多模态 VLOGGER AI：让静态肖像图动起来“说话”

偶像与英伟达竞争，推出全新混同 AI 解决方案

开发者再分享 OpenAI Sora 生成的短视频：树叶大象、彩虹瀑布等

刚刚，AI颠覆物理模拟：一句话精准仿真，学术圈半壁江山联手耗时24个月研究成果

历时2年，华人团队力作，震撼开源生成式物理引擎Genesis，可模拟世界万物

细节表现超Sora，网友：真正的国产之光！MiniMax视频模型再上新

2024年AI 编程现在可以做到什么程度？

超越所有SOTA！最新UniScene：视频点云Occ三大生成任务全部暴力提升~

腾讯基于 RAG 和 Agent 技术的混元大模型业务落地实践

抢跑OpenAI！谷歌Gemini 2.0震撼登场：全面转向Agent，多模态输入输出，免费随便玩

实测来了！Kimi发布k1视觉思考模型，实力颠覆K12教育赛道，涌现能力强得可怕，免费可用！网友：国产之光！