微软探索音生图 AI 模型，实时视觉化会议演讲者语音讲述的场景

2024-10-15 11:57

科技媒体 MSPoweruser 昨日（10 月 14 日）发布博文，报道称微软公司获得了一项新的专利，描述了基于用户实时输入的语音来生成图片。根据美国商标和专利局最新公示的清单，该专利共计 20 页，微软于 2023 年 4 月 5 日提交申请，于 10 月 10 日获批。根据专利描述，该系统可以在会议或讲座中实时捕捉音频，随后通过语言模型进行总结，并生成相应的 AI 图像。

科技媒体 MSPoweruser 昨日（10 月 14 日）发布博文，报道称微软公司获得了一项新的专利，描述了基于用户实时输入的语音来生成图片。

根据美国商标和专利局最新公示的清单，该专利共计 20 页，微软于 2023 年 4 月 5 日提交申请，于 10 月 10 日获批。

根据专利描述，该系统可以在会议或讲座中实时捕捉音频，随后通过语言模型进行总结，并生成相应的 AI 图像。

微软探索音生图 AI 模型，实时视觉化会议演讲者语音讲述的场景

AI在线援引该媒体报道，该工作会分为 3 个步骤：

捕捉音频：用户通过麦克风发言，系统实时记录并转化为文本。
处理文本：分段记录文本，每段内容通过语言模型进行总结。
生成图像：根据总结生成的提示，系统创建 AI 生成的图像，并在屏幕上实时显示。

预计该功能将主要应用于 Microsoft Teams。随着演讲者话题的变化，实时生成的图像也会随之更新，从而增强视觉沟通的效果。微软表示，这种图像的使用有助于澄清概念，特别适合通过视觉辅助学习的用户。

实时AI，最难躺平的战场

机器之能报道编辑：Sia有人预测 2024 将是视频之年，其实今年已经看出端倪。年终将至，图像、视频生成战场仍然高潮迭起。前阵子上线的 Pika Labs 1.0 炸了一波，Meta 又推出一个免费的 AI 图像生成器，口碑不错。谷歌 DeepMind 最新文生图模型 Imagen 2 毫无悬念地登上了今天的头条。如果有内测资格，你会发现谷歌搜索居然可以直接生图。进入谷歌实验室，测试中的谷歌搜索可以直接生图了。与此同时，之前热度不减、但一直处在内测阶段的 AI 设计工具 Krea AI Beta 版也终于开放，

12/14/2023 6:56:00 PM

机器之能

字节豆包大模型已支持实时语音通话

IT 之家 8 月 9 日消息，字节跳动旗下火山引擎今日宣布推出对话式 AI 实时交互解决方案，搭载火山方舟大模型服务平台。该方案通过火山引擎 RTC 实现语音数据的采集、处理和传输，并深度整合豆包・语音识别模型和豆包・语音合成模型，简化语音到文本和文本到语音的转换过程，提供智能对话和自然语言处理能力，帮助应用实现用户和云端大模型的实时语音通话。▲ 对话式 AI 实时交互服务方案架构字节跳动介绍称，对话式 AI 实时交互解决方案支持开箱即用快速搭建，只需调用标准的 OpenAPI 接口即可配置所需的语音识别（ASR

8/9/2024 2:27:22 PM

汪淼

Hugging Face 推出 FastRTC：实时语音视频应用开发变得轻而易举

AI 初创公司 Hugging Face 宣布推出 FastRTC，这是一个开源的 Python 库，旨在消除开发人员在构建实时音频和视频 AI 应用时面临的重大障碍。 Hugging Face 的 FastRTC 旨在简化 WebRTC 和 Websocket 应用的构建过程。 Freddy Boulton，FastRTC 的创建者之一表示:“在 Python 中，构建实时 WebRTC 和 Websocket 应用非常困难，直到现在才有所改变。

2/27/2025 10:41:00 AM

AI在线

资讯热榜

这样在本地搭建DeepSeek可以直接封神：本地部署+避坑指南（升级版）基于 Spring AI + MCP + DeepSeek-R1-7B 构建企业级智能 Agent 工具调用系统 Manus开源平替！Kortix-AI正式发布开源通用AI智能体平台Suna Trae v1.3.0重磅更新，新增MCP与.rules支持引领AI开发新体验纳米AI发布MCP万能工具箱，简化AI工具集成与调用 Figma 推 AI 革命：开发智能应用制作器与网站创建工具即梦3.0海外版发布，电影级视觉与精准英文排版引领AI创作新高度 Persona Engine开源发布，AI虚拟助手与Live2D融合打造交互新体验

标签云

人工智能 OpenAI AIGC AI ChatGPT AI绘画 DeepSeek 数据机器人模型谷歌大模型 Midjourney 智能用户开源学习 GPT 微软 Meta AI创作图像技术论文 Stable Diffusion 马斯克 Gemini 算法蛋白质生成式芯片代码英伟达腾讯神经网络计算研究 Anthropic Sora 3D AI for Science AI设计机器学习 GPU AI视频开发者场景华为预测百度人形机器人伟达苹果 Transformer 深度学习模态 xAI 字节跳动 Claude 大语言模型搜索驾驶文本具身智能神器推荐 Copilot LLaMA 算力视频生成安全干货合集视觉应用大型语言模型科技亚马逊特斯拉 AGI 训练 2024

顶部

微软探索音生图 AI 模型，实时视觉化会议演讲者语音讲述的场景

相关资讯

实时AI，最难躺平的战场

字节豆包大模型已支持实时语音通话

Hugging Face 推出 FastRTC：实时语音视频应用开发变得轻而易举