微软探索音生图 AI 模型，实时视觉化会议演讲者语音讲述的场景

作者：故渊

2024-10-15 11:57

科技媒体 MSPoweruser 昨日（10 月 14 日）发布博文，报道称微软公司获得了一项新的专利，描述了基于用户实时输入的语音来生成图片。根据美国商标和专利局最新公示的清单，该专利共计 20 页，微软于 2023 年 4 月 5 日提交申请，于 10 月 10 日获批。根据专利描述，该系统可以在会议或讲座中实时捕捉音频，随后通过语言模型进行总结，并生成相应的 AI 图像。

科技媒体 MSPoweruser 昨日（10 月 14 日）发布博文，报道称微软公司获得了一项新的专利，描述了基于用户实时输入的语音来生成图片。

根据美国商标和专利局最新公示的清单，该专利共计 20 页，微软于 2023 年 4 月 5 日提交申请，于 10 月 10 日获批。

根据专利描述，该系统可以在会议或讲座中实时捕捉音频，随后通过语言模型进行总结，并生成相应的 AI 图像。

微软探索音生图 AI 模型，实时视觉化会议演讲者语音讲述的场景

微软探索音生图 AI 模型，实时视觉化会议演讲者语音讲述的场景

微软探索音生图 AI 模型，实时视觉化会议演讲者语音讲述的场景

AI在线援引该媒体报道，该工作会分为 3 个步骤：

捕捉音频：用户通过麦克风发言，系统实时记录并转化为文本。
处理文本：分段记录文本，每段内容通过语言模型进行总结。
生成图像：根据总结生成的提示，系统创建 AI 生成的图像，并在屏幕上实时显示。

预计该功能将主要应用于 Microsoft Teams。随着演讲者话题的变化，实时生成的图像也会随之更新，从而增强视觉沟通的效果。微软表示，这种图像的使用有助于澄清概念，特别适合通过视觉辅助学习的用户。

相关标签：

AI 生成图像 10 实时

相关资讯

实时AI，最难躺平的战场

实时AI，最难躺平的战场

机器之能报道编辑：Sia有人预测 2024 将是视频之年，其实今年已经看出端倪。年终将至，图像、视频生成战场仍然高潮迭起。前阵子上线的 Pika Labs 1.0 炸了一波，Meta 又推出一个免费的 AI 图像生成器，口碑不错。谷歌 DeepMind 最新文生图模型 Imagen 2 毫无悬念地登上了今天的头条。如果有内测资格，你会发现谷歌搜索居然可以直接生图。进入谷歌实验室，测试中的谷歌搜索可以直接生图了。与此同时，之前热度不减、但一直处在内测阶段的 AI 设计工具 Krea AI Beta 版也终于开放，

字节豆包大模型已支持实时语音通话

字节豆包大模型已支持实时语音通话

IT 之家 8 月 9 日消息，字节跳动旗下火山引擎今日宣布推出对话式 AI 实时交互解决方案，搭载火山方舟大模型服务平台。该方案通过火山引擎 RTC 实现语音数据的采集、处理和传输，并深度整合豆包・语音识别模型和豆包・语音合成模型，简化语音到文本和文本到语音的转换过程，提供智能对话和自然语言处理能力，帮助应用实现用户和云端大模型的实时语音通话。▲ 对话式 AI 实时交互服务方案架构字节跳动介绍称，对话式 AI 实时交互解决方案支持开箱即用快速搭建，只需调用标准的 OpenAPI 接口即可配置所需的语音识别（ASR

数仓架构的持续演进与发展 — 云原生、湖仓一体、离线实时一体、SaaS模式

数仓架构的持续演进与发展 — 云原生、湖仓一体、离线实时一体、SaaS模式

数据仓库概念从1990年提出，经过了四个主要阶段。从最初的数据库演进到数据仓库，到MPP架构，到大数据时代的数据仓库，再到今天的云原生的数据仓库。在不断的演进过程中，数据仓库面临着不同的挑战。

资讯热榜

罗永浩 Jarvis 初创项目“J1 Assistant AI 助理”上线，利用语音与大模型互动突破非视距条件依赖！大规模区域、低成本的UWB-LiDAR标定与单次定位框架 SK 海力士宣布参展 CES 2025，将展示 122TB 企业级固态硬盘等产品类 Mac Mini 大小的个人 AI 超算：英伟达 Project Digits 发布，起价 3000 美元斯坦福AI科研神器开源，一键成文GPT-4o mini加持！科研写作彻底解放双手从DeepSeek-V3发布谈大模型的技术突破与未来机遇别再将LLM当成数据库了 3 到 5 秒即可同声传译 40 余种语言，时空壶推出 W4 Pro 实时翻译耳机

标签云