支持中英双语及 40 种方言任意混说，中国电信 TeleAI 星辰语音大模型升级

作者：沛霖（实习）

2024-11-03 09:37

中国电信人工智能研究院（TeleAI）在今年 5 月发布业内首个支持 30 种方言自由混说的语音识别大模型 —— 星辰超多方言语音识别大模型。时隔不到半年，TeleAI 星辰语音大模型的多方言能力再次升级，攻克了湛江话、宜宾话、洛阳话、烟台话等方言，将方言种类从 30 种提升至 40 种，并引入对英文的识别。与传统的有标注训练方法相比，TeleAI 通过预训练语音识别模型，利用海量无标注数据进行预训练，再通过少量有标注数据进行微调。

中国电信人工智能研究院（TeleAI）在今年 5 月发布业内首个支持 30 种方言自由混说的语音识别大模型 —— 星辰超多方言语音识别大模型。

时隔不到半年，TeleAI 星辰语音大模型的多方言能力再次升级，攻克了湛江话、宜宾话、洛阳话、烟台话等方言，将方言种类从 30 种提升至 40 种，并引入对英文的识别。

与传统的有标注训练方法相比，TeleAI 通过预训练语音识别模型，利用海量无标注数据进行预训练，再通过少量有标注数据进行微调。

由于方言语音数据普遍存在无标注数据多而有标注数据少的特点，这种“预训练 + 微调”的模型方案与方言场景的需求能够高度契合。

支持中英双语及 40 种方言任意混说，中国电信 TeleAI 星辰语音大模型升级

TeleAI 还在模型结构和成本优化上进行了创新，实现对人工标注数据的需求量大幅降低约 50 倍，且保障模型效果与有监督训练的方言模型水平相当。

AI在线附 GitHub 开源地址：https://github.com/Tele-AI/TeleSpeech-ASR

相关标签：

大模型语音标注 TeleAI 方言

相关资讯

支持 30 种方言混说，中国电信 AI 研究院发布“星辰”超多方言语音识别大模型

支持 30 种方言混说，中国电信 AI 研究院发布“星辰”超多方言语音识别大模型

中国电信人工智能研究院（TeleAI）日前宣布发布业内首个支持 30 种方言自由混说的语音识别大模型 —— 星辰超多方言语音识别大模型。据介绍，该模型可打破单一模型只能识别特定单一方言的困境，支持同时识别理解粤语、上海话、四川话、温州话等 30 多种方言，是国内支持最多方言的语音识别大模型。应用场景方面，该模型有望极大解决老年人、老少边穷地区用户信息服务无法触达的问题。该大模型研发团队首创“蒸馏膨胀”联合训练算法，解决超大规模多场景数据集和大规模参数条件下，预训练坍缩的问题，实现 1B 参数 80 层模型稳定

换了30多种方言，我们竟然没能考倒中国电信的语音大模型

换了30多种方言，我们竟然没能考倒中国电信的语音大模型

不管你来自哪个城市，相信在你的记忆中，都有自己的「家乡话」：吴语柔软细腻、关中方言质朴厚重、四川方言幽默诙谐、粤语古雅潇洒……某种意义上说，方言不只是一种语言习惯，也是一种情感连接、一种文化认同。我们「上网冲浪」遇到的新鲜词汇中，有不少就是来自各地方言。当然，有些时候，方言也是一种交流「壁垒」。在现实生活中，我们经常会看到方言导致的「鸡同鸭讲」，比如这个：如果你关注最近科技圈的动态就会知道，当前的 AI 语音助手已经能达到「实时回复」的水准，甚至比人类反应还快。而且，AI 已经能够充分理解人类的情感，自己也能表现出

中国电信 AI 研究院完成首个全国产化万卡万参大模型训练，TeleChat2-115B 对外开源

中国电信 AI 研究院完成首个全国产化万卡万参大模型训练，TeleChat2-115B 对外开源

“中国电信人工智能研究院”官方公众号今天宣布，中国电信人工智能研究院（AI在线注：下文称 TeleAI）成功完成国内首个基于全国产化万卡集群训练的万亿参数大模型，并正式对外开源首个基于全国产化万卡集群和国产深度学习框架训练的千亿参数大模型 —— 星辰语义大模型 TeleChat2-115B。官方表示，这项科研成果标志着国产大模型训练真正实现全国产化替代，正式进入全国产自主创新、安全可控的新阶段。TeleChat2-115B 基于中国电信自研的天翼云“息壤一体化智算服务平台”和人工智能公司“星海 AI 平台”训练完成

资讯热榜

罗永浩 Jarvis 初创项目“J1 Assistant AI 助理”上线，利用语音与大模型互动 SK 海力士宣布参展 CES 2025，将展示 122TB 企业级固态硬盘等产品突破非视距条件依赖！大规模区域、低成本的UWB-LiDAR标定与单次定位框架类 Mac Mini 大小的个人 AI 超算：英伟达 Project Digits 发布，起价 3000 美元阿里云与黑芝麻智能完成大模型车载芯片级适配斯坦福AI科研神器开源，一键成文GPT-4o mini加持！科研写作彻底解放双手从DeepSeek-V3发布谈大模型的技术突破与未来机遇 3 到 5 秒即可同声传译 40 余种语言，时空壶推出 W4 Pro 实时翻译耳机

标签云