![]()
在人工智能语音领域,通义百聆再次带来了重磅更新。本次发布中,阿里正式推出了 Fun-CosyVoice3 系列语音合成模型 与 Fun-ASR 系列语音识别模型 的全面升级,覆盖从语音克隆、情绪控制到跨语种识别等多项核心能力。
仅需 3 秒录音,AI 即可实现多语言、方言、情绪切换;在嘈杂环境下,依然能实现毫秒级精准识别。无论是语音助手、会议纪要、短视频配音还是智能客服,Fun-CosyVoice3 与 Fun-ASR 都能提供更自然、更高效的智能语音体验。
🧠 一、Fun-CosyVoice3 模型:3秒录音即可多语种情绪复刻
✅ 核心亮点
- 首包延迟降低 50%,中英混说准确率提升一倍;
- 支持 9 种通用语言、18 种方言,具备跨语种音色克隆与情感控制;
- 双向流式合成 实现“输入即发声”,满足语音助手、直播配音、无障碍阅读等实时需求。
Fun-CosyVoice3 可以通过一段 3 秒录音,实现不同语言、方言与情绪的高保真音色复刻。无论是普通话转粤语、英语还是日语,AI 都能保持原音音色一致,让声音表达更自然、更具感染力。
🌈 案例展示:
- 案例1:中英混说精准发音 “上面的 oversize 的衣服就不要选择这么大,你可以稍微再缩小一点点版型。”
- 案例2:跨语种音色复刻能力
- 案例3:韵律提升与多音字识别 “他把数据输入电脑,开始数数。”
🔗 模型体验地址(阿里云百炼)
https://bailian.console.aliyun.com
🚀 二、Fun-CosyVoice3-0.5B 开源:Zero-shot 音色克隆与本地部署支持
Fun-CosyVoice3-0.5B 是轻量化版本,具备 zero-shot 音色克隆能力。用户只需提供一段 3 秒以上参考音频,即可快速复刻其音色并生成新语音。
该模型支持 本地部署、二次开发,为企业及开发者提供灵活的语音合成解决方案。
🔗 开源地址
🎧 三、Fun-ASR 模型:AI “听得懂” 的语音识别系统
如果说 CosyVoice3 让 AI “会说话”,那 Fun-ASR 则让 AI 真正“听得懂”。
Fun-ASR 是通义百聆推出的端到端语音识别大模型,基于数千万小时语音数据训练,已广泛应用于 钉钉AI听记、视频会议、语音助手等场景。
本次升级显著提升了噪声环境下的鲁棒性、多语言混说能力及定制化精度。
✅ 模型亮点:
- 噪声场景准确率 93%,支持音乐、RAP、嘈杂环境下识别;
- 支持 31 种语言自由混说,无须指定语种自动识别;
- 7 大中文方言 + 26 种口音 精准识别;
- 流式识别首字延迟仅 160ms,识别更快。
🌈 案例展示:
- 案例5:嘈杂环境识别 “然后被冠以了渣男线的称号……前方即将到达沈杜公路站,左边是8号线。”
- 案例6:多语言识别(日英混说) “このカフェの Wi-Fi がアンステーブルすぎて…”
- 案例7:方言覆盖(粤语) “佢最想要有露台,佢想感受那个国家嘅生气…”
🔗 模型体验地址(阿里云百炼)
https://bailian.console.aliyun.com
⚙️ 四、Fun-ASR-Nano-0.8B 开源:更轻量、更高效
全新推出的 Fun-ASR-Nano 模型在保持高精度的同时,将参数量压缩至 0.8B,极大降低了推理成本,适合移动端与边缘设备部署。
🔗 开源地址
🔍 五、面向企业与开发者的智能语音生态
通义百聆的 Fun 系列模型不仅面向普通用户,也为企业和开发者提供了定制化能力:
- RAG 检索增强生成机制:热词上限提升至 10,000 条,专有名词识别更精准;
- 多语种场景适配:覆盖金融、医疗、教育、娱乐等领域;
- 支持私有化与本地部署:保障数据安全与低延迟响应;
- 开放 API 与 SDK:方便开发者快速集成 AI 语音能力。
这些特性让 Fun-CosyVoice3 与 Fun-ASR 成为智能语音产品、内容平台和企业级系统的理想基础组件。
✅ 总结
本次 通义百聆 Fun 系列模型升级,在语音合成与语音识别两大方向上实现了显著性能提升。
- Fun-CosyVoice3 让 AI 能“说出”多语种、多情感、高保真音色;
- Fun-ASR 让 AI 能“听懂”复杂环境、多方言、多语种语音。
二者相辅相成,构建出更完善的语音智能生态,为用户和开发者提供从“说”到“听”的全链路AI能力。
