阿里通义千问在 2026年7月6日 披露,实时语音识别模型 Fun-ASR-Realtime 完成升级,并已通过 API 上线阿里云百炼平台。对于实时字幕、语音助手、国际会议、跨语种客服和多方言语音处理场景来说,这次升级的意义不只是“准确率更高”,而是进一步推动实时语音交互进入更稳定、更广覆盖的应用阶段。
从公开信息来看,这次升级有几个核心点值得关注。第一,Fun-ASR-Realtime 的首字延迟控制在百毫秒级别,这意味着用户开口后,系统可以更快给出首轮识别反馈。对实时字幕、会议转写、电话语音机器人等场景来说,低时延直接决定使用体验是否流畅。第二,模型支持 30种语言 与 16种中文方言,这让它不仅能覆盖普通话和主流外语,还能更好进入多地区、多口音、多语种混合场景。第三,阿里云百炼文档已将 fun-asr-realtime 作为实时识别推荐模型之一,说明它已经从“能力展示”进一步走向实际接入和产品化使用。
这类升级最直接的受益方,会是对实时语音输入有明确业务要求的企业和开发者。比如在线会议产品需要更顺滑的字幕体验,企业客服需要覆盖普通话之外的多方言输入,出海产品需要支持东南亚及东亚多语种交流,智能助手和语音终端需要更快响应用户语音指令。在这些真实业务里,识别速度、方言覆盖和多语种切换能力,往往比单次演示效果更重要。
从行业角度看,语音识别已经不是单独存在的工具能力,而是在逐渐成为大模型生态的基础输入层。只要涉及语音助手、语音搜索、智能客服、会议纪要、直播字幕、教育辅导和移动端交互,实时 ASR 能力都会成为产品竞争力的一部分。通义千问这次升级 Fun-ASR-Realtime,本质上是在补强大模型生态的“音频入口”,让后续的理解、检索、问答和执行能力拥有更稳定的输入质量。
值得注意的是,阿里云百炼帮助文档显示,fun-asr-realtime 目前已支持实时 WebSocket 接入,并可配合热词能力使用。结合当天公开报道中提到的多语言、多方言和低时延表现,这意味着模型不仅更适合展示,也更适合直接落地到实时产品环境里。对于想布局语音交互的团队来说,这类基础模型能力的成熟度,往往决定了上层功能能不能真正稳定上线。
综合来看,2026年7月6日 的这次升级,不只是一次模型版本更新,而是一次对实时语音识别落地边界的继续扩展。随着多语言、多方言和低时延能力同步增强,Fun-ASR-Realtime 更适合承接复杂语音环境中的真实任务,这对阿里通义千问的大模型产品线也是一次关键补强。
阿里云百炼语音识别模型文档:https://help.aliyun.com/zh/model-studio/asr-model/
