![]()
智谱 AI 全新发布桌面输入法,GLM-ASR 语音识别技术正式开源
随着语音交互技术在办公、内容创作、实时沟通中的应用越来越普遍,用户对于高精度语音识别的需求不断提升。智谱 AI 近日正式发布了 GLM-ASR 系列语音识别模型,并同步开源完整技术方案,进一步降低了企业与开发者在语音 AI 领域的技术门槛。同时,全新的 智谱 AI 桌面输入法 也正式亮相,为电脑端用户带来更加自然、顺畅、高效的语音输入体验。
这次双重发布,使用户既能使用强大的桌面输入法,也能直接基于开源模型进行定制和集成,为多种实际场景提供灵活可靠的语音交互能力。
GLM-ASR 系列模型:云端与端侧兼具的语音识别体系
GLM-ASR 系列作为智谱 AI 新一代语音识别模型,包含多种不同规格的模型版本,以满足广泛的使用场景和性能需求。其中重点包括:
● GLM-ASR-2512:面向高精度场景的云端语音识别模型
该模型适用于对识别质量要求极高的任务,例如:
- 长语音会议记录
- 专业访谈转写
- 内容创作口述
- 多人会话识别
它在复杂语音条件(例如口音杂音、语速较快的口述)中仍能保持良好的识别性能,是生成式 AI 语音能力的重要基石。
● GLM-ASR-Nano-2512:轻量化端侧模型,离线可用
相比大型云端模型,Nano 版本具备更强灵活性:
- 模型体积更小
- 本地运行速度快
- 离线场景依旧稳定识别
- 数据无需上传,更符合隐私要求
这类模型非常适合部署在本地输入法、车载系统、移动设备等场景中,保证用户在无网络或弱网环境中仍能完成语音输入。
开发者可通过官方页面获取模型:
🔗 https://huggingface.co/zai-org/GLM-ASR-Nano-2512
模型开源意味着团队可以将其集成到自己的应用中,例如客服机器人、语音备忘应用、智能工具软件等,极大提升了二次开发的灵活性与可控性。
智谱 AI 桌面输入法:让语音成为高效办公的自然入口
不同于手机端以语音代替打字的轻度场景,电脑端的需求更偏向专业场景,如文稿写作、会议记录、直播字幕、跨语言沟通等。因此这一次智谱 AI 输入法重点优化了以下体验:
● 1. 高效语音转文字
用户可通过麦克风直接口述,系统会实时识别并生成准确文本,适合:
- 快速整理会议纪要
- 写作思路口述/草稿生成
- 视频脚本或文章初稿
- 程序员用语音输入注释
在长语音场景中,系统能够保持稳定识别不中断,并可自动处理语气词、重复词等常见口语表达。
● 2. 多语言语音翻译
输入法内置语音翻译功能,适用于跨境沟通、学习与国际化办公:
- 中文 → 英文
- 英文 → 中文
- 其他语言模型可拓展
在实时沟通场景中,用户可以直接口述,系统自动识别、翻译并呈现目标语言文本,显著减少处理时间。
● 3. 文本改写与语言表达优化
借助大模型能力,输入法支持自动对内容进行:
- 表达润色
- 风格调整
- 格式优化
- 简繁转换
- 内容精简或扩写
非常适合写作、客户沟通、公众号内容创作等场景,大幅提升办公效率。
面向用户的体验福利:2000 积分 + 最长 28 天免费使用
为了让更多用户感受到语音输入的便利,智谱 AI 推出了面向新用户的福利:
- 免费获取 2000 积分
- 可连续体验长达 28 天
用户无需承担成本即可体验完整功能,包括语音识别、翻译、改写和多种智能输入增强能力。
开源语音识别的意义:更开放、更易用、更可拓展
GLM-ASR 系列的开源不仅有助于推动语音技术普及,也让更多开发者能将其应用到不同的行业与产品中。例如:
- 智能客服
- 在线课堂转写
- 车载语音控制
- 内容创作辅助工具
- 企业内部知识库语音录入
- 智能会议系统
开源模型及完整的输入法工具链,让用户从基础技术到最终应用都能找到适合的解决方案。
总结:语音交互进入更智能、更普及的阶段
智谱 AI 通过 GLM-ASR 模型开源与桌面输入法发布,让语音输入不再是移动端的专属体验,而是电脑端办公与创作的重要工具。高精度识别能力、多场景适配和隐私友好的端侧部署,使语音技术真正走向更多用户与企业的实际需求。
未来,随着开发者在开源模型基础上不断构建应用生态,语音 AI 在效率、便利性与行业使用深度上都将持续提升。
