![]()
在 AI 生成式技术持续发展的当下,腾讯 ARC 实验室推出的AudioStory,以 “大语言模型 + 音频生成” 的融合架构,为长篇叙事音频创作提供了结构化解决方案。这款开源模型突破了传统文本到音频(TTA)技术在长时长内容上的局限,通过创新的协同生成机制与端到端训练设计,实现了音频叙事的时序连贯性与质量稳定性,为影视、教育、游戏等领域的音频制作提供了低成本、高适配的新工具。
一、技术亮点:构建连贯叙事的核心能力
1. 级联式语义拆解与协同生成:让音频符合叙事逻辑
AudioStory 通过大语言模型(LLM)的强理解能力,将复杂的音频需求拆解为有序的子任务,再与音频生成模块协同输出,解决长音频 “碎片化” 问题:
- 语义拆解阶段:LLM 会将用户输入的文本指令(如 “雨天咖啡馆:轻音乐、杯碟碰撞、雨声渐强”)转化为带时间戳的子事件序列,明确每个子事件的音效类型、持续时长与情感基调。例如 “30 秒咖啡馆场景” 可拆分为 “0-10 秒:雨声 + 轻音乐切入”“10-20 秒:杯碟碰撞声叠加”“20-30 秒:雨声渐强 + 音乐减弱” 三个子事件,确保时序清晰。
- 协同生成阶段:采用解耦桥接机制,将 LLM 输出的 “语义令牌”(负责叙事逻辑)与音频扩散模型生成的 “残差令牌”(负责音效细节)融合。比如 “雨声渐强” 的效果,会通过残差令牌动态调整音量衰减曲线,让音效变化符合物理规律,避免突兀切换。
- 一致性优化阶段:通过三阶段渐进训练(单音效生成→子事件协同→长叙事整合),强化跨事件的连贯性。例如 150 秒的播客内容中,背景音乐的风格、人声的语速语调会全程保持统一,不会出现前后风格割裂的情况。
2. 动态视觉路由:提升视频配音的效率与精准度
针对视频配音场景中 “音画同步” 与 “推理效率” 的双重需求,AudioStory 引入动态视觉分辨率路由(ViR) 技术:
- 智能识别视频中的关键区域(如人物动作、物体交互),对这些区域对应的音频细节(如角色台词、物体碰撞声)保留高分辨率处理;背景区域(如静态场景)则适当降采样,减少计算资源消耗。
- 实测数据显示,处理 896px 分辨率的视频时,该技术可使视觉相关的 tokens 数量减少 62%,38B 参数模型的单次推理延迟从 369ms 降至 91ms(基于 A100 GPU),同时音画同步误差控制在 10ms 以内,满足专业视频制作需求。
3. 多语言与场景适配:覆盖多样化创作需求
AudioStory 支持 13 种主流语言(中文、英文、日语等)及 24 种方言(粤语、四川话等)的语音合成,还可通过SSML 标记语言自定义音频参数:
- 语言适配方面,能精准还原不同语言的发音特征,比如粤语的 “懒音”、英语的连读,让语音合成更自然;方言合成则针对地方口音优化,避免 “机械感”。
- 场景适配方面,可根据需求切换音效风格(如 “写实风”“动画风”)。例如为《猫和老鼠》风格视频配音时,会自动生成夸张的 “追逐音效”(如快速脚步声、卡通撞击声);为纪录片配音时,则输出更沉稳的背景音与旁白,贴合内容调性。
二、性能表现:在指令跟随与音频质量上的优势
1. 指令跟随能力领先,语义匹配更精准
在腾讯构建的AudioStory-10K 基准数据集(包含 1 万条自然声、动画声样本)测试中,AudioStory 的表现显著优于传统 TTA 模型:
- 指令遵循率:比 AudioLDM2、TangoFlux 等基线模型高出 17.85%,能更准确还原用户需求。例如输入 “悬疑场景:钟表滴答声 + 远处雷声”,模型生成的音频中,滴答声的节奏会随时间缓慢加快,雷声的距离感通过混响效果精准呈现,完全符合 “悬疑” 的情感预期。
- 语义匹配度:CLAP(音频 – 文本语义匹配)指标得分比基线模型提升 23%,意味着生成的音频与文本描述的契合度更高,减少 “文不对音” 的情况。
2. 音频质量稳定,支持长时长生成
在衡量音频真实性的核心指标上,AudioStory 表现突出:
- Frechet Audio Distance(FAD):比基线模型降低约 30%,生成的音频更接近真实录音质感,比如 “钢琴声” 的泛音细节、“雨声” 的层次感,都能精准还原。
- 长时长生成能力:支持最长 150 秒的连续音频输出,且质量不随时长下降。例如生成 10 分钟的睡前故事音频时,背景白噪音的音量、人声的语调会全程保持稳定,不会出现杂音或音质劣化。
3. 多场景实测:适配影视、游戏、教育等领域
不同场景的落地测试中,AudioStory 展现出较强的实用性:
- 影视配音:为无声动画片段生成同步音效与台词,完播率比传统人工配音的片段提升 40%,制作周期缩短 60%。
- 游戏音效:可根据游戏剧情动态生成音轨,比如 “战斗场景” 会自动叠加武器碰撞声、角色技能音效,且音效风格与游戏世界观保持一致。
- 教育内容:为数学题、科学实验视频生成解说音频,能准确读取公式、描述实验步骤,AIME25 数学竞赛题的解说音频准确率达 75.6%,帮助学习者更好理解复杂内容。
三、开源生态:降低开发与使用门槛
1. 完全开源 + 宽松协议:支持商业与非商业使用
AudioStory 的推理代码、预训练模型及核心训练数据已在 GitHub(https://github.com/TencentARC/AudioStory)完全开源,采用Apache 2.0 协议:
- 个人开发者可免费用于学习、创作;企业用户可直接集成到商业产品中,无需额外申请授权,仅需保留原作者声明即可。
- 开源资源包含完整的部署文档、API 调用示例,即使是新手也能快速上手,比如通过简单的 Python 代码即可调用模型生成自定义音频。
2. 多框架适配与轻量化部署:覆盖不同硬件条件
模型支持 Hugging Face、PyTorch 等主流深度学习框架,同时提供轻量化部署方案:
- 硬件适配:8B 参数模型可在单张 RTX 3060 显卡上实现实时推理(200+ tokens / 秒);38B 模型需 2-4 张 A100 显卡;78B 及以上参数的模型则适配数据中心级硬件,满足不同规模的创作需求。
- 量化优化:支持 4-bit AWQ 量化技术,8B 模型经量化后显存占用从 12GB 降至 3GB,可在中端显卡上运行,降低硬件门槛。
3. 案例与社区支持:提供实践参考与技术交流
腾讯 ARC 团队同步发布了多个行业落地案例,为开发者提供参考:
- 影视领域:为《非遗文化》纪录片生成 20 种方言的配音,减少 70% 的后期制作成本;
- 短视频领域:为英超赛事集锦自动匹配进球欢呼声、解说词,每分钟可生成 5-8 条 15 秒短视频,提升内容产出效率。
- 社区支持:开源社区已聚集 3000 + 开发者,持续分享二次开发方案(如医疗设备警报声定制、工业场景音效库构建),用户可通过 GitHub Issues 或邮件(guoyuxin2021@ia.ac.cn)获取技术支持。
四、使用指南:从快速上手到实践优化
1. 三步生成专业音频
- 输入需求:通过自然语言描述音频场景,或上传视频文件(用于配音),明确时长、语言、风格等参数(如 “45 秒英文动画配音,《猫和老鼠》风格”)。
- 配置参数:在代码中设置模型路径、生成时长、guidance 值(控制音频与指令的贴合度,建议设为 4.0)等,示例代码如下:python
python evaluate/inference.py --model_path /path/to/ckpt --guidance 4.0 --save_folder_name my_audio --total_duration 45
- 优化输出:生成后可通过 SSML 标记调整细节(如 “将某段台词语速放慢 10%”),或使用音频编辑工具微调音量、添加过渡效果。
2. 性能优化建议
- 模型选择:轻量需求(如短视频配音)可选 8B 参数模型,复杂需求(如电影音效、长播客)建议用 38B 或 78B 模型;
- 硬件利用:单张 A100 优先部署 38B 及以下模型,多卡集群可尝试 78B 模型,通过模型并行提升推理速度;
- 量化策略:中端显卡用户可启用 4-bit 量化,在显存占用降低 70% 的同时,保持 85% 以上的音频质量。
3. 合规与版权提示
- 因模型采用 Apache 2.0 协议,商用时需保留原作者声明(腾讯 ARC 实验室),避免侵权;
- 生成涉及他人肖像、版权内容(如影视角色配音)时,需确保已获得相关授权,避免法律风险。
五、开源价值:为音频创作提供新工具
AudioStory 的开源,让个人创作者、中小企业也能低成本获取专业级的音频生成能力 —— 无需组建专业音效团队,通过简单的文本指令或视频输入,就能快速产出符合需求的长音频内容。未来随着模型的迭代,其可能进一步拓展多模态交互(如结合文本、图像、视频生成更丰富的音频场景),为音频创作带来更多可能性。
立即获取 AudioStory
- 代码与文档:GitHub(https://github.com/TencentARC/AudioStory)
- 模型下载:可通过 GitHub 页面指引获取预训练模型 checkpoint
- ** demo 参考 **:项目仓库 “demos” 目录包含影视配音、长音频生成等案例,可直接查看效果
