多模态 AI / 语音与音频 / ASR、TTS 与音频语言模型
本文转载自 Awesome AI Roadmap,原作者 Polo Li,依 CC BY 4.0 协议共享。

第五章:语音识别、合成与音频语言模型

本章覆盖语音/音频领域的三类核心任务——ASR(自动语音识别)、TTS(语音合成)与通用音频理解——的架构演进与评测方式。实时对话场景下的全双工交互与打断处理是独立的工程问题,见 第六章

5.1 语音任务谱系

任务 输入 → 输出 核心难点
ASR(自动语音识别) 语音 → 文字 口音、噪声、重叠语音、专有名词
TTS(语音合成) 文字 → 语音 自然度、韵律、说话人相似度、可控性
音频理解 语音/环境声/音乐 → 文字描述或结构化结果 非语音声学事件、说话人识别、音乐结构
Audio-Language 模型 音频 + 文字 → 文字 跨模态推理("这段录音里谁在生气")

前两类任务历史悠久,各自有专门的架构谱系;第三、四类近年逐渐统一到"用离散音频 token + 语言模型"的范式下,与 第一章描述的融合架构是同一套设计原则在音频模态上的应用。

5.2 ASR 架构演进

早期端到端 ASR 主要有两条路线:

  • CTC(Connectionist Temporal Classification):让模型逐帧输出字符/音素分布,用一个允许"空白符"和重复折叠的对齐算法处理语音帧与文字长度不一致的问题,推理简单但假设各帧输出条件独立,建模能力有限;
  • RNN-Transducer(RNN-T):在 CTC 基础上引入一个显式的语言模型预测网络,联合建模声学和语言依赖,天然支持流式解码(边听边出文字),是长期以来生产级流式 ASR 的主流架构之一。

Whisper 代表了另一条路线:用标准的 encoder-decoder Transformer,在 68 万小时弱监督(网络爬取的音频-文字对,质量参差不齐)数据上直接训练序列到序列的语音识别与翻译任务,不依赖专门的对齐算法,同时用多任务格式(转录、翻译、语种识别、时间戳)统一训练。其技术报告的核心结论是:规模化的弱监督数据训练出的鲁棒性,在跨口音、跨噪声条件下往往优于在干净数据上过拟合的强监督模型

流式场景(边说边出文字)与离线场景(录完整句再识别)的架构约束不同:流式 ASR 必须在看到有限右侧上下文(甚至完全看不到)的情况下增量输出,天然存在"准确率 vs 延迟"的权衡;离线 ASR 可以用完整上下文做双向建模换取更高准确率。

5.3 TTS 架构演进

TTS 长期采用两阶段管线:文本→声学特征(如 Mel 频谱,代表工作 Tacotron 2)加声码器(Vocoder,把声学特征还原为波形,代表工作 WaveNet/HiFi-GAN)。这类管线的音色和韵律建模能力受限于声学特征的表达粒度。

近年的神经编解码器语言模型路线把 TTS 重新表述为一个语言建模问题:先用神经音频编解码器(见 5.4 节)把语音波形离散化为一串 token,再训练一个语言模型在给定文本和一段参考语音(作为音色提示)的条件下,自回归生成目标语音的离散 token 序列,最后用编解码器的解码器把 token 还原成波形。VALL-E 是这一路线的代表:仅用 3 秒参考音频就能在推理时"零样本"模仿说话人音色,把 TTS 的可控性问题转化为语言模型的上下文学习问题,而不需要针对每个新说话人重新训练。

5.4 音频 Token 化:连接感知与生成的公共表示

无论是把音频接入语言模型做理解,还是像 VALL-E 一样把 TTS 转成语言建模问题,都需要先把连续波形离散化为 token。神经音频编解码器(Neural Audio Codec)承担了这个角色:SoundStream 和 EnCodec 都采用"编码器 + 残差向量量化(RVQ)+ 解码器"的结构,用多层级联的 codebook 逐级量化残差,在较低比特率下重建出接近原始质量的波形。

$$ z=E(x),\qquad \hat z=\sum_{l=1}^{L}q_l(r_{l-1}),\quad r_0=z,\ r_l=r_{l-1}-q_l(r_{l-1}) $$

其中 $q_l$ 是第 $l$ 层量化器,$L$ 层级联的残差量化让少量 codebook 也能覆盖较宽的音频动态范围。得到的多层离散 token 序列既可以喂给语言模型做音频理解(AudioLM、Qwen-Audio 一类模型的输入侧),也可以作为语言模型的生成目标(VALL-E 一类模型的输出侧),是音频模态在 第一章 1.4 节 Early Fusion描述的"统一 token 化"范式下的具体实现。

5.5 通用音频理解与 Audio-Language 模型

AudioLM 最早展示了"纯粹用语言建模方式处理离散音频 token"可以同时保留语音内容和说话人身份、韵律等副语言信息,生成的续写音频在语义连贯性和音色一致性上都优于此前的生成式方法。在此基础上,Qwen-Audio、SALMONN 一类 Audio-Language 模型把音频编码器接入大语言模型(沿用 第一章描述的 Late Fusion/projector 路线),使模型能够对语音内容、说话人情绪、背景声学事件、音乐结构等提出开放式问题并用自然语言回答,而不仅是转录文字。

这类模型的评测必须区分"听清楚说了什么"(等价于 ASR 能力)和"听懂了什么"(副语言信息、事件、音乐结构等更高层理解),两者对模型架构和训练数据的要求并不相同。

5.6 评测

任务 指标 说明
ASR WER(词错误率)/ CER(字符错误率) 需固定测试集的口音、噪声条件才可比较
TTS 自然度 MOS(Mean Opinion Score)及其变体 依赖人工评分,主观性强,需报告评分人数与协议
TTS 相似度 说话人相似度(Speaker Similarity) 衡量零样本音色克隆是否忠实于参考音频
音频理解 任务专用准确率/F1 声学事件分类、情绪识别等各有独立基准,不能混用 ASR 指标

WER 极低不代表语音助手体验好:延迟、韵律自然度和打断处理体验同样重要,这些维度需要结合 第六章的实时交互评测一起看。

5.7 常见错误

5.7.1 用离线 WER 评测流式产品体验

流式 ASR 的部分假设(partial hypothesis)会随后续语音修正,仅用最终转录的 WER 评测无法反映用户实际看到的"实时上屏文字是否频繁跳变"体验,应额外报告部分结果的稳定性。

5.7.2 忽视训练数据口音/语言分布与实际使用场景不匹配

模型在标准口音、常见语种上的 WER 很低,不代表在方言、口音混杂或低资源语言上同样可靠,上线前必须用目标人群的真实录音单独核验。

5.7.3 把"音色克隆能力"当成没有风险的功能默认开放

零样本音色克隆技术(如 VALL-E 一类方法)存在被用于语音伪造和身份冒用的风险,产品化时应设置授权确认、水印或使用范围限制,而不是默认对任意参考音频开放克隆能力。

5.8 本章总结

  1. ASR 从 CTC/RNN-T 等专门对齐架构演进到 Whisper 式规模化弱监督序列到序列训练,鲁棒性提升明显得益于数据规模而非架构复杂度;
  2. TTS 从"声学特征 + 声码器"两阶段管线演进出神经编解码器语言模型路线(VALL-E),把语音生成转化为离散 token 的语言建模问题;
  3. 神经音频编解码器(SoundStream/EnCodec 的残差向量量化)是连接音频理解与音频生成的公共表示,呼应第一章的统一 Token 化范式;
  4. Audio-Language 模型(Qwen-Audio、SALMONN)在识别文字之上还要理解副语言信息,需要与纯 ASR 分开评测;
  5. TTS 音色克隆能力应配合授权与滥用防护,不能默认无限制开放。

把音频离散成 token 之后,ASR、TTS 和音频理解能共享一套语言建模思路,但评测仍要分开看准确率、自然度和副语言理解。

参考资料