Appearance
能力·语音模型:听懂说话 + 开口说话
人机交互里最自然的方式就是说话。语音模型分两头:让 AI 听懂人说话(语音转文字),以及让 AI 开口说话(文字转语音)。它们合起来,才让 Agent 能像真人一样"你说我听、我一问一答"。
这篇把这两类讲清楚:它们干嘛、原理、用什么架构。
它有哪些:语音赛道其实是"两条车道"
"语音模型"这个叫法其实包含两类完全不同的活,别混:
一、语音转文字(ASR / Speech-to-Text,语音识别)
- 你说话,它把声音变回文字;
- 你按语音助手说话,转成文字后,才让文字大模型理解;
- 这是"听懂你说话"的那一环。
二、文字转语音(TTS / Text-to-Speech,语音合成)
- 给它文字,它声情并茂地读出来;
- 你问"明天天气",Agent 算好回复,再用它的声音说给你听;
- 这是"开口回应你"的那一环。
记住:ASR = 耳朵(声音→文字),TTS = 嘴巴(文字→声音)。 一个负责听,一个负责说。
语音转文字(ASR)的原理:把"声音"变回"字"
声音本身是一段高低起伏的波形,是一连串数字信号,不是文字。ASR 要做的,是把它翻译成对应的字。靠的是"三步走":
① 把声音切成长短片段。 把语音流切成一小段一小段(比如每 20 毫秒一段),每段算出它的"音色特征"(频率、能量等等),变成一个个小向量。
② 逐个音识别成"字/音"。 模型把这一串小向量,映射成对应的音素(最小的语言单位)或字符,把"声音"转成"大致是哪些字"。
③ 用语言知识拼成通顺的话。 光靠声音可能"听岔"(比如"我要洗澡" vs "我要洗枣"),所以结合语言大模型,把零碎的字拼成最通顺、最合语境的整句话。
现代 ASR 常用端到端方案:直接把"声音波形"整段喂进去,一跳输出一整句话,中间省去手工切分,准确率大幅提升。
文字转语音(TTS)的原理:从"字"变回"声音"
TTS 和 ASR 正好相反,是逆向工程:拿到文字,变成能说出来的声音。也有清晰的三步:
① 文字 → 发音(前端) 把书面文字转成该怎样发音:标出拼音/音素、重音、停顿断句。
② 发音 → 波形细节(声学/声码) 把"该发出的音"变成"声音具体长什么样"的高频信息。
③ 波形 → 最终语音 合成出真实的音频波形,这一步叫"声码器",负责让声音听上去自然、有情感。
现代 TTS 追求"像真人",能做音色克隆(学某个人的声音)、情感语气(开心、严肃、温柔),更像真人在说话而非机器朗读。
它通常选什么架构
语音模型架构也在快速演进,主流思路是"和文本大模型深度融合":
ASR(听懂):
- 老派做法:独立的声音识别模型 + 拼字模型,链路长(上面三步分开);
- 现代主流:基于 Transformer 的编码器-解码器端到端模型(如 Whisper 类),把"声音"和"文字"当成同一种序列来处理,听声音直接出文字;
- 结构上它可以被看成一个"语音版的多模态 Transformer"——输入换成了声音特征序列。
TTS(开口):
- 老派做法:拼接(把预先录好的音库拼起来)为主,机械感强;
- 现代主流:同样是 Transformer / 扩散类模型,从文字直接合成自然波形,能上手调情感和音色;
- 有些还接进多模态模型,让 Agent 用"同一个大脑"边理解边发声。
为什么都朝着 Transformer / 多模态融合走?
- Transformer 处理"序列"的能力,正好把"声音序列"和"文字序列"统一建模;
- 端到端省去了手工切分的误差,更准更自然;
- 随着多模态大模型成熟,听、说、理解常常合进一个模型,ASR 和 TTS 成了它自带的能力(也叫"全模态")。
它的优缺点
ASR(听懂):
- ✅ 无手输入,交互自然;端到端已很准;
- ⚠️ 口音、环境噪音、同音字仍会出错;
TTS(开口):
- ✅ 能读任何文字、可克隆音色、带情感;
- ⚠️ 长句偶有"机器感";音色版权/滥用需谨慎;
软件层面:
- 前后链路若仍分离,端到端融合度越高越自然,但也越吃算力。
在 Agent 里的用处:让 Agent 能"对话"而非"打字"
语音让 Agent 从"文字助手"进化为"语音助手":
- 用户说话 → ASR 转成文字 → Agent 大脑理解思考 → 生成回复文字 → TTS 朗读出来;
- 一条完整的"语音对话"闭环,就是这么接起来的;
- 多模态 Agent 往往把这两块内嵌进一个模型,一个 Agent 既能听懂你、又能开口回你。
没有语音,Agent 只活在文本框里;有了语音,Agent 才真正"能听会说",贴近真人交流。
小结
| 项 | ASR(听懂) | TTS(开口) |
|---|---|---|
| 干什么 | 声音 → 文字 | 文字 → 声音 |
| 原理 | 声音切段→识别发音→拼通顺句子 | 文字→标发音→合成声学→出波形 |
| 常用架构 | Transformer 端到端(Whisper类) | Transformer/扩散,情感音色可控 |
| 为什么 | 序列统一建模、端到端更准 | 自然、可克隆、朝多模态融合 |
| 在 Agent 里 | 让 Agent"听懂你说话" | 让 Agent"开口回你" |