Skip to content
On this page

能力·语音模型:听懂说话 + 开口说话

人机交互里最自然的方式就是说话。语音模型分两头:让 AI 听懂人说话(语音转文字),以及让 AI 开口说话(文字转语音)。它们合起来,才让 Agent 能像真人一样"你说我听、我一问一答"。

这篇把这两类讲清楚:它们干嘛、原理、用什么架构。


它有哪些:语音赛道其实是"两条车道"

"语音模型"这个叫法其实包含两类完全不同的活,别混:

一、语音转文字(ASR / Speech-to-Text,语音识别)

  • 你说话,它把声音变回文字;
  • 你按语音助手说话,转成文字后,才让文字大模型理解;
  • 这是"听懂你说话"的那一环。

二、文字转语音(TTS / Text-to-Speech,语音合成)

  • 给它文字,它声情并茂地读出来;
  • 你问"明天天气",Agent 算好回复,再用它的声音说给你听;
  • 这是"开口回应你"的那一环。

记住:ASR = 耳朵(声音→文字),TTS = 嘴巴(文字→声音)。 一个负责听,一个负责说。


语音转文字(ASR)的原理:把"声音"变回"字"

声音本身是一段高低起伏的波形,是一连串数字信号,不是文字。ASR 要做的,是把它翻译成对应的字。靠的是"三步走":

① 把声音切成长短片段。 把语音流切成一小段一小段(比如每 20 毫秒一段),每段算出它的"音色特征"(频率、能量等等),变成一个个小向量。

② 逐个音识别成"字/音"。 模型把这一串小向量,映射成对应的音素(最小的语言单位)或字符,把"声音"转成"大致是哪些字"。

③ 用语言知识拼成通顺的话。 光靠声音可能"听岔"(比如"我要洗澡" vs "我要洗枣"),所以结合语言大模型,把零碎的字拼成最通顺、最合语境的整句话

现代 ASR 常用端到端方案:直接把"声音波形"整段喂进去,一跳输出一整句话,中间省去手工切分,准确率大幅提升。


文字转语音(TTS)的原理:从"字"变回"声音"

TTS 和 ASR 正好相反,是逆向工程:拿到文字,变成能说出来的声音。也有清晰的三步:

① 文字 → 发音(前端) 把书面文字转成该怎样发音:标出拼音/音素、重音、停顿断句。

② 发音 → 波形细节(声学/声码) 把"该发出的音"变成"声音具体长什么样"的高频信息。

③ 波形 → 最终语音 合成出真实的音频波形,这一步叫"声码器",负责让声音听上去自然、有情感。

现代 TTS 追求"像真人",能做音色克隆(学某个人的声音)、情感语气(开心、严肃、温柔),更像真人在说话而非机器朗读。


它通常选什么架构

语音模型架构也在快速演进,主流思路是"和文本大模型深度融合":

ASR(听懂):

  • 老派做法:独立的声音识别模型 + 拼字模型,链路长(上面三步分开);
  • 现代主流:基于 Transformer 的编码器-解码器端到端模型(如 Whisper 类),把"声音"和"文字"当成同一种序列来处理,听声音直接出文字;
  • 结构上它可以被看成一个"语音版的多模态 Transformer"——输入换成了声音特征序列。

TTS(开口):

  • 老派做法:拼接(把预先录好的音库拼起来)为主,机械感强;
  • 现代主流:同样是 Transformer / 扩散类模型,从文字直接合成自然波形,能上手调情感和音色;
  • 有些还接进多模态模型,让 Agent 用"同一个大脑"边理解边发声。

为什么都朝着 Transformer / 多模态融合走?

  • Transformer 处理"序列"的能力,正好把"声音序列"和"文字序列"统一建模;
  • 端到端省去了手工切分的误差,更准更自然;
  • 随着多模态大模型成熟,听、说、理解常常合进一个模型,ASR 和 TTS 成了它自带的能力(也叫"全模态")。

它的优缺点

ASR(听懂):

  • ✅ 无手输入,交互自然;端到端已很准;
  • ⚠️ 口音、环境噪音、同音字仍会出错;

TTS(开口):

  • ✅ 能读任何文字、可克隆音色、带情感;
  • ⚠️ 长句偶有"机器感";音色版权/滥用需谨慎;

软件层面:

  • 前后链路若仍分离,端到端融合度越高越自然,但也越吃算力。

在 Agent 里的用处:让 Agent 能"对话"而非"打字"

语音让 Agent 从"文字助手"进化为"语音助手":

  • 用户说话 → ASR 转成文字 → Agent 大脑理解思考 → 生成回复文字 → TTS 朗读出来;
  • 一条完整的"语音对话"闭环,就是这么接起来的;
  • 多模态 Agent 往往把这两块内嵌进一个模型,一个 Agent 既能听懂你、又能开口回你。

没有语音,Agent 只活在文本框里;有了语音,Agent 才真正"能听会说",贴近真人交流。


小结

ASR(听懂)TTS(开口)
干什么声音 → 文字文字 → 声音
原理声音切段→识别发音→拼通顺句子文字→标发音→合成声学→出波形
常用架构Transformer 端到端(Whisper类)Transformer/扩散,情感音色可控
为什么序列统一建模、端到端更准自然、可克隆、朝多模态融合
在 Agent 里让 Agent"听懂你说话"让 Agent"开口回你"

要保持清醒 永远不抱有意外的幻想 凭空的期待最要命