Skip to content
On this page

能力·多模态模型:一个能看会说的"通才"

如果说文本模型是"只认得文字的书呆子",那多模态模型就是"眼观六路、耳听八方"的通才——它不光能读文字,还能看懂图片、听懂声音,甚至能自己画图、说话。

现在你打开很多 App 看到的"上传图片让它描述"、"跟它语音对话",背后都是多模态模型。这篇讲讲它是怎么做到的、用什么架构。


它是干嘛的:一个脑袋,多种"感官"

多模态(Multi-modal)里的"模态",指的是信息的种类/格式:文字、图片、音频、视频,各自算一种模态。

多模态模型,就是能同时处理多种模态的模型。 常见的有:

  • 文字 + 图片:你看一张照片,它能描述画面、识别物体、回答"图里的人在干嘛"。比如 GPT-4V、Claude 视觉版。
  • 文字 + 音频:能听懂你说的语音,或用声音回你。
  • 全都要:图、文、音、视频一起来,全能选手。

它的价值在于:现实世界的信息本来就是混合的——一张说明书里有图和字,一段视频里有画面和声音。单一文本的模型看不了图、听不了音,多模态让模型终于能"贴进真实世界"。


它的原理:把不同模态,翻译成"同一个语言"

多模态模型最核心的难点,是怎么让"图片"和"文字"这两种八竿子打不着的东西,能被同一个大脑理解。

它想通这件事的办法很有智慧,分两步:

第一步:给每种模态造"翻译官"。 图片不是文字,没法直接送进大脑。所以设一个"视觉编码器",把一张图切成一格格的小块,每小块转成一段"数字描述";音频同样,切成小片转成数字序列。这一步,相当于把"图片/声音"翻译成了"大脑能读的语言"。

第二步:统一送进 Transformer 大脑。 翻译完的"图片数字"和"文字词元",都被拼在同一个 Transformer 里,当成一长串混合的"字"来一起处理。于是大脑既读到了文字,又"读"到了图片、声音,还能在它们之间互相找联系。

一句话说透:多模态 = 给每种"感官"配个翻译官,把不同信息都翻成同一种"数字语言",再交给同一个 Transformer 通才去统一理解。 这就是为什么它"又能看又会说"。


它通常选什么架构

绝大多数多模态模型,也是Transformer 家族打底,但结构上会有些讲究:

主流做法:多模态 = 一个文本 Transformer 主脑 + 几个"模态翻译官"。

  • 主脑本体,往往就是那个文本模型(密集或 MoE);
  • 前面挂视觉/音频编码器,负责把图片、声音翻成数字;
  • 有的还会有一段"对齐模块",专门负责把视觉信息和文字"校准"到同一个空间。

为什么要这么搭?

  • Transformer 天然的"统一序列处理"能力,正好适合把图片块、音频片、文字混在一起处理;
  • 复用成熟、强大的文本大模型做"总脑",比从零训一个多模态更省力、效果也更稳;
  • 唯一的代价是:挂上影像和声音,数据量和算力要求大幅上升(既要文字语料,还要海量"图配文"、"音配文"数据)。

现在不少模型直接用 MoE 架构来担这个角色,就是为了在"又要大、又要能看能说"时控制成本。


它的优缺点

优点:

  • 信息面宽,能理解现实中"混合形态"的内容;
  • 用户体验更自然(看图说话、语音交互);
  • 在 Agent 里能"看得见"环境。

缺点 / 代价:

  • 贵、慢:要同时处理多个模态,算力和延迟都更高;
  • 模态间易"各说各话":如果对齐没做好,可能出现"图片看到了,但没和文字联系上"的失配;
  • 对数据要求苛刻:得喂海量"图配文 / 音配文"的配对数据,门槛高。

在 Agent 里的用处:让 Agent"睁眼看世界"

有了多模态,Agent 从"只能读懂文字"进化成"能感知真实世界":

  • 截图、照片、扫描件丢给它,它就"眼睛一亮"能理解;
  • 语音跟它对话,交互更自然;
  • 帮它读懂界面元素,从而去操作软件、看图表。

可以说,多模态是让 Agent 离开"纯文字聊天间"、走向真实应用的钥匙。


小结

内容
干什么同时处理文字+图片+音频等多种信息
原理每种模态配"翻译官",统一转成数字,交给同一个 Transformer 理解
常用架构Transformer 主脑(密集/MoE) + 视觉/音频编码器
为什么Transformer 适合统一序列处理;复用文本大模型当主脑
优缺点信息全面但贵而慢;对齐要求高
在 Agent 里让 Agent 睁眼看世界、语音自然交互

要保持清醒 永远不抱有意外的幻想 凭空的期待最要命