Appearance
能力·多模态模型:一个能看会说的"通才"
如果说文本模型是"只认得文字的书呆子",那多模态模型就是"眼观六路、耳听八方"的通才——它不光能读文字,还能看懂图片、听懂声音,甚至能自己画图、说话。
现在你打开很多 App 看到的"上传图片让它描述"、"跟它语音对话",背后都是多模态模型。这篇讲讲它是怎么做到的、用什么架构。
它是干嘛的:一个脑袋,多种"感官"
多模态(Multi-modal)里的"模态",指的是信息的种类/格式:文字、图片、音频、视频,各自算一种模态。
多模态模型,就是能同时处理多种模态的模型。 常见的有:
- 文字 + 图片:你看一张照片,它能描述画面、识别物体、回答"图里的人在干嘛"。比如 GPT-4V、Claude 视觉版。
- 文字 + 音频:能听懂你说的语音,或用声音回你。
- 全都要:图、文、音、视频一起来,全能选手。
它的价值在于:现实世界的信息本来就是混合的——一张说明书里有图和字,一段视频里有画面和声音。单一文本的模型看不了图、听不了音,多模态让模型终于能"贴进真实世界"。
它的原理:把不同模态,翻译成"同一个语言"
多模态模型最核心的难点,是怎么让"图片"和"文字"这两种八竿子打不着的东西,能被同一个大脑理解。
它想通这件事的办法很有智慧,分两步:
第一步:给每种模态造"翻译官"。 图片不是文字,没法直接送进大脑。所以设一个"视觉编码器",把一张图切成一格格的小块,每小块转成一段"数字描述";音频同样,切成小片转成数字序列。这一步,相当于把"图片/声音"翻译成了"大脑能读的语言"。
第二步:统一送进 Transformer 大脑。 翻译完的"图片数字"和"文字词元",都被拼在同一个 Transformer 里,当成一长串混合的"字"来一起处理。于是大脑既读到了文字,又"读"到了图片、声音,还能在它们之间互相找联系。
一句话说透:多模态 = 给每种"感官"配个翻译官,把不同信息都翻成同一种"数字语言",再交给同一个 Transformer 通才去统一理解。 这就是为什么它"又能看又会说"。
它通常选什么架构
绝大多数多模态模型,也是Transformer 家族打底,但结构上会有些讲究:
主流做法:多模态 = 一个文本 Transformer 主脑 + 几个"模态翻译官"。
- 主脑本体,往往就是那个文本模型(密集或 MoE);
- 前面挂视觉/音频编码器,负责把图片、声音翻成数字;
- 有的还会有一段"对齐模块",专门负责把视觉信息和文字"校准"到同一个空间。
为什么要这么搭?
- Transformer 天然的"统一序列处理"能力,正好适合把图片块、音频片、文字混在一起处理;
- 复用成熟、强大的文本大模型做"总脑",比从零训一个多模态更省力、效果也更稳;
- 唯一的代价是:挂上影像和声音,数据量和算力要求大幅上升(既要文字语料,还要海量"图配文"、"音配文"数据)。
现在不少模型直接用 MoE 架构来担这个角色,就是为了在"又要大、又要能看能说"时控制成本。
它的优缺点
优点:
- 信息面宽,能理解现实中"混合形态"的内容;
- 用户体验更自然(看图说话、语音交互);
- 在 Agent 里能"看得见"环境。
缺点 / 代价:
- 贵、慢:要同时处理多个模态,算力和延迟都更高;
- 模态间易"各说各话":如果对齐没做好,可能出现"图片看到了,但没和文字联系上"的失配;
- 对数据要求苛刻:得喂海量"图配文 / 音配文"的配对数据,门槛高。
在 Agent 里的用处:让 Agent"睁眼看世界"
有了多模态,Agent 从"只能读懂文字"进化成"能感知真实世界":
- 把截图、照片、扫描件丢给它,它就"眼睛一亮"能理解;
- 用语音跟它对话,交互更自然;
- 帮它读懂界面元素,从而去操作软件、看图表。
可以说,多模态是让 Agent 离开"纯文字聊天间"、走向真实应用的钥匙。
小结
| 项 | 内容 |
|---|---|
| 干什么 | 同时处理文字+图片+音频等多种信息 |
| 原理 | 每种模态配"翻译官",统一转成数字,交给同一个 Transformer 理解 |
| 常用架构 | Transformer 主脑(密集/MoE) + 视觉/音频编码器 |
| 为什么 | Transformer 适合统一序列处理;复用文本大模型当主脑 |
| 优缺点 | 信息全面但贵而慢;对齐要求高 |
| 在 Agent 里 | 让 Agent 睁眼看世界、语音自然交互 |