Appearance
架构·线性架构:想推翻祖师爷的后浪们
前面两篇说了,Transformer 一个最扎心的软肋是:句子越长,开销越像坐火箭。(要算的关系数量跟句子长度的平方成正比。)
面对这个"平方"的紧箍咒,各路人马都想破局。MoE 是我们上一讲的思路:架构不变,光靠"按需叫人"省成本。而还有一脉更激进的狠人,打算从根本上换掉"两两看"这个机制本身。他们统称线性架构。
这一篇,带你看清楚这波"后浪"到底在打什么主意。
后浪们抓住的靶子:那个"平方"问题
回忆 Transformer 是怎么工作的——它让句子里的**每一个词,都和所有其他词"两两对视"**一遍。字数 N 的文字,要配对的关系大概是 N×N,也就是 N 的平方。
这意味着什么?
- 读到 1000 字,算 1000×1000 = 100 万次关系;
- 读到 1 万字,算 1 亿次——直接翻 100 倍;
- 想处理一本几十万字的小说?那计算量直接爆表,谁也扛不住。
"平方"就是 Transformer 的天花板。 谁能在"长内容"这件事上突破它,谁就掌握了下一代大模型的钥匙。
于是,后浪们的目标非常一致:把"N 的平方"降成"N",也就是"线性"——你的计算量随内容长度成正比增长,而不是平方爆炸。 这也是"线性架构"这个名字的由来。
他们的大招:不"全看",改"滚动记账"
Transformer 靠"每个人环顾所有人"理解全文。线性架构不要这个了,他们换了一种更省的方法,主要有两条路线:
路线一:线性注意力(RWKV 等) 不再让你"两两配对视",而是让信息像记账一样,顺着往下"滚"。每个词读到时,把自己接到一个"滚动累积的记忆账本"上。接下来不管句子再长,读每个新词都只要"查一眼当前账本",成本是固定的——长度加一,成本只加一,不再爆炸。
路线二:状态空间模型 SSM(Mamba 等) 理念类似:把输入想象成流入"系统"的信号,系统维护一个"当前状态",每进来一个字,就更新一次状态。所以无论前面有多少字,处理下一个字时,都只需要看"最近的状态"这一个汇总,同样做到了线性开销。
一句话说透:Transformer 是"一次把全句摊开互相对",线性架构是"边走边记账,永远只看当前一页"。前者胜在信息全,后者胜在省。
线性架构的诱人之处
它一旦成立,好处是决定性的:
- 能扛超长内容:百万字的小说、整本书、大段历史对话,它都吃得下,成本不失控。
- 开销又低又快:比 Transformer 更适合小设备、低成本部署。
- 理论上"推理永远便宜":无论上下文拉得多长,单步成本都不变。
但为什么现在的主流还是 Transformer?——后浪的无奈
听着这么香,怎么还没造反成功?因为后浪们也有自己的硬伤:
硬伤一:捕捉"关系"的本事变弱了。 Transformer 因为是"两两全看",能特别精细地捕捉任意两个词之间的关系(比如"第 3 段的那句话呼应了第 20 段")。线性架构靠"滚动记账",信息都被压扁成了"汇总",长距离、精细的关联能力会打折扣。就好比账簿记得住总数,却说不清某两笔账当初怎么纠缠的。
硬伤二:事实和记忆容易"糊"。 既然都压成"当前状态"了,中间那些具体的细节容易被揉成一团,导致在"精确复述、多跳推理"这类任务上不如 Transformer 稳。这在很多严肃场景是不可接受的。
"省"和"准"之间的博弈,正是后浪们当前最挠头的地方。
现状与启示:不是谁取代谁,而是"两条腿走路"
现实世界里,聪明人不会只押一边。现在出现了很多**"混合架构"——把 Transformer 和线性架构混着用**:核心的重任交给 Transformer 保精度,长上下文、记忆折叠这种重活用线性架构来省钱。代表作像 Jamba,就是把 Mamba 线性层和 Transformer 注意层叠起来的混血儿。
所以大可不必急着判断"谁赢"——这条技术路线之争,最后很可能不是二选一,而是取长补短地融合。
小结:三兄弟怎么选(架构篇收官)
把模型篇的架构部分收个尾,给你一张"三兄弟总表":
| 家族 | 思路 | 优点 | 软肋 | 谁在用 |
|---|---|---|---|---|
| Transformer(密集) | 全员上阵、两两全看 | 效果好、稳定、成熟 | 越长越贵(平方) | GPT、Llama、Claude |
| MoE | 拆专家、按需激活 | 又大又省、可上规模 | 调参复杂、负载易偏 | DeepSeek、Mixtral |
| 线性架构 | 滚动记账、线性开销 | 能扛超长、成本低 | 长距关系变弱、欠稳 | Mamba、RWKV、Jamba |
架构分清之后,下一篇我们换一个坐标系,去谈**"能力"**——文本、多模态、向量、重排、生图、生视频、语音……这才是一直以来你用模型真正在意的功能。