Appearance
架构·一张总览图:模型到底怎么分类
先想一个问题:你去车行买车,会怎么挑车?
你大概会按两个角度问:一是"这车动力系统是什么"(油车、电车、混动),二是"这车尺寸用途是什么"(轿车、SUV、跑车)。同一个车,同时拥有这两个属性。
模型世界完全一样。理解它,关键是先接受这个事实:"架构"和"能力"是两张独立的分类表,任何模型都能在两张表里各占一格。
这篇先帮你把这两张表立起来,重点讲架构这张——因为它是你现在的困惑核心。
你说的 MoE,其实只是"架构"这张表里的一格
很多人第一次听说"模型类型",听到的是 MoE(混合专家)。直觉以为"模型类型"就是 MoE、Mamba 那些词。**大方向没错,但要把事情理顺,得先知道档案里还有哪些邻居。**下面这张表,就是"架构"维度目前所有的主流选项:
| 架构类型 | 一句话记忆 | 代表家伙 |
|---|---|---|
| Transformer(密集) | 祖师爷,全模型世界的起点 | GPT、Llama、Claude、Qwen |
| MoE(混合专家) | 拆成多个"小大脑",按需启用,又大又省 | DeepSeek-V3、Mixtral、Qwen-MoE |
| 线性注意力 / SSM | 想推翻 Transformer 的后浪,处理超长内容不再卡成本 | Mamba、RWKV、Jamba |
你会看到,大多数你认识的模型,底层都是 Transformer——只是有的是"密集版",有的是"MoE 版"。所以下一篇先讲明白 Transformer 这位祖师爷,MoE 才有着落。
怎么快速认出"这是架构问题,还是能力问题"
给你一条判断口诀:
- 如果问的是 "它内部有几个专家、是不是几万亿参数、怎么并行训练" —— 这是架构问题。
- 如果问的是 "它能读文章还是能画图、能不能说话" —— 这是能力问题。
打个比方:架构是你电脑的 CPU 设计,能力是你电脑装了什么软件。 同一个架构可以跑不同的能力,不同的架构也能实现同一种能力。
选架构,本质是在"成本"和"效果"之间平衡
架构最大的现实意义是:它直接决定模型的训练成本、推理成本、速度和上限。你可以把架构之争,理解为一场"花最少钱办最多事"的技术竞赛:
- 密集 Transformer:效果稳、实现简单,但越大越烧钱。
- MoE:能用同样的预算养一个"名义上巨大、实际按需计算"的模型,省钱又够强。
- 线性架构:理论上能把成本拉得极低,但目前还在追赶期。
先记住这张图
面向所有模型的分类
├── 按【架构】(怎么长出来的)
│ ├── Transformer —— 密集版(主流、稳定)
│ ├── Transformer —— MoE 版(大而省,很多新模型在用)
│ └── 线性架构 —— Mamba / RWKV(后浪,竞争力)
└── 按【能力】(能吃什么、吐什么)
├── 文本模型(读文/写文)
├── 多模态模型(图+文+音一起)
├── 向量模型(把内容变成"位置")
├── 重排模型(给结果精排)
├── 生图 / 生视频(创作类)
└── 语音模型(听和说)读到这里,先别急着往后。去 架构·Transformer:那颗祖师爷 把地基打牢,再回头看这张图,你会发现所有"模型类型"都在你脑子里各归各位了。