Skip to content
On this page

架构·一张总览图:模型到底怎么分类

先想一个问题:你去车行买车,会怎么挑车?

你大概会按两个角度问:一是"这车动力系统是什么"(油车、电车、混动),二是"这车尺寸用途是什么"(轿车、SUV、跑车)。同一个车,同时拥有这两个属性。

模型世界完全一样。理解它,关键是先接受这个事实:"架构"和"能力"是两张独立的分类表,任何模型都能在两张表里各占一格。

这篇先帮你把这两张表立起来,重点讲架构这张——因为它是你现在的困惑核心。


你说的 MoE,其实只是"架构"这张表里的一格

很多人第一次听说"模型类型",听到的是 MoE(混合专家)。直觉以为"模型类型"就是 MoE、Mamba 那些词。**大方向没错,但要把事情理顺,得先知道档案里还有哪些邻居。**下面这张表,就是"架构"维度目前所有的主流选项:

架构类型一句话记忆代表家伙
Transformer(密集)祖师爷,全模型世界的起点GPT、Llama、Claude、Qwen
MoE(混合专家)拆成多个"小大脑",按需启用,又大又省DeepSeek-V3、Mixtral、Qwen-MoE
线性注意力 / SSM想推翻 Transformer 的后浪,处理超长内容不再卡成本Mamba、RWKV、Jamba

你会看到,大多数你认识的模型,底层都是 Transformer——只是有的是"密集版",有的是"MoE 版"。所以下一篇先讲明白 Transformer 这位祖师爷,MoE 才有着落。


怎么快速认出"这是架构问题,还是能力问题"

给你一条判断口诀:

  • 如果问的是 "它内部有几个专家、是不是几万亿参数、怎么并行训练" —— 这是架构问题。
  • 如果问的是 "它能读文章还是能画图、能不能说话" —— 这是能力问题。

打个比方:架构是你电脑的 CPU 设计,能力是你电脑装了什么软件。 同一个架构可以跑不同的能力,不同的架构也能实现同一种能力。


选架构,本质是在"成本"和"效果"之间平衡

架构最大的现实意义是:它直接决定模型的训练成本、推理成本、速度和上限。你可以把架构之争,理解为一场"花最少钱办最多事"的技术竞赛:

  • 密集 Transformer:效果稳、实现简单,但越大越烧钱
  • MoE:能用同样的预算养一个"名义上巨大、实际按需计算"的模型,省钱又够强
  • 线性架构:理论上能把成本拉得极低,但目前还在追赶期。

先记住这张图

面向所有模型的分类
├── 按【架构】(怎么长出来的)
│     ├── Transformer —— 密集版(主流、稳定)
│     ├── Transformer —— MoE 版(大而省,很多新模型在用)
│     └── 线性架构  —— Mamba / RWKV(后浪,竞争力)
└── 按【能力】(能吃什么、吐什么)
      ├── 文本模型(读文/写文)
      ├── 多模态模型(图+文+音一起)
      ├── 向量模型(把内容变成"位置")
      ├── 重排模型(给结果精排)
      ├── 生图 / 生视频(创作类)
      └── 语音模型(听和说)

读到这里,先别急着往后。去 架构·Transformer:那颗祖师爷 把地基打牢,再回头看这张图,你会发现所有"模型类型"都在你脑子里各归各位了。

要保持清醒 永远不抱有意外的幻想 凭空的期待最要命