Appearance
模型篇 · 世界上的模型到底分几类
基础篇我们把"大脑"当成一个整体懂了它的道理。但现实里"大脑"可不止一种。打开任何一家模型平台的列表,你会看到一长串名词:GPT、Claude、Llama、DeepSeek、Qwen、MoE、RAG 模型、向量模型、生图模型……
这一篇的目的就一个:让你面对这些名词不再发怵,能看懂"每种模型到底在干嘛、靠什么原理工作、有什么优缺点"。
先把这一篇的脉络记住——它分两个问题,是两个完全不同的维度,千万别搞混:
问题一:这个模型内部是"怎么长"的?(架构) —— 就像问"这台车的发动机是汽油还是电"。
问题二:这个模型能"吃进什么、吐出什么"?(能力) —— 就像问"这台车能载几个人、能不能运货"。
我们第一步,先彻底搞清楚问题一(架构),因为它决定了模型的性能和成本,是技术选型的地基;第二步再讲问题二(能力),那是功能上的分类。
第一步:先搞懂"架构"
- 架构·一张总览图 —— 把"模型"这个工具箱的全貌摆在你面前
- 架构·Transformer:那颗祖师爷 —— 为什么全世界的模型几乎都是它"生的"
- 架构·密集型与 MoE:一对亲兄弟 —— 你认识的 MoE,和它那个"老实"的兄弟
- 架构·线性架构:后浪们 —— Mamba、RWKV 等想推翻 Transformer 的新势力
第二步:再搞懂"能力"
(待续)—— 文本模型、多模态模型、向量模型、重排模型、生图、生视频、语音……会以独立页面展开。
先读 架构·一张总览图,花最短的时间把全貌看明白。