Skip to content
On this page

能力·文本模型:最老牌的大脑

文本模型是模型世界里资格最老、最基础的一类——你输入文字,它输出文字。ChatGPT、Claude、Llama、Qwen,以及 DeepSeek 的主力,本质上都是文本模型。其他所有能力(画图、说话、看视频)大多数也都要从"文本理解"这一身本领往上叠。

这一篇讲清楚三件事:

  1. 文本模型到底是干嘛的,为什么它是一切的地基;
  2. 它的原理;
  3. 它通常选择什么架构、为什么。

它是干嘛的:只吃文字,只吐文字

文本模型干的事,通俗讲就一句:你给它一段文字,它回你一段文字。(技术上叫"下一个词预测",前面基础篇已经讲过这层。)

但它不只是"聊天"。文本能力能撑起一堆活儿:

  • :作文、代码、翻译、摘要、文案;
  • 读懂:理解问题、抽取信息、判断对错;
  • 推理:多步思考、数学、逻辑判断。

也就是说,几乎所有"需要语言去思考"的事,都是文本模型的看家本领。 也正是因为这个,它在整个模型体系里地位最核心。


它的原理:猜下一个词,猜出"会思考"

文本模型的核心机制,在基础篇《LLM:那颗大脑》里详细讲过。简要说就是:

  1. 把文字切成一个个"词元"(Token,相当于字/词的小碎片);
  2. 一个词一个词地往后「猜」:根据前面所有词,算出下一个最该出现的词是谁;
  3. 一路猜下去,直到写完一整段。

神奇的是,当这个"猜词器"规模足够大、见过的文字足够多,它就开始"涌现"出理解力、逻辑力和创造力——它不再是在背,而是在"顺着理路想"

一个朴素而关键的认知:文本模型的"聪明",不是程序员写死的规则,而是从海量文字里"长"出来的。 越多、越杂、越高质量的数据喂进去,它的底子就越厚。


它通常选什么架构:Transformer,及其"省电版"

谈到文本模型的架构,几乎可以武断地说:现代主流文本模型,清一色是 Transformer 家族。

  • 密集 Transformer 的:GPT 全系、Claude、Llama、Qwen 标准版;
  • MoE 的:DeepSeek-V3、Mixtral、Qwen-MoE(想在省钱的前提下把模型做得更大更强)。

为什么偏偏选 Transformer? 因为它最能发挥文本模型的两种关键能力:

  1. 抓"长距离关系":写文章、做推理,往往要回头呼应几千字之前的内容。Transformer 的"自注意力"能直接"两两对视",跨很远也能关联上,这正是文本理解和生成最需要的。
  2. 方便把规模堆大:文本模型的智商,很大程度靠"海量参数+海量数据"堆出来。Transformer 天生适合超大规模并行训练,能一路堆到几千亿参数。

至于 MoE 版,就是在"想更大、又不想更贵"时,用"按需叫专家"的方式把"名义规模"和"实际成本"解耦——刚在架构篇讲过的那个思路,在文本模型上用得最多。

一句话:文本模型的架构选择几乎不用想,就是 Transformer;纠结的只是"密集"还是"MoE"——也就是"追求最稳"还是"追求大而省"。


在 Agent 里的用处:它是"总大脑"

在一个 Agent 系统里,文本模型通常扮演**"总指挥"**:

  • 听懂用户的请求;
  • 决定「要不要查资料(RAG)、要不要调工具(Tool)」;
  • 融合查到的资料、写最终的回答。

其他能力模型,多是"专业干一件事的熟练工";而这个文本模型,是统筹全局的主脑


小结

内容
干什么输入文字→输出文字,写、读、推理
原理逐词预测,从海量数据"长出"智能
常用架构Transformer(密集)为主;追求大而省用 MoE
为什么自注意力抓长程关系 + 适合超大规模训练
在 Agent 里总大脑、调度中枢

要保持清醒 永远不抱有意外的幻想 凭空的期待最要命