Skip to content
On this page

能力·向量模型:把万物变成一个"坐标"

如果说其他模型是"会说话的专家",那向量模型就是一个"不爱说话、但特别擅长把东西变成坐标"的测绘员。它不给你答案,却默默支撑着搜索、推荐、问答这些大应用。

RAG 里那一环"怎么找到相关资料",靠的就是它。这篇讲讲它是干嘛、怎么工作、为什么长这样。


它是干嘛的:把文字/图片,变成一串数字

向量(Vector)模型,也叫 Embedding 模型,它的唯一工作就是:把一段内容(文字、图片、音频……)变成一串数字(一个"坐标")。

听着玄乎,但举个生活例子你就懂了:

  • "苹果"、"香蕉"、"水果" —— 这三个词给你的感觉是不是挺近?
  • "苹果"、"工厂"、"法律" —— 这三个是不是八竿子打不着?

向量模型做的事,就是把每个词/每段话,映射到一个"语义空间"里,让意思相近的东西在空间里挨得近,意思离得远的东西离得远。 产出那串数字,就叫这个内容的向量

它的输出不是"一句话",而是一串数字坐标。模型比的是"谁和谁近"。


它的原理:把"意思"量化成距离

核心思想一句话:让语义的远近,变成数字坐标的远近。

它怎么做到?训练过程会让它学会:意思相近的文本,向量坐标要靠近;意思无关的,坐标要拉远。 训练数据是海量"相似对"和"不相似对",一遍遍让它蹭着调。

于是训练完你就得到一个"语义地图":

  • 向量之间的距离(余弦距离) 越小,说明越像;
  • 你可以拿任意两段文字,算它们的坐标距离,就知道它们语义上多接近。

这正是搜索和 RAG 想要的能力:给定一个问题,把整个知识库的内容都变成向量存起来,然后看哪些内容和问题"距离最近",就认为哪些是"最相关的资料"。 一步一个坐标,谁近谁浮出水面。


它通常选什么架构

向量模型也有讲究,主流是基于 Transformer 的"编码器(Encoder)"架构,但和"会说话"的生成模型有个关键区别:

关键区别:它是"只读一遍"的编码器,而不是"一个字一个字往后写"的生成器。

  • 生成模型(如 GPT)是 Decoder,擅长"顺着往下写作";
  • 向量模型是 Encoder,擅长"把整段内容读进去,压成一个总的向量"。
  • 输出也不是文字,而是那个代表整段意思的向量

为什么这么选?

  • Encoder 天生适合"概括一段话的意思"——读完整段,给一个综合坐标,正好是向量模型要做的;
  • 很多开源的向量模型(如 BGE、text-embedding 系列)都是这种结构;
  • 相比动辄几百亿参数的生成大模型,向量模型通常小巧高效(几亿~几十亿参数),因为它的任务简单直接——只要"把意思算准"。

少数最新的向量模型也开始用生成式大模型来做,但主流落地方案,还是轻快的"编码器"。


它的优缺点

优点:

  • 快、省:模型小,向量检索极快,适合海量数据;
  • 语义理解:不是死板的关键词匹配,而是"意思相近就相关";
  • 是 RAG、搜索、对账、去重的基石。

缺点 / 代价:

  • 只给"相关度",不给"答案":它只告诉你"谁近谁远",不负责组织成话;
  • 对训练数据敏感:如果没能学会某些领域的意思,查出来的相关度会失准;
  • 本身不是"对话大脑":和生成模型是互补,需配合使用。

在 Agent 里的用处:RAG 的"检索抽屉"

向量模型是 RAG 的顶梁柱。Agent 要回答私有知识的问题时:

  1. 把知识库切段、全变成向量,存成"向量库";
  2. 用户提问时,把问题也变向量;
  3. 找出跟问题距离最近的几段,当作"参考答案";
  4. 再交给对话大脑(文本/多模态模型)组织成回答。

可以说,没向量模型,RAG 就无从谈起。它决定"Agent 能不能在几秒内从海量资料里捞到对的那几页"。


小结

内容
干什么把文字/图片等内容变成一个"坐标"(向量)
原理语义相近 → 坐标靠近,靠"相似对"训练出来
常用架构Transformer 的编码器(Encoder),小巧高效
为什么编码器天生适合"概括整段意思成一个向量"
优缺点快省、懂语义;但只给相关度、不给答案
在 Agent 里RAG 的检索基石:"这道题该翻哪几页"由它定

要保持清醒 永远不抱有意外的幻想 凭空的期待最要命