Skip to content
On this page

能力·生图模型:从文字画出画的"画家"

从一句"一只戴帽子的柴犬在海边看日落",直接生成一张像样的图片——这就是生图模型的本事。它跟前面那些"读"模型不一样,是个纯创作的"画家"

它生成图片的原理和那些"预测下一个词"的模型完全两路。这篇讲清楚它怎么画、用什么架构、为什么这么画。


它是干嘛的:文字(或图)→ 生成一张新图片

生图模型(Text-to-Image)的核心能力:根据一段文字描述(prompt),生成一张与描述相符的新图片。

你可以让它:

  • 画"一只在太空里打篮球的猫";
  • 按"赛博朋克风格的科幻城市街道"画;
  • 改图、扩图、按参考图画。

它产出的是真正的像素图片,是"无中生有"的创作 AI,而不是看图说话的"读图" AI。


它的原理:从"一片噪点"里洗出画面来

生图模型最主流的方法,听起来像变魔术,其实很好理解——扩散(Diffusion)

先反向理解一张图是怎么"加噪"的:

  • 拿一张真实图片,一点一点往上面撒"噪点"(随机杂乱像素);
  • 撒得多了,图片就糊成一片纯雪花噪点;
  • 这个"把图一步步变糊变噪"的过程,叫前向过程

然后反着做——学"去噪"来生图:

  • 模型被训练去学习**"怎么一步步把噪点洗回清晰的图"**;
  • 一开始是一张纯噪点(雪花),模型根据你的文字提示,一步步去掉噪点——先勾个轮廓、再填细节、最后变成一张清晰的图画;
  • 你给的文字,就像"洗图的方向盘",引导它往哪个方向洗。

一句话:生图 = 从一张纯噪点开始,照着文字指示,一步一步把噪点"洗"成清晰的画面。 这就是 Diffusion(扩散)模型名字的由来。


它通常选什么架构

生图模型的主流架构,和"文字 Transformer"不同路,用的是一套专门为图像定制的结构:

主流:扩散模型(Diffusion)+ 潜空间(Latent Space)

  • 潜空间扩散(如 Stable Diffusion):不直接在超大的原始像素上操作(太贵),而是先把图片压缩到一个浓缩的"潜空间",在这个小空间里做"去噪",最后再还原成高清像素图。省了一大截算力;
  • 噪声预测器:内部往往也用 Transformer 或 U-Net(一种擅长图像的结构),来学"怎么去噪"。

另外还有两套并行路线:

  • 自回归生图模型:像"画一个字吐一个字"一样,把图片当一长串小块挨个生成——借用文本大模型的思路,也有模型这么做(如部分旗舰模型);
  • 对抗生成(GAN):一个"画家"、一个"鉴定师"互相较劲练出来的旧方案,速度曾经很快,但现在多数被扩散路线取代。

主流之所以选"扩散+潜空间":

  • 大大降低算力和成本(不用在超高清像素上死磕);
  • 生成质量高、可控性好(能精细控制细节与风格);
  • 和文字理解往往是双模型配合:一个文本模型理解你的话,再引导图像扩散模型去画。

它的优缺点

优点:

  • 创造力强:能画完全不存在、天马行空的画面;
  • 支持精确控制(风格、构图、尺寸);
  • 从文字直达图像,门槛极低。

缺点 / 代价:

  • 慢、贵:一步步洗图很吃算力;
  • 手部等细节 / 逻辑常错乱:多指、少眼等"鬼细节"屡见不鲜;
  • 对文字的忠实度有限:有时画出的和 prompt 描述的不完全对得上。

在 Agent 里的用处:让 Agent 会"画画"

生图模型作为 Agent 的一种"工具/技能":

  • 用户说"帮我画个海报",Agent 调用生图工具出图;
  • 结合文案能力,Agent 能自动做配图、封面、产品图;
  • 多模态 Agent 里,生成图再和文本结合,输出图文并茂的内容。

它让 Agent 从"只会说话"变成"还能创作图像",能力范围大幅扩展。


小结

内容
干什么根据文字生成一张新图片
原理扩散:从纯噪点按文字提示一步步"洗"成清晰画面
常用架构扩散模型 + 潜空间(如 Stable Diffusion);也有自回归路线
为什么潜空间省算力、质量高、可控性好
优缺点创造强、门槛低;但慢贵、细节有瑕疵、对文本忠实度有限
在 Agent 里作为"作画工具",让 Agent 能生成配图与海报

要保持清醒 永远不抱有意外的幻想 凭空的期待最要命