Appearance
能力·生图模型:从文字画出画的"画家"
从一句"一只戴帽子的柴犬在海边看日落",直接生成一张像样的图片——这就是生图模型的本事。它跟前面那些"读"模型不一样,是个纯创作的"画家"。
它生成图片的原理和那些"预测下一个词"的模型完全两路。这篇讲清楚它怎么画、用什么架构、为什么这么画。
它是干嘛的:文字(或图)→ 生成一张新图片
生图模型(Text-to-Image)的核心能力:根据一段文字描述(prompt),生成一张与描述相符的新图片。
你可以让它:
- 画"一只在太空里打篮球的猫";
- 按"赛博朋克风格的科幻城市街道"画;
- 改图、扩图、按参考图画。
它产出的是真正的像素图片,是"无中生有"的创作 AI,而不是看图说话的"读图" AI。
它的原理:从"一片噪点"里洗出画面来
生图模型最主流的方法,听起来像变魔术,其实很好理解——扩散(Diffusion):
先反向理解一张图是怎么"加噪"的:
- 拿一张真实图片,一点一点往上面撒"噪点"(随机杂乱像素);
- 撒得多了,图片就糊成一片纯雪花噪点;
- 这个"把图一步步变糊变噪"的过程,叫前向过程。
然后反着做——学"去噪"来生图:
- 模型被训练去学习**"怎么一步步把噪点洗回清晰的图"**;
- 一开始是一张纯噪点(雪花),模型根据你的文字提示,一步步去掉噪点——先勾个轮廓、再填细节、最后变成一张清晰的图画;
- 你给的文字,就像"洗图的方向盘",引导它往哪个方向洗。
一句话:生图 = 从一张纯噪点开始,照着文字指示,一步一步把噪点"洗"成清晰的画面。 这就是 Diffusion(扩散)模型名字的由来。
它通常选什么架构
生图模型的主流架构,和"文字 Transformer"不同路,用的是一套专门为图像定制的结构:
主流:扩散模型(Diffusion)+ 潜空间(Latent Space)
- 潜空间扩散(如 Stable Diffusion):不直接在超大的原始像素上操作(太贵),而是先把图片压缩到一个浓缩的"潜空间",在这个小空间里做"去噪",最后再还原成高清像素图。省了一大截算力;
- 噪声预测器:内部往往也用 Transformer 或 U-Net(一种擅长图像的结构),来学"怎么去噪"。
另外还有两套并行路线:
- 自回归生图模型:像"画一个字吐一个字"一样,把图片当一长串小块挨个生成——借用文本大模型的思路,也有模型这么做(如部分旗舰模型);
- 对抗生成(GAN):一个"画家"、一个"鉴定师"互相较劲练出来的旧方案,速度曾经很快,但现在多数被扩散路线取代。
主流之所以选"扩散+潜空间":
- 大大降低算力和成本(不用在超高清像素上死磕);
- 生成质量高、可控性好(能精细控制细节与风格);
- 和文字理解往往是双模型配合:一个文本模型理解你的话,再引导图像扩散模型去画。
它的优缺点
优点:
- 创造力强:能画完全不存在、天马行空的画面;
- 支持精确控制(风格、构图、尺寸);
- 从文字直达图像,门槛极低。
缺点 / 代价:
- 慢、贵:一步步洗图很吃算力;
- 手部等细节 / 逻辑常错乱:多指、少眼等"鬼细节"屡见不鲜;
- 对文字的忠实度有限:有时画出的和 prompt 描述的不完全对得上。
在 Agent 里的用处:让 Agent 会"画画"
生图模型作为 Agent 的一种"工具/技能":
- 用户说"帮我画个海报",Agent 调用生图工具出图;
- 结合文案能力,Agent 能自动做配图、封面、产品图;
- 多模态 Agent 里,生成图再和文本结合,输出图文并茂的内容。
它让 Agent 从"只会说话"变成"还能创作图像",能力范围大幅扩展。
小结
| 项 | 内容 |
|---|---|
| 干什么 | 根据文字生成一张新图片 |
| 原理 | 扩散:从纯噪点按文字提示一步步"洗"成清晰画面 |
| 常用架构 | 扩散模型 + 潜空间(如 Stable Diffusion);也有自回归路线 |
| 为什么 | 潜空间省算力、质量高、可控性好 |
| 优缺点 | 创造强、门槛低;但慢贵、细节有瑕疵、对文本忠实度有限 |
| 在 Agent 里 | 作为"作画工具",让 Agent 能生成配图与海报 |