Appearance
能力·生视频模型:能把文字变成"动起来"的视频
如果说生图模型是画"静止的一张",那生视频模型就是导演——根据一句话,直接生成一段会动、有画面的视频。这是目前最"重"、也最炫的一种 AI 创作能力。
它比生图难得多。这篇讲清楚它的原理、架构、难点。
它是干嘛的:文字(或一张图)→ 一段动态视频
生视频模型(Text-to-Video 或 Image-to-Video)能做的:
- "一只狮子在草原上奔跑" → 一段几秒的奔跑画面;
- 给一张照片 → 让照片里的人在动(让静态图"活"过来);
- 配合文字剧本 → 生成对应的画面。
它产出的不再是像素图,而是一连串连续、连贯的帧(画面),还要保证人、动作、前后画面看起来顺滑合理。
它的原理:在"生图"基础上,再加一条"时间轴"
生视频和生图同宗同源,核心思想一样是扩散,只不过维度从"二维图片"升到了"二维 + 时间":
视频 = 一串有先后顺序的图片(帧)。 所以生视频的难点是双重的:
- 每一帧要画得对(空间上合理);
- 帧与帧之间要连贯(时间上顺滑:同一只猫不能上一帧黑、下一帧白;动作要流动、不是一顿一跳)。
做法:
- 沿用扩散的思路,但把"一个画面"扩展成"一串画面"一起处理;
- 在扩散模型里额外增加"时间维度"的处理,让模型同时学会"每一帧长什么样"和"帧与帧怎么过渡";
- 从纯噪点出发,参照文字提示,一步步把一整段"噪点视频"洗成连贯的视频。
一句话:生视频 = 生图扩散思路 + 一条额外的"时间轴",从噪点视频一步步洗出连贯动作。
它通常选什么架构
生视频模型架构上,是扩散模型 + 时间建模的组合,也是技术堆叠最重的地方:
主流:扩散 Transformer 或扩散 U-Net + 时空模块
- 在"潜空间扩散"的基础上,模型内部加时空注意力/时间层,专门处理"前后帧怎么衔接";
- 不少新一代模型直接用 DiT(扩散 Transformer)——用 Transformer 来当"噪声预测器",更擅长建模长期动作和时间连贯性;
- 也有路线是首先生成关键帧(起止画面),再让模型填充中间的过渡帧,降低长视频成本。
为什么这么搭?
- 继承生图的扩散成熟思路,再针对"时间"补一块;
- Transformer 强大的建模能力,适合处理"这一帧和前面所有帧的关联";
- 训练和数据是最大瓶颈:需要海量"视频+字幕"的配对数据,计算量远超生图。
总体来说,生视频是技术栈最深、成本最高的一类,通常是各大厂旗舰级投入。
它的优缺点
优点:
- 直观震撼:文字直达视频,创作门槛极低;
- 能力强可做剧本可视化、预览、素材生成。
缺点 / 代价:
- 非常贵、非常慢:生成几秒视频的计算量远超生图几个数量级;
- 时长短、连贯性不稳:容易在动作、手部、背景一致性上穿帮;
- 对 prompt 的忠实度、细节控制目前仍有限。
在 Agent 里的用处:让 Agent 当"导演"
作为 Agent 的一种"创作工具":
- 先让文本 Agent 写脚本/分镜,再调用生视频工具出画面;
- 做产品演示、教程视频、短视频素材的自动化;
- 结合生图、语音,Agent 甚至有潜力端到端产出"图文音视频"内容。
目前它更多是"单项工具",被 Agent 有需要时调用。
小结
| 项 | 内容 |
|---|---|
| 干什么 | 从文字/图片生成一段连贯视频 |
| 原理 | 生图扩散思路 + 时间轴,从噪点视频一步步洗出动作 |
| 常用架构 | 扩散 Transformer(U-Net) + 时空模块;DiT 趋于主流 |
| 为什么 | 继承扩散成熟思路,再针对时间建模补一块 |
| 优缺点 | 直观震撼;但极贵极慢、时长短、连贯性欠稳 |
| 在 Agent 里 | 作为"导演"创作工具,产出动态素材 |