Skip to content
On this page

能力·生视频模型:能把文字变成"动起来"的视频

如果说生图模型是画"静止的一张",那生视频模型就是导演——根据一句话,直接生成一段会动、有画面的视频。这是目前最"重"、也最炫的一种 AI 创作能力。

它比生图难得多。这篇讲清楚它的原理、架构、难点。


它是干嘛的:文字(或一张图)→ 一段动态视频

生视频模型(Text-to-Video 或 Image-to-Video)能做的:

  • "一只狮子在草原上奔跑" → 一段几秒的奔跑画面;
  • 给一张照片 → 让照片里的人在动(让静态图"活"过来);
  • 配合文字剧本 → 生成对应的画面。

它产出的不再是像素图,而是一连串连续、连贯的帧(画面),还要保证人、动作、前后画面看起来顺滑合理。


它的原理:在"生图"基础上,再加一条"时间轴"

生视频和生图同宗同源,核心思想一样是扩散,只不过维度从"二维图片"升到了"二维 + 时间":

视频 = 一串有先后顺序的图片(帧)。 所以生视频的难点是双重的:

  1. 每一帧要画得对(空间上合理);
  2. 帧与帧之间要连贯(时间上顺滑:同一只猫不能上一帧黑、下一帧白;动作要流动、不是一顿一跳)。

做法:

  • 沿用扩散的思路,但把"一个画面"扩展成"一串画面"一起处理;
  • 在扩散模型里额外增加"时间维度"的处理,让模型同时学会"每一帧长什么样"和"帧与帧怎么过渡";
  • 从纯噪点出发,参照文字提示,一步步把一整段"噪点视频"洗成连贯的视频

一句话:生视频 = 生图扩散思路 + 一条额外的"时间轴",从噪点视频一步步洗出连贯动作。


它通常选什么架构

生视频模型架构上,是扩散模型 + 时间建模的组合,也是技术堆叠最重的地方:

主流:扩散 Transformer 或扩散 U-Net + 时空模块

  • 在"潜空间扩散"的基础上,模型内部加时空注意力/时间层,专门处理"前后帧怎么衔接";
  • 不少新一代模型直接用 DiT(扩散 Transformer)——用 Transformer 来当"噪声预测器",更擅长建模长期动作和时间连贯性;
  • 也有路线是首先生成关键帧(起止画面),再让模型填充中间的过渡帧,降低长视频成本。

为什么这么搭?

  • 继承生图的扩散成熟思路,再针对"时间"补一块;
  • Transformer 强大的建模能力,适合处理"这一帧和前面所有帧的关联";
  • 训练和数据是最大瓶颈:需要海量"视频+字幕"的配对数据,计算量远超生图。

总体来说,生视频是技术栈最深、成本最高的一类,通常是各大厂旗舰级投入。


它的优缺点

优点:

  • 直观震撼:文字直达视频,创作门槛极低;
  • 能力强可做剧本可视化、预览、素材生成。

缺点 / 代价:

  • 非常贵、非常慢:生成几秒视频的计算量远超生图几个数量级;
  • 时长短、连贯性不稳:容易在动作、手部、背景一致性上穿帮;
  • 对 prompt 的忠实度、细节控制目前仍有限。

在 Agent 里的用处:让 Agent 当"导演"

作为 Agent 的一种"创作工具":

  • 先让文本 Agent 写脚本/分镜,再调用生视频工具出画面;
  • 做产品演示、教程视频、短视频素材的自动化;
  • 结合生图、语音,Agent 甚至有潜力端到端产出"图文音视频"内容。

目前它更多是"单项工具",被 Agent 有需要时调用。


小结

内容
干什么从文字/图片生成一段连贯视频
原理生图扩散思路 + 时间轴,从噪点视频一步步洗出动作
常用架构扩散 Transformer(U-Net) + 时空模块;DiT 趋于主流
为什么继承扩散成熟思路,再针对时间建模补一块
优缺点直观震撼;但极贵极慢、时长短、连贯性欠稳
在 Agent 里作为"导演"创作工具,产出动态素材

要保持清醒 永远不抱有意外的幻想 凭空的期待最要命