AI 视频怎么做:从一张图到一段能用的动画 封面图
使用教程

AI 视频怎么做:从一张图到一段能用的动画

约 3 分钟阅读

第一次用 AI 视频的人,通常会经历同一个过程:输入一句话,等一会儿,拿到一段几秒的视频,然后发现——画面在乱动。人物的脸在变形,背景在扭曲,物体凭空出现又消失。

这不是模型不行,是用法错了。这篇文章讲清楚正确的用法。

先分清两种生成方式

文生视频:给一段文字,直接生成视频。模型要同时决定"画什么"和"怎么动"两件事。自由度最高,但可控性最差——你连第一帧长什么样都不知道。

图生视频:给一张图当首帧,再给一段文字描述"怎么动"。模型只需要决定"怎么动",画面内容已经被首帧锁死了。

结论先给:除非你只是随便玩玩,否则优先用图生视频。

原因很简单。视频是几十上百帧画面的连续,模型每一帧都可能产生细微偏差,这些偏差会累积。首帧越确定,累积的起点越稳;首帧是随机生成的,等于让模型在流沙上盖楼。

首帧决定了成败的一大半

既然图生视频靠首帧,那首帧就值得单独花时间做。

推荐的流程是:

  1. 文生图生成一批候选,挑构图最好的(提示词怎么写
  2. 图生图把细节修干净(两者怎么选
  3. 把修好的图作为首帧,进 AI 视频

为什么值得这么麻烦: 首帧里的瑕疵会在视频里被放大。一张静态图上你可能注意不到手部有点怪,但一动起来,那只手会变成整段视频里最扎眼的东西。

选首帧时有几个实际标准:

  • 主体清晰、边缘干净 —— 主体和背景糊在一起的图,动起来必然黏连
  • 构图留白 —— 主体贴着画面边缘的话,一动就出框
  • 避免复杂的手部、文字、密集人群 —— 这几类是目前所有模型的公认弱项

运镜描述:只写一个动作

拿到首帧之后,提示词的任务就只剩一件事:告诉模型怎么动。

这里的头号错误是一次描述太多动作

  • ❌ 镜头推进,女孩转头微笑,头发飘起来,背景的树叶落下,天色渐暗

五个动作,模型只有几秒时长,结果是五个动作都做一半,画面看起来就是"乱动"。

  • ✅ 镜头缓慢推进,女孩轻微转头

一到两个动作,就够了。 视频短,动作少反而显得稳、显得有意图。

常用的运镜词汇,可以直接用:

  • 镜头运动:缓慢推进 / 缓慢拉远 / 向左平移 / 环绕 / 固定机位
  • 主体动作:轻微转头 / 眨眼 / 抬手 / 向前走
  • 环境动效:头发被风吹动 / 水面泛起涟漪 / 云层缓慢流动 / 灯光闪烁

一个反直觉但很有效的经验:"固定机位 + 一个轻微的环境动效"往往比复杂运镜的成片率高得多。 一张好图 + 微微飘动的头发,比一段左摇右晃的镜头更像成品。

时长与素材要求

不同模型对时长上限、输入图的尺寸比例、以及消耗都有各自的规定,这些以你在 HappyAI 里所选工具页面的实际标注为准,本文不做统一断言——这类参数各家更新频繁,写死在文章里反而容易误导。

但有一条通用建议:先用最短时长试。 短的生成快、消耗少,用来验证"这个首帧 + 这个动作描述能不能work"。验证通过了,再考虑要不要生成更长的版本。拿长时长去试错,是最浪费的做法。

出来效果不对,按这个顺序排查

  1. 画面整体在乱动/变形 → 首帧不够干净,或者动作描述太多。先减动作,再换首帧。
  2. 几乎不动 → 动作描述太抽象。"有氛围感"不是动作,"头发被风吹动"才是。
  3. 动作对了但主体走形 → 首帧里那个部位本来就不清晰。回去修首帧,而不是反复重生成。
  4. 主体动到画面外 → 首帧构图留白不够,重新裁一张。

注意这四条里有三条的解法都是回去改首帧,而不是在视频这一步反复刷。这是 AI 视频和文生图最大的工作流差异:视频这一步的可调空间很小,绝大部分质量是在前面决定的。

一个最小可行流程

文生图  →  挑构图    →  图生图修细节  →  作为首帧
                                            ↓
                              图生视频(短时长 + 1 个动作)
                                            ↓
                                   效果对了再拉长

照这个走,比直接在文生视频里碰运气稳定得多。做完之后不妨去 AIGC 广场看看别人的作品是怎么动的——怎么从别人的作品里学东西我另外写了一篇。