AI 视频怎么做:从一张图到一段能用的动画
第一次用 AI 视频的人,通常会经历同一个过程:输入一句话,等一会儿,拿到一段几秒的视频,然后发现——画面在乱动。人物的脸在变形,背景在扭曲,物体凭空出现又消失。
这不是模型不行,是用法错了。这篇文章讲清楚正确的用法。
先分清两种生成方式
文生视频:给一段文字,直接生成视频。模型要同时决定"画什么"和"怎么动"两件事。自由度最高,但可控性最差——你连第一帧长什么样都不知道。
图生视频:给一张图当首帧,再给一段文字描述"怎么动"。模型只需要决定"怎么动",画面内容已经被首帧锁死了。
结论先给:除非你只是随便玩玩,否则优先用图生视频。
原因很简单。视频是几十上百帧画面的连续,模型每一帧都可能产生细微偏差,这些偏差会累积。首帧越确定,累积的起点越稳;首帧是随机生成的,等于让模型在流沙上盖楼。
首帧决定了成败的一大半
既然图生视频靠首帧,那首帧就值得单独花时间做。
推荐的流程是:
为什么值得这么麻烦: 首帧里的瑕疵会在视频里被放大。一张静态图上你可能注意不到手部有点怪,但一动起来,那只手会变成整段视频里最扎眼的东西。
选首帧时有几个实际标准:
- 主体清晰、边缘干净 —— 主体和背景糊在一起的图,动起来必然黏连
- 构图留白 —— 主体贴着画面边缘的话,一动就出框
- 避免复杂的手部、文字、密集人群 —— 这几类是目前所有模型的公认弱项
运镜描述:只写一个动作
拿到首帧之后,提示词的任务就只剩一件事:告诉模型怎么动。
这里的头号错误是一次描述太多动作:
- ❌ 镜头推进,女孩转头微笑,头发飘起来,背景的树叶落下,天色渐暗
五个动作,模型只有几秒时长,结果是五个动作都做一半,画面看起来就是"乱动"。
- ✅ 镜头缓慢推进,女孩轻微转头
一到两个动作,就够了。 视频短,动作少反而显得稳、显得有意图。
常用的运镜词汇,可以直接用:
- 镜头运动:缓慢推进 / 缓慢拉远 / 向左平移 / 环绕 / 固定机位
- 主体动作:轻微转头 / 眨眼 / 抬手 / 向前走
- 环境动效:头发被风吹动 / 水面泛起涟漪 / 云层缓慢流动 / 灯光闪烁
一个反直觉但很有效的经验:"固定机位 + 一个轻微的环境动效"往往比复杂运镜的成片率高得多。 一张好图 + 微微飘动的头发,比一段左摇右晃的镜头更像成品。
时长与素材要求
不同模型对时长上限、输入图的尺寸比例、以及消耗都有各自的规定,这些以你在 HappyAI 里所选工具页面的实际标注为准,本文不做统一断言——这类参数各家更新频繁,写死在文章里反而容易误导。
但有一条通用建议:先用最短时长试。 短的生成快、消耗少,用来验证"这个首帧 + 这个动作描述能不能work"。验证通过了,再考虑要不要生成更长的版本。拿长时长去试错,是最浪费的做法。
出来效果不对,按这个顺序排查
- 画面整体在乱动/变形 → 首帧不够干净,或者动作描述太多。先减动作,再换首帧。
- 几乎不动 → 动作描述太抽象。"有氛围感"不是动作,"头发被风吹动"才是。
- 动作对了但主体走形 → 首帧里那个部位本来就不清晰。回去修首帧,而不是反复重生成。
- 主体动到画面外 → 首帧构图留白不够,重新裁一张。
注意这四条里有三条的解法都是回去改首帧,而不是在视频这一步反复刷。这是 AI 视频和文生图最大的工作流差异:视频这一步的可调空间很小,绝大部分质量是在前面决定的。
一个最小可行流程
文生图 → 挑构图 → 图生图修细节 → 作为首帧
↓
图生视频(短时长 + 1 个动作)
↓
效果对了再拉长
照这个走,比直接在文生视频里碰运气稳定得多。做完之后不妨去 AIGC 广场看看别人的作品是怎么动的——怎么从别人的作品里学东西我另外写了一篇。