图生图和文生图有什么区别?三个场景讲清该用哪个
这是新手最常问的问题,也是最容易给错答案的问题。
常见的答案是"文生图不用传图,图生图要传图"。这话没错,但没用——它没告诉你什么时候该用哪个。
真正的区别是这个:
文生图里,构图是模型决定的;图生图里,构图是你决定的。
理解了这一句,剩下的选择就都是自然推论了。
两者到底在做什么
文生图:你给一段文字,模型从随机噪声开始,一步步"去噪"成一张符合描述的图。因为起点是随机的,所以每次生成的构图都不一样。你能控制风格和内容,但很难控制"人站在画面左边还是右边"。
图生图:你给一张图 + 一段文字,模型不是从随机噪声开始,而是从你这张图开始做有限的改动。改多少由一个强度参数控制:改得少,几乎是原图微调;改得多,越来越像重新画一张。
所以图生图的本质是:用一张已有的图,锁住构图和结构,只让模型改你想改的部分。
场景一:脑子里有画面,手上什么都没有
用文生图。
这时候你没有任何视觉素材,只有一段描述。文生图是唯一的起点。
这个阶段的目标不是"一次出对",而是快速铺开可能性——生成一批,看看模型对你这段描述的理解有哪些方向,从中挑一个最接近的。
提示词怎么写才能少走弯路,我在提示词四层结构那篇里写得比较细,这里不重复。
场景二:已经有一张接近的图,想改细节
用图生图。
这是最典型、也最容易被用错的场景。
假设你用文生图出了一张构图很满意的图,但人物的衣服颜色不对。这时候回文生图改提示词是错的——因为文生图每次都从随机噪声重来,你改完提示词,构图也一起变了。衣服是对了,但你满意的那个构图没了。
正确做法是把这张图丢进图生图,用较低的改动强度 + "把上衣改成米白色针织衫"这类局部描述。构图、姿态、光线都保留,只有衣服变了。
一句话记住:满意的部分越多,改动强度就该越低。 只想改颜色,用很低的强度;想换整个风格但保留构图,用中等强度;想大改,那不如回去用文生图。
场景三:想把一张图换成另一种风格
还是图生图,但强度要提上来。
比如把一张实拍照片变成插画风、把一张线稿上色、把白天的场景改成夜景。这类需求的共同点是:构图要保留,但画面的"材质"要整个换掉。
这时候提示词的重心要放在风格层和光线层,主体层可以写得简略一些——因为主体已经在原图里了,不需要你再描述一遍。
这也是图生图相比文生图省力的地方:原图承担了信息量,提示词只需要补差额。
一张对照表
| 文生图 | 图生图 | |
|---|---|---|
| 起点 | 随机噪声 | 你提供的图 |
| 构图由谁定 | 模型 | 你 |
| 每次结果 | 差异大 | 差异可控 |
| 提示词负担 | 重,四层都要写 | 轻,补差额即可 |
| 适合 | 从零探索方向 | 精修、变体、换风格 |
| 不适合 | 精确控制构图 | 从零开始创作 |
最常见的两个误区
误区一:用文生图反复刷,试图刷出想要的细节。 细节是刷不出来的,因为构图每次都在变。正确做法是先用文生图刷出构图,再用图生图修细节。分两步,比在一步里死磕效率高得多。
误区二:图生图强度拉满。 强度拉到很高时,原图的约束几乎失效,结果和文生图差不多——那你传这张图就没意义了。如果你发现必须把强度拉满才能得到想要的效果,说明你其实需要的是文生图。
实际怎么配合
成熟的工作流基本都是两者串起来用:
- 文生图:写四层提示词,生成一批,挑构图最好的一张
- 图生图(中等强度):调整整体风格和光线
- 图生图(低强度):修局部细节,颜色、材质、小元素
- 需要动起来的话,把最终这张图丢进 AI 视频当首帧
每一步都在前一步的基础上收窄范围,而不是每次推倒重来。这是效率差距的真正来源。