图生图和文生图有什么区别?三个场景讲清该用哪个 封面图
功能对比

图生图和文生图有什么区别?三个场景讲清该用哪个

约 3 分钟阅读

这是新手最常问的问题,也是最容易给错答案的问题。

常见的答案是"文生图不用传图,图生图要传图"。这话没错,但没用——它没告诉你什么时候该用哪个

真正的区别是这个:

文生图里,构图是模型决定的;图生图里,构图是你决定的。

理解了这一句,剩下的选择就都是自然推论了。

两者到底在做什么

文生图:你给一段文字,模型从随机噪声开始,一步步"去噪"成一张符合描述的图。因为起点是随机的,所以每次生成的构图都不一样。你能控制风格和内容,但很难控制"人站在画面左边还是右边"。

图生图:你给一张图 + 一段文字,模型不是从随机噪声开始,而是从你这张图开始做有限的改动。改多少由一个强度参数控制:改得少,几乎是原图微调;改得多,越来越像重新画一张。

所以图生图的本质是:用一张已有的图,锁住构图和结构,只让模型改你想改的部分。

场景一:脑子里有画面,手上什么都没有

用文生图。

这时候你没有任何视觉素材,只有一段描述。文生图是唯一的起点。

这个阶段的目标不是"一次出对",而是快速铺开可能性——生成一批,看看模型对你这段描述的理解有哪些方向,从中挑一个最接近的。

提示词怎么写才能少走弯路,我在提示词四层结构那篇里写得比较细,这里不重复。

场景二:已经有一张接近的图,想改细节

用图生图。

这是最典型、也最容易被用错的场景。

假设你用文生图出了一张构图很满意的图,但人物的衣服颜色不对。这时候回文生图改提示词是错的——因为文生图每次都从随机噪声重来,你改完提示词,构图也一起变了。衣服是对了,但你满意的那个构图没了。

正确做法是把这张图丢进图生图,用较低的改动强度 + "把上衣改成米白色针织衫"这类局部描述。构图、姿态、光线都保留,只有衣服变了。

一句话记住:满意的部分越多,改动强度就该越低。 只想改颜色,用很低的强度;想换整个风格但保留构图,用中等强度;想大改,那不如回去用文生图。

场景三:想把一张图换成另一种风格

还是图生图,但强度要提上来。

比如把一张实拍照片变成插画风、把一张线稿上色、把白天的场景改成夜景。这类需求的共同点是:构图要保留,但画面的"材质"要整个换掉。

这时候提示词的重心要放在风格层和光线层,主体层可以写得简略一些——因为主体已经在原图里了,不需要你再描述一遍。

这也是图生图相比文生图省力的地方:原图承担了信息量,提示词只需要补差额。

一张对照表

文生图 图生图
起点 随机噪声 你提供的图
构图由谁定 模型
每次结果 差异大 差异可控
提示词负担 重,四层都要写 轻,补差额即可
适合 从零探索方向 精修、变体、换风格
不适合 精确控制构图 从零开始创作

最常见的两个误区

误区一:用文生图反复刷,试图刷出想要的细节。 细节是刷不出来的,因为构图每次都在变。正确做法是先用文生图刷出构图,再用图生图修细节。分两步,比在一步里死磕效率高得多。

误区二:图生图强度拉满。 强度拉到很高时,原图的约束几乎失效,结果和文生图差不多——那你传这张图就没意义了。如果你发现必须把强度拉满才能得到想要的效果,说明你其实需要的是文生图。

实际怎么配合

成熟的工作流基本都是两者串起来用:

  1. 文生图:写四层提示词,生成一批,挑构图最好的一张
  2. 图生图(中等强度):调整整体风格和光线
  3. 图生图(低强度):修局部细节,颜色、材质、小元素
  4. 需要动起来的话,把最终这张图丢进 AI 视频当首帧

每一步都在前一步的基础上收窄范围,而不是每次推倒重来。这是效率差距的真正来源。