文生图提示词怎么写:从主体到镜头的四层结构 封面图
提示词

文生图提示词怎么写:从主体到镜头的四层结构

约 3 分钟阅读

刚上手文生图的人最常见的挫败感是这样的:输入"一个女孩在海边",出来的图平平无奇;换个模型再试,还是平平无奇。于是得出结论——"这个模型不行"。

但真相往往是:提示词只提供了一层信息,模型只能靠猜补齐剩下的九层。 猜出来的东西当然是平均值,平均值当然平庸。

这篇文章给你一套可复用的结构。它不依赖某个特定模型,在 HappyAI 的文生图里能用,换别的工具也一样能用。

四层结构

一条完整的提示词,信息量应该分布在四个层次上:

主体   谁 / 什么,在做什么,什么状态
风格   什么媒介、什么画风、什么年代感
光线   光从哪来,什么色温,什么氛围
镜头   多远、什么角度、什么焦段

回到开头那个例子,四层补全之后:

一个短发女孩坐在礁石上,望向远处的海平线,风吹起衣角;胶片摄影质感,柔和颗粒;日落前的侧逆光,暖橙色调,发丝有轮廓光;中景,略微仰拍,85mm 浅景深,背景虚化

同样的模型,同样的一次生成,差别不在模型,在你给了多少信息。

第一层:主体

主体要写"名词 + 动作 + 状态",不要只写名词。

  • ❌ 一只猫
  • ⚠️ 一只橘猫
  • ✅ 一只橘猫蜷在窗台上打盹,尾巴垂下来,耳朵有一只是折的

后者不只是更长,而是每个细节都在缩小模型的选择范围。"蜷着"定了姿态,"窗台"定了环境,"折耳"定了品种特征。信息越具体,输出越可控。

一个实用的自检:把你的主体描述念给一个没见过这张图的人听,他能不能画个草图出来? 画不出来,说明信息还不够。

第二层:风格

风格是最容易被忽略、但对成片观感影响最大的一层。它决定的是"这张图看起来像什么东西做出来的"。

常用的几类锚点:

  • 媒介:油画、水彩、铅笔素描、3D 渲染、胶片摄影、拍立得
  • 画风:赛博朋克、极简主义、新艺术运动、浮世绘、蒸汽波
  • 年代:80 年代复古、90 年代动画赛璐璐、千禧年 Y2K

一个常见误区是把风格词堆得越多越好。实际上风格词之间会互相打架 —— "水彩"和"3D 渲染"是矛盾的媒介,同时给出来,模型只能折中,结果是两边都不像。一般 1 到 2 个风格锚点就够了。

第三层:光线

光线是新手最少写、但老手最先写的一层。因为光线几乎单独决定了一张图的情绪

三个要素:

  1. 方向 —— 顺光(平淡、清晰)、侧光(立体、有戏剧性)、逆光/侧逆光(有轮廓光、氛围感强)、顶光(压抑)
  2. 色温 —— 暖橙(日落、烛光、温暖)、冷蓝(月光、雨天、疏离)、中性白(棚拍、干净)
  3. 柔硬 —— 柔光(阴天、柔和阴影、人像友好)、硬光(正午、强对比、有力量感)

同一个主体,"清晨柔和的散射光"和"深夜霓虹的硬光"会给出两张完全不同情绪的图。如果你对出图的"感觉"不满意,先改光线,通常比换模型有效。

第四层:镜头

镜头层解决的是"我离这个东西多远、从哪个角度看"。

  • 景别:特写 / 近景 / 中景 / 全景 / 远景
  • 角度:平视 / 俯拍(显得渺小、脆弱)/ 仰拍(显得高大、有压迫感)
  • 焦段与景深:24mm 广角(视野开阔、有畸变)、50mm(接近人眼)、85mm 浅景深(人像,背景虚化)、微距

镜头层写不写,直接影响图能不能"用"。一张构图随机的图很难放进任何实际场景,一张明确"中景、平视、浅景深"的图,拿去做封面、做配图都合适。

迭代比一次写对更重要

不要指望第一条提示词就完美。真实的工作流是这样的:

  1. 先写一条四层都覆盖的基础提示词,生成一批
  2. 挑出最接近的那张,判断差在哪一层
  3. 只改那一层,其他保持不变,再生成
  4. 重复 2–3 次

关键在第三步:一次只改一个变量。 同时改风格和光线,出来的图变了,你也不知道是哪个改动起的作用,等于白试。

如果你已经有一张接近的图,只是想微调,那这时候更该换用图生图而不是继续在文生图里碰运气——两者的适用场景很不一样,我在另一篇文章里做了完整对比。

一个可以直接抄的模板

[主体:谁/什么 + 动作 + 关键细节],
[风格:媒介 + 画风,最多两个],
[光线:方向 + 色温 + 柔硬],
[镜头:景别 + 角度 + 焦段/景深]

把这个模板贴在手边,每次生成前对着填一遍。填满四行,你的出图质量会立刻和"一个女孩在海边"拉开差距。

写不出来的时候还有个偷懒办法:去看别人的提示词。 AIGC 广场上大量作品是带提示词的,找一张你喜欢的,拆开看它四层各写了什么,比自己凭空想快得多。