文生图提示词怎么写:从主体到镜头的四层结构
刚上手文生图的人最常见的挫败感是这样的:输入"一个女孩在海边",出来的图平平无奇;换个模型再试,还是平平无奇。于是得出结论——"这个模型不行"。
但真相往往是:提示词只提供了一层信息,模型只能靠猜补齐剩下的九层。 猜出来的东西当然是平均值,平均值当然平庸。
这篇文章给你一套可复用的结构。它不依赖某个特定模型,在 HappyAI 的文生图里能用,换别的工具也一样能用。
四层结构
一条完整的提示词,信息量应该分布在四个层次上:
主体 谁 / 什么,在做什么,什么状态
风格 什么媒介、什么画风、什么年代感
光线 光从哪来,什么色温,什么氛围
镜头 多远、什么角度、什么焦段
回到开头那个例子,四层补全之后:
一个短发女孩坐在礁石上,望向远处的海平线,风吹起衣角;胶片摄影质感,柔和颗粒;日落前的侧逆光,暖橙色调,发丝有轮廓光;中景,略微仰拍,85mm 浅景深,背景虚化
同样的模型,同样的一次生成,差别不在模型,在你给了多少信息。
第一层:主体
主体要写"名词 + 动作 + 状态",不要只写名词。
- ❌ 一只猫
- ⚠️ 一只橘猫
- ✅ 一只橘猫蜷在窗台上打盹,尾巴垂下来,耳朵有一只是折的
后者不只是更长,而是每个细节都在缩小模型的选择范围。"蜷着"定了姿态,"窗台"定了环境,"折耳"定了品种特征。信息越具体,输出越可控。
一个实用的自检:把你的主体描述念给一个没见过这张图的人听,他能不能画个草图出来? 画不出来,说明信息还不够。
第二层:风格
风格是最容易被忽略、但对成片观感影响最大的一层。它决定的是"这张图看起来像什么东西做出来的"。
常用的几类锚点:
- 媒介:油画、水彩、铅笔素描、3D 渲染、胶片摄影、拍立得
- 画风:赛博朋克、极简主义、新艺术运动、浮世绘、蒸汽波
- 年代:80 年代复古、90 年代动画赛璐璐、千禧年 Y2K
一个常见误区是把风格词堆得越多越好。实际上风格词之间会互相打架 —— "水彩"和"3D 渲染"是矛盾的媒介,同时给出来,模型只能折中,结果是两边都不像。一般 1 到 2 个风格锚点就够了。
第三层:光线
光线是新手最少写、但老手最先写的一层。因为光线几乎单独决定了一张图的情绪。
三个要素:
- 方向 —— 顺光(平淡、清晰)、侧光(立体、有戏剧性)、逆光/侧逆光(有轮廓光、氛围感强)、顶光(压抑)
- 色温 —— 暖橙(日落、烛光、温暖)、冷蓝(月光、雨天、疏离)、中性白(棚拍、干净)
- 柔硬 —— 柔光(阴天、柔和阴影、人像友好)、硬光(正午、强对比、有力量感)
同一个主体,"清晨柔和的散射光"和"深夜霓虹的硬光"会给出两张完全不同情绪的图。如果你对出图的"感觉"不满意,先改光线,通常比换模型有效。
第四层:镜头
镜头层解决的是"我离这个东西多远、从哪个角度看"。
- 景别:特写 / 近景 / 中景 / 全景 / 远景
- 角度:平视 / 俯拍(显得渺小、脆弱)/ 仰拍(显得高大、有压迫感)
- 焦段与景深:24mm 广角(视野开阔、有畸变)、50mm(接近人眼)、85mm 浅景深(人像,背景虚化)、微距
镜头层写不写,直接影响图能不能"用"。一张构图随机的图很难放进任何实际场景,一张明确"中景、平视、浅景深"的图,拿去做封面、做配图都合适。
迭代比一次写对更重要
不要指望第一条提示词就完美。真实的工作流是这样的:
- 先写一条四层都覆盖的基础提示词,生成一批
- 挑出最接近的那张,判断差在哪一层
- 只改那一层,其他保持不变,再生成
- 重复 2–3 次
关键在第三步:一次只改一个变量。 同时改风格和光线,出来的图变了,你也不知道是哪个改动起的作用,等于白试。
如果你已经有一张接近的图,只是想微调,那这时候更该换用图生图而不是继续在文生图里碰运气——两者的适用场景很不一样,我在另一篇文章里做了完整对比。
一个可以直接抄的模板
[主体:谁/什么 + 动作 + 关键细节],
[风格:媒介 + 画风,最多两个],
[光线:方向 + 色温 + 柔硬],
[镜头:景别 + 角度 + 焦段/景深]
把这个模板贴在手边,每次生成前对着填一遍。填满四行,你的出图质量会立刻和"一个女孩在海边"拉开差距。
写不出来的时候还有个偷懒办法:去看别人的提示词。 AIGC 广场上大量作品是带提示词的,找一张你喜欢的,拆开看它四层各写了什么,比自己凭空想快得多。