做出一张好图是在管理运气。做出十二张看起来像同一次拍摄的图,是一套流程。区别在于:你是在重掷提示词,还是在控制那些真正让输出可复现的东西。
为什么同一条提示词给出不同的图
图像模型从随机噪声开始,再按你的提示词把它塑形。起始噪声一变,同样的词就会得到不同的画面。正是这种随机性让探索变得容易,也让一致性变得困难。
下面所有内容,都是在从流程的某一环去掉随机性,好让模型只在你希望它即兴的地方即兴。
参考图是最强的控制手段
文字在描述,参考图在展示。如果主体是真实存在的,通过图生图把它交给模型,就剥夺了模型重新发明它的自由。这比堆多少形容词都可靠得多。
各模型能接受的参考图数量差别很大。GPT Image 2 和 GPT Image 2.5 最多接受 16 张。Nano Banana 2 收 14 张,Seedream 5 Pro 收 10 张,Nano Banana Pro 和另外几个收 8 张。还有几个模型只收一张。
每个图位该放什么
一套管用的组合:主体的两三个角度,一张承载你想要的光线,一张承载场景或台面。出于不同目的挑选的五张,胜过十二张近乎雷同的图——后者主要是在教模型求平均。
整个系列里保持同一套参考图。在不同次渲染之间换掉其中一张,是「差一点就对齐」的那种成组图最常见的成因。
种子:那个「重来一次」的按钮
种子固定了起始噪声。相同的种子、相同的提示词、相同的设置、相同的模型,就会再次给你同一张图。改一个词,你得到的是一次受控的变化,而不是重新掷骰子。
不是每个模型都开放它。在开放的模型里,Qwen、Midjourney Diffusion、Ideogram 和 Wan 系列允许你直接设定。可用时的流程是:先不设种子探索,直到某一张接近了,记下那张的种子,然后固定种子、只调整措辞地迭代。
常见的错误是太早固定种子。种子会把一个你还没选定的构图锁死。
用大白话说引导强度和步数
| 设置 | 它改变什么 | 合理范围 |
|---|---|---|
| 引导强度(guidance) | 模型多字面地遵循提示词 | 取值域中段;数值高会显得僵硬 |
| 推理步数(steps) | 停下之前打磨多久 | 用默认值,除非输出看起来没画完 |
| strength(图生图) | 允许它离你的参考图多远 | 想保住主体就低,想改造风格就高 |
| 负面提示词 | 要避免什么 | 简短具体,不要写成愿望清单 |
引导强度是大家最容易调过头的一项。推高它会强制字面服从,通常以牺牲自然感为代价——生硬的边缘、僵直的姿势、过饱和的光。如果模型忽略了某个重要的东西,解决办法几乎永远是更清楚的提示词或一张参考图,而不是更高的数值。
strength 则是大家用得不够的一项。在图生图里,它是「帮我修一下」和「重新诠释一遍」之间的旋钮。如果你的产品形状一直在变,那就是 strength 太高了。
怎样写一条经得起重跑的提示词
可复现的提示词会点名四件事:主体、光线、取景,以及不能出现的东西。比这更含糊的部分,每次都会被填成不同的样子。
对比一下「一张好看的瓶子产品图,要专业」和「深色板岩台面上的哑光陶瓷瓶,左侧单一柔光主光,浅景深,无文字,标签上无反光」。后者读起来乏味,但回来的结果是稳定的。
整个系列保持结构不变,只改可变的那一段。如果主体变了但光线和取景不该变,那就只动那几个词。
整组图的一致性
对于必须成套的系列:固定模型、固定宽高比、固定参考图集合、固定那句描述光线的话,只改变主体或角度。在一次工作里跑完,而不是分好几天,因为你自己的措辞比模型漂得更厉害。
组内的分辨率也该保持不变。一张 4K 主图配 1K 辅图没问题;但并排展示的图混用 1K 和 2K,在细节上是看得出来的。哪个位置该选哪一档,我们在画幅与分辨率指南里讲过。
当输出还是稳不下来
如果给了参考图主体仍在变形,那也许根本是模型选错了——参考图上限和指令遵循能力在模型目录里差别很大。如果细节看起来糊成一片,问题更可能是分辨率而不是提示词。如果图里的文字变成乱码,那是模型选择问题:为排版而生的是 Ideogram,在别的模型上写多少提示词都救不回来。
还有,如果一张图除了某一个元素之外都对,就停止生成。用物体移除去掉那个元素,或者用背景工具修好底。这条边界我们在图片清理里讲过。
一个会收敛的循环
先在 2 积分的模型上不设种子、便宜地探索,直到构图对了。如果模型提供种子就记下来。带着同样的措辞,转到适合投放位置的模型上做文生图或图生图。凡是必须准确的东西,都补上参考图。每跑一次只改一个变量,绝不要三个。
大多数活儿这样跑三四次就能落地。工作台会在你切换引擎时把提示词、参考图和设置保存在一处,而每次运行从余额里扣多少,套餐页有写。如果你还在两个引擎之间犹豫,这篇对比是捷径。
一个值得反复用的提示词模板
骨架保持不变,只替换那个可变的从句。大致是:主体和材质,然后是台面或场景,然后是光的方向和质感,然后是景深,最后是排除项。
写出来是:「深色板岩上的哑光陶瓷瓶,左侧单一柔光主光,浅景深,无文字,无强反光」。要在同一组里拍第二件产品,只有第一个从句会变。模型用来构建这套观感的一切都逐字保持不变——这正是要点。
排除项放在最后,而且要具体。「无文字」管用;「不要丑的东西」没有描述任何模型能据以行动的内容。
按症状排查
| 症状 | 可能原因 | 解决 |
|---|---|---|
| 每次跑主体都在变 | 没有参考图,或 strength 太高 | 加参考图;调低 strength |
| 成图显得僵硬或光过曝 | 引导强度推得太高 | 回到取值域中段 |
| 原尺寸下细节糊掉 | 分辨率不匹配用途 | 用 2K 或 4K 重跑 |
| 图中文字是乱码 | 选了不擅长排版的模型 | 改用 Ideogram |
| 整组对不上 | 提示词或参考图漂移了 | 固定措辞和参考集合,一起重跑 |
| 一个元素毁了一张好图 | 试图用重新生成来解决 | 改成把它移除 |
一次只改一件事
让上面这一切成立的纪律很无聊:每跑一次只改一个变量。改种子,或改措辞,或改模型,绝不要两样一起改,否则你不会知道是哪一处改动带来了改进。
它感觉更慢,但结束得更早。三次深思熟虑的运行通常胜过十二次碰运气的,而在便宜的引擎上,那三次一共只要 6 积分。
