每个任务都从同一个岔路口开始,而浪费掉的积分大多来自走错了那个分岔。从零开始用文字描述一张图,和修改一张你手上已有的图,是两种不同的工具,而后者被严重低估了。
规则
如果最终画面里有任何一部分已经存在——一件产品、一个 logo、一个房间、一张脸、一张草图,哪怕是昨天跑出来的一张废图——就从图生图开始。如果还什么都不存在,就从文生图开始。
写下来显得理所当然。但现实里,人们会把自家产品用文字描述给一个从没见过它的模型,然后花十五次渲染试图把它说成正确的形状。
两种模式各自真正控制什么
| 文生图 | 图生图 | |
|---|---|---|
| 你提供 | 一段描述 | 一张或多张图片,外加一段描述 |
| 你控制 | 主体、风格、构图 | 以上全部,再加上对象本身 |
| 命中所需尝试 | 主体具体时要好几次 | 通常一到两次 |
| 参考图位 | 无 | 1 到 16 个,取决于模型 |
| 最适合 | 概念、场景、氛围、背景 | 产品、人物、品牌素材、改稿 |
在同一个模型上,两种模式每次渲染的价格相同。差别不在一次尝试的价钱,而在你需要多少次尝试。
参考图才是关键
一个模型能接受多少张参考图,是真实的能力差异,不是参数表上的细枝末节。有些模型只收一张。GPT Image 2 和 GPT Image 2.5 最多收 16 张。Nano Banana 2 收 14 张,Nano Banana Pro 和 Seedream 收 8 到 10 张。
一张参考图回答的是「做成这个样子」。八张参考图回答的是「这就是那件产品,从这些角度看,是这种工艺,而我想要这样的光」。产品摄影真正提出的,是后面那个问题。
图位里该放什么
一套好用的组合是:主体的两三个角度,一张用于光线或氛围,一张用于台面或环境。放八张同一个角度的变体没有帮助。模型不是在求平均,而是在被告知什么重要。
大家最常搞错的情况
logo 和包装。让模型根据文字描述画你的 logo,它会给你一个「像 logo 的东西」,而且是错的。把它作为参考图给进去,同一个模型就能把它放对。
同一件产品,十二次。电商详情页需要的是一致性,而不是灵光一现。文生图给你十二个看起来都说得通的瓶子;带固定参考集的图生图给你同一个瓶子的十二种拍法。
「差不多了,就改一处」。这是最大的一个坑。当一张图已经对了 90%,人们会重写提示词再掷一次骰子,结果把包括做对的部分在内的一切重新随机了。把这张好图作为参考喂回去,只描述要改的那一处,你喜欢的部分就会留下。
背景。把主体抠出来放到别处不是生成问题。背景去除、透明背景和背景颜色这些工具做得到,而且完全不碰主体。
文生图确实该用的时候
之后要合成进去的背景和环境。目的就是看选项的概念探索。没有现实参照物的插画和风格化创作。任何「给我个惊喜」是优点而不是风险的场合。
它也是更便宜的探索场地。2 积分的模型存在的意义正是如此:一个想法跑六种构图,选一种,然后再带上参考图和更好的模型去执行。
一套真正管用的混合流程
这个平台上大多数完成的图片来自一个循环,而不是一条提示词。先用便宜模型的文生图打构图草稿。挑出最好的一张。转到图生图,把这张图连同真实产品一起作为参考喂回去,只描述该改变的东西。最后用适合投放位置的模型跑成片。
这样走两三轮胜过十二次重掷,而且更省钱。同一个循环里参数那一侧——种子、引导强度、哪些值得在多次运行之间固定——在可复现的结果里讲过。
中途切换不等于重来
在工作台里,两种模式的提示词输入框是同一个;添加一张参考图,就是从一边走到另一边的动作。你的提示词一个字都不用重写,模型列表也不变,所以你先前做过的对比依然成立。
19 个模型都支持两种模式,只是参考图上限不同。模型目录里有列表,而价格按渲染次数计,与你用哪种模式无关——所以这个选择唯一改变的,是你需要渲染多少次。而那通常就是全部预算。
同一个任务,两种走法
一个具体对比。你有一张陶瓷瓶的照片,需要三张图:一张白底商品图、一个厨房场景、一张宽幅横幅。
| 做法 | 步骤 | 结果 |
|---|---|---|
| 只用文生图 | 每次都描述这只瓶子;重掷到形状接近为止 | 三只不同的瓶子,没有一只是你的 |
| 图生图 | 把照片作为参考喂进去;只描述场景和画幅 | 一只瓶子,三个场景,彼此一致 |
第二条路收工也更快,因为每张图一到两次就定,而不是五次。每次渲染的积分完全相同,但总数根本不在一个量级。
值得认出的几种失败
飘移的主体。产品的形状在每次渲染之间都在变。要么你本不该待在文生图里,要么 strength 调得太高,给了模型重新解释参考图的空间。
拼贴化。过多互不相干的参考图会产出一张把它们平均掉的图。按不同职责挑选的五张——角度、角度、光线、台面、氛围——管用;十二张雷同的不管用。
被覆盖掉的好结果。一张图几乎完美,你重写了提示词,好的那版就没了。把好图作为参考喂回去,只描述那一处改动。
本该用工具解决的提示词。要求「同一张图但换成白底」要花一整次渲染,而一个工具就能做到,还不碰主体。
哪些模型适合哪种模式
对文生图来说,便宜又快的引擎最重要,因为尝试次数正是在探索阶段堆起来的。对图生图来说,参考图上限决定了什么事做得成:做风格迁移一个图位就够,但涉及多角度的产品活需要八个以上。
模型页面会同时列出这两个数字,模型目录里可以并排查看。换模式时你工作流的其他部分完全不用变——同样的提示词、同样的宽高比设置、同样的平衡感。
