Annual billing keeps the same monthly credits for around 30% less.

See Plans

可重現的結果:參考圖、種子和真正有用的設定

可重現的結果:參考圖、種子和真正有用的設定

做出一張好圖是在管理運氣。做出十二張看起來像同一次拍攝的圖,是一套流程。差別在於:你是在重擲提示詞,還是在控制那些真正讓輸出可重現的東西。

為什麼同一條提示詞給出不同的圖

影像模型從隨機雜訊開始,再按你的提示詞把它塑形。起始雜訊一變,同樣的字就會得到不同的畫面。正是這種隨機性讓探索變得容易,也讓一致性變得困難。

以下所有內容,都是在從流程的某一環去掉隨機性,好讓模型只在你希望它即興的地方即興。

參考圖是最強的控制手段

文字在描述,參考圖在展示。如果主體是真實存在的,透過以圖生圖把它交給模型,就剝奪了模型重新發明它的自由。這比堆多少形容詞都可靠得多。

各模型能接受的參考圖數量差別很大。GPT Image 2 和 GPT Image 2.5 最多接受 16 張。Nano Banana 2 收 14 張,Seedream 5 Pro 收 10 張,Nano Banana Pro 和另外幾個收 8 張。還有幾個模型只收一張。

每個欄位該放什麼

一套管用的組合:主體的兩三個角度,一張承載你想要的光線,一張承載場景或檯面。出於不同目的挑選的五張,勝過十二張近乎雷同的圖——後者主要是在教模型求平均。

整個系列裡維持同一套參考圖。在不同次算圖之間換掉其中一張,是「差一點就對齊」的那種成組圖最常見的成因。

種子:那個「重來一次」的按鈕

種子固定了起始雜訊。相同的種子、相同的提示詞、相同的設定、相同的模型,就會再次給你同一張圖。改一個字,你得到的是一次受控的變化,而不是重新擲骰子。

不是每個模型都開放它。在開放的模型裡,Qwen、Midjourney Diffusion、Ideogram 和 Wan 系列允許你直接設定。可用時的流程是:先不設種子探索,直到某一張接近了,記下那張的種子,然後固定種子、只調整措辭地迭代。

常見的錯誤是太早固定種子。種子會把一個你還沒選定的構圖鎖死。

用大白話說引導強度和步數

設定它改變什麼合理範圍
引導強度(guidance)模型多字面地遵循提示詞取值域中段;數值高會顯得僵硬
推論步數(steps)停下之前打磨多久用預設值,除非輸出看起來沒畫完
strength(以圖生圖)允許它離你的參考圖多遠想保住主體就低,想改造風格就高
負面提示詞要避免什麼簡短具體,不要寫成願望清單

引導強度是大家最容易調過頭的一項。推高它會強制字面服從,通常以犧牲自然感為代價——生硬的邊緣、僵直的姿勢、過飽和的光。如果模型忽略了某個重要的東西,解決辦法幾乎永遠是更清楚的提示詞或一張參考圖,而不是更高的數值。

strength 則是大家用得不夠的一項。在以圖生圖裡,它是「幫我修一下」和「重新詮釋一遍」之間的旋鈕。如果你的產品形狀一直在變,那就是 strength 太高了。

怎樣寫一條經得起重跑的提示詞

可重現的提示詞會點名四件事:主體、光線、取景,以及不能出現的東西。比這更含糊的部分,每次都會被填成不同的樣子。

對比一下「一張好看的瓶子產品圖,要專業」和「深色板岩檯面上的霧面陶瓷瓶,左側單一柔光主光,淺景深,無文字,標籤上無反光」。後者讀起來乏味,但回來的結果是穩定的。

整個系列維持結構不變,只改可變的那一段。如果主體變了但光線和取景不該變,那就只動那幾個字。

整組圖的一致性

對於必須成套的系列:固定模型、固定長寬比、固定參考圖集合、固定那句描述光線的話,只改變主體或角度。在一次作業裡跑完,而不是分好幾天,因為你自己的措辭比模型飄得更厲害。

組內的解析度也該維持不變。一張 4K 主圖配 1K 輔圖沒問題;但並排展示的圖混用 1K 和 2K,在細節上是看得出來的。哪個版位該選哪一級,我們在畫面與解析度指南裡談過。

當輸出還是穩不下來

如果給了參考圖主體仍在變形,那也許根本是模型選錯了——參考圖上限和指令遵循能力在模型目錄裡差別很大。如果細節看起來糊成一片,問題更可能是解析度而不是提示詞。如果圖裡的文字變成亂碼,那是模型選擇問題:為排版而生的是 Ideogram,在別的模型上寫多少提示詞都救不回來。

還有,如果一張圖除了某一個元素之外都對,就停止生成。用物件移除去掉那個元素,或者用背景工具修好底。這條界線我們在圖片清理裡談過。

一個會收斂的循環

先在 2 點的模型上不設種子、便宜地探索,直到構圖對了。如果模型提供種子就記下來。帶著同樣的措辭,轉到適合版位的模型上做文字生成圖片以圖生圖。凡是必須準確的東西,都補上參考圖。每跑一次只改一個變數,絕不要三個。

大多數工作這樣跑三四次就能落地。工作區會在你切換引擎時把提示詞、參考圖和設定保存在一處,而每次執行從餘額裡扣多少,方案頁有寫。如果你還在兩個引擎之間猶豫,這篇比較是捷徑。

一個值得反覆用的提示詞範本

骨架維持不變,只替換那個可變的子句。大致是:主體和材質,然後是檯面或場景,然後是光的方向和質感,然後是景深,最後是排除項。

寫出來是:「深色板岩上的霧面陶瓷瓶,左側單一柔光主光,淺景深,無文字,無強反光」。要在同一組裡拍第二件產品,只有第一個子句會變。模型用來建構這套觀感的一切都逐字維持不變——這正是重點。

排除項放在最後,而且要具體。「無文字」管用;「不要醜的東西」沒有描述任何模型能據以行動的內容。

按症狀排查

症狀可能原因解法
每次跑主體都在變沒有參考圖,或 strength 太高加參考圖;調低 strength
成品顯得僵硬或光過曝引導強度推得太高回到取值域中段
原尺寸下細節糊掉解析度不符用途用 2K 或 4K 重跑
圖中文字是亂碼選了不擅長排版的模型改用 Ideogram
整組對不上提示詞或參考圖飄移了固定措辭和參考集合,一起重跑
一個元素毀了一張好圖試圖用重新生成來解決改成把它移除

一次只改一件事

讓上面這一切成立的紀律很無聊:每跑一次只改一個變數。改種子,或改措辭,或改模型,絕不要兩樣一起改,否則你不會知道是哪一處改動帶來了改進。

它感覺更慢,但結束得更早。三次深思熟慮的執行通常勝過十二次碰運氣的,而在便宜的引擎上,那三次一共只要 6 點。