どの仕事も同じ分岐から始まり、無駄になるクレジットの大半は間違った枝を選んだことから生まれます。何もないところから絵を言葉で描写するのと、すでに手元にある絵を変更するのは別の道具であり、後者は使われなさすぎています。
ルール
最終画像の一部がすでに存在するなら——商品、ロゴ、部屋、顔、スケッチ、昨日の失敗作でさえ——画像から画像で始めてください。まだ何も存在しないなら、テキストから画像で始めます。
こう書くと当たり前に聞こえます。しかし実際には、自社の商品を見たこともないモデルに言葉で説明し、正しい形にたどり着かせようとして 15 回レンダリングする人がいます。
それぞれのモードが実際に制御するもの
| テキストから画像 | 画像から画像 | |
|---|---|---|
| あなたが渡すもの | 説明文 | 1 枚以上の画像+説明文 |
| あなたが制御できるもの | 被写体、スタイル、構図 | それらすべて+対象そのもの |
| 当てるまでの試行 | 被写体が具体的なら複数回 | たいてい 1〜2 回 |
| 参照スロット | なし | モデルにより 1〜16 |
| 向いている用途 | コンセプト、シーン、ムード、背景 | 商品、人物、ブランド素材、修正 |
同じモデルなら 1 レンダリングあたりの価格は同じです。違いは 1 回の値段ではなく、何回必要かです。
参照画像こそが本質
モデルが受け付ける参照枚数は、スペック表の細かい項目ではなく、実際の能力差です。ちょうど 1 枚しか取らないモデルもあります。GPT Image 2 と GPT Image 2.5 は最大 16 枚。Nano Banana 2 は 14 枚、Nano Banana Pro と Seedream は 8〜10 枚です。
1 枚の参照は「これっぽくして」に答えます。8 枚の参照は「これがその商品で、これらの角度から、この仕上げで、照明はこうしてほしい」に答えます。商品撮影が実際に投げかけているのは、後者の問いです。
スロットに何を入れるか
使える構成は、被写体の角度違いを 2〜3 枚、照明やムード用に 1 枚、置き面や環境用に 1 枚。同じ角度のバリエーションを 8 枚入れても役に立ちません。モデルは平均を取っているのではなく、何が重要かを見せられているのです。
みんなが間違える場面
ロゴとパッケージ。説明文からあなたのロゴを描かせると、「ロゴっぽい何か」が出てきて、それは間違っています。参照として渡せば、同じモデルが正しく配置します。
同じ商品を 12 回。商品ページに必要なのは非凡さより一貫性です。テキストから画像は「もっともらしいボトル」を 12 本くれます。参照セットを固定した画像から画像は、1 本のボトルを 12 通りに撮ってくれます。
「ほぼ正解、あと 1 か所」。これが最大の落とし穴です。90% まで来たとき、人はプロンプトを書き直して振り直し、うまくいっていた部分まで含めてすべてを再ランダム化してしまいます。良いレンダリングを参照として戻し、変更点だけを書けば、気に入った部分は残ります。
背景。被写体を切り抜いて別の場所に置くのは、生成の問題ではありません。背景除去、背景の透過、背景色のツールが、被写体にいっさい触れずにやってくれます。
テキストから画像が本当に正しい場面
あとで合成する背景や環境。選択肢を見ること自体が目的のコンセプト作業。現実の参照物がないイラストや様式化された作品。「驚かせてほしい」がリスクではなく長所である場合すべて。
探索の場としても安上がりです。2 クレジットのモデルはまさにそのために存在します。ひとつのアイデアで 6 通りの構図を走らせ、1 つ選び、そのあとで参照とより良いモデルを持ち込んで仕上げるのです。
うまくいくハイブリッドな進め方
このプラットフォームで完成する画像の大半は、単発のプロンプトではなくループから生まれます。安いモデルのテキストから画像で構図を下描きする。最良のフレームを選ぶ。画像から画像に移り、そのフレームを実物の商品と一緒に参照として戻し、変えるべき点だけを書く。最後は掲載先に合うモデルで本番を回す。
これを 2〜3 周するほうが、12 回の振り直しに勝り、しかも安い。同じループのパラメータ側——シード、ガイダンス、実行間で固定する価値があるもの——は再現できる結果で扱っています。
途中で切り替えても、やり直しにはならない
ワークスペースでは、プロンプト入力欄は両モードで同一です。参照画像を追加することが、一方からもう一方へ移る操作そのものです。プロンプトを書き直す必要はなく、モデル一覧も変わらないので、すでに行った比較はそのまま有効です。
19 のモデルがどちらのモードにも対応し、参照枚数の上限はそれぞれ異なります。一覧はカタログにあり、価格はどちらのモードを使ったかに関係なくレンダリング単位です——つまりこの選択が変えるのは、必要なレンダリング回数だけ。そしてそれがたいてい予算のすべてです。
同じ仕事を両方のやり方で
具体的な比較です。陶器のボトルの写真があり、3 枚の画像が必要だとします。白背景の商品カット、キッチンのシーン、横長のバナー。
| やり方 | 手順 | 結果 |
|---|---|---|
| テキストから画像だけ | 毎回ボトルを説明し、形が近づくまで振り直す | 3 本の別々のボトル。どれもあなたのものではない |
| 画像から画像 | 写真を参照として渡し、舞台と画角だけを説明する | 1 本のボトル、3 つの舞台、一貫している |
後者のほうが終わるのも早い。各画像が 5 回ではなく 1〜2 回で決まるからです。1 レンダリングあたりのクレジットは同じでも、合計は比べ物になりません。
見分けておきたい失敗パターン
ぶれる被写体。レンダリングのたびに商品の形が変わる。テキストから画像でいるべきでないときにそこにいるか、strength が高すぎて参照を解釈し直す余地を与えているかのどちらかです。
コラージュ化。関係のない参照が多すぎると、それらを平均した画像になります。役割を分けた 5 枚——角度、角度、照明、置き面、ムード——は機能しますが、似た 12 枚は機能しません。
上書きされた勝ち手。あと少しで完璧なレンダリングがあったのに、プロンプトを書き直したら良い版が消えた。良いレンダリングを参照として戻し、変更点だけを書いてください。
ツールで済んだはずのプロンプト。「同じ画像を白背景で」は 1 レンダリング分かかりますが、専用ツールなら被写体に触れずに済みます。
どのモデルがどちらのモードに向くか
テキストから画像では、安くて速いエンジンが最も重要です。試行回数が積み上がるのは探索の場面だからです。画像から画像では、参照枚数の上限が可能なことを決めます。スタイル転送なら 1 枠で足りますが、複数角度を扱う商品撮影には 8 枠以上が要ります。
各モデルのページには両方の数値が載っており、カタログでは並べて確認できます。モードを切り替えても、ワークフローの他の部分は何も変える必要がありません——同じプロンプト、同じアスペクト比設定、同じ勘所です。
