Mendapat satu gambar bagus adalah soal mengelola keberuntungan. Mendapat dua belas gambar yang tampak berasal dari satu pemotretan adalah sebuah proses. Bedanya: apakah Anda sedang melempar ulang prompt, atau mengendalikan hal-hal yang benar-benar membuat hasilnya bisa diulang.
Kenapa prompt yang sama memberi gambar berbeda
Model gambar mulai dari derau acak lalu membentuknya sesuai prompt Anda. Ubah derau awalnya dan kata-kata yang sama akan menghasilkan gambar lain. Keacakan itulah yang membuat penjelajahan mudah dan konsistensi sulit.
Semua yang ada di bawah ini adalah cara mencabut keacakan dari satu bagian proses, supaya model hanya berimprovisasi di tempat yang Anda inginkan.
Referensi adalah kendali terkuat
Kata-kata mendeskripsikan; referensi memperlihatkan. Kalau subjeknya ada, menyerahkannya lewat gambar ke gambar mencabut kebebasan model untuk mengarang ulang. Itu jauh lebih andal daripada menumpuk kata sifat sebanyak apa pun.
Berapa banyak referensi yang diterima tiap model sangat bervariasi. GPT Image 2 dan GPT Image 2.5 menerima hingga enam belas. Nano Banana 2 empat belas, Seedream 5 Pro sepuluh, Nano Banana Pro dan beberapa lainnya delapan. Beberapa model menerima tepat satu.
Apa yang diisi ke tiap slot
Susunan yang bekerja: dua atau tiga sudut subjek, satu gambar yang membawa pencahayaan yang Anda mau, satu yang membawa latar atau permukaan. Lima referensi yang dipilih dengan alasan berbeda mengalahkan dua belas yang hampir kembar, karena yang terakhir kebanyakan mengajari model untuk merata-rata.
Pertahankan set referensi yang sama sepanjang satu seri. Menukar satu gambar di antara render adalah penyebab paling umum dari set yang "hampir" cocok.
Seed: tombol ulang
Seed mengunci derau awal. Seed sama, prompt sama, setelan sama, model sama — Anda mendapatkan gambar yang sama lagi. Ubah satu kata dan Anda dapat variasi yang terkendali, bukan lemparan dadu baru.
Tak semua model membukanya. Di antara yang membuka, Qwen, Midjourney Diffusion, Ideogram, dan model Wan membolehkan Anda mengaturnya langsung. Saat tersedia, alurnya: jelajahi tanpa seed sampai ada yang mendekat, catat seed render itu, lalu iterasi dengan seed terkunci sambil menyetel kata-katanya.
Kesalahannya adalah mengunci seed terlalu dini. Seed mengunci komposisi yang belum Anda pilih.
Guidance dan langkah, dengan bahasa biasa
| Setelan | Apa yang berubah | Rentang yang masuk akal |
|---|---|---|
| Skala guidance | Seharfiah apa model mengikuti prompt | Tengah rentang; nilai tinggi terlihat kaku |
| Langkah inferensi | Seberapa lama ia memoles sebelum berhenti | Bawaan, kecuali hasilnya tampak belum selesai |
| Strength (gambar ke gambar) | Seberapa jauh ia boleh menyimpang dari referensi | Rendah untuk menjaga subjek, tinggi untuk mengubah gaya |
| Prompt negatif | Apa yang harus dihindari | Pendek dan konkret, bukan daftar harapan |
Guidance adalah yang paling sering disetel berlebihan. Didorong tinggi, ia memaksa kepatuhan harfiah dan biasanya mengorbankan kealamian — tepian keras, pose kaku, cahaya terlalu jenuh. Kalau model mengabaikan sesuatu yang penting, perbaikannya hampir selalu prompt yang lebih jelas atau sebuah gambar referensi, bukan angka yang lebih tinggi.
Strength adalah yang paling jarang dipakai. Di mode gambar, ia adalah tombol antara "rapikan ini" dan "tafsirkan ulang ini". Kalau produk Anda terus berubah bentuk, strength-nya terlalu tinggi.
Menulis prompt yang selamat saat dijalankan ulang
Prompt yang bisa diulang menyebut empat hal: subjek, cahaya, pembingkaian, dan apa yang tak boleh ada. Apa pun yang lebih kabur akan diisi berbeda setiap kali.
Bandingkan "foto produk botol yang bagus, profesional" dengan "botol keramik doff di atas batu tulis gelap, satu key light lembut dari kiri, kedalaman ruang tajam yang dangkal, tanpa teks, tanpa pantulan di label". Yang kedua membosankan dibaca dan kembali konsisten.
Pertahankan strukturnya tetap sepanjang seri dan ubah hanya bagian yang variabel. Kalau subjeknya berganti sementara cahaya dan bingkai tidak boleh berubah, hanya kata-kata itulah yang bergerak.
Konsistensi dalam satu set
Untuk seri yang harus menyatu: kunci modelnya, kunci rasio aspeknya, kunci set referensinya, kunci kalimat pencahayaannya, dan variasikan hanya subjek atau sudutnya. Jalankan dalam sekali duduk, bukan berhari-hari, karena kata-kata Anda sendiri lebih melenceng daripada modelnya.
Resolusi juga harus tetap sama dalam satu set. Mencampur gambar utama 4K dengan foto pendukung 1K tidak apa-apa; mencampur 1K dan 2K untuk gambar yang ditampilkan berdampingan terlihat di detailnya. Tingkat mana untuk slot mana dibahas di panduan bingkai dan resolusi kami.
Ketika hasilnya tetap tidak tenang
Kalau subjek terus berubah meski sudah ada referensi, bisa jadi modelnya memang bukan yang tepat — batas referensi dan kepatuhan pada instruksi berbeda tajam di seluruh katalog. Kalau detail tampak melebar, penyebabnya lebih mungkin resolusi daripada prompt. Kalau teks di dalam gambar keluar berantakan, itu soal pilihan model: Ideogram yang dibuat untuk tipografi, dan sebanyak apa pun prompt tak akan memperbaikinya di model lain.
Dan kalau gambarnya sudah benar kecuali satu elemen, berhentilah membuat ulang. Hilangkan elemennya dengan penghapusan objek atau benahi latarnya dengan alat latar. Batas itu kami bahas di membersihkan gambar.
Siklus yang mengerucut
Jelajahi dengan murah pada model 2 kredit tanpa seed sampai komposisinya benar. Catat seed-nya kalau model menyediakannya. Pindah ke teks ke gambar atau gambar ke gambar pada model yang sesuai tujuannya, dengan membawa kata-kata yang sama. Tambahkan referensi untuk apa pun yang harus tetap akurat. Ubah satu variabel tiap kali jalan, jangan pernah tiga.
Kebanyakan pekerjaan selesai begitu dalam tiga atau empat render. Ruang kerja menyimpan prompt, referensi, dan setelan di satu tempat sementara Anda berganti mesin, dan paket menunjukkan berapa yang diambil tiap proses dari saldo Anda. Kalau masih memilih antar-mesin, perbandingan ini adalah jalan pintasnya.
Templat prompt yang layak dipakai berulang
Pertahankan kerangkanya dan tukar hanya klausa variabelnya. Kira-kira begini: subjek dan material, lalu permukaan atau latar, lalu arah dan kualitas cahaya, lalu kedalaman ruang tajam, lalu pengecualiannya.
Ditulis penuh: "botol keramik doff di atas batu tulis gelap, satu key light lembut dari kiri, kedalaman ruang tajam yang dangkal, tanpa teks, tanpa pantulan keras". Untuk memotret produk kedua dalam set yang sama, hanya klausa pertama yang berubah. Semua yang dipakai model untuk membangun tampilannya tetap sama persis kata demi kata, dan itulah intinya.
Pengecualian ditaruh di akhir dan harus konkret. "Tanpa teks" bekerja. "Jangan yang jelek" tidak mendeskripsikan apa pun yang bisa ditindaklanjuti model.
Pemecahan masalah menurut gejala
| Gejala | Kemungkinan penyebab | Perbaikan |
|---|---|---|
| Subjek berubah antar-proses | Tanpa referensi, atau strength terlalu tinggi | Tambah referensi; turunkan strength |
| Hasil tampak kaku atau kelewat terang | Guidance didorong terlalu tinggi | Kembali ke tengah rentang |
| Detail melebar pada ukuran penuh | Resolusi terlalu rendah untuk penggunaannya | Jalankan ulang di 2K atau 4K |
| Teks dalam gambar berantakan | Model yang salah untuk tipografi | Pakai Ideogram |
| Set tidak cocok satu sama lain | Prompt atau referensi melenceng | Kunci kata-kata dan set referensi; jalankan ulang bersamaan |
| Satu elemen merusak bingkai yang bagus | Mencoba menyelesaikannya dengan membuat ulang | Hapus saja elemen itu |
Ubah satu hal saja setiap kali
Disiplin yang membuat semua di atas bekerja itu membosankan: satu variabel per proses. Ubah seed-nya, atau kata-katanya, atau modelnya — jangan pernah dua sekaligus, kalau tidak Anda takkan tahu perubahan mana yang membawa perbaikan.
Terasa lebih lambat dan selesai lebih cepat. Tiga proses yang disengaja biasanya mengalahkan selusin proses penuh harapan, dan di mesin murah tiga proses itu berbiaya enam kredit.
