Setiap pekerjaan dimulai dari persimpangan yang sama, dan sebagian besar kredit yang terbuang berasal dari mengambil cabang yang keliru. Mendeskripsikan gambar dari nol dan memodifikasi gambar yang sudah Anda punya adalah dua alat berbeda, dan yang kedua terlalu jarang dipakai.
Aturannya
Jika ada bagian mana pun dari gambar akhir yang sudah ada — sebuah produk, logo, ruangan, wajah, sketsa, bahkan render jelek dari kemarin — mulailah dari gambar ke gambar. Kalau belum ada apa pun, mulailah dari teks ke gambar.
Ditulis begini terdengar jelas. Pada praktiknya orang menjelaskan produknya sendiri dengan kata-kata kepada model yang belum pernah melihatnya, lalu menghabiskan lima belas render untuk membujuknya ke bentuk yang benar.
Apa yang sebenarnya dikendalikan tiap mode
| Teks ke gambar | Gambar ke gambar | |
|---|---|---|
| Anda menyediakan | Sebuah deskripsi | Satu gambar atau lebih, plus deskripsi |
| Anda mengendalikan | Subjek, gaya, pembingkaian | Semua itu, plus bendanya sendiri |
| Percobaan sampai tepat | Beberapa, kalau subjeknya spesifik | Biasanya satu atau dua |
| Slot referensi | Tidak ada | 1 sampai 16, tergantung model |
| Paling cocok untuk | Konsep, adegan, suasana, latar | Produk, orang, aset merek, revisi |
Keduanya berbiaya sama per render pada model yang sama. Bedanya bukan harga satu percobaan, melainkan berapa percobaan yang Anda butuhkan.
Gambar referensi adalah inti persoalannya
Berapa banyak referensi yang diterima sebuah model adalah perbedaan kemampuan yang nyata, bukan detail lembar spesifikasi. Sebagian model hanya menerima satu. GPT Image 2 dan GPT Image 2.5 menerima sampai enam belas. Nano Banana 2 menerima empat belas; Nano Banana Pro dan Seedream delapan sampai sepuluh.
Satu referensi menjawab "buat mirip seperti ini". Delapan referensi menjawab "ini produknya, dari sudut-sudut ini, dengan finishing ini, dan inilah pencahayaan yang saya mau". Pertanyaan kedua itulah yang sebenarnya diajukan fotografi produk.
Apa yang diisi ke slotnya
Susunan yang berguna: dua atau tiga sudut subjek, satu gambar untuk cahaya atau suasana, dan satu untuk permukaan atau latar tempat. Menambahkan delapan variasi sudut yang sama tidak membantu. Model bukan sedang merata-rata; ia sedang ditunjukkan apa yang penting.
Kasus yang sering salah
Logo dan kemasan. Model yang diminta menggambar logo Anda dari deskripsi akan menghasilkan sesuatu yang berbentuk logo dan keliru. Berikan sebagai referensi, dan model yang sama akan menempatkannya dengan benar.
Produk yang sama, dua belas kali. Halaman produk lebih butuh konsistensi daripada kecemerlangan. Teks ke gambar memberi dua belas botol yang masuk akal; gambar ke gambar dengan set referensi tetap memberi satu botol yang difoto dua belas cara.
"Hampir benar, satu perubahan". Ini yang paling besar. Ketika render sudah 90 persen, orang menulis ulang prompt dan melempar dadu lagi, yang mengacak ulang semuanya termasuk bagian yang sudah bagus. Memasukkan kembali render yang bagus sebagai referensi dan mendeskripsikan hanya perubahannya akan menjaga apa yang Anda sukai.
Latar belakang. Memotong subjek dan menaruhnya di tempat lain bukan persoalan generasi. Alat penghapus latar, latar transparan, dan warna latar melakukannya tanpa menyentuh subjek sama sekali.
Kapan teks ke gambar memang pilihan yang tepat
Latar dan lingkungan yang nanti akan Anda komposisikan. Kerja konsep yang justru bertujuan melihat opsi. Ilustrasi dan karya bergaya tanpa acuan dunia nyata. Apa pun ketika "kejutkan saya" adalah nilai lebih, bukan risiko.
Ini juga tempat yang lebih murah untuk menjelajah. Model 2 kredit ada persis untuk ini: jalankan enam pembingkaian dari satu ide, pilih satu, dan baru kemudian bawa referensi serta model yang lebih baik untuk mengeksekusinya.
Alur hibrida yang benar-benar bekerja
Sebagian besar gambar jadi di platform ini lahir dari satu siklus, bukan satu prompt. Buat draf komposisi dengan teks ke gambar pada model murah. Pilih bingkai terbaik. Pindah ke gambar ke gambar, masukkan bingkai itu sebagai referensi bersama produk aslinya, dan deskripsikan hanya apa yang harus berubah. Jalankan versi final pada model yang cocok dengan tujuannya.
Dua atau tiga putaran seperti itu mengalahkan dua belas kali lempar ulang, dan lebih murah. Hasil yang bisa diulang membahas sisi parameter dari siklus yang sama — seed, guidance, dan apa yang layak dikunci antar-jalan.
Berpindah di tengah jalan tanpa mengulang
Di ruang kerja, kotak prompt identik di kedua mode; menambahkan gambar referensi itulah yang memindahkan Anda dari satu ke yang lain. Tak ada bagian prompt yang perlu ditulis ulang, dan daftar modelnya tetap sama, jadi perbandingan yang sudah Anda buat masih berlaku.
Sembilan belas model mendukung kedua mode, dengan batas referensi yang berbeda. Katalog mencantumkannya, dan harga dihitung per render terlepas dari mode yang dipakai — jadi satu-satunya yang diubah pilihan ini adalah berapa render yang Anda butuhkan. Dan itu biasanya seluruh anggarannya.
Pekerjaan yang sama, dijalankan dua cara
Perbandingan konkret. Anda punya foto botol keramik dan butuh tiga gambar: foto katalog berlatar putih, adegan dapur, dan spanduk lebar.
| Pendekatan | Langkah | Hasil |
|---|---|---|
| Teks ke gambar saja | Deskripsikan botolnya tiap kali; ulangi sampai bentuknya mendekati | Tiga botol berbeda, tak satu pun milik Anda |
| Gambar ke gambar | Masukkan fotonya sebagai referensi; deskripsikan hanya latar dan bingkai | Satu botol, tiga latar, konsisten |
Rute kedua juga selesai lebih cepat, karena tiap gambar jadi dalam satu atau dua percobaan, bukan lima. Biaya kredit per render identik; totalnya jauh berbeda.
Pola kegagalan yang perlu dikenali
Subjek yang melenceng. Produk Anda berubah bentuk antar-render. Entah Anda berada di mode teks padahal semestinya tidak, entah strength disetel cukup tinggi sehingga model bebas menafsir ulang referensinya.
Kolase. Terlalu banyak referensi yang tak berhubungan menghasilkan gambar yang merata-ratakannya. Lima referensi yang dipilih untuk tugas berbeda — sudut, sudut, cahaya, permukaan, suasana — bekerja; dua belas yang serupa tidak.
Keberhasilan yang tertimpa. Sebuah render nyaris sempurna, Anda menulis ulang prompt, dan versi bagus itu lenyap. Masukkan kembali render bagus sebagai referensi dan deskripsikan hanya perubahannya.
Prompt yang seharusnya sebuah alat. Meminta "gambar yang sama tapi latarnya putih" memakan satu render penuh, padahal satu alat melakukannya tanpa menyentuh subjek.
Model mana untuk mode mana
Untuk teks ke gambar, mesin murah dan cepat paling penting, karena di tahap penjelajahanlah percobaan menumpuk. Untuk gambar ke gambar, batas referensi menentukan apa yang mungkin: satu slot cukup untuk transfer gaya, tapi kerja produk dengan beberapa sudut butuh delapan atau lebih.
Halaman tiap model mencantumkan kedua angka itu, dan katalog menampilkannya berdampingan. Selebihnya tak ada yang perlu berubah dalam alur kerja Anda saat berpindah mode — prompt yang sama, setelan rasio aspek yang sama, pertimbangan yang sama.
