Ottenere una buona immagine è gestione della fortuna. Ottenerne dodici che sembrino uscite dallo stesso shooting è un processo. La differenza sta nel se stai rilanciando prompt o stai controllando le cose che rendono davvero ripetibile un risultato.
Perché lo stesso prompt dà immagini diverse
I modelli di immagine partono da rumore casuale e lo modellano secondo il tuo prompt. Cambia il rumore di partenza e da parole identiche esce un'immagine diversa. Quella casualità è il motivo per cui esplorare è facile e la coerenza è difficile.
Tutto ciò che segue è un modo di togliere casualità da una parte del processo, così che il modello improvvisi solo dove vuoi tu.
I riferimenti sono il controllo più forte
Le parole descrivono; i riferimenti mostrano. Se il soggetto esiste, fornirlo tramite immagine in immagine toglie al modello la libertà di reinventarlo. È molto più affidabile di qualsiasi accumulo di aggettivi.
Quanti riferimenti accetta un modello varia parecchio. GPT Image 2 e GPT Image 2.5 ne accettano fino a sedici. Nano Banana 2 ne prende quattordici, Seedream 5 Pro dieci, Nano Banana Pro e diversi altri otto. Qualche modello ne accetta esattamente uno.
Cosa mettere in ciascuno slot
Un set che funziona: due o tre angolazioni del soggetto, un'immagine che porti la luce che vuoi, una che porti l'ambiente o la superficie. Cinque riferimenti scelti per ragioni diverse battono dodici quasi-duplicati, che soprattutto insegnano al modello a fare la media.
Mantieni lo stesso set di riferimenti lungo tutta una serie. Cambiare una sola immagine fra un render e l'altro è la causa più comune di una serie che «quasi» combacia.
Seed: il pulsante ripeti
Un seed fissa il rumore di partenza. Stesso seed, stesso prompt, stesse impostazioni, stesso modello: ti restituisce la stessa immagine. Cambia una parola e ottieni una variazione controllata invece di un nuovo lancio di dadi.
Non tutti i modelli lo espongono. Fra quelli che lo fanno, Qwen, Midjourney Diffusion, Ideogram e i modelli Wan ti lasciano impostarlo direttamente. Quando è disponibile il flusso è: esplorare senza seed finché qualcosa non ci va vicino, annotare il seed di quel render, poi iterare tenendolo fisso mentre sistemi le parole.
L'errore è fissare un seed troppo presto. Un seed blocca una composizione che non hai ancora scelto.
Guidance e passi, in parole semplici
| Impostazione | Cosa cambia | Intervallo sensato |
|---|---|---|
| Scala di guidance | Quanto alla lettera il modello segue il prompt | Metà intervallo; valori alti risultano rigidi |
| Passi di inferenza | Per quanto rifinisce prima di fermarsi | Valore predefinito, salvo output incompiuto |
| Strength (immagine in immagine) | Quanto può allontanarsi dal tuo riferimento | Bassa per tenere il soggetto, alta per ristilizzare |
| Prompt negativo | Cosa evitare | Breve e concreto, non una lista dei desideri |
La guidance è quella che si esagera di più. Spinta in alto impone un'obbedienza letterale e di solito costa naturalezza: bordi duri, pose rigide, luce sovrasatura. Se il modello ignora qualcosa di importante, il rimedio è quasi sempre un prompt più chiaro o un'immagine di riferimento, non un numero più alto.
La strength è quella che si usa troppo poco. In immagine in immagine è la manopola fra «ritocca questo» e «reinterpreta questo». Se il tuo prodotto continua a cambiare forma, la strength è troppo alta.
Scrivere un prompt che sopravvive a una seconda esecuzione
Un prompt ripetibile nomina quattro cose: il soggetto, la luce, l'inquadratura e ciò che non deve esserci. Tutto ciò che è più vago viene riempito ogni volta in modo diverso.
Confronta «una bella foto prodotto di una bottiglia, professionale» con «una bottiglia in ceramica opaca su ardesia scura, una sola luce principale morbida da sinistra, profondità di campo ridotta, niente testo, nessun riflesso sull'etichetta». La seconda è noiosa da leggere e torna coerente.
Tieni la struttura fissa lungo la serie e cambia solo la parte variabile. Se cambia il soggetto ma luce e inquadratura non devono cambiare, solo quelle parole si muovono.
Coerenza lungo una serie
Per una serie che deve reggere insieme: fissa il modello, fissa la proporzione, fissa il set di riferimenti, fissa la frase sull'illuminazione e varia solo il soggetto o l'angolazione. Eseguili in un'unica sessione invece che in giorni diversi, perché la tua formulazione deriva più del modello.
Anche la risoluzione dovrebbe restare costante all'interno di un set. Mescolare un'immagine principale in 4K con scatti di supporto a 1K va bene; mescolare 1K e 2K per immagini mostrate affiancate si vede nel dettaglio. Quale livello scegliere per ciascuno spazio lo copre la nostra guida a inquadrature e risoluzione.
Quando l'output continua a non stabilizzarsi
Se un soggetto continua a mutare nonostante i riferimenti, forse il modello semplicemente non è quello giusto: limiti di riferimento e aderenza alle istruzioni variano parecchio nel catalogo. Se il dettaglio appare spalmato, la causa è più probabilmente la risoluzione che il prompt. Se il testo nell'immagine esce storpiato, è una questione di modello: quello costruito per la tipografia è Ideogram, e altrove nessun prompt lo sistema.
E se l'immagine è giusta tranne per un elemento, smetti di generare. Rimuovi l'elemento con la rimozione oggetti o sistema il fondale con gli strumenti per lo sfondo. Abbiamo trattato questo confine in pulire le immagini.
Un ciclo che converge
Esplora a poco prezzo su un modello da 2 crediti senza seed finché la composizione non è giusta. Annota il seed se il modello ne offre uno. Passa a testo in immagine o immagine in immagine sul modello adatto alla destinazione, portandoti dietro la stessa formulazione. Aggiungi riferimenti per tutto ciò che deve restare accurato. Cambia una variabile per esecuzione, mai tre.
Così la maggior parte dei lavori si chiude in tre o quattro render. Lo spazio di lavoro tiene prompt, riferimenti e impostazioni in un unico posto mentre cambi motore, e i piani mostrano quanto ciascuna di quelle esecuzioni preleva dal saldo. Se stai ancora scegliendo fra motori, questo confronto è la scorciatoia.
Un modello di prompt da riutilizzare
Tieni fisso lo scheletro e sostituisci solo la parte variabile. Qualcosa tipo: soggetto e materiale, poi superficie o ambiente, poi direzione e qualità della luce, poi profondità di campo, poi le esclusioni.
Scritto per esteso: «una bottiglia in ceramica opaca su ardesia scura, una sola luce principale morbida da sinistra, profondità di campo ridotta, niente testo, nessun riflesso duro». Per fotografare un secondo prodotto nello stesso set cambia solo la prima parte. Tutto ciò che il modello usa per costruire il look resta identico parola per parola, ed è proprio questo il punto.
Le esclusioni vanno in fondo e devono essere concrete. «Niente testo» funziona. «Niente di brutto» non descrive nulla su cui il modello possa agire.
Diagnosi per sintomo
| Sintomo | Causa probabile | Rimedio |
|---|---|---|
| Il soggetto cambia fra un'esecuzione e l'altra | Nessun riferimento, o strength troppo alta | Aggiungere riferimenti; abbassare la strength |
| Risultato rigido o sovraesposto | Guidance spinta troppo in alto | Tornare a metà intervallo |
| Dettaglio spalmato a dimensione piena | Risoluzione troppo bassa per l'uso | Rieseguire a 2K o 4K |
| Il testo nell'immagine è storpiato | Modello sbagliato per la tipografia | Usare Ideogram |
| La serie non combacia | Prompt o riferimenti sono derivati | Fissare formulazione e set di riferimenti; rieseguire insieme |
| Un elemento rovina un buon scatto | Si prova a risolverlo rigenerando | Rimuoverlo invece |
Cambia una cosa per volta
La disciplina che fa funzionare tutto questo è noiosa: una variabile per esecuzione. Cambia il seed o la formulazione o il modello, mai due insieme, altrimenti non saprai quale modifica ha prodotto il miglioramento.
Sembra più lento e finisce prima. Tre esecuzioni deliberate battono di solito una dozzina di tentativi speranzosi, e sui motori economici quelle tre esecuzioni costano sei crediti.
