Å få ett godt bilde er å forvalte flaks. Å få tolv som ser ut som de kom fra samme fotografering, er en prosess. Forskjellen ligger i om du kaster ledetekster på nytt eller styrer de tingene som faktisk gjør resultatet gjentakbart.
Hvorfor samme ledetekst gir ulike bilder
Bildemodeller starter fra tilfeldig støy og former den etter ledeteksten din. Endrer du startstøyen, får du et annet bilde av de samme ordene. Det er denne tilfeldigheten som gjør utforsking lett og enhetlighet vanskelig.
Alt nedenfor er måter å fjerne tilfeldighet fra én del av prosessen, slik at modellen bare improviserer der du vil.
Referanser er den sterkeste styringen
Ord beskriver; referanser viser. Finnes motivet, fjerner det å levere det via bilde til bilde modellens frihet til å finne det opp på nytt. Det er langt mer pålitelig enn aldri så mange stablede adjektiv.
Hvor mange referanser en modell tar imot, varierer mye. GPT Image 2 og GPT Image 2.5 tar opptil seksten. Nano Banana 2 tar fjorten, Seedream 5 Pro ti, Nano Banana Pro og flere andre åtte. Noen få modeller tar nøyaktig én.
Hva som hører hjemme i hver plass
Et sett som virker: to eller tre vinkler av motivet, ett bilde som bærer lyset du vil ha, og ett som bærer omgivelsene eller underlaget. Fem referanser valgt av ulike grunner slår tolv nesten like, som stort sett lærer modellen å ta gjennomsnitt.
Behold det samme referansesettet gjennom en serie. Å bytte ut ett bilde mellom renderinger er den vanligste årsaken til en serie som nesten passer sammen.
Seeds: gjenta-knappen
En seed låser startstøyen. Samme seed, samme ledetekst, samme innstillinger, samme modell gir deg det samme bildet igjen. Endrer du ett ord, får du en kontrollert variasjon i stedet for et nytt terningkast.
Ikke alle modeller viser den. Blant dem som gjør det, lar Qwen, Midjourney Diffusion, Ideogram og Wan-modellene deg sette den direkte. Når den er tilgjengelig, er arbeidsflyten: utforsk uten seed til noe er nær, noter seeden til den renderingen, og iterer deretter med den låst mens du justerer formuleringen.
Feilen er å låse en seed for tidlig. En seed låser en komposisjon du ennå ikke har valgt.
Guidance og steg, med enkle ord
| Innstilling | Hva den endrer | Fornuftig område |
|---|---|---|
| Guidance-skala | Hvor bokstavelig modellen følger ledeteksten | Midt i området; høye verdier virker stive |
| Inferenssteg | Hvor lenge den finpusser før den stopper | Standard, med mindre resultatet ser uferdig ut |
| Strength (bilde til bilde) | Hvor langt den får avvike fra referansen din | Lav for å beholde motivet, høy for å restilisere |
| Negativ ledetekst | Hva som skal unngås | Kort og konkret, ikke en ønskeliste |
Guidance er den folk skrur for mye på. Skrudd høyt opp tvinger den bokstavelig lydighet og koster som regel naturlighet — harde kanter, stive positurer, overmettet lys. Overser modellen noe viktig, ligger løsningen nesten alltid i en klarere ledetekst eller et referansebilde, ikke i et høyere tall.
Strength er den folk bruker for lite. I bilde til bilde er den bryteren mellom «friske opp dette» og «tolk dette på nytt». Skifter produktet ditt stadig form, er strength for høy.
Å skrive en ledetekst som tåler en ny kjøring
En gjentakbar ledetekst navngir fire ting: motivet, lyset, utsnittet og hva som ikke skal være der. Alt vagere blir fylt ut ulikt hver gang.
Sammenlign «et fint produktbilde av en flaske, profesjonelt» med «en matt keramikkflaske på mørk skifer, ett mykt hovedlys fra venstre, grunn dybdeskarphet, ingen tekst, ingen refleksjoner på etiketten». Den andre er kjedelig å lese og kommer tilbake enhetlig.
Hold strukturen fast gjennom en serie, og endre bare den variable delen. Skifter motivet mens lys og utsnitt skal ligge fast, er det bare de ordene som får flytte seg.
Enhetlighet gjennom en serie
For en serie som skal henge sammen: lås modellen, lås sideforholdet, lås referansesettet, lås lyssetningen, og varier bare motiv eller vinkel. Kjør dem i én økt i stedet for over flere dager, for dine egne formuleringer driver mer enn modellen gjør.
Oppløsningen bør også være konstant innenfor et sett. Å blande et hovedbilde i 4K med støttebilder i 1K går fint; å blande 1K og 2K på bilder som vises ved siden av hverandre, synes i detaljene. Hvilket nivå som passer hvor, dekker guiden vår til utsnitt og oppløsning.
Når resultatet fortsatt ikke faller til ro
Fortsetter et motiv å mutere til tross for referanser, er kanskje modellen rett og slett ikke den rette — referansegrenser og evnen til å følge instruksjoner varierer kraftig i katalogen. Ser detaljer utsmurte ut, er oppløsningen mer sannsynlig årsaken enn ledeteksten. Kommer tekst i bildet ut forvrengt, er det et modellvalg: Ideogram er bygget for typografi, og ingen ledetekst fikser det andre steder.
Og er bildet riktig bortsett fra ett element, slutt å generere. Fjern elementet med objektfjerning, eller fiks bakgrunnen med bakgrunnsverktøyene. Den grensen dekket vi i å rydde opp i bilder.
En løkke som konvergerer
Utforsk billig på en modell til 2 kreditter uten seed til komposisjonen er riktig. Noter seeden hvis modellen tilbyr en. Gå videre til tekst til bilde eller bilde til bilde på modellen som passer bestemmelsesstedet, med den samme formuleringen. Legg til referanser for alt som må forbli nøyaktig. Endre én variabel per kjøring, aldri tre.
De fleste jobber lander slik på tre eller fire renderinger. Arbeidsrommet holder ledetekst, referanser og innstillinger på ett sted mens du bytter motor, og abonnementene viser hva hver av kjøringene trekker fra saldoen. Er du fortsatt i ferd med å velge motor, er denne sammenligningen snarveien.
En ledetekstmal verdt å gjenbruke
Hold skjelettet fast, og bytt bare ut den variable delen. Noe sånt som: motiv og materiale, så underlag eller omgivelser, så lysretning og -kvalitet, så dybdeskarphet, så unntakene.
Skrevet ut: «en matt keramikkflaske på mørk skifer, ett mykt hovedlys fra venstre, grunn dybdeskarphet, ingen tekst, ingen harde refleksjoner». Skal et annet produkt i samme sett fotograferes, er det bare første del som endres. Alt modellen bruker til å bygge uttrykket, forblir ord for ord identisk, og det er hele poenget.
Unntak hører til slutt og bør være konkrete. «Ingen tekst» virker. «Ingenting stygt» beskriver ingenting en modell kan handle på.
Feilsøking etter symptom
| Symptom | Sannsynlig årsak | Løsning |
|---|---|---|
| Motivet endrer seg mellom kjøringer | Ingen referanse, eller strength for høy | Legg til referanser; senk strength |
| Resultatet virker stivt eller overbelyst | Guidance skrudd for høyt | Tilbake til midten av området |
| Detaljer utsmurt i full størrelse | For lav oppløsning for bruken | Kjør på nytt i 2K eller 4K |
| Tekst i bildet er forvrengt | Feil modell for typografi | Bruk Ideogram |
| Serien passer ikke sammen | Ledetekst eller referanser har drevet | Lås formuleringen og referansesettet; kjør alt på nytt samlet |
| Ett element ødelegger et godt bilde | Forsøk på å løse det ved å generere på nytt | Fjern det i stedet |
Endre én ting om gangen
Disiplinen som får alt dette til å virke, er kjedelig: én variabel per kjøring. Endre seeden eller formuleringen eller modellen, aldri to samtidig, ellers vet du ikke hvilken endring som ga forbedringen.
Det føles tregere og blir ferdig tidligere. Tre bevisste kjøringer slår som regel et dusin håpefulle, og på de billige motorene koster de tre kjøringene seks kreditter.
