Annual billing keeps the same monthly credits for around 30% less.

See Plans

Gjentakbare resultater: referanser, seeds og innstillingene som teller

Gjentakbare resultater: referanser, seeds og innstillingene som teller

Å få ett godt bilde er å forvalte flaks. Å få tolv som ser ut som de kom fra samme fotografering, er en prosess. Forskjellen ligger i om du kaster ledetekster på nytt eller styrer de tingene som faktisk gjør resultatet gjentakbart.

Hvorfor samme ledetekst gir ulike bilder

Bildemodeller starter fra tilfeldig støy og former den etter ledeteksten din. Endrer du startstøyen, får du et annet bilde av de samme ordene. Det er denne tilfeldigheten som gjør utforsking lett og enhetlighet vanskelig.

Alt nedenfor er måter å fjerne tilfeldighet fra én del av prosessen, slik at modellen bare improviserer der du vil.

Referanser er den sterkeste styringen

Ord beskriver; referanser viser. Finnes motivet, fjerner det å levere det via bilde til bilde modellens frihet til å finne det opp på nytt. Det er langt mer pålitelig enn aldri så mange stablede adjektiv.

Hvor mange referanser en modell tar imot, varierer mye. GPT Image 2 og GPT Image 2.5 tar opptil seksten. Nano Banana 2 tar fjorten, Seedream 5 Pro ti, Nano Banana Pro og flere andre åtte. Noen få modeller tar nøyaktig én.

Hva som hører hjemme i hver plass

Et sett som virker: to eller tre vinkler av motivet, ett bilde som bærer lyset du vil ha, og ett som bærer omgivelsene eller underlaget. Fem referanser valgt av ulike grunner slår tolv nesten like, som stort sett lærer modellen å ta gjennomsnitt.

Behold det samme referansesettet gjennom en serie. Å bytte ut ett bilde mellom renderinger er den vanligste årsaken til en serie som nesten passer sammen.

Seeds: gjenta-knappen

En seed låser startstøyen. Samme seed, samme ledetekst, samme innstillinger, samme modell gir deg det samme bildet igjen. Endrer du ett ord, får du en kontrollert variasjon i stedet for et nytt terningkast.

Ikke alle modeller viser den. Blant dem som gjør det, lar Qwen, Midjourney Diffusion, Ideogram og Wan-modellene deg sette den direkte. Når den er tilgjengelig, er arbeidsflyten: utforsk uten seed til noe er nær, noter seeden til den renderingen, og iterer deretter med den låst mens du justerer formuleringen.

Feilen er å låse en seed for tidlig. En seed låser en komposisjon du ennå ikke har valgt.

Guidance og steg, med enkle ord

InnstillingHva den endrerFornuftig område
Guidance-skalaHvor bokstavelig modellen følger ledetekstenMidt i området; høye verdier virker stive
InferensstegHvor lenge den finpusser før den stopperStandard, med mindre resultatet ser uferdig ut
Strength (bilde til bilde)Hvor langt den får avvike fra referansen dinLav for å beholde motivet, høy for å restilisere
Negativ ledetekstHva som skal unngåsKort og konkret, ikke en ønskeliste

Guidance er den folk skrur for mye på. Skrudd høyt opp tvinger den bokstavelig lydighet og koster som regel naturlighet — harde kanter, stive positurer, overmettet lys. Overser modellen noe viktig, ligger løsningen nesten alltid i en klarere ledetekst eller et referansebilde, ikke i et høyere tall.

Strength er den folk bruker for lite. I bilde til bilde er den bryteren mellom «friske opp dette» og «tolk dette på nytt». Skifter produktet ditt stadig form, er strength for høy.

Å skrive en ledetekst som tåler en ny kjøring

En gjentakbar ledetekst navngir fire ting: motivet, lyset, utsnittet og hva som ikke skal være der. Alt vagere blir fylt ut ulikt hver gang.

Sammenlign «et fint produktbilde av en flaske, profesjonelt» med «en matt keramikkflaske på mørk skifer, ett mykt hovedlys fra venstre, grunn dybdeskarphet, ingen tekst, ingen refleksjoner på etiketten». Den andre er kjedelig å lese og kommer tilbake enhetlig.

Hold strukturen fast gjennom en serie, og endre bare den variable delen. Skifter motivet mens lys og utsnitt skal ligge fast, er det bare de ordene som får flytte seg.

Enhetlighet gjennom en serie

For en serie som skal henge sammen: lås modellen, lås sideforholdet, lås referansesettet, lås lyssetningen, og varier bare motiv eller vinkel. Kjør dem i én økt i stedet for over flere dager, for dine egne formuleringer driver mer enn modellen gjør.

Oppløsningen bør også være konstant innenfor et sett. Å blande et hovedbilde i 4K med støttebilder i 1K går fint; å blande 1K og 2K på bilder som vises ved siden av hverandre, synes i detaljene. Hvilket nivå som passer hvor, dekker guiden vår til utsnitt og oppløsning.

Når resultatet fortsatt ikke faller til ro

Fortsetter et motiv å mutere til tross for referanser, er kanskje modellen rett og slett ikke den rette — referansegrenser og evnen til å følge instruksjoner varierer kraftig i katalogen. Ser detaljer utsmurte ut, er oppløsningen mer sannsynlig årsaken enn ledeteksten. Kommer tekst i bildet ut forvrengt, er det et modellvalg: Ideogram er bygget for typografi, og ingen ledetekst fikser det andre steder.

Og er bildet riktig bortsett fra ett element, slutt å generere. Fjern elementet med objektfjerning, eller fiks bakgrunnen med bakgrunnsverktøyene. Den grensen dekket vi i å rydde opp i bilder.

En løkke som konvergerer

Utforsk billig på en modell til 2 kreditter uten seed til komposisjonen er riktig. Noter seeden hvis modellen tilbyr en. Gå videre til tekst til bilde eller bilde til bilde på modellen som passer bestemmelsesstedet, med den samme formuleringen. Legg til referanser for alt som må forbli nøyaktig. Endre én variabel per kjøring, aldri tre.

De fleste jobber lander slik på tre eller fire renderinger. Arbeidsrommet holder ledetekst, referanser og innstillinger på ett sted mens du bytter motor, og abonnementene viser hva hver av kjøringene trekker fra saldoen. Er du fortsatt i ferd med å velge motor, er denne sammenligningen snarveien.

En ledetekstmal verdt å gjenbruke

Hold skjelettet fast, og bytt bare ut den variable delen. Noe sånt som: motiv og materiale, så underlag eller omgivelser, så lysretning og -kvalitet, så dybdeskarphet, så unntakene.

Skrevet ut: «en matt keramikkflaske på mørk skifer, ett mykt hovedlys fra venstre, grunn dybdeskarphet, ingen tekst, ingen harde refleksjoner». Skal et annet produkt i samme sett fotograferes, er det bare første del som endres. Alt modellen bruker til å bygge uttrykket, forblir ord for ord identisk, og det er hele poenget.

Unntak hører til slutt og bør være konkrete. «Ingen tekst» virker. «Ingenting stygt» beskriver ingenting en modell kan handle på.

Feilsøking etter symptom

SymptomSannsynlig årsakLøsning
Motivet endrer seg mellom kjøringerIngen referanse, eller strength for høyLegg til referanser; senk strength
Resultatet virker stivt eller overbelystGuidance skrudd for høytTilbake til midten av området
Detaljer utsmurt i full størrelseFor lav oppløsning for brukenKjør på nytt i 2K eller 4K
Tekst i bildet er forvrengtFeil modell for typografiBruk Ideogram
Serien passer ikke sammenLedetekst eller referanser har drevetLås formuleringen og referansesettet; kjør alt på nytt samlet
Ett element ødelegger et godt bildeForsøk på å løse det ved å generere på nyttFjern det i stedet

Endre én ting om gangen

Disiplinen som får alt dette til å virke, er kjedelig: én variabel per kjøring. Endre seeden eller formuleringen eller modellen, aldri to samtidig, ellers vet du ikke hvilken endring som ga forbedringen.

Det føles tregere og blir ferdig tidligere. Tre bevisste kjøringer slår som regel et dusin håpefulle, og på de billige motorene koster de tre kjøringene seks kreditter.