Conseguir uma boa imagem é administrar sorte. Conseguir doze que pareçam do mesmo ensaio é um processo. A diferença está em: você está rerolando prompts ou controlando as coisas que de fato tornam o resultado repetível?
Por que o mesmo prompt dá imagens diferentes
Modelos de imagem partem de ruído aleatório e o moldam conforme o seu prompt. Mude o ruído inicial e as mesmas palavras dão outra imagem. É essa aleatoriedade que torna a exploração fácil e a consistência difícil.
Tudo o que vem abaixo é um jeito de tirar a aleatoriedade de uma parte do processo, para que o modelo improvise só onde você quer.
Referências são o controle mais forte
Palavras descrevem; referências mostram. Se o sujeito existe, entregá-lo por imagem para imagem tira do modelo a liberdade de reinventá-lo. Isso é muito mais confiável do que empilhar adjetivos.
Quantas referências cada modelo aceita varia bastante. GPT Image 2 e GPT Image 2.5 aceitam até dezesseis. Nano Banana 2 aceita quatorze, Seedream 5 Pro dez, Nano Banana Pro e vários outros oito. Alguns aceitam exatamente uma.
O que colocar em cada espaço
Um conjunto que funciona: dois ou três ângulos do sujeito, uma imagem que carregue a luz desejada e uma que carregue o cenário ou a superfície. Cinco referências escolhidas por razões diferentes batem doze quase idênticas, que basicamente ensinam o modelo a tirar média.
Mantenha o mesmo conjunto de referências ao longo de uma série. Trocar uma única imagem entre renderizações é a causa mais comum de um conjunto que "quase" combina.
Seeds: o botão de repetir
Um seed fixa o ruído inicial. Mesmo seed, mesmo prompt, mesmos ajustes, mesmo modelo: você recebe a mesma imagem de novo. Mude uma palavra e terá uma variação controlada em vez de um novo lance de dados.
Nem todo modelo expõe isso. Entre os que expõem, Qwen, Midjourney Diffusion, Ideogram e os modelos Wan deixam definir direto. Quando está disponível, o fluxo é: explorar sem seed até algo ficar perto, anotar o seed daquela renderização e então iterar com ele fixo enquanto ajusta as palavras.
O erro é fixar um seed cedo demais. Um seed tranca uma composição que você ainda não escolheu.
Guidance e passos, em linguagem simples
| Ajuste | O que muda | Faixa sensata |
|---|---|---|
| Escala de guidance | Quão literalmente o modelo segue o prompt | Meio da faixa; valores altos ficam duros |
| Passos de inferência | Quanto tempo refina antes de parar | Padrão, a não ser que saia inacabado |
| Strength (imagem para imagem) | Quanto pode se afastar da sua referência | Baixa para manter o sujeito, alta para reestilizar |
| Prompt negativo | O que evitar | Curto e concreto, não uma lista de desejos |
Guidance é o que mais se exagera. Empurrado para cima, força obediência literal e costuma custar naturalidade — bordas duras, poses travadas, luz saturada demais. Se o modelo está ignorando algo importante, a correção quase sempre é um prompt mais claro ou uma imagem de referência, não um número maior.
Strength é o que menos se usa. Em imagem para imagem, é o botão entre "dá um retoque" e "reinterpreta isso". Se o seu produto vive mudando de forma, a strength está alta demais.
Escrever um prompt que sobrevive a uma segunda rodada
Um prompt repetível nomeia quatro coisas: o sujeito, a luz, o enquadramento e o que não pode aparecer. Qualquer coisa mais vaga é preenchida de outro jeito a cada vez.
Compare "uma boa foto de produto de uma garrafa, profissional" com "uma garrafa de cerâmica fosca sobre ardósia escura, uma única luz principal suave vinda da esquerda, pouca profundidade de campo, sem texto, sem reflexos no rótulo". O segundo é chato de ler e volta consistente.
Mantenha a estrutura fixa ao longo da série e mude só a parte variável. Se o sujeito muda mas luz e enquadramento não devem mudar, só essas palavras se movem.
Consistência dentro de um conjunto
Para uma série que precisa se sustentar junta: fixe o modelo, fixe a proporção, fixe o conjunto de referências, fixe a frase de iluminação e varie apenas o sujeito ou o ângulo. Rode tudo numa sentada, não ao longo de dias, porque a sua própria redação deriva mais do que o modelo.
A resolução também deve ficar constante dentro de um conjunto. Misturar uma imagem principal em 4K com apoios em 1K é aceitável; misturar 1K e 2K em imagens exibidas lado a lado aparece no detalhe. Qual faixa escolher para cada espaço está no nosso guia de enquadramento e resolução.
Quando o resultado ainda não assenta
Se um sujeito continua mudando apesar das referências, talvez o modelo simplesmente não seja o certo — limites de referência e obediência a instruções variam muito dentro do catálogo. Se o detalhe parece borrado, a resolução é causa mais provável que o prompt. Se o texto na imagem sai embaralhado, isso é escolha de modelo: Ideogram é o feito para tipografia, e nenhum prompt resolve isso em outro lugar.
E se a imagem está certa a não ser por um elemento, pare de gerar. Remova o elemento com remoção de objeto ou corrija o fundo com as ferramentas de fundo. Tratamos dessa fronteira em limpando imagens.
Um ciclo que converge
Explore barato num modelo de 2 créditos, sem seed, até a composição ficar certa. Anote o seed se o modelo oferecer. Vá para texto para imagem ou imagem para imagem no modelo adequado ao destino, levando a mesma redação. Acrescente referências para tudo que precisa permanecer exato. Mude uma variável por execução, nunca três.
A maioria dos trabalhos fecha assim em três ou quatro renderizações. O espaço de trabalho mantém prompt, referências e ajustes num só lugar enquanto você troca de motor, e os planos mostram o que cada execução tira do seu saldo. Se ainda está escolhendo entre motores, esta comparação é o atalho.
Um modelo de prompt que vale reutilizar
Mantenha o esqueleto fixo e troque só a parte variável. Algo como: sujeito e material, depois superfície ou cenário, depois direção e qualidade da luz, depois profundidade de campo, e por fim as exclusões.
Escrito por extenso: "uma garrafa de cerâmica fosca sobre ardósia escura, uma única luz principal suave vinda da esquerda, pouca profundidade de campo, sem texto, sem reflexos duros". Para fotografar um segundo produto do mesmo conjunto, só a primeira parte muda. Tudo o que o modelo usa para construir o visual continua idêntico palavra por palavra — e é esse o ponto.
As exclusões ficam no fim e devem ser concretas. "Sem texto" funciona. "Nada feio" não descreve nada sobre o que o modelo possa agir.
Diagnóstico por sintoma
| Sintoma | Causa provável | Correção |
|---|---|---|
| O sujeito muda entre execuções | Sem referência, ou strength alta demais | Adicionar referências; baixar a strength |
| Resultado sai duro ou estourado de luz | Guidance empurrada alto demais | Voltar ao meio da faixa |
| Detalhe borrado no tamanho real | Resolução baixa demais para o uso | Rodar de novo em 2K ou 4K |
| Texto na imagem sai embaralhado | Modelo errado para tipografia | Usar Ideogram |
| O conjunto não combina | Prompt ou referências derivaram | Fixar a redação e o conjunto de referências; rodar tudo junto |
| Um elemento estraga uma boa foto | Tentativa de resolver regerando | Removê-lo em vez disso |
Mude uma coisa de cada vez
A disciplina que faz tudo isso funcionar é entediante: uma variável por execução. Mude o seed, ou a redação, ou o modelo, nunca dois juntos, senão você não saberá qual mudança produziu a melhora.
Parece mais lento e termina mais cedo. Três execuções deliberadas costumam vencer uma dúzia de tentativas esperançosas, e nos motores baratos essas três custam seis créditos.
