Todo trabalho começa na mesma bifurcação, e a maior parte dos créditos desperdiçados vem de pegar o ramo errado. Descrever uma imagem do zero e modificar uma imagem que você já tem são ferramentas diferentes, e a segunda é subutilizada.
A regra
Se qualquer parte da imagem final já existe — um produto, um logotipo, um cômodo, um rosto, um esboço, até uma renderização ruim de ontem — comece por imagem para imagem. Se ainda não existe nada, comece por texto para imagem.
Escrito assim parece óbvio. Na prática, as pessoas descrevem o próprio produto em palavras para um modelo que nunca o viu, e depois gastam quinze renderizações tentando convencê-lo da forma certa.
O que cada modo realmente controla
| Texto para imagem | Imagem para imagem | |
|---|---|---|
| Você fornece | Uma descrição | Uma ou mais imagens, mais uma descrição |
| Você controla | Sujeito, estilo, enquadramento | Tudo isso, mais a coisa em si |
| Tentativas até acertar | Várias, se o sujeito for específico | Geralmente uma ou duas |
| Espaços de referência | Nenhum | De 1 a 16, conforme o modelo |
| Melhor para | Conceitos, cenas, climas, fundos | Produtos, pessoas, ativos de marca, revisões |
Os dois custam o mesmo por renderização no mesmo modelo. A diferença não é o preço de uma tentativa, é quantas tentativas você precisa.
Imagens de referência são o ponto central
Quantas referências um modelo aceita é uma diferença real de capacidade, não um detalhe de ficha técnica. Alguns aceitam exatamente uma. GPT Image 2 e GPT Image 2.5 aceitam até dezesseis. Nano Banana 2 aceita quatorze; Nano Banana Pro e Seedream, de oito a dez.
Uma referência responde a "faça parecer com isto". Oito referências respondem a "este é o produto, nestes ângulos, neste acabamento, e esta é a luz que eu quero". A segunda pergunta é a que a fotografia de produto faz de verdade.
O que colocar nos espaços
Um conjunto útil é: dois ou três ângulos do sujeito, uma imagem para luz ou clima e uma para a superfície ou o cenário. Adicionar oito variações do mesmo ângulo não ajuda. O modelo não está tirando média; está sendo mostrado o que importa.
Os casos que as pessoas erram
Logotipos e embalagens. Um modelo instruído a desenhar seu logotipo a partir de uma descrição vai produzir algo em formato de logotipo e errado. Entregue-o como referência e o mesmo modelo o posiciona corretamente.
O mesmo produto, doze vezes. Páginas de produto precisam de consistência mais do que de brilho. Texto para imagem dá doze garrafas plausíveis; imagem para imagem com um conjunto fixo de referências dá uma garrafa fotografada de doze maneiras.
"Quase certo, uma mudança". Este é o maior. Quando uma renderização está em 90%, as pessoas reescrevem o prompt e jogam de novo, o que re-aleatoriza tudo, inclusive as partes que funcionavam. Devolver a boa renderização como referência e descrever só a mudança preserva o que você gostou.
Fundos. Recortar um sujeito e colocá-lo em outro lugar não é problema de geração. As ferramentas de remoção de fundo, fundo transparente e cor de fundo fazem isso sem tocar no sujeito.
Quando texto para imagem é mesmo a escolha certa
Fundos e ambientes que você vai compor depois. Trabalho de conceito em que o objetivo é ver opções. Ilustração e arte estilizada sem referente no mundo real. Qualquer coisa em que "me surpreenda" seja uma qualidade e não um risco.
É também o lugar mais barato para explorar. Os modelos de 2 créditos existem exatamente para isso: rode seis enquadramentos de uma ideia, escolha um, e só então traga referências e um modelo melhor para executar.
Um fluxo híbrido que funciona
A maioria das imagens finalizadas nesta plataforma sai de um ciclo, não de um único prompt. Rascunhe a composição com texto para imagem num modelo barato. Escolha o melhor quadro. Vá para imagem para imagem, devolva esse quadro como referência junto com o produto real e descreva apenas o que deve mudar. Rode a final no modelo adequado ao destino.
Duas ou três passagens dessas batem doze rerolagens, e custam menos. Resultados repetíveis cobre o lado dos parâmetros do mesmo ciclo — seeds, guidance e o que vale fixar entre execuções.
Trocar no meio do caminho sem recomeçar
No espaço de trabalho, a caixa de prompt é idêntica nos dois modos; adicionar uma imagem de referência é o que leva você de um para o outro. Nada do seu prompt precisa ser reescrito, e a lista de modelos continua a mesma, então uma comparação que você já fez continua valendo.
Dezenove modelos suportam os dois modos, com limites de referência diferentes. O catálogo lista todos, e o preço é por renderização independentemente do modo — então a única coisa que a escolha muda é de quantas renderizações você precisa. E isso costuma ser o orçamento inteiro.
O mesmo trabalho, pelos dois caminhos
Uma comparação concreta. Você tem a foto de uma garrafa de cerâmica e precisa de três imagens: uma foto de listagem em fundo branco, uma cena de cozinha e um banner largo.
| Abordagem | Passos | Resultado |
|---|---|---|
| Só texto para imagem | Descrever a garrafa toda vez; rerolar até a forma chegar perto | Três garrafas diferentes, nenhuma é a sua |
| Imagem para imagem | Dar a foto como referência; descrever só o cenário e o quadro | Uma garrafa, três cenários, consistentes |
O segundo caminho também termina mais rápido, porque cada imagem sai em uma ou duas tentativas em vez de cinco. O custo em créditos por renderização é idêntico; o total não chega perto.
Modos de falha que vale reconhecer
O sujeito que deriva. Seu produto muda de forma entre renderizações. Ou você está em texto para imagem quando não deveria, ou a força está alta o bastante para o modelo reinterpretar a referência.
A colagem. Referências demais e sem relação produzem uma imagem que tira a média delas. Cinco referências escolhidas para funções distintas — ângulo, ângulo, luz, superfície, clima — funcionam; doze parecidas não.
O acerto sobrescrito. Uma renderização está quase perfeita, você reescreve o prompt e a boa versão some. Devolva a boa renderização como referência e descreva apenas a mudança.
O prompt que deveria ter sido uma ferramenta. Pedir "a mesma imagem, mas com fundo branco" custa uma renderização inteira quando uma ferramenta resolve sem tocar no sujeito.
Quais modelos servem a cada modo
Para texto para imagem, os motores baratos e rápidos são o que mais importa, porque é na exploração que as tentativas se acumulam. Para imagem para imagem, o limite de referências decide o que é possível: um espaço basta para transferência de estilo, mas trabalho de produto com vários ângulos precisa de oito ou mais.
As páginas dos modelos trazem os dois números, e o catálogo os mostra lado a lado. Nada mais no seu fluxo precisa mudar entre os modos — o mesmo prompt, os mesmos ajustes de proporção, o mesmo equilíbrio.
