Annual billing keeps the same monthly credits for around 30% less.

See Plans

Texto para imagem ou imagem para imagem: por onde começar

Texto para imagem ou imagem para imagem: por onde começar

Todo trabalho começa na mesma bifurcação, e a maior parte dos créditos desperdiçados vem de pegar o ramo errado. Descrever uma imagem do zero e modificar uma imagem que você já tem são ferramentas diferentes, e a segunda é subutilizada.

A regra

Se qualquer parte da imagem final já existe — um produto, um logotipo, um cômodo, um rosto, um esboço, até uma renderização ruim de ontem — comece por imagem para imagem. Se ainda não existe nada, comece por texto para imagem.

Escrito assim parece óbvio. Na prática, as pessoas descrevem o próprio produto em palavras para um modelo que nunca o viu, e depois gastam quinze renderizações tentando convencê-lo da forma certa.

O que cada modo realmente controla

Texto para imagemImagem para imagem
Você forneceUma descriçãoUma ou mais imagens, mais uma descrição
Você controlaSujeito, estilo, enquadramentoTudo isso, mais a coisa em si
Tentativas até acertarVárias, se o sujeito for específicoGeralmente uma ou duas
Espaços de referênciaNenhumDe 1 a 16, conforme o modelo
Melhor paraConceitos, cenas, climas, fundosProdutos, pessoas, ativos de marca, revisões

Os dois custam o mesmo por renderização no mesmo modelo. A diferença não é o preço de uma tentativa, é quantas tentativas você precisa.

Imagens de referência são o ponto central

Quantas referências um modelo aceita é uma diferença real de capacidade, não um detalhe de ficha técnica. Alguns aceitam exatamente uma. GPT Image 2 e GPT Image 2.5 aceitam até dezesseis. Nano Banana 2 aceita quatorze; Nano Banana Pro e Seedream, de oito a dez.

Uma referência responde a "faça parecer com isto". Oito referências respondem a "este é o produto, nestes ângulos, neste acabamento, e esta é a luz que eu quero". A segunda pergunta é a que a fotografia de produto faz de verdade.

O que colocar nos espaços

Um conjunto útil é: dois ou três ângulos do sujeito, uma imagem para luz ou clima e uma para a superfície ou o cenário. Adicionar oito variações do mesmo ângulo não ajuda. O modelo não está tirando média; está sendo mostrado o que importa.

Os casos que as pessoas erram

Logotipos e embalagens. Um modelo instruído a desenhar seu logotipo a partir de uma descrição vai produzir algo em formato de logotipo e errado. Entregue-o como referência e o mesmo modelo o posiciona corretamente.

O mesmo produto, doze vezes. Páginas de produto precisam de consistência mais do que de brilho. Texto para imagem dá doze garrafas plausíveis; imagem para imagem com um conjunto fixo de referências dá uma garrafa fotografada de doze maneiras.

"Quase certo, uma mudança". Este é o maior. Quando uma renderização está em 90%, as pessoas reescrevem o prompt e jogam de novo, o que re-aleatoriza tudo, inclusive as partes que funcionavam. Devolver a boa renderização como referência e descrever só a mudança preserva o que você gostou.

Fundos. Recortar um sujeito e colocá-lo em outro lugar não é problema de geração. As ferramentas de remoção de fundo, fundo transparente e cor de fundo fazem isso sem tocar no sujeito.

Quando texto para imagem é mesmo a escolha certa

Fundos e ambientes que você vai compor depois. Trabalho de conceito em que o objetivo é ver opções. Ilustração e arte estilizada sem referente no mundo real. Qualquer coisa em que "me surpreenda" seja uma qualidade e não um risco.

É também o lugar mais barato para explorar. Os modelos de 2 créditos existem exatamente para isso: rode seis enquadramentos de uma ideia, escolha um, e só então traga referências e um modelo melhor para executar.

Um fluxo híbrido que funciona

A maioria das imagens finalizadas nesta plataforma sai de um ciclo, não de um único prompt. Rascunhe a composição com texto para imagem num modelo barato. Escolha o melhor quadro. Vá para imagem para imagem, devolva esse quadro como referência junto com o produto real e descreva apenas o que deve mudar. Rode a final no modelo adequado ao destino.

Duas ou três passagens dessas batem doze rerolagens, e custam menos. Resultados repetíveis cobre o lado dos parâmetros do mesmo ciclo — seeds, guidance e o que vale fixar entre execuções.

Trocar no meio do caminho sem recomeçar

No espaço de trabalho, a caixa de prompt é idêntica nos dois modos; adicionar uma imagem de referência é o que leva você de um para o outro. Nada do seu prompt precisa ser reescrito, e a lista de modelos continua a mesma, então uma comparação que você já fez continua valendo.

Dezenove modelos suportam os dois modos, com limites de referência diferentes. O catálogo lista todos, e o preço é por renderização independentemente do modo — então a única coisa que a escolha muda é de quantas renderizações você precisa. E isso costuma ser o orçamento inteiro.

O mesmo trabalho, pelos dois caminhos

Uma comparação concreta. Você tem a foto de uma garrafa de cerâmica e precisa de três imagens: uma foto de listagem em fundo branco, uma cena de cozinha e um banner largo.

AbordagemPassosResultado
Só texto para imagemDescrever a garrafa toda vez; rerolar até a forma chegar pertoTrês garrafas diferentes, nenhuma é a sua
Imagem para imagemDar a foto como referência; descrever só o cenário e o quadroUma garrafa, três cenários, consistentes

O segundo caminho também termina mais rápido, porque cada imagem sai em uma ou duas tentativas em vez de cinco. O custo em créditos por renderização é idêntico; o total não chega perto.

Modos de falha que vale reconhecer

O sujeito que deriva. Seu produto muda de forma entre renderizações. Ou você está em texto para imagem quando não deveria, ou a força está alta o bastante para o modelo reinterpretar a referência.

A colagem. Referências demais e sem relação produzem uma imagem que tira a média delas. Cinco referências escolhidas para funções distintas — ângulo, ângulo, luz, superfície, clima — funcionam; doze parecidas não.

O acerto sobrescrito. Uma renderização está quase perfeita, você reescreve o prompt e a boa versão some. Devolva a boa renderização como referência e descreva apenas a mudança.

O prompt que deveria ter sido uma ferramenta. Pedir "a mesma imagem, mas com fundo branco" custa uma renderização inteira quando uma ferramenta resolve sem tocar no sujeito.

Quais modelos servem a cada modo

Para texto para imagem, os motores baratos e rápidos são o que mais importa, porque é na exploração que as tentativas se acumulam. Para imagem para imagem, o limite de referências decide o que é possível: um espaço basta para transferência de estilo, mas trabalho de produto com vários ângulos precisa de oito ou mais.

As páginas dos modelos trazem os dois números, e o catálogo os mostra lado a lado. Nada mais no seu fluxo precisa mudar entre os modos — o mesmo prompt, os mesmos ajustes de proporção, o mesmo equilíbrio.