Annual billing keeps the same monthly credits for around 30% less.

See Plans

Texto a imagen o imagen a imagen: por dónde empezar un trabajo

Texto a imagen o imagen a imagen: por dónde empezar un trabajo

Todo trabajo empieza en la misma bifurcación, y la mayoría de los créditos desperdiciados vienen de tomar la rama equivocada. Describir una imagen desde cero y modificar una imagen que ya tienes son herramientas distintas, y la segunda está infrautilizada.

La regla

Si alguna parte de la imagen final ya existe —un producto, un logotipo, una habitación, una cara, un boceto, incluso un mal render de ayer— empieza por imagen a imagen. Si aún no existe nada, empieza por texto a imagen.

Escrito así suena obvio. En la práctica, la gente describe su propio producto con palabras a un modelo que nunca lo ha visto, y luego gasta quince renders intentando convencerlo de la forma correcta.

Qué controla realmente cada modo

Texto a imagenImagen a imagen
Tú aportasUna descripciónUna o varias imágenes, más una descripción
Tú controlasSujeto, estilo, encuadreTodo eso, más la cosa en sí
Intentos hasta acertarVarios, si el sujeto es específicoNormalmente uno o dos
Huecos de referenciaNingunoDe 1 a 16, según el modelo
Mejor paraConceptos, escenas, ambientes, fondosProductos, personas, activos de marca, revisiones

Ambos cuestan lo mismo por render en el mismo modelo. La diferencia no es el precio de un intento, sino cuántos intentos necesitas.

Las imágenes de referencia son la clave

Cuántas referencias acepta un modelo es una diferencia real de capacidad, no un detalle de ficha técnica. Algunos aceptan exactamente una. GPT Image 2 y GPT Image 2.5 aceptan hasta dieciséis. Nano Banana 2 acepta catorce; Nano Banana Pro y Seedream, de ocho a diez.

Una referencia responde a «haz que se parezca a esto». Ocho referencias responden a «este es el producto, desde estos ángulos, con este acabado, y esta es la luz que quiero». La segunda pregunta es la que realmente plantea la fotografía de producto.

Qué poner en cada hueco

Un conjunto útil es: dos o tres ángulos del sujeto, una imagen para la luz o el ambiente y una para la superficie o el entorno. Añadir ocho variaciones del mismo ángulo no ayuda. El modelo no está promediando; le están enseñando qué importa.

Los casos que la gente suele equivocar

Logotipos y packaging. Pedirle a un modelo que dibuje tu logotipo a partir de una descripción producirá algo con forma de logotipo y equivocado. Dáselo como referencia y el mismo modelo lo coloca bien.

El mismo producto, doce veces. Las fichas de producto necesitan coherencia más que brillantez. Texto a imagen da doce botellas plausibles; imagen a imagen con un conjunto fijo de referencias da una botella fotografiada de doce maneras.

«Casi bien, un solo cambio». Este es el mayor. Cuando un render está al 90 %, la gente reescribe el prompt y vuelve a tirar, lo que re-aleatoriza todo, incluidas las partes que funcionaban. Devolver el buen render como referencia y describir solo el cambio conserva lo que te gustaba.

Fondos. Recortar un sujeto y ponerlo en otro sitio no es un problema de generación. Las herramientas de quitar fondo, fondo transparente y color de fondo lo hacen sin tocar el sujeto en absoluto.

Cuándo texto a imagen es de verdad lo correcto

Fondos y entornos que compondrás más tarde. Trabajo de concepto donde la gracia es ver opciones. Ilustración y arte estilizado sin referente real. Todo aquello donde «sorpréndeme» es una virtud y no un riesgo.

También es el lugar más barato para explorar. Los modelos de 2 créditos existen exactamente para eso: lanza seis encuadres de una idea, elige uno y solo entonces trae referencias y un modelo mejor para ejecutarlo.

Un flujo híbrido que funciona

La mayoría de las imágenes terminadas en esta plataforma salen de un bucle, no de un solo prompt. Esboza la composición con texto a imagen en un modelo barato. Elige el mejor encuadre. Pasa a imagen a imagen, devuelve ese encuadre como referencia junto con el producto real y describe solo lo que debe cambiar. Haz el render final en el modelo que convenga al destino.

Dos o tres pasadas de eso ganan a doce tiradas, y cuestan menos. Resultados repetibles cubre el lado de los parámetros del mismo bucle: semillas, guía y qué conviene fijar entre ejecuciones.

Cambiar a mitad de trabajo sin empezar de cero

En el espacio de trabajo, la caja de prompt es idéntica en ambos modos; añadir una imagen de referencia es lo que te mueve de uno a otro. No hace falta reescribir nada de tu prompt, y la lista de modelos sigue igual, así que una comparación que ya hiciste sigue valiendo.

Diecinueve modelos admiten los dos modos, con límites de referencia distintos. El catálogo los lista, y el precio es por render independientemente del modo que usaras: lo único que cambia la elección es cuántos renders necesitas. Y eso suele ser todo el presupuesto.

El mismo trabajo, por los dos caminos

Una comparación concreta. Tienes la foto de una botella de cerámica y necesitas tres imágenes: una toma de ficha con fondo blanco, una escena de cocina y un banner ancho.

EnfoquePasosResultado
Solo texto a imagenDescribir la botella cada vez; volver a tirar hasta acercar la formaTres botellas distintas, ninguna es la tuya
Imagen a imagenDar la foto como referencia; describir solo el entorno y el encuadreUna botella, tres entornos, coherentes

La segunda ruta además termina antes, porque cada imagen sale en uno o dos intentos en lugar de cinco. El coste en créditos por render es idéntico; el total no se parece.

Modos de fallo que conviene reconocer

El sujeto que se desvía. Tu producto cambia de forma entre renders. O estás en texto a imagen cuando no deberías, o la fuerza está tan alta que el modelo puede reinterpretar la referencia.

El collage. Demasiadas referencias sin relación producen una imagen que las promedia. Cinco referencias elegidas para tareas distintas —ángulo, ángulo, luz, superficie, ambiente— funcionan; doce parecidas no.

El acierto sobrescrito. Un render está casi perfecto, reescribes el prompt y la buena versión desaparece. Devuelve el buen render como referencia y describe solo el cambio.

El prompt que debería haber sido una herramienta. Pedir «la misma imagen pero con fondo blanco» cuesta un render entero cuando una herramienta lo hace sin tocar el sujeto.

Qué modelos convienen a cada modo

Para texto a imagen, lo que más importa son los motores baratos y rápidos, porque es en la exploración donde se acumulan los intentos. Para imagen a imagen, el límite de referencias decide lo que es posible: un hueco basta para una transferencia de estilo, pero el trabajo de producto con varios ángulos necesita ocho o más.

Las páginas de cada modelo indican ambas cifras, y el catálogo las muestra una junto a otra. Nada más de tu flujo tiene que cambiar entre modos: el mismo prompt, los mismos ajustes de relación de aspecto, el mismo criterio.