Conseguir una buena imagen es gestionar la suerte. Conseguir doce que parezcan de la misma sesión es un proceso. La diferencia está en si estás volviendo a tirar prompts o controlando lo que de verdad hace repetible el resultado.
Por qué el mismo prompt da imágenes distintas
Los modelos de imagen parten de ruido aleatorio y lo moldean según tu prompt. Cambia el ruido inicial y las mismas palabras dan otra imagen. Esa aleatoriedad es la razón de que explorar sea fácil y la coherencia sea difícil.
Todo lo que viene a continuación es una manera de quitar aleatoriedad de una parte del proceso, para que el modelo improvise solo donde tú quieres.
Las referencias son el control más fuerte
Las palabras describen; las referencias enseñan. Si el sujeto existe, entregarlo mediante imagen a imagen le quita al modelo la libertad de reinventarlo. Es mucho más fiable que acumular adjetivos.
Cuántas referencias acepta cada modelo varía bastante. GPT Image 2 y GPT Image 2.5 aceptan hasta dieciséis. Nano Banana 2 admite catorce, Seedream 5 Pro diez, Nano Banana Pro y varios más ocho. Unos pocos aceptan exactamente una.
Qué poner en cada hueco
Un conjunto que funciona: dos o tres ángulos del sujeto, una imagen que lleve la luz que quieres y otra que lleve el entorno o la superficie. Cinco referencias elegidas por razones distintas superan a doce casi idénticas, que sobre todo le enseñan al modelo a promediar.
Mantén el mismo conjunto de referencias a lo largo de una serie. Cambiar una sola imagen entre renders es la causa más común de un conjunto que «casi» encaja.
Semillas: el botón de repetir
Una semilla fija el ruido inicial. Misma semilla, mismo prompt, mismos ajustes, mismo modelo: vuelves a obtener la misma imagen. Cambia una palabra y tendrás una variación controlada en vez de otra tirada de dados.
No todos los modelos la exponen. Entre los que sí, Qwen, Midjourney Diffusion, Ideogram y los modelos Wan permiten fijarla directamente. Cuando está disponible, el flujo es: explorar sin semilla hasta que algo se acerque, anotar la semilla de ese render y después iterar con ella fija mientras ajustas las palabras.
El error es fijar una semilla demasiado pronto. Una semilla bloquea una composición que aún no has elegido.
Guía y pasos, en lenguaje llano
| Ajuste | Qué cambia | Rango sensato |
|---|---|---|
| Escala de guía | Cuán literalmente sigue el modelo el prompt | Mitad del rango; valores altos quedan rígidos |
| Pasos de inferencia | Cuánto refina antes de parar | El valor por defecto, salvo que salga a medio hacer |
| Fuerza (imagen a imagen) | Cuánto puede alejarse de tu referencia | Baja para conservar el sujeto, alta para reestilizar |
| Prompt negativo | Qué evitar | Corto y concreto, no una lista de deseos |
La guía es el ajuste que más se sobrepasa. Subirla mucho fuerza el cumplimiento literal y suele costar naturalidad: bordes duros, poses rígidas, luz sobresaturada. Si el modelo está ignorando algo importante, la solución casi siempre es un prompt más claro o una imagen de referencia, no un número más alto.
La fuerza es el ajuste que menos se usa. En imagen a imagen es el mando entre «retoca esto» y «reinterpreta esto». Si tu producto no deja de cambiar de forma, la fuerza está demasiado alta.
Escribir un prompt que sobreviva a una segunda pasada
Un prompt repetible nombra cuatro cosas: el sujeto, la luz, el encuadre y lo que no debe aparecer. Cualquier cosa más vaga se rellena distinta cada vez.
Compara «una buena foto de producto de una botella, profesional» con «una botella de cerámica mate sobre pizarra oscura, una única luz principal suave desde la izquierda, poca profundidad de campo, sin texto, sin reflejos en la etiqueta». La segunda es aburrida de leer y vuelve consistente.
Mantén la estructura fija a lo largo de una serie y cambia solo la parte variable. Si cambia el sujeto pero la luz y el encuadre no deberían cambiar, solo esas palabras deben moverse.
Coherencia dentro de un conjunto
Para una serie que tiene que sostenerse junta: fija el modelo, fija la relación de aspecto, fija el conjunto de referencias, fija la frase de iluminación y varía solo el sujeto o el ángulo. Lánzalas de una sentada y no repartidas en días, porque tu propia redacción se desvía más que el modelo.
La resolución también debe mantenerse constante dentro de un conjunto. Mezclar una imagen principal en 4K con secundarias en 1K está bien; mezclar 1K y 2K en imágenes que se muestran una al lado de otra se nota en el detalle. Qué nivel elegir para cada hueco lo cubre nuestra guía de encuadres y resolución.
Cuando el resultado sigue sin asentarse
Si un sujeto sigue mutando pese a las referencias, quizá el modelo simplemente no sea el adecuado: los límites de referencias y el seguimiento de instrucciones varían mucho dentro del catálogo. Si el detalle se ve emborronado, lo más probable es que el problema sea la resolución y no el prompt. Si el texto dentro de la imagen sale ilegible, eso es cuestión de modelo: Ideogram es el hecho para tipografía, y ningún prompt lo arregla en otros.
Y si la imagen está bien salvo por un elemento, deja de generar. Quita el elemento con eliminar objeto o arregla el fondo con las herramientas de fondo. Cubrimos esa frontera en limpiar imágenes.
Un bucle que converge
Explora barato en un modelo de 2 créditos y sin semilla hasta que la composición esté bien. Anota la semilla si el modelo la ofrece. Pasa a texto a imagen o imagen a imagen en el modelo que convenga al destino, llevando la misma redacción. Añade referencias para todo lo que deba mantenerse exacto. Cambia una variable por ejecución, nunca tres.
Así, la mayoría de los encargos se cierran en tres o cuatro renders. El espacio de trabajo mantiene prompt, referencias y ajustes en un mismo sitio mientras cambias de motor, y los planes muestran lo que cada una de esas ejecuciones descuenta de tu saldo. Si aún dudas entre motores, esta comparación es el atajo.
Una plantilla de prompt que merece reutilizarse
Mantén el esqueleto fijo y cambia solo la cláusula variable. Algo así: sujeto y material, luego superficie o entorno, luego dirección y calidad de la luz, luego profundidad de campo, y al final las exclusiones.
Escrito entero: «una botella de cerámica mate sobre pizarra oscura, una única luz principal suave desde la izquierda, poca profundidad de campo, sin texto, sin reflejos duros». Para fotografiar un segundo producto del mismo conjunto, solo cambia la primera cláusula. Todo lo que el modelo usa para construir el aspecto sigue idéntico palabra por palabra, que es de lo que se trata.
Las exclusiones van al final y deben ser concretas. «Sin texto» funciona. «Nada feo» no describe nada sobre lo que el modelo pueda actuar.
Diagnóstico por síntoma
| Síntoma | Causa probable | Solución |
|---|---|---|
| El sujeto cambia entre ejecuciones | Sin referencia, o fuerza demasiado alta | Añadir referencias; bajar la fuerza |
| El resultado sale rígido o sobreiluminado | Guía subida en exceso | Volver a la mitad del rango |
| Detalle emborronado a tamaño completo | Resolución demasiado baja para el uso | Relanzar en 2K o 4K |
| El texto de la imagen sale ilegible | Modelo equivocado para tipografía | Usar Ideogram |
| El conjunto no encaja | El prompt o las referencias se desviaron | Fijar la redacción y el conjunto de referencias; relanzar juntas |
| Un elemento estropea una buena toma | Se intenta resolver regenerando | Eliminarlo en su lugar |
Cambia una cosa cada vez
La disciplina que hace funcionar todo lo anterior es aburrida: una variable por ejecución. Cambia la semilla, o la redacción, o el modelo, nunca dos a la vez, o no sabrás qué cambio produjo la mejora.
Se siente más lento y termina antes. Tres ejecuciones deliberadas suelen ganar a una docena esperanzadas, y en los motores baratos esas tres cuestan seis créditos.
