La mayoría de briefs de imagen con IA fallan antes de generar la primera imagen. No fallan en la herramienta, fallan en la instrucción. Un brief escrito con el vocabulario de e-commerce genérico («foto de producto, fondo blanco, buena iluminación») le da a la IA información de estilo, no información de prenda. Y sin información de prenda, la IA rellena los huecos a su manera.
Así se ve un brief típico, el que cualquiera escribiría sin pensarlo dos veces:

Es una instrucción razonable si hablas con un fotógrafo que ya conoce la prenda física, porque él la tiene delante y resuelve solo el resto. Pero una IA de imagen no tiene la prenda delante. No sabe si «rojo» es un rojo burdeos mate o un rojo carmín brillante, no sabe si el vestido cae fluido o si tiene estructura, no sabe qué fornituras lleva ni dónde van. Rellena esos huecos con la opción más probable estadísticamente, que casi nunca es la tuya.
El criterio profesional no es escribir un brief más largo. Es, escribir uno con las variables que de verdad cambian el resultado: tejido, caída, fornituras, color con referencia y encuadre con referencia visual.
Tejido: No basta con nombrar la prenda, hay que nombrar cómo se comporta el material. Un crepé no se mueve igual que un punto, un denim no se mueve igual que una seda. Si la IA no sabe qué tejido es, elige uno por defecto, y ese default rara vez coincide con el tuyo.
Caída: fluida, estructurada, acampanada, ajustada al cuerpo. Es la diferencia entre una prenda que cuelga con peso propio y una que mantiene forma por construcción. Sin esta variable, la IA tiende a suavizar cualquier prenda hacia el mismo pliegue genérico.
Fornituras: botones, cremalleras, hebillas, cierres vistos u ocultos. Son pequeñas, pero es donde primero se nota una imagen genérica: fornituras inventadas, mal colocadas o directamente ausentes.
Color con referencia: «rojo» no es una instrucción, es un rango. Una referencia Pantone, una muestra de tejido fotografiada, o al menos una descripción comparativa («rojo burdeos, no carmín») reduce ese rango a algo que la IA puede acertar.
Referencia visual de encuadre: Un ejemplo de la composición que buscas (ángulo, distancia, tipo de plano) hace más por el resultado que dos párrafos describiéndolo con palabras.
Con esas cinco variables, el mismo brief se reescribe así:

La diferencia entre los dos briefs no es de extensión, es de qué tipo de información contienen. El primero describe una foto. El segundo describe una prenda. Y a una IA de imagen hay que darle la prenda, no la foto, porque la foto la construye ella a partir de lo que le digas sobre la prenda.
Esto no elimina la necesidad de iterar. Incluso con un brief con criterio, la primera generación puede fallar en algún detalle y hará falta ajustar. Pero la diferencia entre iterar dos veces e iterar diez es, casi siempre, la calidad del brief de partida.

Imagen correcta de producto con modelo.

Imagen correcta de producto, mantiene color, diseño y caída de la prenda.

Imagen incorrecta de producto, no corresponde a la prenda.