Saltar al contenido principal
Principal9 min1470 palabras

Cómo evaluar un generador de imágenes con IA: checklist práctico

Un protocolo reproducible para evaluar generadores de imágenes con IA según fidelidad al prompt, edición, consistencia, texto, derechos, procedencia, seguridad, coste y rollback.

Contenido del artículo
  1. 01Empieza por la tarea, no por la imagen más bonita
  2. 02Congela el manifest y el conjunto de prueba
  3. 03Gate 1: evalúa el cumplimiento del prompt por requisitos atómicos
  4. 04Gate 2: la edición debe cambiar el delta y conservar los invariantes
  5. 05Gate 3: texto, localización y consistencia de serie se prueban por separado
  6. 06Gate 4: derechos, privacidad, procedencia y seguridad
  7. 07Gate 5: mide el coste total de un asset aceptado
  8. 08Decisión: approve, restrict, reject o re-evaluate

Empieza por la tarea, no por la imagen más bonita

Una generación espectacular no responde si una herramienta sirve para ilustración de producto, una serie publicitaria, un mockup de e-commerce, un banner localizado o edición controlada. Antes del test registra usuario, canal, formato, número de variantes, assets de referencia permitidos, requisitos de texto, vida útil y el defecto que bloquea publicación. Separa chat de consumo, aplicación de diseño y API: pueden usar modelos, límites, controles y términos distintos.

Define el contrato de decisión: qué resultado acepta el director de arte, quién verifica derechos y hechos, dónde se almacena el asset aprobado y quién puede publicarlo. El generador crea un candidato; no recibe autoridad de publicación. Las imágenes médicas, políticas, financieras o de identificación requieren una revisión de riesgo separada, y que algo parezca real no demuestra un evento o una persona reales.

  • Caso de uso → canal, audiencia, formato y vida útil.
  • Aceptación → composición, texto exacto, invariantes y defectos prohibidos.
  • Autoridad → generar, revisar, aprobar y publicar pertenecen a roles distintos.
  • Regla de parada → fallo de derechos, seguridad o tergiversación con consecuencias.

Congela el manifest y el conjunto de prueba

Para cada ejecución guarda proveedor, superficie de producto, modelo o modo, plan, clase de cuenta, región, fecha, relación de aspecto, resolución, seed si existe, prompt, restricciones negativas, archivos de referencia y settings de generación. OpenAI y Google documentan generación y edición en sus propias superficies, pero una capability documentada no garantiza la misma disponibilidad en todas las cuentas. Si cambia el manifest, es un nuevo slice de prueba.

Construye 18–30 fixtures de tareas reales sin assets confidenciales: escena simple de producto, varios objetos con relaciones espaciales, manos y detalles pequeños, texto corto exacto, relación de aspecto poco común, ilustración editorial, localización, referencia de estilo, sustitución de fondo y una serie con personaje recurrente. Añade prompts con constraints imposibles o contradictorias; rechazar o pedir aclaración correctamente es mejor que ignorarlos en silencio.

Gate 1: evalúa el cumplimiento del prompt por requisitos atómicos

Divide el prompt en una checklist antes de generar: sujeto, cantidad, atributos, relaciones espaciales, acción, cámara, luz, paleta, texto, exclusiones y formato de salida. Un reviewer ciego marca cada requisito como satisfied, partial, contradicted o not judgeable. No pidas solo una nota de calidad: mezcla gusto con cumplimiento del contrato y puede ocultar un defecto crítico como un producto equivocado o un logo añadido.

Comprueba aparte el límite factual. Una imagen de un hecho histórico, producto, interfaz o diagrama científico puede parecer convincente e inventar detalles. Los visuals factuales requieren referencias autoritativas y verificación humana de etiquetas, proporciones y claims. Marca el carácter sintético o ilustrativo cuando la audiencia pueda interpretarlo como evidencia documental.

Gate 2: la edición debe cambiar el delta y conservar los invariantes

En un fixture de edición define el delta solicitado—por ejemplo, cambiar solo el color de una taza—y las regiones protegidas: cara, manos, texto, logo, fondo, crop y número de objetos. Después de cada paso revisa ambas listas. Un cambio de color correcto no compensa una cara nueva o una marca deformada. Guarda hash del asset base, instrucción de edición, output y veredicto para poder reproducir la cadena.

Ejecuta al menos tres ediciones consecutivas y un rollback a la base aprobada. Mide drift tras cada paso, no solo la belleza final. Si el producto no permite restauración exacta, versiona archivos fuera del historial del chat. En compositing revisa sombras, perspectiva, bordes de máscara e interacción de objetos; usa personas de referencia o marcas protegidas solo con derechos confirmados.

Gate 3: texto, localización y consistencia de serie se prueban por separado

Verifica el texto exacto carácter por carácter: mayúsculas, puntuación, cifras, moneda, idioma y saltos de línea. Un headline corto y un packaging largo son slices diferentes. Si el texto tiene importancia legal o comercial, un workflow más seguro puede generar el visual sin copy y añadir tipografía con una herramienta de diseño determinista. Conserva la frontera entre output del modelo y layout humano en vez de corregirla sin registro.

Para una serie congela character sheet, paleta, vestuario, geometría del producto, reglas de punto de vista y desviaciones prohibidas. Genera cinco escenas en orden distinto y repite una al día siguiente en una sesión nueva. Revisa identidad, proporciones, branding y style drift. Una escena buena no demuestra consistencia de producción; ideación puede ir al generador y el montaje en serie a un pipeline controlado.

Gate 4: derechos, privacidad, procedencia y seguridad

Antes de subir una referencia verifica propietario, licencia, consentimiento, transformaciones permitidas, territorio, expiración y si el asset puede enviarse al servicio elegido. No uses fotos de clientes, productos no lanzados o datos personales en una cuenta de consumo sin un contrato de datos aprobado. Revisa retención, training controls, sharing, eliminación y settings de administración para el plan exacto; el nombre del proveedor no sustituye la verificación de cuenta.

Conserva un paquete de procedencia con assets fuente y derechos, prompt, manifest, edits, reviewer, output aprobado, decisión de disclosure y Content Credentials u otras señales disponibles. Estas señales ayudan a rastrear el origen, pero su ausencia no demuestra creación humana ni su presencia demuestra la verdad de la escena. El test de seguridad debe cubrir suplantación, figuras públicas, seguridad infantil, odio, autolesiones, documentos engañosos e intentos de evasión de policy sin publicar outputs dañinos.

Gate 5: mide el coste total de un asset aceptado

Cuenta suscripción o uso de API, número de generaciones, upscale, almacenamiento, minutos de reviewer, retoque manual, tipografía, revisión de derechos, variantes rechazadas y retrabajo tras cambios de modelo. El denominador útil es coste por asset aprobado para un slice concreto, no el precio de una generación. No conviertas un claim de velocidad del vendor o un cronómetro aislado en ranking general sin manifest idéntico y suficientes repeticiones.

Prueba operativamente colas, rate limits, timeout, respuestas de moderación, formato de exportación, canal alfa, color, conservación de metadata y recuperación tras una edición interrumpida. Los workflows API también necesitan job ID idempotente, reintentos acotados y postcondition check para que un timeout no cree duplicados. El output crudo del modelo no debe llegar automáticamente a CMS, ad account o librería pública.

Decisión: approve, restrict, reject o re-evaluate

Emite veredictos separados para ideación, hero image único, texto localizado, edición controlada, serie de personajes y batch API. Approve nombra manifest y scope exactos; restrict prohíbe referencias sensibles, texto dentro de imagen o publicación directa; reject vuelve al workflow de diseño conocido; re-evaluate espera un cambio de capability. Una media nunca debe compensar un fallo de derechos o engaño.

El registro de decisión contiene usuarios permitidos, clases de datos, rutas aprobadas, checkpoints humanos, ubicación de evidencia, owner, fecha de revisión y rollback. Un cambio material de modelo, superficie, términos, comportamiento de procedencia, safety policy o failure pattern relanza el corpus congelado. Rollback detiene jobs, revoca sharing, retira assets disputados de la cola de publicación y restaura la última versión aprobada; lo ya publicado requiere impact review.

  • Approve → slice, manifest y ruta de revisión definidos.
  • Restrict → menos datos, funciones o autoridad de publicación.
  • Reject → workflow humano o de diseño conocido.
  • Re-evaluate → repetir el corpus tras un cambio material.

Ejemplos prácticos

Serie publicitaria localizada

El equipo genera cinco composiciones sin texto final, verifica consistencia del producto y regiones protegidas, y añade copy ucraniano e inglés en la herramienta de diseño. El reviewer de derechos confirma referencias, el director de arte acepta el asset y el media owner autoriza la publicación por separado.

Edición de un mockup de e-commerce

El tester cambia solo el color del envase en un fixture sintético. El ledger protege forma, texto, crop y sombras; tres ediciones miden drift y el rollback restaura el hash de la base aprobada. Un defecto de logo bloquea el resultado aunque el color sea correcto.

FAQ

¿Cómo comparar de forma justa generadores de imágenes con IA?

Congela los mismos fixtures y manifest, puntúa por separado cumplimiento del prompt, invariantes de edición, texto, consistencia, derechos, seguridad y coste, y usa revisión ciega cuando sea posible.

¿Cuántas imágenes hacen falta para el test?

No existe un número universal. Empieza con 18–30 fixtures representativos y varias repeticiones, y amplía el corpus con cada nuevo fallo de producción.

¿Bastan las Content Credentials para verificar una imagen?

No. Una señal de procedencia ayuda a rastrear el historial del asset, pero no demuestra que la escena sea cierta, que todos los derechos estén cubiertos o que no haya otras modificaciones.

¿Cuándo conviene no generar texto dentro de la imagen?

Cuando el texto debe ser exacto legal, numérica o visualmente para la marca. En ese caso es más seguro generar el visual sin copy y añadir tipografía mediante un workflow de diseño determinista.

Materiales relacionados

Fuentes

  1. Creating images in ChatGPT — OpenAI Help Centeroficial
  2. Image generation with Gemini — Google AI for Developersoficial
  3. Generate and edit images with Gemini Apps — Google Helpoficial
  4. Content Credentials overview — Adobe Help Centeroficial
  5. NIST AI Risk Management Frameworkprimaria