Respuesta corta

Para editar la foto principal de un plato sin tocar la comida, Seedream 5 Pro en modo fast fue la configuración más fiable de esta prueba: 5 de 5 salidas aptas, unos 33 segundos y 0,045 USD por imagen. Para previsualizaciones pequeñas ganó otro modelo, GPT Image 2.5 en calidad low, con 26 de 30 aptas. Nano Banana Pro, FLUX.2 Pro, Qwen Image 3 y FLUX.2 Klein quedaron por detrás en esta muestra.

Dos preguntas distintas

Un editor de fotos de comida necesita dos cosas que parecen la misma y no lo son. La foto principal combina varios ajustes a la vez (luz, superficie, paleta, atrezo) y debe dejar intactos la comida, la vajilla y los cubiertos. La miniatura muestra una sola opción para que alguien elija: tiene que verse el cambio, cargar rápido y costar poco.

Probamos siete modelos sobre cinco fotografías profesionales de platos (maíz, dumplings, pimientos, carne y pollo): cinco principales con tres o cuatro ajustes combinados y treinta miniaturas de un solo ajuste. Las fotos son de terceros y no tenemos permiso para reproducirlas; por eso esta página muestra cifras y no imágenes.

Cada salida recibió uno de tres veredictos:

  • Apta: fiel al plato y con el ajuste reconocible.
  • Dudosa: escala o posición algo cambiadas, cumplimiento parcial, o un fallo provocado por un prompt contradictorio.
  • No apta: cambia la comida o la vajilla, añade o borra objetos contra una regla explícita, o no aplica el ajuste.

La foto principal: conservar todo y cambiar varias cosas

Todas las ejecuciones de la foto principal, ordenadas por proporción de aptas
ConfiguraciónImágenesAptasDudosasNo aptasUSD por imagenEspera mediana
Seedream 5 Pro · fast55000,04533 s
Seedream 5 Pro · standard1311110,045~101 s
Nano Banana 2 · con instrucciones de sistema54010,08219 s
GPT Image 2.5 · max54100,244201 s
GPT Image 2.5 · high53200,072109 s
GPT Image 2.5 · medium148600,03026 s
Nano Banana Pro157440,16728–34 s
Nano Banana 2 · sin instrucciones de sistema52210,08220 s
FLUX.2 Pro50230,05423 s

Tres lecturas útiles de esta tabla:

  • Seedream es conservador, y aquí eso es una virtud. No tocó comida, vajilla ni cubiertos en el modo fast. Repetido con otras semillas en modo standard, mantuvo 11 de 13: no ganó por azar. El modo fast dio el mismo resultado con un tercio de la espera y al mismo precio.
  • GPT Image 2.5 no falla de forma grave, pero duda. Ninguna salida suya fue «no apta», aunque muchas quedaron como dudosas. Subir de medium a high no mejoró: repitió los mismos fallos. Solo max conservó los dumplings, a un coste unas cinco veces mayor que Seedream y con una espera seis veces más larga.
  • Las instrucciones de sistema importan en Nano Banana 2. Con las instrucciones de sistema que usamos en producción pasó de 2 a 4 aptas sobre 5. Aun así, al añadir una copa borró cubiertos que estaban en la foto.

Las miniaturas: que el cambio se vea

En una miniatura el modelo conservador se queda corto: si el ajuste no se nota, la opción no sirve para elegir. Seedream fast aprobó 5 de 10 y solo 2 de 5 en luz, porque desaturaba la comida o dejaba la mesa visible bajo un foco sobre negro.

Miniaturas aptas por tipo de ajuste (aptas / imágenes)
AjusteGPT Image 2.5 · lowFLUX.2 Klein 4BKlein · frase neutraSeedream 5 · fast
Luz4/53/54/52/5
Dramatismo5/50/53/51/1
Superficie5/52/53/51/1
Paleta4/50/50/51/1
Composición3/51/50/50/1
Atrezo5/53/5—0/1
Total26/309/3010/255/10

GPT Image 2.5 en calidad low hizo visible el ajuste sin estropear el plato en 26 de 30 casos, con unos 22 segundos y 0,022 USD por imagen. Nano Banana 2 y Nano Banana Pro solo se probaron en seis miniaturas compartidas (4 de 6 cada uno). Qwen Image 3 no aprobó ninguna de las cinco que devolvió y rechazó una petición.

Los fallos que más se repitieron

Cubiertos que aparecen y desaparecen

La mitad de los fallos de FLUX.2 Klein eran cubiertos inventados. La causa estaba en el prompt: una frase que pedía conservar todos los cubiertos y no inventar ninguno. Al sustituirla por una frase neutra con la misma semilla, los cubiertos inventados pasaron de 10 de 20 a 0 de 20. Nombrar un objeto, aunque sea para prohibirlo, puede hacer que un modelo pequeño lo dibuje. En el otro sentido, Nano Banana borró cubiertos reales al añadir una copa.

El acento de color acaba en la comida

Al pedir «un acento rojo», Klein y GPT pintaron de rojo parte de la comida, por ejemplo una guindilla. Si el acento debe ir en la vajilla, el textil o el fondo, el prompt tiene que decir que va fuera del plato.

Prompts imposibles

Uno de los cinco casos pedía márgenes iguales y una mesa mayor que el plato cuando el plato ya llenaba el encuadre. Ningún modelo puede cumplir las dos órdenes a la vez sin mover la cámara. Antes de culpar al modelo, comprueba que tu petición es posible.

Qué puedes aplicar en tu propio flujo

  1. Separa la foto final de la previsualización. No hace falta usar el mismo modelo para las dos.
  2. Mide «aptas por euro», no precio por imagen. Una imagen barata que hay que repetir sale cara: en esta prueba, una apta de Nano Banana Pro costó unos 0,36 USD frente a 0,045 USD con Seedream fast.
  3. Revisa el prompt antes de cambiar de modelo. Una frase sobre cubiertos explicaba la mitad de los fallos de un modelo pequeño.
  4. Repite antes de decidir. Nano Banana Pro pasó de 4 de 5 en la primera ronda a 2 y 1 de 5 al repetir con otras semillas.

Para practicar la revisión con imágenes propias, empieza por las cinco cosas que mirar y compara tres modelos sobre el mismo salmón. Si quieres automatizar la revisión, lee qué detectan cinco modelos de visión. Si lo que necesitas es otro ángulo y no otra mesa, lee qué se inventa Qwen al cambiar la perspectiva, y si varios modelos fallan igual, revisa antes la entrada con el caso de la máscara compartida.

Método y límites del estudio

Tres rondas. La primera generó 84 imágenes de 85 parejas caso/modelo. La segunda (93 peticiones, 90 imágenes) repitió con otras semillas, probó el modo fast de Seedream, las instrucciones de sistema de Nano Banana 2, GPT low en todas las miniaturas y la frase neutra en Klein. La tercera probó GPT Image 2.5 en high y max. En total se evaluaron 184 imágenes; tres peticiones quedaron atascadas en el servicio y no se cobraron.

Evaluación a ciegas. El orden de las salidas se barajó en cada caso, el mapa entre letra y modelo se guardó sin leer, y cada veredicto se selló con huella SHA-256 y hora antes de desvelar el modelo. Se revisaron tamaño completo, recorte ampliado de la comida, versión a 240 px y superposición de contornos; además se midieron escala, desplazamiento, diferencia de color y similitud estructural de la zona de comida. Los contornos corrigieron dos veces una impresión visual equivocada.

Límites. Un único evaluador, que es un modelo de visión, sin revisión humana cruzada. Cinco fotos profesionales de terceros, no fotos de móvil ni de clientes. Todo a unos 1K de resolución. Varias configuraciones con una sola ejecución por caso. Tiempos medidos por petición con cinco simultáneas a través de Comfy, no latencias de una aplicación. Precios por imagen observados en la ejecución a través de Comfy Router: pueden haber cambiado y no son tarifas oficiales de cada proveedor. Los porcentajes describen esta muestra, no una tasa general de cada modelo. Para ver dónde quedan estos modelos en las clasificaciones generales, consulta el panorama de modelos de imagen de 2026.