Respuesta corta

Sí, con matices. Cinco modelos de visión revisaron las mismas parejas de original y edición. Ninguno marcó como alterada una foto intacta, y casi todos encontraron las alteraciones claras. Pero un «alterada» acertado puede llegar por la razón equivocada, y una respuesta mal formada o cortada no es un veredicto. Úsalos como primer filtro con reglas claras, no como juez final.

Qué le pedimos a cada modelo

Cuando editas muchas fotos con IA, mirar cada pareja a mano deja de ser viable. La tentación es pedir a otro modelo que lo haga: «¿se ha mantenido la comida?». Para comprobar hasta dónde llega esa idea, cinco modelos con visión recibieron las mismas parejas, el mismo contrato de respuesta y la misma lista de lo que podía cambiar y lo que no.

  • Podían cambiar: iluminación, gradación de color general, fondo y la cámara si se había pedido.
  • No podían cambiar: ingredientes añadidos o eliminados, cantidad, color propio de la comida, recipiente y utensilios en contacto con el plato.

El banco tenía 18 parejas elegidas entre 32 candidatas: 13 fotografías de origen, 13 preparaciones distintas (carne, pescado, sushi, pizza, croquetas, lentejas, pimientos, pollo, tarta, kebab, dumplings…) y salidas de siete modelos generadores. Antes de enviar nada se fijó una referencia: diez parejas intactas, cinco alteradas y tres ambiguas. Una pareja sirvió para diagnóstico técnico y se excluyó para todos, de modo que la comparación principal usa 17 parejas, 14 de ellas con referencia clara.

Resultados

Catorce referencias claras: nueve intactas y cinco alteradas
ModeloAciertos / 14Dio «intacta» a una alteradaDudasUSD por parejaEspera mediana
Gemini 3.8 Flash13100,00396,9 s
Opus 5.512110,01817,0 s
Sonnet 5.512110,007621,9 s
GLM 5.3 Flash12020,000616,9 s
DeepSeek V4.1 Flash11030,003412,4 s

Ninguno de los cinco marcó como «alterada» una de las nueve parejas intactas. El único «intacta» equivocado de Gemini, Opus y Sonnet fue el mismo caso, y al revisarlo a mayor tamaño la propia referencia resultó discutible: los dos platos tenían un contorno asimétrico y el cambio de cámara podía explicar parte de la diferencia. Lo contamos como fallo, tal como estaba la referencia antes de ver las respuestas; sin ese caso, Gemini acierta las 13 restantes.

Gemini 3.8 Flash devolvió una respuesta válida en las 17 parejas, identificó las cuatro alteraciones no discutidas (hierbas desaparecidas, fruta y salsa cambiadas en una tarta, dos recipientes distintos) y mantuvo intactas las nueve fotos intactas, con un coste unas cuatro o cinco veces menor que Opus. GLM 5.3 Flash fue siete veces más barato que Gemini, pero dos respuestas se quedaron vacías al agotar el presupuesto de razonamiento.

Tres trampas de la revisión automática

1. Acertar por la razón equivocada

En la pareja de las hierbas retiradas, DeepSeek respondió «alterada»… por los cubiertos, y afirmó que la comida era equivalente. El veredicto binario cuenta como acierto, pero el modelo no vio el cambio que importaba. Si solo guardas el sí o el no, nunca lo sabrás: pide siempre que el modelo diga qué cambió.

2. Respuestas cortadas o mal formadas

Sonnet describió bien una alteración, pero escribió un carácter de más y su JSON no era válido. GLM y DeepSeek agotaron su presupuesto de tokens razonando y dejaron respuestas vacías en varios casos. Ninguna de esas respuestas se reparó a mano para sumar un acierto: se trataron como duda. Tu sistema debe hacer lo mismo y nunca convertir un error en un «intacta» por defecto.

3. La referencia también se equivoca

El caso discutible muestra que la «respuesta correcta» de un banco de pruebas es otra opinión. Congélala antes de ver las respuestas, conserva la etiqueta original y, si la revisas, publica el análisis con y sin ese caso.

Cómo montar tu propio filtro

  1. Escribe la lista de lo que puede y no puede cambiar antes de elegir modelo. Separa el color de la luz del color propio del ingrediente.
  2. Exige una respuesta estructurada con el motivo. Un campo para el veredicto y otro para describir qué cambió.
  3. Trata las respuestas inválidas o vacías como duda y envíalas a revisión humana.
  4. Haz que «intacta» no apruebe sola. El riesgo caro es aceptar una foto con la comida cambiada; un filtro debe servir para descartar, no para dar el visto bueno final.
  5. Compara candidatos sobre las mismas parejas y vuelve a medir cuando cambies de modelo o de presupuesto de tokens.

Las parejas que revisan estos modelos salen del mismo tipo de ediciones que puedes ver en diez platos editados y en el estudio de siete modelos. Antes de culpar al modelo de un cambio, descarta el montaje: el error de máscara que compartieron cinco motores y el cambio de ángulo con Qwen muestran fallos que vienen de la entrada.

Método y límites

Mismo contrato, imágenes y criterios para los cinco modelos, enviados a través de OpenRouter con presupuestos de salida distintos para poder obtener JSON (entre 1000 y 4096 tokens). Copias JPEG a 1024 px de lado máximo. Se registraron 90 intentos y 89 respuestas correctas a nivel HTTP; ninguna pareja ya intentada se reenvió. Coste total comunicado por las API: 0,60 USD, incluidos diagnósticos y salidas vacías.

Los costes medios incluyen las 17 parejas comparables, también las ambiguas y las respuestas truncadas. La espera incluye transporte y el proveedor al que se enrutó cada petición, que no fue el mismo para todos los modelos: no es una medida pura del modelo.

Siete parejas tienen origen sintético conocido y once no tienen un origen sintético determinado; no son fotos de clientes. Once salidas proceden del mismo generador. No hubo conjunto reservado, repeticiones estadísticas ni calibración humana, y no había un fallo aislado de cantidad ni de color propio inequívoco. Las referencias las fijó un agente, no un panel humano. No se midieron textura detallada, fidelidad de ángulo ni calidad estética. Los porcentajes no se pueden extrapolar a otras fotos. Las imágenes del banco no se muestran porque los derechos de varias están por comprobar.