Investigación de Repeato · Benchmark de visión de LLM

¿Se puede confiar en los LLM multimodales para las pruebas de interfaz de usuario?

Benchmark basado únicamente en capturas de pantalla para la automatización de pruebas de interfaz: localizar elementos accionables, reconocer cuándo falta un elemento, detectar defectos visibles de diseño y registrar el coste operativo de obtener una respuesta.

Edición piloto2026-08-13

Seis pantallas deterministas. Veinticuatro objetivos de comprensión. 9 modelos de API. Un piloto centrado, no una clasificación.

Pantallas6
Objetivos de comprensión24
Categorías de defectos6
Modelos9

Resultados del piloto

Qué muestra esta edición

Estos resultados describen una respuesta conservada por caso en un corpus sintético pequeño. Son señales útiles para la próxima edición, no clasificaciones generales de modelos ni afirmaciones sobre estabilidad.

02

La presencia de elementos estuvo casi saturada

8 de 9 modelos alcanzaron una exactitud equilibrada del 100 %. Esta prueba funciona como comprobación de cordura para elementos ausentes, pero esta versión piloto apenas diferencia a la mayoría de los modelos.

03

Grok 4.5 lideró la detección de defectos

Fue el único modelo con una exactitud equilibrada del 100 % en diseños limpios y defectuosos. Su exactitud por categoría de defecto fue del 67 %, lo que demuestra que detectar un problema y nombrarlo con precisión son tareas distintas.

Qué significa esto para la automatización de pruebas

Usa el tipo de visión adecuado para cada paso de la prueba

La interacción exacta, la observación continua y la interpretación semántica tienen requisitos de rendimiento diferentes. No se debe esperar que una sola técnica de visión optimice las tres.

Observación localHasta 20 veces por segundoSolicitud al LLMA menudo, entre 2 y 10 segundosCómo combinamos la visión local y los LLMContraer análisis

El bucle local de visión por computador de Repeato puede inspeccionar la pantalla a 20 Hz, una vez cada 50 ms. Una solicitud a un modelo de visión y lenguaje suele necesitar entre 2 y 10 segundos para transferir la imagen, realizar la inferencia y completar el recorrido de ida y vuelta por la red. Esta diferencia importa cuando una prueba debe detectar la aparición de un elemento, esperar a que termine un movimiento o reaccionar antes de que desaparezca un estado transitorio.

01

Feedback rápido para interacciones repetidas

Las huellas visuales locales pueden buscar continuamente los objetivos grabados y actuar en cuanto la pantalla esté lista. Repetir llamadas a modelos remotos con la misma frecuencia no sería práctico.

02

Predecible, privado y económico

La coincidencia local no requiere un recorrido de ida y vuelta por la red, disponibilidad del proveedor ni cargos de API por solicitud. Las pantallas permanecen en la estación de trabajo y el mismo algoritmo puede ejecutarse sin conexión.

03

IA para las preguntas que la coincidencia no puede responder

La visión basada en LLM justifica su latencia cuando una prueba necesita criterio semántico: interpretar texto o números, comprender contenido dinámico o comprobar conceptos como una gráfica con tendencia ascendente.

División práctica

Usa la visión por computador local para el bucle de control de alta frecuencia: encontrar objetivos, esperar, interactuar y comparar visualmente. Recurre selectivamente a la visión mediante IA cuando la aserción requiera realmente comprensión lingüística o semántica.

Piloto de comprensión

¿Puede un modelo localizar el elemento de interfaz solicitado?

Cada modelo recibió 24 objetivos accionables en seis pantallas limpias del piloto. Un punto válido según el esquema dentro del objetivo cuenta como acierto; IoU de la caja mide la precisión de localización. Expande una fila para ver los resultados por escenario.

IoU de las cajasMás alto es mejor · escala de 0 a 1
  1. Holo3 122B A10B0.478
  2. Grok 4.50.445
  3. GPT-5.40.528
  4. Gemini 3.6 Flash0.645
  5. GPT-5.6 Sol0.677
  6. GPT-5.6 Luna0.771
  7. Claude Sonnet 50.043
  8. Claude Opus 50.314
  9. Gemini 3.1 Pro Preview0.632
Coste totalMás bajo es mejor · 24 solicitudes
  1. Holo3 122B A10B$0.0126
  2. Grok 4.5$0.0669
  3. GPT-5.4$0.1196
  4. Gemini 3.6 Flash$0.0637
  5. GPT-5.6 Sol$0.2453
  6. GPT-5.6 Luna$0.0057
  7. Claude Sonnet 5$0.0990
  8. Claude Opus 5$0.2474
  9. Gemini 3.1 Pro Preview$0.0726
Latencia mediaMás bajo es mejor · por solicitud
  1. Holo3 122B A10B1.68 s
  2. Grok 4.51.67 s
  3. GPT-5.42.99 s
  4. Gemini 3.6 Flash1.83 s
  5. GPT-5.6 Sol3.23 s
  6. GPT-5.6 Luna3.55 s
  7. Claude Sonnet 53.91 s
  8. Claude Opus 54.24 s
  9. Gemini 3.1 Pro Preview11.89 s
Equilibrio entre precisión, coste y latenciaMás arriba y más a la izquierda es mejor. El color muestra la latencia media de respuesta.
1,67 s rápido11,89 s lento
Better value0.000.250.500.751.00$0.00$0.05$0.10$0.15$0.20$0.25Total cost for 24 requests (USD) →Box IoU →Holo3 122B A10BGrok 4.5GPT-5.4Gemini 3.6 FlashGPT-5.6 SolGPT-5.6 LunaClaude Sonnet 5Claude Opus 5Gemini 3.1 Pro Preview
Respuesta no válida1 reintento de transporte92 % de aciertos0.4781.68 s$0.0126
Aprobadas1 reintento de transporte83 % de aciertos0.4451.67 s$0.0669
Aprobadas1 reintento de transporte75 % de aciertos0.5282.99 s$0.1196
Respuesta no válida1 reintento de transporte79 % de aciertos0.6451.83 s$0.0637
Aprobadas1 reintento de transporte96 % de aciertos0.6773.23 s$0.2453
Aprobadas1 reintento de transporte100 % de aciertos0.7713.55 s$0.0057
Respuesta no válida1 reintento de transporte21 % de aciertos0.0433.91 s$0.0990
Respuesta no válida1 reintento de transporte46 % de aciertos0.3144.24 s$0.2474
Respuesta no válida1 reintento de transporte88 % de aciertos0.63211.89 s$0.0726

Pilotos de detección

Presencia y defectos visibles

Dos tareas equilibradas evalúan si los modelos pueden rechazar elementos de UI ausentes y distinguir controles limpios de defectos de diseño introducidos. Los resultados se mantienen separados de la localización.

¿Puede el modelo detectar cuándo un elemento no está presente?

Seis consultas objetivo presentes y seis ausentes por modelo. Esta prueba mide únicamente la clasificación.

100 % válidos12/12 casos · 0 intentos fallidos100%100%100%0%1.29 s$0.3636por cada 1.000 casos conservados
100 % válidos12/12 casos · 0 intentos fallidos100%100%100%0%7.45 s$0.1414por cada 1.000 casos conservados
100 % válidos12/12 casos · 0 intentos fallidos100%100%100%0%7.55 s$3.2402por cada 1.000 casos conservados
100 % válidos12/12 casos · 0 intentos fallidos100%100%100%0%7.82 s$2.3426por cada 1.000 casos conservados
100 % válidos12/12 casos · 0 intentos fallidos100%100%100%0%9.85 s$7.4788por cada 1.000 casos conservados
100 % válidos12/12 casos · 0 intentos fallidos100%100%100%0%7.50 s$2.2346por cada 1.000 casos conservados
100 % válidos12/12 casos · 0 intentos fallidos100%100%100%0%9.27 s$2.9915por cada 1.000 casos conservados
100 % válidos12/12 casos · 0 intentos fallidos100%100%100%0%7.79 s$7.0680por cada 1.000 casos conservados
100 % válidos12/12 casos · 0 intentos fallidos92%100%83%17%15.01 s$2.3602por cada 1.000 casos conservados

¿Puede el modelo distinguir entre diseños limpios y defectuosos?

Seis controles limpios y seis capturas de pantalla con un defecto introducido por modelo. Los fallos de transporte siguen siendo fallos operativos, no respuestas de precisión.

Equilibrio entre precisión, coste y latencia de los defectosMás arriba y más a la izquierda es mejor. El color muestra la latencia media de respuesta.
2,44 s rápido21,75 s lento
Better value0.000.250.500.751.00$0.00$2.40$4.80$7.20$9.60$12.00Cost per 1,000 retained defect cases (USD) →Balanced accuracy →Holo3 122B A10BGPT-5.6 LunaGPT-5.4Gemini 3.6 FlashClaude Opus 5Grok 4.5Claude Sonnet 5GPT-5.6 SolGemini 3.1 Pro Preview
67 % válidos12/12 casos · 0 intentos fallidos58%17%100%0%2.44 s$0.8251por cada 1.000 casos conservados
92 % válidos12/12 casos · 0 intentos fallidos83%67%100%50%8.36 s$0.2389por cada 1.000 casos conservados
100 % válidos12/12 casos · 0 intentos fallidos92%83%100%67%9.02 s$5.2075por cada 1.000 casos conservados
75 % válidos12/12 casos · 0 intentos fallidos75%83%67%67%8.43 s$3.8341por cada 1.000 casos conservados
83 % válidos12/12 casos · 0 intentos fallidos83%67%100%67%10.15 s$11.5029por cada 1.000 casos conservados
100 % válidos12/12 casos · 0 intentos fallidos100%100%100%67%7.40 s$2.7465por cada 1.000 casos conservados
92 % válidos12/12 casos · 0 intentos fallidos83%83%83%67%10.52 s$4.7403por cada 1.000 casos conservados
92 % válidos12/12 casos · 0 intentos fallidos92%83%100%67%11.91 s$11.6632por cada 1.000 casos conservados
100 % válidos12/12 casos · 0 intentos fallidos92%100%83%67%21.75 s$3.0450por cada 1.000 casos conservados

Una ejecución por caso; sin intervalos de confianza ni afirmaciones de estabilidad. El coste agregado se extrapola a 1.000 casos conservados para que las ejecuciones incompletas no parezcan artificialmente baratas. Las filas con menos de 12 respuestas aún tienen una combinación de casos menor y no son directamente comparables con las filas completas.

Corpus congelado

Tres pantallas de escritorio y tres móviles

Cada fixture tiene un control limpio y una variante deliberadamente defectuosa. Las capturas usan ventanas gráficas fijas, recursos locales, geometría estable de objetivos y límites exactos de diferencia de píxeles.

Control limpio del catálogo comercial
Catálogo comercial con recorte del contenedor
Catálogo de comercioWeb de escritorio · Recorte del contenedor
Control limpio del panel de analítica
Panel de analítica con desbordamiento de texto
Panel de analíticaWeb de escritorio · Desbordamiento de texto
Control limpio del centro de control de IoT
Centro de control de IoT con superposición de elementos
Centro de control de IoTWeb de escritorio · Superposición de elementos
Banca móvil con control limpio
Banca móvil con recorte de la ventana gráfica
Banca móvilSimilar a iOS · Recorte de la ventana gráfica
Pase de vuelo con control limpio
Pase de vuelo con acción oculta
Pase de vueloSimilar a iOS · Acción oculta
Casa inteligente con control limpio
Casa inteligente con reflujo adaptable defectuoso
Casa inteligenteSimilar a Android · Reflujo adaptable defectuoso

Expedientes de modelos

Una página de evidencias por modelo

Abre la página de un modelo para consultar sus resultados de fundamentación, presencia de elementos, defectos de diseño, latencia, fiabilidad y costes. Las rutas permanecen fijadas al proveedor ascendente indicado, con las alternativas desactivadas.

Metodología

Mide lo que el modelo realmente ve

El piloto separa la fundamentación de UI, la presencia de elementos, la detección de defectos de diseño visibles y el rendimiento operativo. No los combina en una puntuación general.

EntradaSolo capturas de pantalla
Geometría0–1000
EjecucionesUna por caso
PuntuaciónMétricas independientes

Contrato de entrada

Solo capturas de pantalla

Texto del prompt más un PNG en base64: sin DOM, árbol de accesibilidad, código fuente, OCR, herramientas, plugins ni búsqueda web.

01

Renderizado fijo

Chromium a 1440 × 900 o 390 × 844; factor de escala del dispositivo: 1.

02

Geometría normalizada

Verdad de referencia derivada del navegador en un espacio de coordenadas de 0–1000.

03

Pares estables

Las variantes limpias y defectuosas conservan la geometría objetivo y los hashes de captura.

Pista A

Fundamentación de elementos de UI

Cuatro objetivos por captura de pantalla, correspondientes a tipos comunes de elementos de UI accionables.

Precisión de puntos

El punto de clic predicho queda dentro del cuadro objetivo.

Precisión de cajas

IoU medio y proporción de predicciones con IoU ≥ 0.5.

Validez

Tasa de respuestas válidas según el esquema; una ejecución no permite calcular una puntuación de estabilidad.

Pista B

Presencia de elementos

Una consulta cuya presencia se conoce y otra plausible pero ausente por cada pantalla limpia.

Detección

La exactitud equilibrada asigna el mismo peso a los casos presentes y ausentes.

Comportamiento de la clase

La recuperación, la especificidad y la tasa de falsos positivos revelan la dirección del error.

Solo booleano

found=true o found=false; sin puntuación de localización.

Pista C

Defectos visibles del diseño

Las escenas limpias y defectuosas emparejadas cubren seis tipos objetivos de fallos de diseño.

Detección

Exactitud equilibrada, recuperación, especificidad y tasa de falsos positivos.

Clasificación

Exactitud por categoría de defecto tras una detección correcta.

Localización

IoU del cuadro predicho frente a las regiones de defectos derivadas del navegador.

Enrutamiento y operaciones

Mantén visible el comportamiento del proveedor

IDs de modelo fijados, rutas propias, alternativas desactivadas y un único contrato de respuesta.

Política de reintentos

Un reintento para errores 429, 5xx o de red; no para respuestas incorrectas.

Métricas operativas

La latencia, los fallos, los reintentos y el coste se mantienen separados de la exactitud.

Privacidad

Los registros publicados omiten las claves y los identificadores de solicitud del proveedor.

Limitaciones

Un piloto, no una tabla de clasificación

Seis pantallas sintéticas, una ejecución por caso y 24 objetivos no pueden demostrar una superioridad o estabilidad generalizadas.

Cada edición registra los IDs exactos de los modelos, la fecha, los hashes del prompt y del esquema, los controles del endpoint y los intentos saneados, porque los proveedores cambian.

Reprodúcelo

Inspecciona las evidencias

Los registros sin procesar de los modelos se han saneado. No se publican claves de API, identificadores de solicitudes ni identificadores de generación.

Las capturas de pantalla, anotaciones, manifiestos y resultados agregados creados por Repeato están disponibles bajo CC BY 4.0. Consulta la el aviso de licencia del benchmark. Los resultados sin procesar de los modelos siguen sujetos a los términos de sus proveedores.

ES