GPT-5.6 Luna lideró la localización de interfaces
Acertó los 24 objetivos y obtuvo el IoU medio de recuadro más alto, con 0.771. También registró el menor coste de localización indicado en esta ejecución: $0.0057.
Investigación de Repeato · Benchmark de visión de LLM
Benchmark basado únicamente en capturas de pantalla para la automatización de pruebas de interfaz: localizar elementos accionables, reconocer cuándo falta un elemento, detectar defectos visibles de diseño y registrar el coste operativo de obtener una respuesta.
Seis pantallas deterministas. Veinticuatro objetivos de comprensión. 9 modelos de API. Un piloto centrado, no una clasificación.
Resultados del piloto
Estos resultados describen una respuesta conservada por caso en un corpus sintético pequeño. Son señales útiles para la próxima edición, no clasificaciones generales de modelos ni afirmaciones sobre estabilidad.
Acertó los 24 objetivos y obtuvo el IoU medio de recuadro más alto, con 0.771. También registró el menor coste de localización indicado en esta ejecución: $0.0057.
8 de 9 modelos alcanzaron una exactitud equilibrada del 100 %. Esta prueba funciona como comprobación de cordura para elementos ausentes, pero esta versión piloto apenas diferencia a la mayoría de los modelos.
Fue el único modelo con una exactitud equilibrada del 100 % en diseños limpios y defectuosos. Su exactitud por categoría de defecto fue del 67 %, lo que demuestra que detectar un problema y nombrarlo con precisión son tareas distintas.
Qué significa esto para la automatización de pruebas
La interacción exacta, la observación continua y la interpretación semántica tienen requisitos de rendimiento diferentes. No se debe esperar que una sola técnica de visión optimice las tres.
El bucle local de visión por computador de Repeato puede inspeccionar la pantalla a 20 Hz, una vez cada 50 ms. Una solicitud a un modelo de visión y lenguaje suele necesitar entre 2 y 10 segundos para transferir la imagen, realizar la inferencia y completar el recorrido de ida y vuelta por la red. Esta diferencia importa cuando una prueba debe detectar la aparición de un elemento, esperar a que termine un movimiento o reaccionar antes de que desaparezca un estado transitorio.
Las huellas visuales locales pueden buscar continuamente los objetivos grabados y actuar en cuanto la pantalla esté lista. Repetir llamadas a modelos remotos con la misma frecuencia no sería práctico.
La coincidencia local no requiere un recorrido de ida y vuelta por la red, disponibilidad del proveedor ni cargos de API por solicitud. Las pantallas permanecen en la estación de trabajo y el mismo algoritmo puede ejecutarse sin conexión.
La visión basada en LLM justifica su latencia cuando una prueba necesita criterio semántico: interpretar texto o números, comprender contenido dinámico o comprobar conceptos como una gráfica con tendencia ascendente.
Usa la visión por computador local para el bucle de control de alta frecuencia: encontrar objetivos, esperar, interactuar y comparar visualmente. Recurre selectivamente a la visión mediante IA cuando la aserción requiera realmente comprensión lingüística o semántica.
Piloto de comprensión
Cada modelo recibió 24 objetivos accionables en seis pantallas limpias del piloto. Un punto válido según el esquema dentro del objetivo cuenta como acierto; IoU de la caja mide la precisión de localización. Expande una fila para ver los resultados por escenario.
Pilotos de detección
Dos tareas equilibradas evalúan si los modelos pueden rechazar elementos de UI ausentes y distinguir controles limpios de defectos de diseño introducidos. Los resultados se mantienen separados de la localización.
Seis consultas objetivo presentes y seis ausentes por modelo. Esta prueba mide únicamente la clasificación.
| 100 % válidos12/12 casos · 0 intentos fallidos | 100% | 100% | 100% | 0% | 1.29 s | $0.3636por cada 1.000 casos conservados | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % válidos12/12 casos · 0 intentos fallidos | 100% | 100% | 100% | 0% | 7.45 s | $0.1414por cada 1.000 casos conservados | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % válidos12/12 casos · 0 intentos fallidos | 100% | 100% | 100% | 0% | 7.55 s | $3.2402por cada 1.000 casos conservados | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % válidos12/12 casos · 0 intentos fallidos | 100% | 100% | 100% | 0% | 7.82 s | $2.3426por cada 1.000 casos conservados | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % válidos12/12 casos · 0 intentos fallidos | 100% | 100% | 100% | 0% | 9.85 s | $7.4788por cada 1.000 casos conservados | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % válidos12/12 casos · 0 intentos fallidos | 100% | 100% | 100% | 0% | 7.50 s | $2.2346por cada 1.000 casos conservados | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % válidos12/12 casos · 0 intentos fallidos | 100% | 100% | 100% | 0% | 9.27 s | $2.9915por cada 1.000 casos conservados | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % válidos12/12 casos · 0 intentos fallidos | 100% | 100% | 100% | 0% | 7.79 s | $7.0680por cada 1.000 casos conservados | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % válidos12/12 casos · 0 intentos fallidos | 92% | 100% | 83% | 17% | 15.01 s | $2.3602por cada 1.000 casos conservados | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
Seis controles limpios y seis capturas de pantalla con un defecto introducido por modelo. Los fallos de transporte siguen siendo fallos operativos, no respuestas de precisión.
| 67 % válidos12/12 casos · 0 intentos fallidos | 58% | 17% | 100% | 0% | 2.44 s | $0.8251por cada 1.000 casos conservados | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 92 % válidos12/12 casos · 0 intentos fallidos | 83% | 67% | 100% | 50% | 8.36 s | $0.2389por cada 1.000 casos conservados | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % válidos12/12 casos · 0 intentos fallidos | 92% | 83% | 100% | 67% | 9.02 s | $5.2075por cada 1.000 casos conservados | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 75 % válidos12/12 casos · 0 intentos fallidos | 75% | 83% | 67% | 67% | 8.43 s | $3.8341por cada 1.000 casos conservados | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 83 % válidos12/12 casos · 0 intentos fallidos | 83% | 67% | 100% | 67% | 10.15 s | $11.5029por cada 1.000 casos conservados | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % válidos12/12 casos · 0 intentos fallidos | 100% | 100% | 100% | 67% | 7.40 s | $2.7465por cada 1.000 casos conservados | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 92 % válidos12/12 casos · 0 intentos fallidos | 83% | 83% | 83% | 67% | 10.52 s | $4.7403por cada 1.000 casos conservados | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 92 % válidos12/12 casos · 0 intentos fallidos | 92% | 83% | 100% | 67% | 11.91 s | $11.6632por cada 1.000 casos conservados | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % válidos12/12 casos · 0 intentos fallidos | 92% | 100% | 83% | 67% | 21.75 s | $3.0450por cada 1.000 casos conservados | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
Una ejecución por caso; sin intervalos de confianza ni afirmaciones de estabilidad. El coste agregado se extrapola a 1.000 casos conservados para que las ejecuciones incompletas no parezcan artificialmente baratas. Las filas con menos de 12 respuestas aún tienen una combinación de casos menor y no son directamente comparables con las filas completas.
Corpus congelado
Cada fixture tiene un control limpio y una variante deliberadamente defectuosa. Las capturas usan ventanas gráficas fijas, recursos locales, geometría estable de objetivos y límites exactos de diferencia de píxeles.












Expedientes de modelos
Abre la página de un modelo para consultar sus resultados de fundamentación, presencia de elementos, defectos de diseño, latencia, fiabilidad y costes. Las rutas permanecen fijadas al proveedor ascendente indicado, con las alternativas desactivadas.
Metodología
El piloto separa la fundamentación de UI, la presencia de elementos, la detección de defectos de diseño visibles y el rendimiento operativo. No los combina en una puntuación general.
Contrato de entrada
Texto del prompt más un PNG en base64: sin DOM, árbol de accesibilidad, código fuente, OCR, herramientas, plugins ni búsqueda web.
Chromium a 1440 × 900 o 390 × 844; factor de escala del dispositivo: 1.
Verdad de referencia derivada del navegador en un espacio de coordenadas de 0–1000.
Las variantes limpias y defectuosas conservan la geometría objetivo y los hashes de captura.
Pista A
Cuatro objetivos por captura de pantalla, correspondientes a tipos comunes de elementos de UI accionables.
El punto de clic predicho queda dentro del cuadro objetivo.
IoU medio y proporción de predicciones con IoU ≥ 0.5.
Tasa de respuestas válidas según el esquema; una ejecución no permite calcular una puntuación de estabilidad.
Pista B
Una consulta cuya presencia se conoce y otra plausible pero ausente por cada pantalla limpia.
La exactitud equilibrada asigna el mismo peso a los casos presentes y ausentes.
La recuperación, la especificidad y la tasa de falsos positivos revelan la dirección del error.
found=true o found=false; sin puntuación de localización.
Pista C
Las escenas limpias y defectuosas emparejadas cubren seis tipos objetivos de fallos de diseño.
Exactitud equilibrada, recuperación, especificidad y tasa de falsos positivos.
Exactitud por categoría de defecto tras una detección correcta.
IoU del cuadro predicho frente a las regiones de defectos derivadas del navegador.
Enrutamiento y operaciones
IDs de modelo fijados, rutas propias, alternativas desactivadas y un único contrato de respuesta.
Un reintento para errores 429, 5xx o de red; no para respuestas incorrectas.
La latencia, los fallos, los reintentos y el coste se mantienen separados de la exactitud.
Los registros publicados omiten las claves y los identificadores de solicitud del proveedor.
Limitaciones
Seis pantallas sintéticas, una ejecución por caso y 24 objetivos no pueden demostrar una superioridad o estabilidad generalizadas.
Cada edición registra los IDs exactos de los modelos, la fecha, los hashes del prompt y del esquema, los controles del endpoint y los intentos saneados, porque los proveedores cambian.
Reprodúcelo
Los registros sin procesar de los modelos se han saneado. No se publican claves de API, identificadores de solicitudes ni identificadores de generación.
Las capturas de pantalla, anotaciones, manifiestos y resultados agregados creados por Repeato están disponibles bajo CC BY 4.0. Consulta la el aviso de licencia del benchmark. Los resultados sin procesar de los modelos siguen sujetos a los términos de sus proveedores.