Google Gemini · Eficiente · 2026-08-13

Benchmark de visión de Gemini 3.6 Flash

Cómo se comportó Gemini 3.6 Flash en tareas de fundamentación de la interfaz basadas en capturas, presencia de elementos y defectos de diseño visibles relevantes para la automatización de pruebas.

Modelo de API exactogoogle/gemini-3.6-flash

Las solicitudes se dirigieron a la infraestructura de Google AI Studio mediante OpenRouter. Las alternativas se desactivaron para todas las solicitudes conservadas.

Tasa de aciertos de localización79%
IoU medio de las cajas0.645
Precisión de presencia100%
Precisión de defectos75%

Resultado general

Gemini 3.6 Flash en las tres tareas de interfaz

Gemini 3.6 Flash acertó 19 de los 24 objetivos de interfaz solicitados. Su precisión equilibrada fue del 100 % para la presencia de elementos y del 75 % para la detección de defectos de diseño.

Este piloto fechado conservó 24 respuestas de localización y 24 respuestas de detección. No falló ninguna solicitud de detección. Los resultados describen este modelo de API exacto y este corpus de pruebas, no la calidad general del modelo ni un producto de chat para consumidores.

Consulta el benchmark completo de visión de LLM →

Rendimiento relativo

Posición de Gemini 3.6 Flash entre los modelos probados

Cada escala compara el modelo seleccionado con el modelo alternativo más fuerte y el más débil. Las tres métricas proceden de la misma ejecución completada de localización en 24 casos; un valor mayor siempre aparece a la derecha.

IoU de las cajasUn valor mayor es mejor
0.645
Alternativa más débil
Claude Sonnet 50.043
Alternativa más fuerte
GPT-5.6 Luna0.771
VelocidadUna latencia menor es mejor
1.83 s
Alternativa más débil
Gemini 3.1 Pro Preview11.89 s
Alternativa más fuerte
Grok 4.51.67 s
CosteUn coste total menor es mejor
$0.0637
Alternativa más débil
Claude Opus 5$0.2474
Alternativa más fuerte
GPT-5.6 Luna$0.0057
Consulta el benchmark completo de visión de LLM →

Localización de UI

¿Puede Gemini 3.6 Flash localizar elementos interactivos?

Veinticuatro objetivos abarcan seis pantallas deterministas de escritorio y móvil. Un punto válido según el esquema dentro del objetivo solicitado cuenta como acierto; el IoU de las cajas mide la precisión de localización.

catálogo comercial escritorio / limpio / localización / añadir productoAprobadasAcierto0.9931.89 s$0.0022
catálogo comercial escritorio / limpio / localización / buscarAprobadasAcierto0.8791.36 s$0.0021
catálogo comercial escritorio / limpio / localización / consulta del catálogoAprobadasAcierto0.8431.39 s$0.0021
catálogo comercial escritorio / limpio / localización / filtro de stockAprobadasAcierto0.0811.37 s$0.0021
panel de analítica escritorio / limpio / localización / campo de búsquedaAprobadasAcierto0.9561.67 s$0.0022
panel de analítica escritorio / limpio / localización / interruptor de comparaciónRespuesta no válidaFallo0.0003.31 s$0.0047
panel de analítica escritorio / limpio / localización / pestaña de audienciaAprobadasAcierto0.7701.21 s$0.0022
panel de analítica escritorio / limpio / localización / tarjeta de ingresosRespuesta no válidaFallo0.0002.92 s$0.0047
control de IoT escritorio / limpio / localización / modo automáticoRespuesta no válidaFallo0.0003.79 s$0.0047
control de IoT escritorio / limpio / localización / navegación de dispositivosAprobadasAcierto0.9911.35 s$0.0022
control de IoT escritorio / limpio / localización / tarjeta de bombaAprobadasAcierto0.9761.20 s$0.0021
control de IoT escritorio / limpio / localización / reiniciar dispositivoAprobadasAcierto0.9761.33 s$0.0021
banca iOS / limpio / localización / transferenciaAprobadasAcierto0.9611.89 s$0.0021
banca iOS / limpio / localización / perfilAprobadasAcierto0.9391.54 s$0.0022
banca iOS / limpio / localización / búsqueda de transaccionesAprobadasAcierto0.8611.13 s$0.0021
banca iOS / limpio / localización / ocultar saldoAprobadasAcierto0.0331.56 s$0.0021
pase de vuelo iOS / limpio / localización / pestaña de viajesRespuesta no válidaFallo0.0003.49 s$0.0047
pase de vuelo iOS / limpio / grounding / tarjeta de embarqueAprobadasAcierto0.9731.29 s$0.0021
pase de vuelo iOS / limpio / grounding / check-inAprobadasAcierto0.9771.20 s$0.0021
pase de vuelo iOS / limpio / grounding / pestaña de perfilRespuesta no válidaFallo0.0003.30 s$0.0047
hogar inteligente Android / limpio / grounding / tarjeta del termostatoAprobadasAcierto0.9871.56 s$0.0021
hogar inteligente Android / limpio / grounding / añadir dispositivoAprobadasAcierto0.9771.77 s$0.0022
hogar inteligente Android / limpio / grounding / másAprobadasAcierto0.4451.34 s$0.0022
hogar inteligente Android / limpio / grounding / búsqueda de habitacionesAprobadasAcierto0.8661.19 s$0.0021

Resultados de detección

Defectos de presencia y diseño visible

Las tareas equilibradas independientes miden si el modelo rechaza elementos ausentes y distingue controles limpios de capturas de pantalla con un único defecto de diseño introducido.

¿Puede el modelo detectar cuándo un elemento no está presente?

Seis consultas objetivo presentes y seis ausentes por modelo. Esta prueba mide únicamente la clasificación.

Precisión equilibrada100%
Sensibilidad de elementos presentes100%
Especificidad de elementos ausentes100%
Cobertura12/12
Esperado
catálogo de comercio electrónico en escritorio / limpio / presencia del elemento / presenteVálidoCorrectoPresentePresente8.25 s$0.0022
catálogo de comercio electrónico en escritorio / limpio / presencia del elemento / ausenteVálidoCorrectoAusenteAusente5.01 s$0.0028
panel de analítica en escritorio / limpio / presencia del elemento / presenteVálidoCorrectoPresentePresente7.92 s$0.0023
panel de analítica en escritorio / limpio / presencia del elemento / ausenteVálidoCorrectoAusenteAusente8.31 s$0.0026
control de IoT en escritorio / limpio / presencia del elemento / presenteVálidoCorrectoPresentePresente9.20 s$0.0022
control de IoT en escritorio / limpio / presencia del elemento / ausenteVálidoCorrectoAusenteAusente6.31 s$0.0025
banca iOS / limpio / presencia del elemento / presenteVálidoCorrectoPresentePresente8.33 s$0.0021
banca iOS / limpio / presencia del elemento / ausenteVálidoCorrectoAusenteAusente8.04 s$0.0025
pase de vuelo iOS / limpio / presencia del elemento / presenteVálidoCorrectoPresentePresente6.08 s$0.0018
pase de vuelo iOS / limpio / presencia del elemento / ausenteVálidoCorrectoAusenteAusente8.84 s$0.0025
hogar inteligente Android / limpio / presencia del elemento / presenteVálidoCorrectoPresentePresente8.83 s$0.0022
hogar inteligente Android / limpio / presencia del elemento / ausenteVálidoCorrectoAusenteAusente8.69 s$0.0026

¿Puede el modelo distinguir entre diseños limpios y defectuosos?

Seis controles limpios y seis capturas de pantalla con un defecto introducido por modelo. Los fallos de transporte siguen siendo fallos operativos, no respuestas de precisión.

Precisión equilibrada75%
Sensibilidad de defectos83%
Especificidad de diseños limpios67%
Cobertura12/12
IoU de localización
catálogo de comercio electrónico en escritorio / limpio / defecto de diseñoVálidoCorrectoNo aplicable7.31 s$0.0026
catálogo de comercio electrónico en escritorio / defecto / defecto de diseñoVálidoCorrectoCorrecto0.2069.66 s$0.0043
panel de analítica en escritorio / limpio / defecto de diseñoNo válidoIncorrectoNo aplicable6.06 s$0.0048
panel de analítica en escritorio / defecto / defecto de diseñoNo válidoIncorrectoIncorrecto0.0009.06 s$0.0047
control de IoT en escritorio / limpio / defecto de diseñoNo válidoIncorrectoNo aplicable8.94 s$0.0047
control de IoT en escritorio / defecto / defecto de diseñoVálidoCorrectoCorrecto0.0789.32 s$0.0032
banca iOS / limpio / defecto de diseñoVálidoCorrectoNo aplicable7.25 s$0.0028
banca iOS / defecto / defecto de diseñoVálidoCorrectoCorrecto0.0668.59 s$0.0045
pase de vuelo iOS / limpio / defecto de diseñoVálidoCorrectoNo aplicable6.41 s$0.0024
pase de vuelo iOS / defecto / defecto de diseñoVálidoCorrectoCorrecto0.9849.48 s$0.0046
hogar inteligente Android / limpio / defecto de diseñoVálidoCorrectoNo aplicable9.46 s$0.0028
hogar inteligente Android / defecto / defecto de diseñoVálidoCorrectoIncorrecto0.0009.58 s$0.0044

Por qué importa esta investigación

Usar el tipo de visión adecuado para cada prueba

Los principales LLM de visión pueden razonar sobre significados visuales complejos, pero siguen siendo demasiado lentos y costosos para cada paso de una prueba. Esta investigación nos ayuda a identificar dónde sus capacidades semánticas justifican ese intercambio.

01

Evaluación local rápida

Los propios algoritmos locales de visión de Repeato gestionan las interacciones frecuentes, la coincidencia visual y las comprobaciones de regresión con respuestas rápidas, comportamiento predecible y sin coste por solicitud del modelo.

02

Razonamiento semántico cuando es necesario

Los principales LLM de visión son útiles para preguntas más complejas: comprender significados, comprobar contenido dinámico, describir defectos o evaluar conceptos que no pueden capturarse con una simple huella visual.

03

Un enfoque híbrido basado en evidencia

Comparar la precisión, la latencia, la fiabilidad y el coste nos ayuda a decidir qué comprobaciones deben seguir siendo locales y cuáles se benefician lo suficiente de un LLM como para justificar una evaluación más lenta y costosa.

Nuestra estrategia de producto

Usar la visión por computador local de Repeato como base rápida y recurrir selectivamente a los principales LLM de visión para razonamientos complejos o semánticos, cuando aporten un valor adicional significativo.

Consulta el benchmark completo de visión →

Cobertura de pruebas

Seis pantallas, tres tipos de tareas

Cada modelo se evalúa con el mismo corpus congelado, las mismas indicaciones, los mismos esquemas de respuesta y una geometría normalizada de 0–1000.

01

Catálogo de comercio

Web de escritorio con un control correcto y un defecto de recorte en un contenedor asociado.

02

Panel de analítica

Web de escritorio con un control correcto y un defecto asociado de desbordamiento de texto.

03

Centro de control de IoT

Web de escritorio con un control correcto y un defecto asociado de solapamiento de elementos.

ES