Cómo se comportó Gemini 3.1 Pro Preview en tareas de fundamentación de la interfaz basadas en capturas, presencia de elementos y defectos de diseño visibles relevantes para la automatización de pruebas.
Modelo de API exactogoogle/gemini-3.1-pro-preview
Las solicitudes se dirigieron a la infraestructura de Google AI Studio mediante OpenRouter. Las alternativas se desactivaron para todas las solicitudes conservadas.
Gemini 3.1 Pro Preview en las tres tareas de interfaz
Gemini 3.1 Pro Preview acertó 21 de los 24 objetivos de interfaz solicitados. Su precisión equilibrada fue del 92 % para la presencia de elementos y del 92 % para la detección de defectos de diseño.
Este piloto fechado conservó 24 respuestas de localización y 24 respuestas de detección. No falló ninguna solicitud de detección. Los resultados describen este modelo de API exacto y este corpus de pruebas, no la calidad general del modelo ni un producto de chat para consumidores.
Posición de Gemini 3.1 Pro Preview entre los modelos probados
Cada escala compara el modelo seleccionado con el modelo alternativo más fuerte y el más débil. Las tres métricas proceden de la misma ejecución completada de localización en 24 casos; un valor mayor siempre aparece a la derecha.
¿Puede Gemini 3.1 Pro Preview localizar elementos interactivos?
Veinticuatro objetivos abarcan seis pantallas deterministas de escritorio y móvil. Un punto válido según el esquema dentro del objetivo solicitado cuenta como acierto; el IoU de las cajas mide la precisión de localización.
Las tareas equilibradas independientes miden si el modelo rechaza elementos ausentes y distingue controles limpios de capturas de pantalla con un único defecto de diseño introducido.
¿Puede el modelo detectar cuándo un elemento no está presente?
Seis consultas objetivo presentes y seis ausentes por modelo. Esta prueba mide únicamente la clasificación.
¿Puede el modelo distinguir entre diseños limpios y defectuosos?
Seis controles limpios y seis capturas de pantalla con un defecto introducido por modelo. Los fallos de transporte siguen siendo fallos operativos, no respuestas de precisión.
Los principales LLM de visión pueden razonar sobre significados visuales complejos, pero siguen siendo demasiado lentos y costosos para cada paso de una prueba. Esta investigación nos ayuda a identificar dónde sus capacidades semánticas justifican ese intercambio.
01
Evaluación local rápida
Los propios algoritmos locales de visión de Repeato gestionan las interacciones frecuentes, la coincidencia visual y las comprobaciones de regresión con respuestas rápidas, comportamiento predecible y sin coste por solicitud del modelo.
02
Razonamiento semántico cuando es necesario
Los principales LLM de visión son útiles para preguntas más complejas: comprender significados, comprobar contenido dinámico, describir defectos o evaluar conceptos que no pueden capturarse con una simple huella visual.
03
Un enfoque híbrido basado en evidencia
Comparar la precisión, la latencia, la fiabilidad y el coste nos ayuda a decidir qué comprobaciones deben seguir siendo locales y cuáles se benefician lo suficiente de un LLM como para justificar una evaluación más lenta y costosa.
Nuestra estrategia de producto
Usar la visión por computador local de Repeato como base rápida y recurrir selectivamente a los principales LLM de visión para razonamientos complejos o semánticos, cuando aporten un valor adicional significativo.