Recherche Repeato · Benchmark LLM de vision

Peut-on faire confiance aux LLM multimodaux pour tester les interfaces utilisateur ?

Un benchmark d’automatisation des tests d’interface basé uniquement sur des captures d’écran : localiser les éléments interactifs, reconnaître l’absence d’un élément, détecter les défauts visibles de mise en page et mesurer le coût opérationnel d’une réponse.

Édition pilote2026-08-13

Six écrans déterministes. Vingt-quatre cibles de repérage. 9 modèles API. Un pilote ciblé, pas un classement.

Écrans6
Cibles de repérage24
Catégories de défauts6
Modèles9

Résultats du pilote

Ce que montre cette édition

Ces résultats décrivent une réponse conservée par cas sur un petit corpus synthétique. Ils constituent des indications utiles pour la prochaine édition, et non un classement général des modèles ni des affirmations sur leur stabilité.

01

GPT-5.6 Luna en tête pour l’ancrage UI

Il a atteint les 24 cibles et obtenu le meilleur IoU moyen des boîtes, à 0,771. Il affichait également le coût d’ancrage déclaré le plus faible de cette exécution, à 0,0057 $.

02

La présence des éléments était presque saturée

8 modèles sur 9 ont atteint une précision équilibrée de 100 %. Ce volet fonctionne comme un contrôle de cohérence des éléments absents, mais cette version pilote différencie peu la plupart des modèles.

03

Grok 4.5 en tête pour la détection des défauts

C’était le seul modèle affichant une précision équilibrée de 100 % sur les interfaces propres et défectueuses. Sa précision par catégorie de défaut était de 67 %, ce qui montre que repérer un problème et le nommer précisément sont deux tâches différentes.

Ce que cela signifie pour l’automatisation des tests

Utilisez le type de vision adapté à chaque étape du test

L’interaction précise, l’observation continue et l’interprétation sémantique répondent à des exigences de performance différentes. Il ne faut pas s’attendre à ce qu’une seule technique de vision les optimise toutes.

Observation localeJusqu’à 20 fois par secondeRequête LLMSouvent 2 à 10 secondesComment nous combinons la vision locale et les LLMRéduire l’analyse

La boucle locale de vision par ordinateur de Repeato peut analyser l’écran à 20 Hz, soit une fois toutes les 50 ms. Une requête à un modèle de vision-langage nécessite généralement 2 à 10 secondes pour le transfert de l’image, l’inférence et l’aller-retour réseau. Cette différence est importante lorsqu’un test doit détecter l’apparition d’un élément, attendre l’arrêt d’un mouvement ou réagir avant la disparition d’un état transitoire.

01

Un retour rapide pour les interactions répétées

Les empreintes visuelles locales peuvent rechercher en continu les cibles enregistrées et agir dès que l’écran est prêt. Répéter des appels à distance au modèle à la même fréquence serait irréaliste.

02

Prévisible, privé et économique

La correspondance locale ne nécessite ni aller-retour réseau, ni disponibilité d’un fournisseur, ni frais d’API par requête. Les écrans restent sur le poste de travail, et le même algorithme peut fonctionner hors ligne.

03

L’IA pour les questions auxquelles la correspondance ne peut pas répondre

La vision par LLM justifie sa latence lorsqu’un test nécessite un jugement sémantique : interpréter du texte ou des nombres, comprendre du contenu dynamique ou vérifier des concepts comme une courbe ascendante.

Répartition pratique

Utilisez la vision par ordinateur locale pour la boucle de contrôle haute fréquence : trouver les cibles, attendre, interagir et comparer visuellement. Faites appel sélectivement à la vision par IA lorsque l’assertion nécessite réellement une compréhension linguistique ou sémantique.

Pilote de repérage

Un modèle peut-il localiser l’élément d’interface demandé ?

Chaque modèle a reçu 24 cibles interactives réparties sur six écrans propres du pilote. Un point valide selon le schéma à l’intérieur de la cible compte comme une réussite ; l’IoU des boîtes mesure la précision de la localisation. Développez une ligne pour voir les résultats par scénario.

IoU des boîtesPlus élevé = meilleur · échelle de 0 à 1
  1. Holo3 122B A10B0.478
  2. Grok 4.50.445
  3. GPT-5.40.528
  4. Gemini 3.6 Flash0.645
  5. GPT-5.6 Sol0.677
  6. GPT-5.6 Luna0.771
  7. Claude Sonnet 50.043
  8. Claude Opus 50.314
  9. Gemini 3.1 Pro Preview0.632
Coût totalPlus faible = meilleur · 24 requêtes
  1. Holo3 122B A10B$0.0126
  2. Grok 4.5$0.0669
  3. GPT-5.4$0.1196
  4. Gemini 3.6 Flash$0.0637
  5. GPT-5.6 Sol$0.2453
  6. GPT-5.6 Luna$0.0057
  7. Claude Sonnet 5$0.0990
  8. Claude Opus 5$0.2474
  9. Gemini 3.1 Pro Preview$0.0726
Latence moyennePlus faible = meilleur · par requête
  1. Holo3 122B A10B1.68 s
  2. Grok 4.51.67 s
  3. GPT-5.42.99 s
  4. Gemini 3.6 Flash1.83 s
  5. GPT-5.6 Sol3.23 s
  6. GPT-5.6 Luna3.55 s
  7. Claude Sonnet 53.91 s
  8. Claude Opus 54.24 s
  9. Gemini 3.1 Pro Preview11.89 s
Compromis entre précision, coût et latencePlus c’est haut et à gauche, mieux c’est. La couleur indique la latence moyenne des réponses.
1,67 s — rapide11,89 s — lent
Better value0.000.250.500.751.00$0.00$0.05$0.10$0.15$0.20$0.25Total cost for 24 requests (USD) →Box IoU →Holo3 122B A10BGrok 4.5GPT-5.4Gemini 3.6 FlashGPT-5.6 SolGPT-5.6 LunaClaude Sonnet 5Claude Opus 5Gemini 3.1 Pro Preview
Réponse non valide1 nouvelle tentative de transport92 % de clics réussis0.4781.68 s$0.0126
Réussis1 nouvelle tentative de transport83 % de clics réussis0.4451.67 s$0.0669
Réussis1 nouvelle tentative de transport75 % de clics réussis0.5282.99 s$0.1196
Réponse non valide1 nouvelle tentative de transport79 % de clics réussis0.6451.83 s$0.0637
Réussis1 nouvelle tentative de transport96 % de clics réussis0.6773.23 s$0.2453
Réussis1 nouvelle tentative de transport100 % de clics réussis0.7713.55 s$0.0057
Réponse non valide1 nouvelle tentative de transport21 % de clics réussis0.0433.91 s$0.0990
Réponse non valide1 nouvelle tentative de transport46 % de clics réussis0.3144.24 s$0.2474
Réponse non valide1 nouvelle tentative de transport88 % de clics réussis0.63211.89 s$0.0726

Pilotes de détection

Présence et défauts visibles

Deux tâches équilibrées vérifient si les modèles peuvent rejeter les éléments d’interface absents et distinguer les contrôles propres des défauts de mise en page introduits. Les résultats restent distincts du repérage.

Le modèle peut-il déterminer quand un élément est absent ?

Six requêtes cibles présentes et six absentes par modèle. Cette série mesure uniquement la classification.

100 % valides12/12 cas · 0 tentative échouée100%100%100%0%1.29 s$0.3636pour 1 000 cas conservés
100 % valides12/12 cas · 0 tentative échouée100%100%100%0%7.45 s$0.1414pour 1 000 cas conservés
100 % valides12/12 cas · 0 tentative échouée100%100%100%0%7.55 s$3.2402pour 1 000 cas conservés
100 % valides12/12 cas · 0 tentative échouée100%100%100%0%7.82 s$2.3426pour 1 000 cas conservés
100 % valides12/12 cas · 0 tentative échouée100%100%100%0%9.85 s$7.4788pour 1 000 cas conservés
100 % valides12/12 cas · 0 tentative échouée100%100%100%0%7.50 s$2.2346pour 1 000 cas conservés
100 % valides12/12 cas · 0 tentative échouée100%100%100%0%9.27 s$2.9915pour 1 000 cas conservés
100 % valides12/12 cas · 0 tentative échouée100%100%100%0%7.79 s$7.0680pour 1 000 cas conservés
100 % valides12/12 cas · 0 tentative échouée92%100%83%17%15.01 s$2.3602pour 1 000 cas conservés

Le modèle peut-il distinguer les mises en page propres des mises en page défectueuses ?

Six contrôles propres et six captures d’écran présentant chacune un défaut introduit par modèle. Les échecs de transport restent des échecs opérationnels, et non des réponses de précision.

Compromis entre la précision de détection des défauts, le coût et la latencePlus c’est haut et à gauche, mieux c’est. La couleur indique la latence moyenne des réponses.
2,44 s — rapide21,75 s — lent
Better value0.000.250.500.751.00$0.00$2.40$4.80$7.20$9.60$12.00Cost per 1,000 retained defect cases (USD) →Balanced accuracy →Holo3 122B A10BGPT-5.6 LunaGPT-5.4Gemini 3.6 FlashClaude Opus 5Grok 4.5Claude Sonnet 5GPT-5.6 SolGemini 3.1 Pro Preview
67 % valides12/12 cas · 0 tentative échouée58%17%100%0%2.44 s$0.8251pour 1 000 cas conservés
92 % valides12/12 cas · 0 tentative échouée83%67%100%50%8.36 s$0.2389pour 1 000 cas conservés
100 % valides12/12 cas · 0 tentative échouée92%83%100%67%9.02 s$5.2075pour 1 000 cas conservés
75 % valides12/12 cas · 0 tentative échouée75%83%67%67%8.43 s$3.8341pour 1 000 cas conservés
Un passage par cas ; aucun intervalle de confiance ni affirmation de stabilité. Le coût total est extrapolé à 1 000 cas conservés afin que les exécutions incomplètes ne paraissent pas artificiellement moins coûteuses. Les lignes comportant moins de 12 réponses reposent sur un échantillon de cas plus réduit et ne sont pas directement comparables aux lignes complètes.12/12 cas · 0 tentative échouée83%67%100%67%10.15 s$11.5029pour 1 000 cas conservés
100 % valides12/12 cas · 0 tentative échouée100%100%100%67%7.40 s$2.7465pour 1 000 cas conservés
92 % valides12/12 cas · 0 tentative échouée83%83%83%67%10.52 s$4.7403pour 1 000 cas conservés
92 % valides12/12 cas · 0 tentative échouée92%83%100%67%11.91 s$11.6632pour 1 000 cas conservés
100 % valides12/12 cas · 0 tentative échouée92%100%83%67%21.75 s$3.0450pour 1 000 cas conservés

Un passage par cas ; aucun intervalle de confiance ni affirmation de stabilité. Le coût total est extrapolé à 1 000 cas conservés afin que les exécutions incomplètes ne paraissent pas artificiellement moins coûteuses. Les lignes comportant moins de 12 réponses reposent sur un échantillon de cas plus réduit et ne sont pas directement comparables aux lignes complètes.

Corpus figé

Trois écrans de bureau et trois écrans mobiles

Chaque fixture comporte un contrôle propre et une variante délibérément défectueuse. Les captures utilisent des fenêtres d’affichage fixes, des ressources locales, une géométrie stable des cibles et des seuils exacts de différence entre pixels.

Contrôle propre du catalogue e-commerce
Catalogue e-commerce avec rognage du conteneur
Catalogue commercialWeb de bureau · Rognage du conteneur
Contrôle propre du tableau de bord analytique
Tableau de bord analytique avec débordement du texte
Tableau de bord analytiqueWeb de bureau · Débordement du texte
Contrôle propre du centre de contrôle IoT
Centre de contrôle IoT avec chevauchement d’éléments
Centre de contrôle IoTWeb desktop · Chevauchement d’éléments
Services bancaires mobiles, contrôle clair
Services bancaires mobiles avec recadrage de la fenêtre d’affichage
Services bancaires mobilesStyle iOS · Recadrage de la fenêtre d’affichage
Carte d’embarquement, contrôle clair
Carte d’embarquement avec action masquée
Carte d’embarquementStyle iOS · Action masquée
Maison connectée, contrôle clair
Maison connectée avec réagencement responsive défaillant
Maison connectéeStyle Android · Réagencement responsive défaillant

Fiches des modèles

Une page de résultats par modèle

Ouvrez la page d’un modèle pour consulter ses résultats de grounding, de présence d’éléments, de défauts de mise en page, de latence, de fiabilité et de coût. Les routes restent liées au fournisseur amont indiqué, avec les solutions de secours désactivées.

Méthodologie

Mesurer ce que le modèle voit réellement

Le pilote sépare le grounding d’interface, la présence des éléments, la détection des défauts de mise en page visibles et les performances opérationnelles. Il ne les combine pas en un score global.

EntréeCapture d’écran uniquement
Géométrie0–1000
ExécutionsUn par cas
ÉvaluationMétriques distinctes

Contrat d’entrée

Capture d’écran uniquement

Texte de prompt et un PNG en base64 uniquement — sans DOM, arbre d’accessibilité, code source, OCR, outils, plugins ni recherche Web.

01

Rendu fixe

Chromium en 1440 × 900 ou 390 × 844 ; facteur d’échelle de l’appareil : 1.

02

Géométrie normalisée

Vérité terrain dérivée du navigateur dans un espace de coordonnées de 0 à 1000.

03

Paires stables

Les variantes saines et défectueuses préservent la géométrie cible et les hachages des captures.

Volet A

Grounding des éléments d’interface

Quatre cibles par capture d’écran, couvrant les types courants d’éléments d’interface actionnables.

Exactitude des points

Le point de clic prédit se trouve à l’intérieur de la zone cible.

Exactitude des boîtes

IoU moyenne et part des prédictions avec une IoU ≥ 0,5.

Validité

Taux de réponses conformes au schéma ; une seule exécution ne permet pas d’évaluer la stabilité.

Volet B

Présence des éléments

Une requête dont la présence est avérée et une requête plausible mais absente par écran sain.

Détection

L’exactitude équilibrée pondère de manière égale les cas présents et absents.

Comportement de la classe

Le rappel, la spécificité et le taux de faux positifs révèlent la direction des erreurs.

Booléen uniquement

found=true ou found=false ; aucun score de localisation.

Piste C

Défauts de mise en page visibles

Des scènes saines et défectueuses appariées couvrent six types objectifs de défaillances de mise en page.

Détection

Exactitude équilibrée, rappel, spécificité et taux de faux positifs.

Classification

Exactitude de la catégorie de défaut après détection réussie.

Localisation

IoU de la zone prédite par rapport aux régions de défaut dérivées du navigateur.

Routage et opérations

Garder le comportement du fournisseur visible

Identifiants de modèles figés, routes propriétaires, solutions de repli désactivées et un seul contrat de réponse.

Politique de nouvelle tentative

Une nouvelle tentative pour une erreur 429, 5xx ou réseau — pas pour les mauvaises réponses.

Métriques opérationnelles

La latence, les échecs, les nouvelles tentatives et le coût restent distincts de l’exactitude.

Confidentialité

Les enregistrements publiés omettent les clés et les identifiants de requête des fournisseurs.

Limites

Un pilote, pas un classement

Six écrans synthétiques, une exécution par cas et 24 cibles ne peuvent pas établir une supériorité ou une stabilité générales.

Chaque édition consigne les identifiants exacts des modèles, la date, les hachages du prompt et du schéma, les contrôles des points de terminaison et les tentatives assainies, car les fournisseurs évoluent.

Reproduire

Examiner les éléments de preuve

Les enregistrements bruts des modèles sont assainis. Les clés API, identifiants de requête et identifiants de génération ne sont pas publiés.

Les captures d’écran, annotations, manifestes et résultats agrégés créés par Repeato sont disponibles sous CC BY 4.0. Consultez la l’avis de licence du benchmark . Les sorties brutes des modèles restent soumises aux conditions de leurs fournisseurs.

FR