GPT-5.6 Luna en tête pour l’ancrage UI
Il a atteint les 24 cibles et obtenu le meilleur IoU moyen des boîtes, à 0,771. Il affichait également le coût d’ancrage déclaré le plus faible de cette exécution, à 0,0057 $.
Recherche Repeato · Benchmark LLM de vision
Un benchmark d’automatisation des tests d’interface basé uniquement sur des captures d’écran : localiser les éléments interactifs, reconnaître l’absence d’un élément, détecter les défauts visibles de mise en page et mesurer le coût opérationnel d’une réponse.
Six écrans déterministes. Vingt-quatre cibles de repérage. 9 modèles API. Un pilote ciblé, pas un classement.
Résultats du pilote
Ces résultats décrivent une réponse conservée par cas sur un petit corpus synthétique. Ils constituent des indications utiles pour la prochaine édition, et non un classement général des modèles ni des affirmations sur leur stabilité.
Il a atteint les 24 cibles et obtenu le meilleur IoU moyen des boîtes, à 0,771. Il affichait également le coût d’ancrage déclaré le plus faible de cette exécution, à 0,0057 $.
8 modèles sur 9 ont atteint une précision équilibrée de 100 %. Ce volet fonctionne comme un contrôle de cohérence des éléments absents, mais cette version pilote différencie peu la plupart des modèles.
C’était le seul modèle affichant une précision équilibrée de 100 % sur les interfaces propres et défectueuses. Sa précision par catégorie de défaut était de 67 %, ce qui montre que repérer un problème et le nommer précisément sont deux tâches différentes.
Ce que cela signifie pour l’automatisation des tests
L’interaction précise, l’observation continue et l’interprétation sémantique répondent à des exigences de performance différentes. Il ne faut pas s’attendre à ce qu’une seule technique de vision les optimise toutes.
La boucle locale de vision par ordinateur de Repeato peut analyser l’écran à 20 Hz, soit une fois toutes les 50 ms. Une requête à un modèle de vision-langage nécessite généralement 2 à 10 secondes pour le transfert de l’image, l’inférence et l’aller-retour réseau. Cette différence est importante lorsqu’un test doit détecter l’apparition d’un élément, attendre l’arrêt d’un mouvement ou réagir avant la disparition d’un état transitoire.
Les empreintes visuelles locales peuvent rechercher en continu les cibles enregistrées et agir dès que l’écran est prêt. Répéter des appels à distance au modèle à la même fréquence serait irréaliste.
La correspondance locale ne nécessite ni aller-retour réseau, ni disponibilité d’un fournisseur, ni frais d’API par requête. Les écrans restent sur le poste de travail, et le même algorithme peut fonctionner hors ligne.
La vision par LLM justifie sa latence lorsqu’un test nécessite un jugement sémantique : interpréter du texte ou des nombres, comprendre du contenu dynamique ou vérifier des concepts comme une courbe ascendante.
Utilisez la vision par ordinateur locale pour la boucle de contrôle haute fréquence : trouver les cibles, attendre, interagir et comparer visuellement. Faites appel sélectivement à la vision par IA lorsque l’assertion nécessite réellement une compréhension linguistique ou sémantique.
Pilote de repérage
Chaque modèle a reçu 24 cibles interactives réparties sur six écrans propres du pilote. Un point valide selon le schéma à l’intérieur de la cible compte comme une réussite ; l’IoU des boîtes mesure la précision de la localisation. Développez une ligne pour voir les résultats par scénario.
Pilotes de détection
Deux tâches équilibrées vérifient si les modèles peuvent rejeter les éléments d’interface absents et distinguer les contrôles propres des défauts de mise en page introduits. Les résultats restent distincts du repérage.
Six requêtes cibles présentes et six absentes par modèle. Cette série mesure uniquement la classification.
| 100 % valides12/12 cas · 0 tentative échouée | 100% | 100% | 100% | 0% | 1.29 s | $0.3636pour 1 000 cas conservés | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % valides12/12 cas · 0 tentative échouée | 100% | 100% | 100% | 0% | 7.45 s | $0.1414pour 1 000 cas conservés | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % valides12/12 cas · 0 tentative échouée | 100% | 100% | 100% | 0% | 7.55 s | $3.2402pour 1 000 cas conservés | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % valides12/12 cas · 0 tentative échouée | 100% | 100% | 100% | 0% | 7.82 s | $2.3426pour 1 000 cas conservés | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % valides12/12 cas · 0 tentative échouée | 100% | 100% | 100% | 0% | 9.85 s | $7.4788pour 1 000 cas conservés | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % valides12/12 cas · 0 tentative échouée | 100% | 100% | 100% | 0% | 7.50 s | $2.2346pour 1 000 cas conservés | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % valides12/12 cas · 0 tentative échouée | 100% | 100% | 100% | 0% | 9.27 s | $2.9915pour 1 000 cas conservés | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % valides12/12 cas · 0 tentative échouée | 100% | 100% | 100% | 0% | 7.79 s | $7.0680pour 1 000 cas conservés | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % valides12/12 cas · 0 tentative échouée | 92% | 100% | 83% | 17% | 15.01 s | $2.3602pour 1 000 cas conservés | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
Six contrôles propres et six captures d’écran présentant chacune un défaut introduit par modèle. Les échecs de transport restent des échecs opérationnels, et non des réponses de précision.
| 67 % valides12/12 cas · 0 tentative échouée | 58% | 17% | 100% | 0% | 2.44 s | $0.8251pour 1 000 cas conservés | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 92 % valides12/12 cas · 0 tentative échouée | 83% | 67% | 100% | 50% | 8.36 s | $0.2389pour 1 000 cas conservés | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % valides12/12 cas · 0 tentative échouée | 92% | 83% | 100% | 67% | 9.02 s | $5.2075pour 1 000 cas conservés | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 75 % valides12/12 cas · 0 tentative échouée | 75% | 83% | 67% | 67% | 8.43 s | $3.8341pour 1 000 cas conservés | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| Un passage par cas ; aucun intervalle de confiance ni affirmation de stabilité. Le coût total est extrapolé à 1 000 cas conservés afin que les exécutions incomplètes ne paraissent pas artificiellement moins coûteuses. Les lignes comportant moins de 12 réponses reposent sur un échantillon de cas plus réduit et ne sont pas directement comparables aux lignes complètes.12/12 cas · 0 tentative échouée | 83% | 67% | 100% | 67% | 10.15 s | $11.5029pour 1 000 cas conservés | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % valides12/12 cas · 0 tentative échouée | 100% | 100% | 100% | 67% | 7.40 s | $2.7465pour 1 000 cas conservés | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 92 % valides12/12 cas · 0 tentative échouée | 83% | 83% | 83% | 67% | 10.52 s | $4.7403pour 1 000 cas conservés | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 92 % valides12/12 cas · 0 tentative échouée | 92% | 83% | 100% | 67% | 11.91 s | $11.6632pour 1 000 cas conservés | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % valides12/12 cas · 0 tentative échouée | 92% | 100% | 83% | 67% | 21.75 s | $3.0450pour 1 000 cas conservés | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
Un passage par cas ; aucun intervalle de confiance ni affirmation de stabilité. Le coût total est extrapolé à 1 000 cas conservés afin que les exécutions incomplètes ne paraissent pas artificiellement moins coûteuses. Les lignes comportant moins de 12 réponses reposent sur un échantillon de cas plus réduit et ne sont pas directement comparables aux lignes complètes.
Corpus figé
Chaque fixture comporte un contrôle propre et une variante délibérément défectueuse. Les captures utilisent des fenêtres d’affichage fixes, des ressources locales, une géométrie stable des cibles et des seuils exacts de différence entre pixels.












Fiches des modèles
Ouvrez la page d’un modèle pour consulter ses résultats de grounding, de présence d’éléments, de défauts de mise en page, de latence, de fiabilité et de coût. Les routes restent liées au fournisseur amont indiqué, avec les solutions de secours désactivées.
Méthodologie
Le pilote sépare le grounding d’interface, la présence des éléments, la détection des défauts de mise en page visibles et les performances opérationnelles. Il ne les combine pas en un score global.
Contrat d’entrée
Texte de prompt et un PNG en base64 uniquement — sans DOM, arbre d’accessibilité, code source, OCR, outils, plugins ni recherche Web.
Chromium en 1440 × 900 ou 390 × 844 ; facteur d’échelle de l’appareil : 1.
Vérité terrain dérivée du navigateur dans un espace de coordonnées de 0 à 1000.
Les variantes saines et défectueuses préservent la géométrie cible et les hachages des captures.
Volet A
Quatre cibles par capture d’écran, couvrant les types courants d’éléments d’interface actionnables.
Le point de clic prédit se trouve à l’intérieur de la zone cible.
IoU moyenne et part des prédictions avec une IoU ≥ 0,5.
Taux de réponses conformes au schéma ; une seule exécution ne permet pas d’évaluer la stabilité.
Volet B
Une requête dont la présence est avérée et une requête plausible mais absente par écran sain.
L’exactitude équilibrée pondère de manière égale les cas présents et absents.
Le rappel, la spécificité et le taux de faux positifs révèlent la direction des erreurs.
found=true ou found=false ; aucun score de localisation.
Piste C
Des scènes saines et défectueuses appariées couvrent six types objectifs de défaillances de mise en page.
Exactitude équilibrée, rappel, spécificité et taux de faux positifs.
Exactitude de la catégorie de défaut après détection réussie.
IoU de la zone prédite par rapport aux régions de défaut dérivées du navigateur.
Routage et opérations
Identifiants de modèles figés, routes propriétaires, solutions de repli désactivées et un seul contrat de réponse.
Une nouvelle tentative pour une erreur 429, 5xx ou réseau — pas pour les mauvaises réponses.
La latence, les échecs, les nouvelles tentatives et le coût restent distincts de l’exactitude.
Les enregistrements publiés omettent les clés et les identifiants de requête des fournisseurs.
Limites
Six écrans synthétiques, une exécution par cas et 24 cibles ne peuvent pas établir une supériorité ou une stabilité générales.
Chaque édition consigne les identifiants exacts des modèles, la date, les hachages du prompt et du schéma, les contrôles des points de terminaison et les tentatives assainies, car les fournisseurs évoluent.
Reproduire
Les enregistrements bruts des modèles sont assainis. Les clés API, identifiants de requête et identifiants de génération ne sont pas publiés.
Les captures d’écran, annotations, manifestes et résultats agrégés créés par Repeato sont disponibles sous CC BY 4.0. Consultez la l’avis de licence du benchmark . Les sorties brutes des modèles restent soumises aux conditions de leurs fournisseurs.