GPT-5.6 Luna führend bei UI-Grounding
Das Modell erreichte alle 24 Ziele und erzielte mit 0,771 die höchste durchschnittliche Box-IoU. Außerdem hatte es in diesem Durchlauf mit 0,0057 $ die niedrigsten gemeldeten Grounding-Kosten.
Repeato-Forschung · LLM-Vision-Benchmark
Ein ausschließlich auf Screenshots basierender Benchmark für UI-Testautomatisierung: interaktive Elemente finden, das Fehlen eines Elements erkennen, sichtbare Layoutfehler identifizieren und die operativen Kosten einer Antwort erfassen.
Sechs deterministische Screens. Vierundzwanzig Grounding-Ziele. 9 API-Modelle. Ein fokussierter Pilot, kein Ranking.
Erkenntnisse aus dem Pilotprojekt
Diese Erkenntnisse beschreiben pro Fall eine beibehaltene Antwort auf einem kleinen synthetischen Korpus. Sie liefern nützliche Signale für die nächste Ausgabe, sind aber weder allgemeine Modellrankings noch Aussagen zur Stabilität.
Das Modell erreichte alle 24 Ziele und erzielte mit 0,771 die höchste durchschnittliche Box-IoU. Außerdem hatte es in diesem Durchlauf mit 0,0057 $ die niedrigsten gemeldeten Grounding-Kosten.
8 von 9 Modellen erreichten eine balancierte Genauigkeit von 100 %. Der Track eignet sich als Plausibilitätsprüfung für fehlende Elemente, unterscheidet in dieser Pilotversion jedoch die meisten Modelle kaum.
Es war das einzige Modell mit einer balancierten Genauigkeit von 100 % bei fehlerfreien und fehlerhaften Layouts. Die Genauigkeit bei Fehlerkategorien lag bei 67 % – ein Problem zu erkennen und es präzise zu benennen, sind unterschiedliche Aufgaben.
Was das für die Testautomatisierung bedeutet
Exakte Interaktion, kontinuierliche Beobachtung und semantische Interpretation stellen unterschiedliche Leistungsanforderungen. Es sollte nicht erwartet werden, dass eine einzige Computer-Vision-Technik alle drei Bereiche optimiert.
Die lokale Computer-Vision-Schleife von Repeato kann den Bildschirm mit 20 Hz prüfen – einmal alle 50 ms. Eine Anfrage an ein Vision-Language-Modell benötigt für Bildübertragung, Inferenz und Netzwerk-Roundtrip üblicherweise 2–10 Sekunden. Dieser Unterschied ist entscheidend, wenn ein Test das Erscheinen eines Elements erkennen, auf das Ende einer Bewegung warten oder reagieren muss, bevor ein flüchtiger Zustand verschwindet.
Lokale visuelle Fingerabdrücke können kontinuierlich nach aufgezeichneten Zielen suchen und handeln, sobald der Bildschirm bereit ist. Remote-Modellanfragen in derselben Frequenz zu wiederholen, wäre unpraktisch.
Lokales Matching erfordert weder einen Netzwerk-Roundtrip noch die Verfügbarkeit eines Anbieters und verursacht keine API-Kosten pro Anfrage. Bildschirme bleiben auf dem Arbeitsplatzrechner, und derselbe Algorithmus kann offline ausgeführt werden.
Die LLM-Bildverarbeitung spielt ihre Latenz aus, wenn ein Test eine semantische Beurteilung benötigt: Texte oder Zahlen interpretieren, dynamische Inhalte verstehen oder Konzepte wie einen Aufwärtstrend in einem Diagramm prüfen.
Nutze lokale Computer Vision für die hochfrequente Steuerschleife – Ziele finden, warten, interagieren und visuell vergleichen. Wechsle gezielt zu KI-Vision, wenn die Prüfung tatsächlich Sprachverständnis oder semantisches Verständnis erfordert.
Grounding-Pilotprojekt
Jedes Modell erhielt 24 interaktive Ziele auf sechs fehlerfreien Pilot-Screens. Ein schema-valider Punkt innerhalb des Ziels zählt als Treffer; Box-IoU misst die Lokalisierungspräzision. Erweitere eine Zeile für Ergebnisse auf Szenarioebene.
Erkennungspilot
Zwei ausgewogene Aufgaben prüfen, ob Modelle fehlende UI-Elemente ablehnen und fehlerfreie Steuerelemente von absichtlich eingebauten Layoutfehlern unterscheiden können. Die Ergebnisse bleiben vom Grounding getrennt.
Sechs vorhandene und sechs nicht vorhandene Zielabfragen pro Modell. Dieser Track misst ausschließlich die Klassifizierung.
| 100 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche | 100% | 100% | 100% | 0% | 1.29 s | $0.3636pro 1.000 beibehaltene Fälle | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche | 100% | 100% | 100% | 0% | 7.45 s | $0.1414pro 1.000 beibehaltene Fälle | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche | 100% | 100% | 100% | 0% | 7.55 s | $3.2402pro 1.000 beibehaltene Fälle | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche | 100% | 100% | 100% | 0% | 7.82 s | $2.3426pro 1.000 beibehaltene Fälle | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche | 100% | 100% | 100% | 0% | 9.85 s | $7.4788pro 1.000 beibehaltene Fälle | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche | 100% | 100% | 100% | 0% | 7.50 s | $2.2346pro 1.000 beibehaltene Fälle | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche | 100% | 100% | 100% | 0% | 9.27 s | $2.9915pro 1.000 beibehaltene Fälle | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche | 100% | 100% | 100% | 0% | 7.79 s | $7.0680pro 1.000 beibehaltene Fälle | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche | 92% | 100% | 83% | 17% | 15.01 s | $2.3602pro 1.000 beibehaltene Fälle | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
Sechs saubere Steuerelemente und sechs Screenshots mit jeweils einem gezielt eingefügten Fehler pro Modell. Transportfehler bleiben Betriebsfehler und zählen nicht als Genauigkeitsergebnisse.
| 67 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche | 58% | 17% | 100% | 0% | 2.44 s | $0.8251pro 1.000 beibehaltene Fälle | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 92 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche | 83% | 67% | 100% | 50% | 8.36 s | $0.2389pro 1.000 beibehaltene Fälle | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche | 92% | 83% | 100% | 67% | 9.02 s | $5.2075pro 1.000 beibehaltene Fälle | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 75 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche | 75% | 83% | 67% | 67% | 8.43 s | $3.8341pro 1.000 beibehaltene Fälle | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 83 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche | 83% | 67% | 100% | 67% | 10.15 s | $11.5029pro 1.000 beibehaltene Fälle | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche | 100% | 100% | 100% | 67% | 7.40 s | $2.7465pro 1.000 beibehaltene Fälle | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 92 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche | 83% | 83% | 83% | 67% | 10.52 s | $4.7403pro 1.000 beibehaltene Fälle | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 92 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche | 92% | 83% | 100% | 67% | 11.91 s | $11.6632pro 1.000 beibehaltene Fälle | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| 100 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche | 92% | 100% | 83% | 67% | 21.75 s | $3.0450pro 1.000 beibehaltene Fälle | |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
| |||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
Ein Durchlauf pro Fall; keine Konfidenzintervalle oder Stabilitätsaussagen. Die Gesamtkosten werden auf 1.000 beibehaltene Fälle hochgerechnet, damit unvollständige Durchläufe nicht künstlich günstig erscheinen. Zeilen mit weniger als 12 Antworten enthalten weiterhin eine kleinere Fallauswahl und sind nicht direkt mit vollständigen Zeilen vergleichbar.
Unveränderter Datensatz
Jede Testvorrichtung verfügt über eine fehlerfreie Kontrolle und eine absichtlich fehlerhafte Variante. Die Aufnahmen nutzen feste Viewports, lokale Assets, stabile Zielgeometrie und exakte Grenzen für Pixeldifferenzen.












Modelldossiers
Öffne eine Modellseite für die Grounding-, Elementvorhandenseins-, Layoutfehler-, Latenz-, Zuverlässigkeits- und Kostenergebnisse. Die Routen bleiben auf den genannten Upstream-Anbieter festgelegt, Fallbacks sind deaktiviert.
Methodik
Der Pilot trennt UI-Grounding, Elementvorhandensein, Erkennung sichtbarer Layoutfehler und Betriebsleistung. Diese werden nicht zu einer Gesamtbewertung kombiniert.
Eingabevertrag
Prompttext plus ein Base64-PNG – kein DOM, kein Barrierefreiheitsbaum, kein Quelltext, keine OCR, Tools, Plugins oder Websuche.
Chromium mit 1440 × 900 oder 390 × 844; Geräte-Skalierungsfaktor 1.
Browserbasierte Ground Truth in einem Koordinatenraum von 0–1000.
Fehlerfreie und fehlerhafte Varianten bewahren die Zielgeometrie und Capture-Hashes.
Track A
Vier Ziele pro Screenshot aus gängigen interaktiven UI-Elementtypen.
Der vorhergesagte Klickpunkt liegt innerhalb der Zielbox.
Mittlere IoU und Anteil der Vorhersagen mit IoU ≥ 0,5.
Rate schema-valider Antworten; ein Durchlauf ergibt keinen Stabilitätswert.
Track B
Pro fehlerfreiem Bildschirm eine bekanntermaßen vorhandene und eine plausible, aber nicht vorhandene Abfrage.
Die ausgewogene Genauigkeit gewichtet vorhandene und nicht vorhandene Fälle gleich.
Recall, Spezifität und Falsch-Positiv-Rate zeigen die Fehlerrichtung.
found=true oder found=false; kein Lokalisierungswert.
Track C
Gepaarte fehlerfreie und fehlerhafte Szenen decken sechs objektive Arten von Layout-Fehlern ab.
Ausgewogene Genauigkeit, Recall, Spezifität und Falsch-Positiv-Rate.
Genauigkeit der Fehlerkategorie nach erfolgreicher Erkennung.
IoU der vorhergesagten Box im Vergleich zu browserbasierten Fehlerregionen.
Routing und Betrieb
Fixierte Modell-IDs, First-Party-Routen, deaktivierte Fallbacks und ein Antwortvertrag.
Ein Wiederholungsversuch bei 429, 5xx oder Netzwerkfehlern – nicht bei falschen Antworten.
Latenz, Fehler, Wiederholungsversuche und Kosten bleiben von der Genauigkeit getrennt.
Veröffentlichte Datensätze enthalten weder Schlüssel noch Anfragekennungen der Anbieter.
Grenzen
Sechs synthetische Bildschirme, ein Durchlauf pro Fall und 24 Ziele können keine breite Überlegenheit oder Stabilität belegen.
Jede Ausgabe erfasst exakte Modell-IDs, Datum, Hashes von Prompt und Schema, Endpunktkontrollen sowie bereinigte Versuche, da Anbieter Änderungen vornehmen.
Reproduzieren
Rohe Modelldatensätze werden bereinigt. API-Schlüssel, Anfrage-IDs und Generierungs-IDs werden nicht veröffentlicht.
Von Repeato erstellte Screenshots, Annotationen, Manifeste und aggregierte Ergebnisse sind verfügbar unter CC BY 4.0. Siehe die Hinweis zur Benchmark-Lizenz. Rohe Modellausgaben unterliegen weiterhin den Bedingungen ihrer Anbieter.