Repeato-Forschung · LLM-Vision-Benchmark

Kann man multimodalen LLMs UI-Tests anvertrauen?

Ein ausschließlich auf Screenshots basierender Benchmark für UI-Testautomatisierung: interaktive Elemente finden, das Fehlen eines Elements erkennen, sichtbare Layoutfehler identifizieren und die operativen Kosten einer Antwort erfassen.

Pilotausgabe2026-08-13

Sechs deterministische Screens. Vierundzwanzig Grounding-Ziele. 9 API-Modelle. Ein fokussierter Pilot, kein Ranking.

Screens6
Grounding-Ziele24
Fehlerkategorien6
Modelle9

Erkenntnisse aus dem Pilotprojekt

Was diese Ausgabe zeigt

Diese Erkenntnisse beschreiben pro Fall eine beibehaltene Antwort auf einem kleinen synthetischen Korpus. Sie liefern nützliche Signale für die nächste Ausgabe, sind aber weder allgemeine Modellrankings noch Aussagen zur Stabilität.

01

GPT-5.6 Luna führend bei UI-Grounding

Das Modell erreichte alle 24 Ziele und erzielte mit 0,771 die höchste durchschnittliche Box-IoU. Außerdem hatte es in diesem Durchlauf mit 0,0057 $ die niedrigsten gemeldeten Grounding-Kosten.

02

Elementerkennung nahezu ausgeschöpft

8 von 9 Modellen erreichten eine balancierte Genauigkeit von 100 %. Der Track eignet sich als Plausibilitätsprüfung für fehlende Elemente, unterscheidet in dieser Pilotversion jedoch die meisten Modelle kaum.

03

Grok 4.5 führend bei der Fehlererkennung

Es war das einzige Modell mit einer balancierten Genauigkeit von 100 % bei fehlerfreien und fehlerhaften Layouts. Die Genauigkeit bei Fehlerkategorien lag bei 67 % – ein Problem zu erkennen und es präzise zu benennen, sind unterschiedliche Aufgaben.

Was das für die Testautomatisierung bedeutet

Verwende für jeden Testschritt die passende Art von Vision

Exakte Interaktion, kontinuierliche Beobachtung und semantische Interpretation stellen unterschiedliche Leistungsanforderungen. Es sollte nicht erwartet werden, dass eine einzige Computer-Vision-Technik alle drei Bereiche optimiert.

Lokale BeobachtungBis zu 20-mal pro SekundeLLM-AnfrageOft 2–10 SekundenWie wir lokale Vision und LLMs kombinierenAnalyse einklappen

Die lokale Computer-Vision-Schleife von Repeato kann den Bildschirm mit 20 Hz prüfen – einmal alle 50 ms. Eine Anfrage an ein Vision-Language-Modell benötigt für Bildübertragung, Inferenz und Netzwerk-Roundtrip üblicherweise 2–10 Sekunden. Dieser Unterschied ist entscheidend, wenn ein Test das Erscheinen eines Elements erkennen, auf das Ende einer Bewegung warten oder reagieren muss, bevor ein flüchtiger Zustand verschwindet.

01

Schnelles Feedback bei wiederholten Interaktionen

Lokale visuelle Fingerabdrücke können kontinuierlich nach aufgezeichneten Zielen suchen und handeln, sobald der Bildschirm bereit ist. Remote-Modellanfragen in derselben Frequenz zu wiederholen, wäre unpraktisch.

02

Planbar, privat und kostengünstig

Lokales Matching erfordert weder einen Netzwerk-Roundtrip noch die Verfügbarkeit eines Anbieters und verursacht keine API-Kosten pro Anfrage. Bildschirme bleiben auf dem Arbeitsplatzrechner, und derselbe Algorithmus kann offline ausgeführt werden.

03

KI für Fragen, die Matching nicht beantworten kann

Die LLM-Bildverarbeitung spielt ihre Latenz aus, wenn ein Test eine semantische Beurteilung benötigt: Texte oder Zahlen interpretieren, dynamische Inhalte verstehen oder Konzepte wie einen Aufwärtstrend in einem Diagramm prüfen.

Praktische Aufteilung

Nutze lokale Computer Vision für die hochfrequente Steuerschleife – Ziele finden, warten, interagieren und visuell vergleichen. Wechsle gezielt zu KI-Vision, wenn die Prüfung tatsächlich Sprachverständnis oder semantisches Verständnis erfordert.

Grounding-Pilotprojekt

Kann ein Modell das angeforderte UI-Element finden?

Jedes Modell erhielt 24 interaktive Ziele auf sechs fehlerfreien Pilot-Screens. Ein schema-valider Punkt innerhalb des Ziels zählt als Treffer; Box-IoU misst die Lokalisierungspräzision. Erweitere eine Zeile für Ergebnisse auf Szenarioebene.

Box-IoUHöher ist besser · Skala von 0 bis 1
  1. Holo3 122B A10B0.478
  2. Grok 4.50.445
  3. GPT-5.40.528
  4. Gemini 3.6 Flash0.645
  5. GPT-5.6 Sol0.677
  6. GPT-5.6 Luna0.771
  7. Claude Sonnet 50.043
  8. Claude Opus 50.314
  9. Gemini 3.1 Pro Preview0.632
GesamtkostenNiedriger ist besser · 24 Anfragen
  1. Holo3 122B A10B$0.0126
  2. Grok 4.5$0.0669
  3. GPT-5.4$0.1196
  4. Gemini 3.6 Flash$0.0637
  5. GPT-5.6 Sol$0.2453
  6. GPT-5.6 Luna$0.0057
  7. Claude Sonnet 5$0.0990
  8. Claude Opus 5$0.2474
  9. Gemini 3.1 Pro Preview$0.0726
Mittlere LatenzNiedriger ist besser · pro Anfrage
  1. Holo3 122B A10B1.68 s
  2. Grok 4.51.67 s
  3. GPT-5.42.99 s
  4. Gemini 3.6 Flash1.83 s
  5. GPT-5.6 Sol3.23 s
  6. GPT-5.6 Luna3.55 s
  7. Claude Sonnet 53.91 s
  8. Claude Opus 54.24 s
  9. Gemini 3.1 Pro Preview11.89 s
Abwägung zwischen Genauigkeit, Kosten und LatenzHöher und weiter links ist besser. Die Farbe zeigt die mittlere Antwortlatenz.
1,67 s schnell11,89 s langsam
Better value0.000.250.500.751.00$0.00$0.05$0.10$0.15$0.20$0.25Total cost for 24 requests (USD) →Box IoU →Holo3 122B A10BGrok 4.5GPT-5.4Gemini 3.6 FlashGPT-5.6 SolGPT-5.6 LunaClaude Sonnet 5Claude Opus 5Gemini 3.1 Pro Preview
Ungültige Antwort1 Transport-Wiederholung92 % Treffer0.4781.68 s$0.0126
Bestanden1 Transport-Wiederholung83 % Treffer0.4451.67 s$0.0669
Bestanden1 Transport-Wiederholung75 % Treffer0.5282.99 s$0.1196
Ungültige Antwort1 Transport-Wiederholung79 % Treffer0.6451.83 s$0.0637
Bestanden1 Transport-Wiederholung96 % Treffer0.6773.23 s$0.2453
Bestanden1 Transport-Wiederholung100 % Treffer0.7713.55 s$0.0057
Ungültige Antwort1 Transport-Wiederholung21 % Treffer0.0433.91 s$0.0990
Ungültige Antwort1 Transport-Wiederholung46 % Treffer0.3144.24 s$0.2474
Ungültige Antwort1 Transport-Wiederholung88 % Treffer0.63211.89 s$0.0726

Erkennungspilot

Vorhandensein und sichtbare Fehler

Zwei ausgewogene Aufgaben prüfen, ob Modelle fehlende UI-Elemente ablehnen und fehlerfreie Steuerelemente von absichtlich eingebauten Layoutfehlern unterscheiden können. Die Ergebnisse bleiben vom Grounding getrennt.

Kann das Modell erkennen, wenn ein Element nicht vorhanden ist?

Sechs vorhandene und sechs nicht vorhandene Zielabfragen pro Modell. Dieser Track misst ausschließlich die Klassifizierung.

100 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche100%100%100%0%1.29 s$0.3636pro 1.000 beibehaltene Fälle
100 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche100%100%100%0%7.45 s$0.1414pro 1.000 beibehaltene Fälle
100 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche100%100%100%0%7.55 s$3.2402pro 1.000 beibehaltene Fälle
100 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche100%100%100%0%7.82 s$2.3426pro 1.000 beibehaltene Fälle
100 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche100%100%100%0%9.85 s$7.4788pro 1.000 beibehaltene Fälle
100 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche100%100%100%0%7.50 s$2.2346pro 1.000 beibehaltene Fälle
100 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche100%100%100%0%9.27 s$2.9915pro 1.000 beibehaltene Fälle
100 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche100%100%100%0%7.79 s$7.0680pro 1.000 beibehaltene Fälle
100 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche92%100%83%17%15.01 s$2.3602pro 1.000 beibehaltene Fälle

Kann das Modell zwischen sauberen und fehlerhaften Layouts unterscheiden?

Sechs saubere Steuerelemente und sechs Screenshots mit jeweils einem gezielt eingefügten Fehler pro Modell. Transportfehler bleiben Betriebsfehler und zählen nicht als Genauigkeitsergebnisse.

Abwägung zwischen Fehlergenauigkeit, Kosten und LatenzHöher und weiter links ist besser. Die Farbe zeigt die mittlere Antwortlatenz.
2,44 s schnell21,75 s langsam
Better value0.000.250.500.751.00$0.00$2.40$4.80$7.20$9.60$12.00Cost per 1,000 retained defect cases (USD) →Balanced accuracy →Holo3 122B A10BGPT-5.6 LunaGPT-5.4Gemini 3.6 FlashClaude Opus 5Grok 4.5Claude Sonnet 5GPT-5.6 SolGemini 3.1 Pro Preview
67 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche58%17%100%0%2.44 s$0.8251pro 1.000 beibehaltene Fälle
92 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche83%67%100%50%8.36 s$0.2389pro 1.000 beibehaltene Fälle
100 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche92%83%100%67%9.02 s$5.2075pro 1.000 beibehaltene Fälle
75 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche75%83%67%67%8.43 s$3.8341pro 1.000 beibehaltene Fälle
83 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche83%67%100%67%10.15 s$11.5029pro 1.000 beibehaltene Fälle
100 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche100%100%100%67%7.40 s$2.7465pro 1.000 beibehaltene Fälle
92 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche83%83%83%67%10.52 s$4.7403pro 1.000 beibehaltene Fälle
92 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche92%83%100%67%11.91 s$11.6632pro 1.000 beibehaltene Fälle
100 % gültig12/12 Fälle · 0 fehlgeschlagene Versuche92%100%83%67%21.75 s$3.0450pro 1.000 beibehaltene Fälle

Ein Durchlauf pro Fall; keine Konfidenzintervalle oder Stabilitätsaussagen. Die Gesamtkosten werden auf 1.000 beibehaltene Fälle hochgerechnet, damit unvollständige Durchläufe nicht künstlich günstig erscheinen. Zeilen mit weniger als 12 Antworten enthalten weiterhin eine kleinere Fallauswahl und sind nicht direkt mit vollständigen Zeilen vergleichbar.

Unveränderter Datensatz

Drei Desktop- und drei mobile Bildschirme

Jede Testvorrichtung verfügt über eine fehlerfreie Kontrolle und eine absichtlich fehlerhafte Variante. Die Aufnahmen nutzen feste Viewports, lokale Assets, stabile Zielgeometrie und exakte Grenzen für Pixeldifferenzen.

Commerce-Katalog ohne Fehler
Commerce-Katalog mit Container-Clipping
Commerce-KatalogDesktop-Web · Container-Clipping
Analytics-Dashboard ohne Fehler
Analytics-Dashboard mit Textüberlauf
Analytics-DashboardDesktop-Web · Textüberlauf
IoT-Kontrollzentrum ohne Fehler
IoT-Kontrollzentrum mit Elementüberlappung
IoT-SteuerzentraleDesktop-Web · Elementüberlappung
Mobile-Banking ohne Fehler
Mobile-Banking mit Viewport-Beschnitt
Mobile-BankingiOS-ähnlich · Viewport-Beschnitt
Bordkarte ohne Fehler
Bordkarte mit verdeckter Aktion
BordkarteiOS-ähnlich · Verdeckte Aktion
Smart Home ohne Fehler
Smart Home mit fehlerhaftem responsivem Reflow
Smart HomeAndroid-ähnlich · Fehlerhafter responsiver Reflow

Modelldossiers

Eine Belegseite pro Modell

Öffne eine Modellseite für die Grounding-, Elementvorhandenseins-, Layoutfehler-, Latenz-, Zuverlässigkeits- und Kostenergebnisse. Die Routen bleiben auf den genannten Upstream-Anbieter festgelegt, Fallbacks sind deaktiviert.

Methodik

Messen, was das Modell tatsächlich sieht

Der Pilot trennt UI-Grounding, Elementvorhandensein, Erkennung sichtbarer Layoutfehler und Betriebsleistung. Diese werden nicht zu einer Gesamtbewertung kombiniert.

EingabeNur Screenshot
Geometrie0–1000
DurchläufeEiner pro Fall
BewertungSeparate Metriken

Eingabevertrag

Nur Screenshot

Prompttext plus ein Base64-PNG – kein DOM, kein Barrierefreiheitsbaum, kein Quelltext, keine OCR, Tools, Plugins oder Websuche.

01

Festes Rendering

Chromium mit 1440 × 900 oder 390 × 844; Geräte-Skalierungsfaktor 1.

02

Normalisierte Geometrie

Browserbasierte Ground Truth in einem Koordinatenraum von 0–1000.

03

Stabile Paare

Fehlerfreie und fehlerhafte Varianten bewahren die Zielgeometrie und Capture-Hashes.

Track A

Verankerung von UI-Elementen

Vier Ziele pro Screenshot aus gängigen interaktiven UI-Elementtypen.

Punktgenauigkeit

Der vorhergesagte Klickpunkt liegt innerhalb der Zielbox.

Boxgenauigkeit

Mittlere IoU und Anteil der Vorhersagen mit IoU ≥ 0,5.

Gültigkeit

Rate schema-valider Antworten; ein Durchlauf ergibt keinen Stabilitätswert.

Track B

Vorhandensein von Elementen

Pro fehlerfreiem Bildschirm eine bekanntermaßen vorhandene und eine plausible, aber nicht vorhandene Abfrage.

Erkennung

Die ausgewogene Genauigkeit gewichtet vorhandene und nicht vorhandene Fälle gleich.

Klassenverhalten

Recall, Spezifität und Falsch-Positiv-Rate zeigen die Fehler­richtung.

Nur boolesch

found=true oder found=false; kein Lokalisierungswert.

Track C

Sichtbare Layoutfehler

Gepaarte fehlerfreie und fehlerhafte Szenen decken sechs objektive Arten von Layout-Fehlern ab.

Erkennung

Ausgewogene Genauigkeit, Recall, Spezifität und Falsch-Positiv-Rate.

Klassifizierung

Genauigkeit der Fehlerkategorie nach erfolgreicher Erkennung.

Lokalisierung

IoU der vorhergesagten Box im Vergleich zu browserbasierten Fehlerregionen.

Routing und Betrieb

Anbieter-Verhalten sichtbar halten

Fixierte Modell-IDs, First-Party-Routen, deaktivierte Fallbacks und ein Antwortvertrag.

Wiederholungsrichtlinie

Ein Wiederholungsversuch bei 429, 5xx oder Netzwerkfehlern – nicht bei falschen Antworten.

Betriebsmetriken

Latenz, Fehler, Wiederholungsversuche und Kosten bleiben von der Genauigkeit getrennt.

Datenschutz

Veröffentlichte Datensätze enthalten weder Schlüssel noch Anfragekennungen der Anbieter.

Grenzen

Ein Pilot, keine Rangliste

Sechs synthetische Bildschirme, ein Durchlauf pro Fall und 24 Ziele können keine breite Überlegenheit oder Stabilität belegen.

Jede Ausgabe erfasst exakte Modell-IDs, Datum, Hashes von Prompt und Schema, Endpunktkontrollen sowie bereinigte Versuche, da Anbieter Änderungen vornehmen.

Reproduzieren

Belege prüfen

Rohe Modelldatensätze werden bereinigt. API-Schlüssel, Anfrage-IDs und Generierungs-IDs werden nicht veröffentlicht.

Von Repeato erstellte Screenshots, Annotationen, Manifeste und aggregierte Ergebnisse sind verfügbar unter CC BY 4.0. Siehe die Hinweis zur Benchmark-Lizenz. Rohe Modellausgaben unterliegen weiterhin den Bedingungen ihrer Anbieter.

DE