Schnelle lokale Auswertung
Die lokalen Vision-Algorithmen von Repeato übernehmen häufige Interaktionen, visuellen Abgleich und Regressionstests mit schnellem Feedback, vorhersehbarem Verhalten und ohne Kosten pro Modellanfrage.
Google Gemini · Spitzenmodell · 2026-08-13
So hat Gemini 3.1 Pro Preview bei screenshotbasierten Aufgaben zu UI-Grounding, Elementpräsenz und sichtbaren Layoutfehlern für die Testautomatisierung abgeschnitten.
Die Anfragen wurden über OpenRouter an die Infrastruktur von Google AI Studio gebunden. Fallbacks waren für jede gespeicherte Anfrage deaktiviert.
Gesamtergebnis
Gemini 3.1 Pro Preview traf 21 von 24 angeforderten UI-Zielen. Die ausgewogene Genauigkeit betrug 92 % bei der Elementpräsenz und 92 % bei der Erkennung von Layoutfehlern.
Dieser zeitlich begrenzte Pilotversuch umfasste 24 Grounding- und 24 Erkennungsantworten. Keine Erkennungsanfrage schlug fehl. Die Ergebnisse beschreiben dieses konkrete API-Modell und den Testkorpus, nicht die allgemeine Modellqualität oder ein Consumer-Chat-Produkt.
Relative Leistung
Jede Skala vergleicht das ausgewählte Modell mit dem stärksten und schwächsten anderen Modell. Alle drei Kennzahlen stammen aus demselben abgeschlossenen Grounding-Lauf mit 24 Fällen; stärker ist immer weiter rechts.
UI-Verankerung
24 Ziele erstrecken sich über sechs deterministische Desktop- und Mobilbildschirme. Ein schema-valider Punkt innerhalb des angeforderten Ziels zählt als Treffer; die Box-IoU misst die Lokalisierungspräzision.
Erkennungsergebnisse
Separate balancierte Aufgaben messen, ob das Modell nicht vorhandene Elemente zurückweist und saubere Steuerelemente von Screenshots mit einem gezielt eingefügten Layoutfehler unterscheidet.
Sechs vorhandene und sechs nicht vorhandene Zielabfragen pro Modell. Dieser Track misst ausschließlich die Klassifizierung.
Sechs saubere Steuerelemente und sechs Screenshots mit jeweils einem gezielt eingefügten Fehler pro Modell. Transportfehler bleiben Betriebsfehler und zählen nicht als Genauigkeitsergebnisse.
Warum diese Forschung wichtig ist
Moderne Vision-LLMs können komplexe visuelle Bedeutungen erfassen, sind aber für jeden Testschritt noch zu langsam und teuer. Diese Forschung hilft uns zu erkennen, wann ihre semantischen Fähigkeiten diesen Kompromiss rechtfertigen.
Die lokalen Vision-Algorithmen von Repeato übernehmen häufige Interaktionen, visuellen Abgleich und Regressionstests mit schnellem Feedback, vorhersehbarem Verhalten und ohne Kosten pro Modellanfrage.
Moderne Vision-LLMs sind bei komplexeren Fragen hilfreich: beim Verstehen von Bedeutungen, Prüfen dynamischer Inhalte, Beschreiben von Fehlern oder Bewerten von Konzepten, die sich nicht durch einen einfachen visuellen Fingerabdruck erfassen lassen.
Der Vergleich von Genauigkeit, Latenz, Zuverlässigkeit und Kosten hilft uns zu entscheiden, welche Prüfungen lokal bleiben sollten und welche ausreichend von einem LLM profitieren, um eine langsamere und teurere Auswertung zu rechtfertigen.
Repeatos lokale Computer Vision als schnelles Fundament nutzen und moderne Vision-LLMs gezielt für komplexe oder semantische Schlussfolgerungen einsetzen, wenn sie einen spürbaren zusätzlichen Nutzen bieten.
Testabdeckung
Jedes Modell wird anhand desselben eingefrorenen Korpus, derselben Prompts und Antwortschemata sowie einer normalisierten Geometrie von 0–1000 bewertet.
Desktop-Web mit einem sauberen Steuerelement und einem zugehörigen Fehler durch abgeschnittenen Containerinhalt.
Desktop-Web mit einem sauberen Steuerelement und einem zugehörigen Fehler durch überlaufenden Text.
Desktop-Web mit einem sauberen Steuerelement und einem zugehörigen Fehler durch überlappende Elemente.