Anthropic Claude · Effizient · 2026-08-13

Vision-Benchmark für Claude Sonnet 5

So schnitt Claude Sonnet 5 bei screenshotbasierten UI-Grounding-Aufgaben, Prüfungen des Elementvorhandenseins und der Erkennung sichtbarer Layoutfehler ab, die für die Testautomatisierung relevant sind.

Exaktes API-Modellanthropic/claude-sonnet-5

Die Anfragen wurden über OpenRouter an die Anthropic-Infrastruktur gebunden. Fallbacks waren für jede gespeicherte Anfrage deaktiviert.

Trefferquote beim Grounding21%
Mittlere Box-IoU0.043
Genauigkeit beim Vorhandensein100%
Genauigkeit bei Fehlern83%

Gesamtergebnis

Claude Sonnet 5 bei allen drei UI-Aufgaben

Claude Sonnet 5 traf 5 von 24 angeforderten UI-Zielen. Die ausgewogene Genauigkeit betrug 100 % beim Elementvorhandensein und 83 % bei der Erkennung von Layoutfehlern.

Dieser zeitlich begrenzte Pilotversuch umfasste 24 Grounding- und 24 Erkennungsantworten. Keine Erkennungsanfrage schlug fehl. Die Ergebnisse beschreiben dieses konkrete API-Modell und den Testkorpus, nicht die allgemeine Modellqualität oder ein Consumer-Chat-Produkt.

Den vollständigen LLM-Vision-Benchmark ansehen →

Relative Leistung

Position von Claude Sonnet 5 unter den getesteten Modellen

Jede Skala vergleicht das ausgewählte Modell mit dem stärksten und schwächsten anderen Modell. Alle drei Kennzahlen stammen aus demselben abgeschlossenen Grounding-Lauf mit 24 Fällen; stärker ist immer weiter rechts.

Box-IoUHöher ist stärker
0.043
Schwächstes anderes Modell
Claude Opus 50.314
Stärkstes anderes Modell
GPT-5.6 Luna0.771
GeschwindigkeitGeringere Latenz ist besser
3.91 s
Schwächstes anderes Modell
Gemini 3.1 Pro Preview11.89 s
Stärkstes anderes Modell
Grok 4.51.67 s
KostenGeringere Gesamtkosten sind besser
$0.0990
Schwächstes anderes Modell
Claude Opus 5$0.2474
Stärkstes anderes Modell
GPT-5.6 Luna$0.0057
Den vollständigen LLM-Vision-Benchmark ansehen →

UI-Verankerung

Kann Claude Sonnet 5 bedienbare Elemente lokalisieren?

24 Ziele erstrecken sich über sechs deterministische Desktop- und Mobilbildschirme. Ein schema-valider Punkt innerhalb des angeforderten Ziels zählt als Treffer; die Box-IoU misst die Lokalisierungspräzision.

commerce catalog desktop / clean / grounding / add productUngültige AntwortKein Treffer0.0005.52 s$0.0054
commerce catalog desktop / clean / grounding / searchUngültige AntwortKein Treffer0.0004.32 s$0.0054
commerce catalog desktop / clean / grounding / catalog queryBestandenKein Treffer0.0003.58 s$0.0054
commerce catalog desktop / clean / grounding / stock filterBestandenKein Treffer0.0003.76 s$0.0054
Analytics-Dashboard Desktop / sauber / Grounding / SuchfeldBestandenKein Treffer0.0003.64 s$0.0054
analytics dashboard desktop / clean / grounding / compare toggleBestandenKein Treffer0.0003.93 s$0.0054
analytics dashboard desktop / clean / grounding / audience tabBestandenTreffer0.1843.71 s$0.0054
analytics dashboard desktop / clean / grounding / revenue cardBestandenTreffer0.3263.35 s$0.0054
iot control desktop / clean / grounding / auto modeBestandenKein Treffer0.0003.58 s$0.0054
iot control desktop / clean / grounding / devices navBestandenTreffer0.3663.61 s$0.0054
iot control desktop / clean / grounding / pump cardUngültige AntwortKein Treffer0.0003.69 s$0.0054
iot control desktop / clean / grounding / restart deviceUngültige AntwortKein Treffer0.0004.20 s$0.0054
banking ios / clean / grounding / transferBestandenKein Treffer0.0002.96 s$0.0028
banking ios / clean / grounding / profileBestandenKein Treffer0.0003.67 s$0.0028
banking ios / clean / grounding / transaction searchBestandenTreffer0.0734.07 s$0.0028
banking ios / clean / grounding / hide balanceBestandenKein Treffer0.0003.62 s$0.0028
flight pass ios / clean / grounding / trips tabBestandenKein Treffer0.0003.97 s$0.0028
flight pass ios / clean / grounding / boarding passBestandenKein Treffer0.0005.43 s$0.0029
flight pass ios / clean / grounding / check inBestandenKein Treffer0.0003.63 s$0.0028
Flight Pass iOS / sauber / Grounding / Profil-TabBestandenKein Treffer0.0004.13 s$0.0028
Smart Home Android / sauber / Grounding / ThermostatkarteBestandenKein Treffer0.0003.60 s$0.0028
Smart Home Android / sauber / Grounding / Gerät hinzufügenBestandenKein Treffer0.0004.27 s$0.0028
Smart Home Android / sauber / Grounding / MehrBestandenKein Treffer0.0003.98 s$0.0028
Smart Home Android / sauber / Grounding / Raum suchenBestandenTreffer0.0883.55 s$0.0028

Erkennungsergebnisse

Vorhandensein und sichtbare Layoutfehler

Separate balancierte Aufgaben messen, ob das Modell nicht vorhandene Elemente zurückweist und saubere Steuerelemente von Screenshots mit einem gezielt eingefügten Layoutfehler unterscheidet.

Kann das Modell erkennen, wenn ein Element nicht vorhanden ist?

Sechs vorhandene und sechs nicht vorhandene Zielabfragen pro Modell. Dieser Track misst ausschließlich die Klassifizierung.

Balancierte Genauigkeit100%
Recall für vorhandene Elemente100%
Spezifität für nicht vorhandene Elemente100%
Abdeckung12/12
Erwartet
Commerce-Katalog Desktop / sauber / Elementvorhandensein / vorhandenGültigRichtigVorhandenVorhanden6.60 s$0.0043
Commerce-Katalog Desktop / sauber / Elementvorhandensein / nicht vorhandenGültigRichtigNicht vorhandenNicht vorhanden7.77 s$0.0043
Analytics-Dashboard Desktop / sauber / Elementvorhandensein / vorhandenGültigRichtigVorhandenVorhanden9.99 s$0.0043
Analytics-Dashboard Desktop / sauber / Elementvorhandensein / nicht vorhandenGültigRichtigNicht vorhandenNicht vorhanden12.36 s$0.0043
IoT-Steuerung Desktop / sauber / Elementvorhandensein / vorhandenGültigRichtigVorhandenVorhanden10.46 s$0.0043
IoT-Steuerung Desktop / sauber / Elementvorhandensein / nicht vorhandenGültigRichtigNicht vorhandenNicht vorhanden9.33 s$0.0043
Banking iOS / sauber / Element vorhanden / vorhandenGültigRichtigVorhandenVorhanden10.32 s$0.0017
Banking iOS / sauber / Element vorhanden / nicht vorhandenGültigRichtigNicht vorhandenNicht vorhanden6.23 s$0.0017
Flugpass iOS / sauber / Element vorhanden / vorhandenGültigRichtigVorhandenVorhanden10.02 s$0.0017
Flugpass iOS / sauber / Element vorhanden / nicht vorhandenGültigRichtigNicht vorhandenNicht vorhanden10.54 s$0.0017
Smart Home Android / sauber / Element vorhanden / vorhandenGültigRichtigVorhandenVorhanden8.79 s$0.0017
Smart Home Android / sauber / Element vorhanden / nicht vorhandenGültigRichtigNicht vorhandenNicht vorhanden8.85 s$0.0017

Kann das Modell zwischen sauberen und fehlerhaften Layouts unterscheiden?

Sechs saubere Steuerelemente und sechs Screenshots mit jeweils einem gezielt eingefügten Fehler pro Modell. Transportfehler bleiben Betriebsfehler und zählen nicht als Genauigkeitsergebnisse.

Balancierte Genauigkeit83%
Fehlererkennung83%
Spezifität bei sauberen Layouts83%
Abdeckung12/12
Lokalisierungs-IoU
Commerce-Katalog Desktop / sauber / LayoutfehlerGültigRichtigNicht zutreffend12.13 s$0.0059
Commerce-Katalog Desktop / Fehler / LayoutfehlerGültigRichtigRichtig0.22511.34 s$0.0062
Analytics-Dashboard Desktop / sauber / LayoutfehlerGültigRichtigNicht zutreffend8.67 s$0.0060
Analytics-Dashboard Desktop / Fehler / LayoutfehlerGültigRichtigRichtig0.12811.24 s$0.0061
IoT-Steuerung Desktop / sauber / LayoutfehlerGültigRichtigNicht zutreffend9.57 s$0.0059
IoT-Steuerung Desktop / Fehler / LayoutfehlerGültigRichtigRichtig0.07110.76 s$0.0062
Banking iOS / sauber / LayoutfehlerGültigFalschNicht zutreffend10.25 s$0.0035
Banking iOS / Fehler / LayoutfehlerGültigRichtigRichtig0.00010.58 s$0.0036
Flugpass iOS / sauber / LayoutfehlerGültigRichtigNicht zutreffend10.54 s$0.0030
Flugpass iOS / Fehler / LayoutfehlerGültigRichtigFalsch0.00010.05 s$0.0035
Smart Home Android / sauber / LayoutfehlerGültigRichtigNicht zutreffend10.28 s$0.0031
Smart Home Android / Fehler / LayoutfehlerUngültigFalschFalsch0.00010.87 s$0.0037

Warum diese Forschung wichtig ist

Für jeden Test die richtige Art von Computer Vision verwenden

Moderne Vision-LLMs können komplexe visuelle Bedeutungen erfassen, sind aber für jeden Testschritt noch zu langsam und teuer. Diese Forschung hilft uns zu erkennen, wann ihre semantischen Fähigkeiten diesen Kompromiss rechtfertigen.

01

Schnelle lokale Auswertung

Die lokalen Vision-Algorithmen von Repeato übernehmen häufige Interaktionen, visuellen Abgleich und Regressionstests mit schnellem Feedback, vorhersehbarem Verhalten und ohne Kosten pro Modellanfrage.

02

Semantisches Schlussfolgern bei Bedarf

Moderne Vision-LLMs sind bei komplexeren Fragen hilfreich: beim Verstehen von Bedeutungen, Prüfen dynamischer Inhalte, Beschreiben von Fehlern oder Bewerten von Konzepten, die sich nicht durch einen einfachen visuellen Fingerabdruck erfassen lassen.

03

Ein evidenzbasierter Hybridansatz

Der Vergleich von Genauigkeit, Latenz, Zuverlässigkeit und Kosten hilft uns zu entscheiden, welche Prüfungen lokal bleiben sollten und welche ausreichend von einem LLM profitieren, um eine langsamere und teurere Auswertung zu rechtfertigen.

Unsere Produktstrategie

Repeatos lokale Computer Vision als schnelles Fundament nutzen und moderne Vision-LLMs gezielt für komplexe oder semantische Schlussfolgerungen einsetzen, wenn sie einen spürbaren zusätzlichen Nutzen bieten.

Den gesamten Vision-Benchmark ansehen →

Testabdeckung

Sechs Bildschirme, drei Aufgabentypen

Jedes Modell wird anhand desselben eingefrorenen Korpus, derselben Prompts und Antwortschemata sowie einer normalisierten Geometrie von 0–1000 bewertet.

01

Commerce-Katalog

Desktop-Web mit einem sauberen Steuerelement und einem zugehörigen Fehler durch abgeschnittenen Containerinhalt.

02

Analytics-Dashboard

Desktop-Web mit einem sauberen Steuerelement und einem zugehörigen Fehler durch überlaufenden Text.

03

IoT-Steuerzentrale

Desktop-Web mit einem sauberen Steuerelement und einem zugehörigen Fehler durch überlappende Elemente.

DE