H Company Holo · Phare · 2026-08-13

Benchmark de vision de Holo3 122B A10B

Performances de Holo3 122B A10B sur les tâches de repérage d’interface à partir de captures d’écran, de présence d’éléments et de détection de défauts visibles de mise en page, pertinentes pour l’automatisation des tests.

Modèle API exactholo3-122b-a10b

Les requêtes ont été envoyées directement via l’API H Company Models, avec la sortie structurée et le raisonnement désactivés. Les solutions de secours étaient désactivées pour chaque requête conservée.

Taux de réussite de l’ancrage92%
IoU moyen des boîtes0.478
Précision de présence100%
Précision de détection des défauts58%

Résultat global

Holo3 122B A10B sur les trois tâches d’interface

Holo3 122B A10B a atteint 22 des 24 cibles d’interface demandées. Sa précision équilibrée était de 100 % pour la présence des éléments et de 58 % pour la détection des défauts de mise en page.

Ce pilote daté a conservé 24 réponses d’ancrage et 24 réponses de détection. Aucune requête de détection n’a échoué. Les résultats décrivent ce modèle API et ce corpus de test précis, et non la qualité générale du modèle ni un produit de chat grand public.

Découvrez le benchmark complet de vision des LLM →

Performances relatives

Position de Holo3 122B A10B parmi les modèles testés

Chaque échelle compare le modèle sélectionné au modèle concurrent le plus fort et au plus faible. Les trois métriques proviennent de la même exécution d’ancrage terminée sur 24 cas ; la valeur la plus élevée est toujours à droite.

IoU des boîtesPlus élevé = meilleur
0.478
Concurrent le plus faible
Claude Sonnet 50.043
Concurrent le plus fort
GPT-5.6 Luna0.771
VitesseUne latence plus faible est préférable
1.68 s
Concurrent le plus faible
Gemini 3.1 Pro Preview11.89 s
Concurrent le plus fort
Grok 4.51.67 s
CoûtUn coût total plus faible est préférable
$0.0126
Concurrent le plus faible
Claude Opus 5$0.2474
Concurrent le plus fort
GPT-5.6 Luna$0.0057
Découvrez le benchmark complet de vision des LLM →

Ancrage d’interface

Holo3 122B A10B peut-il localiser les éléments interactifs ?

Vingt-quatre cibles couvrent six écrans de bureau et mobiles déterministes. Un point conforme au schéma situé à l’intérieur de la cible demandée compte comme une réussite ; l’IoU des boîtes mesure la précision de la localisation.

catalogue commercial bureau / propre / ancrage / ajouter un produitRéussisRéussi0.7573.56 s$0.00071
catalogue commercial bureau / propre / ancrage / rechercheRéussisRéussi0.5721.73 s$0.00070
catalogue commercial bureau / propre / ancrage / requête du catalogueRéussisRéussi0.4631.69 s$0.00072
catalogue commercial bureau / propre / ancrage / filtre de stockRéussisRéussi0.1251.65 s$0.00071
tableau de bord analytique bureau / propre / ancrage / champ de rechercheRéussisRéussi0.4461.66 s$0.00071
tableau de bord analytique bureau / propre / ancrage / bouton de comparaisonRéponse non valideÉchec0.0001.70 s$0.00072
tableau de bord analytique bureau / propre / ancrage / onglet audienceRéussisRéussi0.4121.76 s$0.00072
tableau de bord analytique bureau / propre / ancrage / carte des revenusRéussisRéussi0.3861.63 s$0.00070
contrôle IoT bureau / propre / ancrage / mode automatiqueRéussisRéussi0.2162.51 s$0.00072
contrôle IoT bureau / propre / ancrage / navigation des appareilsRéussisRéussi0.7441.83 s$0.00072
contrôle IoT bureau / propre / ancrage / carte de la pompeRéponse non valideÉchec0.0001.65 s$0.00069
contrôle IoT bureau / propre / ancrage / redémarrer l’appareilRéussisRéussi0.8391.65 s$0.00071
banque iOS / propre / ancrage / virementRéussisRéussi0.8811.44 s$0.00034
banque iOS / propre / ancrage / profilRéussisRéussi0.4591.47 s$0.00035
banque iOS / propre / ancrage / recherche de transactionsRéussisRéussi0.2571.42 s$0.00032
banque iOS / propre / ancrage / masquer le soldeRéussisRéussi0.1811.38 s$0.00031
pass de vol iOS / propre / ancrage / onglet trajetsRéussisRéussi0.2671.43 s$0.00035
pass de vol iOS / propre / ancrage / carte d’embarquementRéussisRéussi0.5771.37 s$0.00031
pass de vol iOS / propre / ancrage / enregistrementRéussisRéussi0.8711.41 s$0.00034
pass de vol iOS / propre / ancrage / onglet ProfilRéussisRéussi0.7371.46 s$0.00037
maison connectée Android / propre / ancrage / carte du thermostatRéussisRéussi0.6871.47 s$0.00033
maison connectée Android / propre / ancrage / ajouter un appareilRéussisRéussi0.8811.47 s$0.00034
maison connectée Android / propre / ancrage / plusRéussisRéussi0.4611.46 s$0.00033
maison connectée Android / propre / ancrage / recherche de pièceRéussisRéussi0.2471.46 s$0.00034

Résultats de détection

Défauts de présence et de mise en page visibles

Des tâches équilibrées distinctes mesurent si le modèle rejette les éléments absents et distingue les contrôles propres des captures d’écran contenant un seul défaut de mise en page introduit.

Le modèle peut-il déterminer quand un élément est absent ?

Six requêtes cibles présentes et six absentes par modèle. Cette série mesure uniquement la classification.

Précision équilibrée100%
Rappel des éléments présents100%
Spécificité des éléments absents100%
Couverture12/12

Le modèle peut-il distinguer les mises en page propres des mises en page défectueuses ?

Six contrôles propres et six captures d’écran présentant chacune un défaut introduit par modèle. Les échecs de transport restent des échecs opérationnels, et non des réponses de précision.

Précision équilibrée58%
Rappel des défauts17%
Spécificité des éléments propres100%
Couverture12/12
IoU de localisation
catalogue e-commerce ordinateur / propre / défaut de mise en pageValideCorrectNon applicable1.87 s$0.00062
catalogue e-commerce ordinateur / défaut / défaut de mise en pageInvalideIncorrectIncorrect0.0004.55 s$0.0018
tableau de bord analytique ordinateur / propre / défaut de mise en pageValideCorrectNon applicable1.42 s$0.00062
tableau de bord analytique ordinateur / défaut / défaut de mise en pageInvalideIncorrectIncorrect0.0004.57 s$0.0018
commande IoT ordinateur / propre / défaut de mise en pageValideCorrectNon applicable1.48 s$0.00063
commande IoT ordinateur / défaut / défaut de mise en pageInvalideIncorrectIncorrect0.0004.42 s$0.0018
application bancaire iOS / propre / défaut de mise en pageValideCorrectNon applicable1.33 s$0.00025
application bancaire iOS / défaut / défaut de mise en pageInvalideIncorrectIncorrect0.0004.32 s$0.0014
pass de vol iOS / propre / défaut de mise en pageValideCorrectNon applicable1.22 s$0.00024
pass de vol iOS / défaut / défaut de mise en pageValideCorrectIncorrect0.0001.69 s$0.00038
maison connectée Android / propre / défaut de mise en pageValideCorrectNon applicable1.28 s$0.00025
maison connectée Android / défaut / défaut de mise en pageValideIncorrectIncorrect0.0001.17 s$0.00025

Pourquoi cette recherche est importante

Utiliser le bon type de vision pour chaque test

Les meilleurs LLM de vision peuvent raisonner sur des concepts visuels complexes, mais ils restent trop lents et coûteux pour chaque étape de test. Cette recherche nous aide à déterminer où leurs capacités sémantiques justifient ce compromis.

01

Évaluation locale rapide

Les propres algorithmes locaux de vision de Repeato gèrent les interactions fréquentes, la mise en correspondance visuelle et les vérifications de régression avec un retour rapide, un comportement prévisible et aucun coût de modèle par requête.

02

Raisonnement sémantique quand nécessaire

Les meilleurs LLM de vision sont utiles pour les questions plus complexes : comprendre le sens, vérifier du contenu dynamique, décrire des défauts ou évaluer des concepts impossibles à capturer avec une simple empreinte visuelle.

03

Une approche hybride fondée sur les preuves

Comparer la précision, la latence, la fiabilité et le coût nous aide à déterminer quelles vérifications doivent rester locales et lesquelles justifient suffisamment l’utilisation d’un LLM pour compenser une évaluation plus lente et plus coûteuse.

Notre stratégie produit

Utiliser la vision par ordinateur locale de Repeato comme base rapide, puis faire appel de manière ciblée aux meilleurs LLM de vision pour les raisonnements complexes ou sémantiques, lorsqu’ils apportent une réelle valeur ajoutée.

Consultez l’intégralité du benchmark de vision →

Couverture des tests

Six écrans, trois types de tâches

Chaque modèle est évalué sur le même corpus figé, avec les mêmes prompts, schémas de réponse et géométrie normalisée de 0 à 1000.

01

Catalogue commercial

Web desktop avec un contrôle intact et un défaut associé de rognage du conteneur.

02

Tableau de bord analytique

Web desktop avec un contrôle intact et un défaut associé de débordement du texte.

03

Centre de contrôle IoT

Web desktop avec un contrôle intact et un défaut associé de chevauchement d’éléments.

FR