Performances de GPT-5.6 Luna sur les tâches d’ancrage d’interface, de présence d’éléments et de détection de défauts de mise en page visibles, pertinentes pour l’automatisation des tests.
Modèle API exactopenai/gpt-5.6-luna
Les requêtes étaient limitées à l’infrastructure OpenAI via OpenRouter. Les solutions de secours étaient désactivées pour chaque requête conservée.
GPT-5.6 Luna a trouvé 24 des 24 cibles d’interface demandées. Sa précision équilibrée était de 100 % pour la présence d’éléments et de 83 % pour la détection de défauts de mise en page.
Ce pilote daté a conservé 24 réponses d’ancrage et 24 réponses de détection. Aucune requête de détection n’a échoué. Les résultats décrivent ce modèle API et ce corpus de test précis, et non la qualité générale du modèle ni un produit de chat grand public.
Chaque échelle compare le modèle sélectionné au modèle concurrent le plus fort et au plus faible. Les trois métriques proviennent de la même exécution d’ancrage terminée sur 24 cas ; la valeur la plus élevée est toujours à droite.
GPT-5.6 Luna peut-il localiser les éléments actionnables ?
Vingt-quatre cibles couvrent six écrans de bureau et mobiles déterministes. Un point conforme au schéma situé à l’intérieur de la cible demandée compte comme une réussite ; l’IoU des boîtes mesure la précision de la localisation.
Des tâches équilibrées distinctes mesurent si le modèle rejette les éléments absents et distingue les contrôles propres des captures d’écran contenant un seul défaut de mise en page introduit.
Le modèle peut-il déterminer quand un élément est absent ?
Six requêtes cibles présentes et six absentes par modèle. Cette série mesure uniquement la classification.
Le modèle peut-il distinguer les mises en page propres des mises en page défectueuses ?
Six contrôles propres et six captures d’écran présentant chacune un défaut introduit par modèle. Les échecs de transport restent des échecs opérationnels, et non des réponses de précision.
Les meilleurs LLM de vision peuvent raisonner sur des concepts visuels complexes, mais ils restent trop lents et coûteux pour chaque étape de test. Cette recherche nous aide à déterminer où leurs capacités sémantiques justifient ce compromis.
01
Évaluation locale rapide
Les propres algorithmes locaux de vision de Repeato gèrent les interactions fréquentes, la mise en correspondance visuelle et les vérifications de régression avec un retour rapide, un comportement prévisible et aucun coût de modèle par requête.
02
Raisonnement sémantique quand nécessaire
Les meilleurs LLM de vision sont utiles pour les questions plus complexes : comprendre le sens, vérifier du contenu dynamique, décrire des défauts ou évaluer des concepts impossibles à capturer avec une simple empreinte visuelle.
03
Une approche hybride fondée sur les preuves
Comparer la précision, la latence, la fiabilité et le coût nous aide à déterminer quelles vérifications doivent rester locales et lesquelles justifient suffisamment l’utilisation d’un LLM pour compenser une évaluation plus lente et plus coûteuse.
Notre stratégie produit
Utiliser la vision par ordinateur locale de Repeato comme base rapide, puis faire appel de manière ciblée aux meilleurs LLM de vision pour les raisonnements complexes ou sémantiques, lorsqu’ils apportent une réelle valeur ajoutée.