Spécifications des tests
Dimensions du score
Notes
Les notes sont étalonnées pour correspondre à l’intuition des développeurs. Un score de 91 devrait correspondre à du code que vous accepteriez avec une révision minimale. Un score de 55 devrait correspondre à quelque chose qui exige un vrai travail de correction.
Validation des résultats
- Vérifications de présence : les symboles du SDK, les imports et les clés de configuration requis sont présents dans le résultat.
- Détection d’hallucinations : les packages inventés, les mauvaises variantes du SDK et les méthodes d’API fabriquées sont détectés.
- Vérifications de sécurité : les identifiants codés en dur, les tokens stockés dans un emplacement non sécurisé et les secrets dans le code source sont signalés.
- Validation structurelle : le code est correctement assemblé — les bons composants dans les bons fichiers, les hooks du cycle de vie sont gérés et le middleware est dans le bon ordre.
- Exactitude des versions : l’agent utilise les API actuelles, et non des modèles obsolètes (vérifié seulement lorsque l’agent a accès à la documentation à jour).
- Évaluation globale : un juge LLM évalue l’exactitude globale de l’implémentation.
Coût et temps estimés
Coût estimé
Temps estimé
- La latence de l’API du fournisseur de modèle et les limites de débit
- Le nombre d’appels aux outils requis (varie selon la complexité de la tâche)
- Les conditions réseau entre l’environnement d’évaluation et le fournisseur de modèle
- La profondeur de la file d’attente et la charge du fournisseur