Spécifications des tests
Dimensions du score
Notes
Les notes sont calibrées pour correspondre à l’intuition des développeurs. Un score de 91 devrait correspondre à du code que vous accepteriez après une révision minimale. Un score de 55 devrait correspondre à quelque chose qui exige un vrai travail de correction.
Validation des résultats
- Vérifications de présence : Les symboles du SDK, les imports et les clés de configuration requis sont présents dans la sortie.
- Détection des hallucinations : Les packages inventés, les mauvaises variantes du SDK et les méthodes d’API fabriquées sont détectés.
- Vérifications de sécurité : Les identifiants codés en dur, les jetons stockés de façon non sécurisée et les secrets dans le code source sont signalés.
- Validation structurelle : Le code est correctement assemblé — les bons composants dans les bons fichiers, les hooks du cycle de vie sont bien gérés, et le middleware est dans le bon ordre.
- Exactitude des versions : L’agent utilise les API actuelles, et non des modèles dépréciés (vérifié seulement lorsque l’agent a accès à la documentation à jour).
- Examen d’ensemble : Un juge LLM évalue l’exactitude globale de la mise en œuvre.
Coût et temps estimés
Coût estimé
Temps estimé
- La latence de l’API du fournisseur de modèle et les limites de débit
- Le nombre d’appels d’outils requis (varie selon la complexité de la tâche)
- Les conditions réseau entre l’environnement d’évaluation et le fournisseur de modèle
- La profondeur de la file d’attente et la charge du côté du fournisseur