Skip to main content
L’Agent Experience Score mesure l’efficacité avec laquelle les agents d’IA intègrent Auth0 dans différents modèles et frameworks. Il vous permet de comparer les scores actuels d’agents qui implémentent des services et des fonctionnalités d’Auth0 — comme l’authentification multifacteur (MFA) ou Auth0 Actions — dans des environnements de développement et de test, afin de voir comment les outils d’Auth0 améliorent la performance des agents. Utilisez cette ressource pour en savoir plus sur la méthodologie de notation, notamment sur la façon dont les scores sont calculés, les dimensions mesurées et la manière dont les notes sont attribuées.

Spécifications des tests

Les agents IA — Claude Code, GitHub Copilot, Gemini CLI — exécutent des tâches d’intégration Auth0 dans des environnements de développement isolés. Chaque agent utilise les mêmes outils qu’un développeur utiliserait dans un environnement réaliste : un espace de travail, un shell et des outils de gestion de fichiers comme Auth0 CLI. Les consignes sont courtes et réalistes : « ajoute l’authentification à mon application Next.js », et non des procédures étape par étape. Chaque modèle est testé avec et sans les outils Auth0 (MCP Server et Agent Skills). L’écart entre ces scores représente l’impact mesurable des outils d’IA d’Auth0 sur l’expérience des développeurs.

Dimensions du score

Chaque exécution est évaluée selon 8 dimensions réparties en deux catégories — 50 % pour le processus et 50 % pour le résultat. Cinq dimensions évaluent de bout en bout le processus suivi par l’agent avec les outils Auth0. Trois dimensions évaluent le résultat final. Chaque dimension est notée individuellement de 0 à 100, puis pondérée et intégrée au score global.

Notes

Les scores globaux se traduisent en notes alphabétiques : Les notes sont calibrées pour correspondre à l’intuition des développeurs. Un score de 91 devrait correspondre à du code que vous accepteriez après une révision minimale. Un score de 55 devrait correspondre à quelque chose qui exige un vrai travail de correction.

Validation des résultats

Chaque évaluateur vérifie le code généré — pas le texte ni les explications. Les évaluateurs s’assurent que le code compile, importe de vrais packages, appelle de véritables méthodes du SDK et n’introduit pas de vulnérabilités de sécurité. Les résultats sont validés à plusieurs niveaux :
  • Vérifications de présence : Les symboles du SDK, les imports et les clés de configuration requis sont présents dans la sortie.
  • Détection des hallucinations : Les packages inventés, les mauvaises variantes du SDK et les méthodes d’API fabriquées sont détectés.
  • Vérifications de sécurité : Les identifiants codés en dur, les jetons stockés de façon non sécurisée et les secrets dans le code source sont signalés.
  • Validation structurelle : Le code est correctement assemblé — les bons composants dans les bons fichiers, les hooks du cycle de vie sont bien gérés, et le middleware est dans le bon ordre.
  • Exactitude des versions : L’agent utilise les API actuelles, et non des modèles dépréciés (vérifié seulement lorsque l’agent a accès à la documentation à jour).
  • Examen d’ensemble : Un juge LLM évalue l’exactitude globale de la mise en œuvre.

Coût et temps estimés

La page des résultats affiche le coût estimé et le temps estimé pour chaque configuration. Ces valeurs correspondent à une seule exécution d’évaluation avec Auth0 MCP + Skills activés.

Coût estimé

Le coût est calculé en fonction du nombre total de jetons consommés pendant l’exécution d’évaluation (jetons d’entrée + jetons de sortie), multiplié par le tarif par jeton publié par le fournisseur du modèle. Auth0 ne facture pas l’exécution des évaluations — le coût correspond à ce que vous paieriez à votre fournisseur de modèle pour une utilisation équivalente de jetons. Le tarif des jetons varie selon le modèle et le fournisseur. Pour connaître les tarifs en vigueur, consultez la page de tarification de votre fournisseur :

Temps estimé

Le temps correspond à la durée réelle d’une exécution de l’évaluation, de la soumission du prompt jusqu’au résultat final. Il inclut toute l’activité de l’agent : lecture de fichiers, appels d’outils, attente des réponses de l’API et écriture de code. Le temps peut varier selon :
  • La latence de l’API du fournisseur de modèle et les limites de débit
  • Le nombre d’appels d’outils requis (varie selon la complexité de la tâche)
  • Les conditions réseau entre l’environnement d’évaluation et le fournisseur de modèle
  • La profondeur de la file d’attente et la charge du côté du fournisseur
Le temps n’est pas normalisé d’un fournisseur à l’autre. Un temps plus court reflète à la fois l’efficacité du modèle et la performance de l’infrastructure du fournisseur.

Pour en savoir plus