Especificaciones de las pruebas
Dimensiones de evaluación
Calificaciones
Las calificaciones se han calibrado para ajustarse a la intuición de los desarrolladores. Una puntuación de 91 debería sentirse como un código que aceptarías con una revisión mínima. Una puntuación de 55 debería sentirse como algo que requiere un trabajo considerable para corregirse.
Validación de resultados
- Comprobaciones de presencia: Los símbolos del SDK, las importaciones y las claves de configuración requeridos están presentes en el resultado.
- Detección de alucinaciones: Se detectan paquetes inventados, variantes incorrectas del SDK y métodos de API inexistentes.
- Comprobaciones de seguridad: Se marcan las credenciales codificadas de forma fija, los tokens almacenados de forma insegura y los secretos en el código fuente.
- Validación estructural: El código está correctamente ensamblado: los componentes adecuados en los archivos correctos, los hooks del ciclo de vida gestionados y el middleware en el orden correcto.
- Corrección de versión: El agente usa las API actuales, no patrones obsoletos (solo se comprueba cuando el agente tiene acceso a la documentación actual).
- Revisión integral: Un juez de LLM evalúa la corrección general de la implementación.
Coste y tiempo estimados
Costo estimado
Tiempo estimado
- La latencia de la API del proveedor del modelo y los límites de frecuencia
- La cantidad de llamadas a herramientas necesarias (varía según la complejidad de la tarea)
- Las condiciones de red entre el entorno de evaluación y el proveedor del modelo
- La profundidad de la cola y la carga del proveedor