テスト仕様
スコアの評価軸
グレード
グレードは、開発者の感覚に合うように調整されています。91点なら、最小限のレビューで受け入れられるコードだと感じられるはずです。55点なら、修正にかなり手間がかかると感じられるはずです。
結果のバリデーション
- 存在チェック: 必須の SDK シンボル、import、設定キーが出力に含まれていること。
- ハルシネーション検出: 存在しないパッケージ、誤った SDK バリアント、捏造された API メソッドを検出すること。
- セキュリティチェック: ハードコードされた資格情報、安全でないストレージに保存されたトークン、ソースコード内のシークレットを検出すること。
- 構造バリデーション: コードが正しく構成されていること — 適切なコンポーネントが適切なファイルに配置され、ライフサイクル フックが適切に処理され、middleware が正しい順序になっていること。
- バージョンの正確性: エージェントが、非推奨のパターンではなく、現在の API を使用していること (確認されるのは、エージェントが最新のドキュメントにアクセスできる場合のみ) 。
- 総合レビュー: LLM judge が実装全体の正確性を評価すること。
推定コストと所要時間
推定コスト
推定時間
- モデルプロバイダー API のレイテンシとレート制限
- 必要なツール呼び出しの回数 (タスクの複雑さによって異なります)
- eval 環境とモデルプロバイダー間のネットワーク状況
- プロバイダー側のキューの深さと負荷