テスト仕様
スコアの評価軸
グレード
グレードは、開発者の感覚に合うように調整されています。91 点なら、最小限のレビューで受け入れられるコードだと感じられるはずです。55 点なら、修正にかなりの作業が必要なものだと感じられるはずです。
結果の検証
- 存在チェック: 必須のSDKシンボル、import、設定キーが出力に含まれているかを確認します。
- ハルシネーション検出: 架空のパッケージ、誤ったSDKバリアント、捏造されたAPIメソッドを検出します。
- セキュリティチェック: ハードコードされた認証情報、安全でないストレージ内のトークン、ソースコード内のシークレットを検出します。
- 構造検証: コードが正しく構成されているかを確認します。具体的には、適切なコンポーネントが適切なファイルに配置されていること、ライフサイクルフックが処理されていること、ミドルウェアが正しい順序になっていることを検証します。
- バージョンの妥当性: エージェントが最新のAPIを使用し、非推奨のパターンを使っていないことを確認します (エージェントが最新のドキュメントにアクセスできる場合にのみチェックされます) 。
- 総合レビュー: LLM judge が実装全体の正確性を評価します。
推定コストと推定時間
推定コスト
推定時間
- モデルプロバイダーの API レイテンシーとレート制限
- 必要なツール呼び出しの回数 (タスクの複雑さによって異なります)
- eval 環境とモデルプロバイダーの間のネットワーク状況
- プロバイダー側のキューの深さと負荷