Overview
Your RAG evaluation workspace
Runs stored
–
Chat models
–
Embedding models
–
Strategies
–
Recent runs
| Run | Kind | Config |
|---|
Strategies available
Metric presets
New evaluation
Pick a strategy + models, paste your corpus & questions, get scored.
Results
Compare strategies × models
Head-to-head leaderboard across multiple configurations on the same corpus.
Leaderboard
Evaluation runs
Every run executed through this server
| ID | Kind | Config | Faithfulness | Relevance | Cost |
|---|
Model catalog
| Model ID | Type | Context | $ In/1M | $ Out/1M | Notes |
|---|