{{ d.name }}
{% if d.description %}{{ d.description }}
{% endif %} {% set tags = [] %} {% for v in d.versions %}{% for t in v.tags %}{% set _ = tags.append(t) %}{% endfor %}{% endfor %} {% if tags %}{% endif %}{{ ui_lang.datasets_lede|default('Versioned collections of evaluation examples and the experiment runs scored against them. Curate examples from traces or annotations, pin a version with a tag, then run evaluators (trajectory match, tool-use, LLM-judge, …) and compare results over time. Storage backend:') }} {{ storage }}
{{ d.description }}
{% endif %} {% set tags = [] %} {% for v in d.versions %}{% for t in v.tags %}{% set _ = tags.append(t) %}{% endfor %}{% endfor %} {% if tags %}{% endif %}{{ ui_lang.datasets_no_datasets|default('No datasets yet. Create one above to get started.') }}
{% endif %}| {{ ui_lang.datasets_col_cmp|default('cmp') }} | {{ ui_lang.datasets_col_experiment|default('Experiment') }} | {{ ui_lang.datasets_col_dataset|default('Dataset') }} | {{ ui_lang.datasets_col_version|default('Version') }} | {{ ui_lang.datasets_col_examples|default('Examples') }} | {{ ui_lang.datasets_col_scores|default('Scores') }} | {{ ui_lang.datasets_col_created|default('Created') }} |
|---|---|---|---|---|---|---|
| {{ e.name or e.id }} | {{ e.dataset_name }} | {{ e.dataset_version }} |
{{ e.example_count }} | {% for k, v in e.aggregate_scores.items() %} {{ k }}: {{ '%.2f'|format(v) }} {% endfor %} | {{ e.created_at }} |
{{ ui_lang.datasets_no_experiments|default('No experiments yet. Select a dataset and evaluators above, then Run.') }}
{% endif %}