{{ ui_lang.datasets_heading|default('Datasets & Experiments') }}

{{ ui_lang.datasets_lede|default('Versioned collections of evaluation examples and the experiment runs scored against them. Curate examples from traces or annotations, pin a version with a tag, then run evaluators (trajectory match, tool-use, LLM-judge, …) and compare results over time. Storage backend:') }} {{ storage }}

{{ ui_lang.datasets_annotation_process|default('Annotation process') }}

{{ ui_lang.datasets_loading_status|default('Loading status…') }}

{{ ui_lang.datasets_new_dataset|default('New dataset') }}

{{ ui_lang.datasets_name_hint|default('Letters, numbers, hyphens, underscores.') }}

{{ ui_lang.datasets_run_experiment|default('Run experiment') }}

{% for ev in evaluators %} {% endfor %}
{{ ui_lang.datasets_llm_judge_note|default('LLM-judge evaluators call your configured AI endpoint and may take a while on large datasets.') }}

{{ ui_lang.datasets_datasets_heading|default('Datasets') }} ({{ datasets|length }})

{% if datasets %}
{% for d in datasets %}

{{ d.name }}

{% if d.description %}

{{ d.description }}

{% endif %}
{{ d.versions|length }} {{ ui_lang.datasets_versions_label|default('version(s)') if d.versions|length != 1 else ui_lang.datasets_version_label|default('version') }} {% if d.latest_version %} {{ d.latest_version.example_count }} {{ ui_lang.datasets_examples_label|default('example(s)') if d.latest_version.example_count != 1 else ui_lang.datasets_example_label|default('example') }} {% endif %}
{% set tags = [] %} {% for v in d.versions %}{% for t in v.tags %}{% set _ = tags.append(t) %}{% endfor %}{% endfor %} {% if tags %}
{% for t in tags %}{{ t }}{% endfor %}
{% endif %}
{% endfor %}
{% else %}

{{ ui_lang.datasets_no_datasets|default('No datasets yet. Create one above to get started.') }}

{% endif %}

{{ ui_lang.datasets_experiments_heading|default('Experiments') }} ({{ experiments|length }})

{% if experiments %}
{% for e in experiments %} {% endfor %}
{{ ui_lang.datasets_col_cmp|default('cmp') }} {{ ui_lang.datasets_col_experiment|default('Experiment') }} {{ ui_lang.datasets_col_dataset|default('Dataset') }} {{ ui_lang.datasets_col_version|default('Version') }} {{ ui_lang.datasets_col_examples|default('Examples') }} {{ ui_lang.datasets_col_scores|default('Scores') }} {{ ui_lang.datasets_col_created|default('Created') }}
{{ e.name or e.id }} {{ e.dataset_name }} {{ e.dataset_version }} {{ e.example_count }} {% for k, v in e.aggregate_scores.items() %} {{ k }}: {{ '%.2f'|format(v) }} {% endfor %} {{ e.created_at }}
{% else %}

{{ ui_lang.datasets_no_experiments|default('No experiments yet. Select a dataset and evaluators above, then Run.') }}

{% endif %}