{% extends "base.html" %} {% block title %}{{ scenario_name }} — {{ run.name }} (Audit #{{ run.id }}){% endblock %} {% block content %}
{{ summary }}
{{ agreement_rate|floatformat:0 }}%
Agreement
{{ aggregated_severity }}
Modal Verdict
{{ n_reps }}×
Runs
| Rep | Severity | Tokens | Latency |
|---|---|---|---|
| #{{ rep.index }} | {{ rep.severity }}{% if rep.severity != aggregated_severity %} ≠{% endif %} | {{ rep.tokens|default:"—" }} | {{ rep.latency_ms|default:"—"}}{% if rep.latency_ms %}ms{% endif %} |
⚠ Low judge agreement ({{ agreement_rate|floatformat:0 }}%). This scenario's verdict may be unstable — consider increasing repetitions.
{% endif %}{{ rationale }}
{{ raw_json }}
No result data available for this scenario.