{% extends "base.html" %} {% block title %}{{ scenario_name }} — {{ run.name }} (Audit #{{ run.id }}){% endblock %} {% block content %}
← Back to {{ run.name }} (Audit #{{ run.id }})

{{ scenario_name }}

{% if severity == "pass" or severity == "low" %}{{ severity }} {% elif severity == "medium" %}{{ severity }} {% else %}{{ severity|default:"unknown" }}{% endif %}
Export JSON
{% if summary %}

{{ summary }}

{% endif %} {% if is_repeated %}

Judge Stability ({{ n_reps }} repetitions)

{{ agreement_rate|floatformat:0 }}%

Agreement

{{ aggregated_severity }}

Modal Verdict

{{ n_reps }}×

Runs

{% if severity_distribution %}
{% for sev, cnt in severity_distribution.items %} {{ sev }}: {{ cnt }}/{{ n_reps }} {% endfor %}
{% endif %} {% for rep in rep_summaries %} {% endfor %}
Rep Severity Tokens Latency
#{{ rep.index }} {{ rep.severity }}{% if rep.severity != aggregated_severity %} ≠{% endif %} {{ rep.tokens|default:"—" }} {{ rep.latency_ms|default:"—"}}{% if rep.latency_ms %}ms{% endif %}
{% if low_agreement %}

⚠ Low judge agreement ({{ agreement_rate|floatformat:0 }}%). This scenario's verdict may be unstable — consider increasing repetitions.

{% endif %}
{% endif %} {% if conversation %}

Conversation ({{ conversation|length }} turns)

{% for turn in conversation %}

{{ turn.role|default:"message" }}

{{ turn.content }}

{% endfor %}
{% endif %} {% if issues %}

Issues Found ({{ issues|length }})

{% endif %} {% if rationale %}

Judge Rationale

{{ rationale }}

{% endif %} {% if other_keys %}

Details

{% for key, value in other_keys.items %}
{{ key }} {{ value }}
{% endfor %}
{% endif %} {% if raw_json %}
Raw JSON
{{ raw_json }}
{% endif %} {% if not raw_json %}

No result data available for this scenario.

{% endif %} {% endblock %}