{% extends "base.html" %} {% block title %}Evalground - Memorizz{% endblock %} {% block content %}
Run paper-backed long-term-memory evaluations with local open models or a metered OpenAI reader.
Accepted Trace Insights become versioned drafts here. A draft is evidence for an evaluation plan; it does not mutate the production agent.
{% if trace_experiments %}| Experiment | Version | Status | Agent | Component | Target | Created |
|---|---|---|---|---|---|---|
{{ experiment.experiment_id|truncate(24) }} |
v{{ experiment.experiment_version }} | {{ experiment.status|default('draft')|title }} | {{ experiment.agent_id|default('—')|truncate(16) }} |
{{ experiment.component or '—' }} | {{ experiment.target or '—' }} | {{ experiment.created_at or '—' }} |
No accepted trace recommendations yet.
{% endif %}Official datasets remain external. Configure each environment variable or enter a path for the run.
{{ item.dataset_env }}memorizz eval dataset sync {{ item.benchmark_id }}| Run ID | Status | Benchmark | Mode | Agent | Dataset | Samples | Accuracy | Created | Finished | Actions |
|---|---|---|---|---|---|---|---|---|---|---|
{{ run.run_id[:8] }}... |
{{ run_status }} | {{ run.benchmark or 'longmemeval' }} | {{ 'Full MemAgent' if run.evaluation_mode == 'memagent' else 'Retrieval' }} | {{ run.agent_name }} | {{ run.dataset_variant or 'oracle' }} | {{ run.num_samples }} | {% if run.overall_accuracy is not none %} {{ run.overall_accuracy }}% {% else %} - {% endif %} | {{ run.created_at or '-' }} | {{ run.finished_at or '-' }} | View {% if run_status in ['queued', 'running', 'canceling'] %} {% endif %} |
No benchmark runs yet.
{% endif %}{{ selected_agent.agent_id }}
| Benchmark | {{ eval_results.benchmark_name }} |
| Dataset | {{ eval_results.metadata.dataset_variant }} |
| Execution | {% if eval_results.metadata.evaluation_mode == 'memagent' %} Full MemAgent · {{ eval_results.metadata.application_mode|default('assistant') }} {% else %} Memory retrieval diagnostic {% endif %} |
| Timestamp | {{ eval_results.metadata.timestamp }} |
| Retrieval basis | {{ eval_results.retrieval.basis or 'diagnostic_fusion' }} · top {{ eval_results.retrieval.top_k }} of {{ eval_results.retrieval.candidate_pool_size }} |
| Models | {{ eval_results.metadata.model_provider }}:{{ eval_results.metadata.reader_model }} reader · {{ eval_results.metadata.judge_model }} judge · {{ eval_results.metadata.embedding_model }} embeddings |
| External API cost | ${{ eval_results.metadata.external_api_cost_usd }} |
| Comparison status | {{ eval_results.comparison_label or 'Diagnostic' }} |
| Output | {{ eval_output_path }} |
Run a benchmark to see results.
{{ run_output }}