Metadata-Version: 2.4
Name: belegbench
Version: 0.1.1
Summary: BelegBench — Benchmark für die Extraktion Schweizer QR-Rechnungen (100 % synthetisch, DE/FR/IT)
Author: Keyvan Hardani
License-Expression: Apache-2.0
Project-URL: Homepage, https://github.com/Keyvanhardani/belegbench
Keywords: benchmark,invoice,qr-bill,swiss,ocr,synthetic-data
Requires-Python: >=3.11
Description-Content-Type: text/markdown
Requires-Dist: belegant
Requires-Dist: httpx>=0.27

![Belegant](assets/belegant-logo.png)

# BelegBench

🇨🇭 Schweiz · 🇩🇪 DE · 🇫🇷 FR · 🇮🇹 IT · 🇦🇹 AT

> BelegBench ist der Benchmark hinter [Belegant-4B](https://huggingface.co/Keyven/belegant-4b) — der Schweizer On-Prem Beleg-AI. Von den Machern von [German-OCR](https://german-ocr.de).

Benchmark für die Extraktion Schweizer QR-Rechnungen — 100 % synthetisch, DE / FR / IT.

Bisher gab es kein öffentliches Benchmark für Schweizer QR-Rechnungen mit CH-Spezifika
(QR-IBAN, QR-Referenz, MWST 8.1 / 2.6 / 3.8 %, CHE-UID, Apostroph-Tausender). BelegBench schliesst
die Lücke — inkl. der Metrik, die für Treuhänder zählt: Halluzinationsrate.

## Ergebnisse (v1, n = 300, fairer 4B-Vergleich)

| Modell | Field-EM | Halluzinationsrate | Parse-Fehler |
|---|---|---|---|
| Belegant-4B | **84.7 %** | **0.0 %** | 3/300 |
| Qwen3.5-4B (roh) | 75.8 % | 1.2 % | 15/100 |
| gemma3:4b (roh) | 16.5 % | 15.9 % | 76/100 |

Trilingual: FR 81.4 %, IT 83.0 %. Viral-Grafik: `belegbench/viral_table.html`.

Der Datensatz ist zu 100 % synthetisch (300 Belege, DE / FR / IT) — kein Datenschutzproblem.
Die aggregierten Ergebnisse je Modell liegen unter `belegbench/results/`.

## Benchmark laufen lassen

```bash
python belegbench/run_eval.py --model belegant-4b --mode belegant --n 300
```

Metriken: Field-Level Exact Match, Halluzinationsrate, checksummen-validierte Accuracy,
Verify-Catch-Rate, Latenz.

## Lizenz

Apache-2.0 · *von den Machern von German-OCR*
