modelduelResultados versionados en el repositoriov$version

Clasificación pública

$lede

$podium

Modelos

$ranking_rows
Orden: proporción de tareas resueltas, después de tests superados y después coste por intento (menos es mejor). Los empates comparten posición.
Pos.ModeloTareas resueltasTests superadosDuelosCoste

Histórico de duelos

$history_rows
Del más reciente al más antiguo. Cada informe se genera desde el results.json versionado en el repositorio.
FechaDueloContendientesPrimeroInforme

Cómo se calcula

Cada modelo suma sus tareas, tests y costes en todos los duelos donde aparece. Se compara la proporción, no el total, para que jugar más duelos no dé ventaja. Una sola ejecución es una señal débil: mira el nº de duelos.

Para añadir resultados reales: modelduel run mis-tareas --a PROVEEDOR:MODELO --b PROVEEDOR:MODELO --out runs/duelo y copia runs/duelo/results.json a results/ con un nombre como 2026-10-02-duelo-x-y.json.

$price_note