V2.1 多轴 rescorer 训练
把累计的人工 rubric 标注 + auto/goldenset 数据训成 6 个 per-axis 回归模型。
训完后下次跑 pipeline 自动启用,与 auto rubric 并排显示。
| 轴 | 训练行数 | 含人工 | CV R² | CV MAE (★) |
|---|
本 demo 占用
--
总占用
--
分析记录数
--
累计图片
每次分析记录
| run_id | 大小 | 图片 | 分类 | 状态 | 距今 |
|---|
机器全局模型缓存
这些是 PyTorch / HuggingFace 等下载的预训练模型。删除后第一次重新分析会下载,之后照旧。本面板不会动它们,需要清的话执行下方命令。
| 缓存 | 路径 | 大小 |
|---|
评估 rescorer · 对照真实数据集
把一组带
manual_label(keep / maybe / cull)的图作为 ground truth,
让 pipeline 跑一遍,出 confusion matrix · macro-F1 · Cohen κ · 逐轴 MAE。
如果你之前评过一版,把那次的 eval_*.json 喂回去 (--baseline)
就能告诉你新模型究竟是否变好。
# 数据布局
golden/
ground_truth.csv # filename, scene, manual_label
# + 可选 gt_<axis>_stars 列做逐轴评估
images/*.jpg
# 单次评估(CLI)
PYTHONPATH=. python scripts/eval_on_golden_set.py golden/ \
--report --label v1
# V1 vs V2 对比 — 哪个 rescorer 更好?
PYTHONPATH=. python scripts/eval_on_golden_set.py golden/ \
--report --label v2 \
--baseline golden/_eval_output/eval_v1.json
输出位置:
<golden>/_eval_output/eval_<label>.{json,html}。
HTML 是自包含的,可以直接发给搭档看。
阈值约定见 pixcull.scoring.eval_metrics._improvement_verdict:
macro-F1 +2pp 才算"推荐替换"。