存储管理 ← 返回上传 垂类样本采集 →

--

V2.1 多轴 rescorer 训练

把累计的人工 rubric 标注 + auto/goldenset 数据训成 6 个 per-axis 回归模型。 训完后下次跑 pipeline 自动启用,与 auto rubric 并排显示。
训练行数含人工CV R²CV MAE (★)

本 demo 占用

--
总占用
--
分析记录数
--
累计图片

每次分析记录

run_id 大小 图片 分类 状态 距今

机器全局模型缓存

这些是 PyTorch / HuggingFace 等下载的预训练模型。删除后第一次重新分析会下载,之后照旧。本面板不会动它们,需要清的话执行下方命令。
缓存路径大小

评估 rescorer · 对照真实数据集

把一组带 manual_label(keep / maybe / cull)的图作为 ground truth, 让 pipeline 跑一遍,出 confusion matrix · macro-F1 · Cohen κ · 逐轴 MAE。 如果你之前评过一版,把那次的 eval_*.json 喂回去 (--baseline) 就能告诉你新模型究竟是否变好。
# 数据布局
golden/
  ground_truth.csv          # filename, scene, manual_label
                            #   + 可选 gt_<axis>_stars 列做逐轴评估
  images/*.jpg

# 单次评估(CLI)
PYTHONPATH=. python scripts/eval_on_golden_set.py golden/ \
  --report --label v1

# V1 vs V2 对比 — 哪个 rescorer 更好?
PYTHONPATH=. python scripts/eval_on_golden_set.py golden/ \
  --report --label v2 \
  --baseline golden/_eval_output/eval_v1.json
输出位置:<golden>/_eval_output/eval_<label>.{json,html}。 HTML 是自包含的,可以直接发给搭档看。 阈值约定见 pixcull.scoring.eval_metrics._improvement_verdict: macro-F1 +2pp 才算"推荐替换"。

错误上报(opt-in,默认关闭)

开启后,只在你主动点击"立即提交"时会把日志(已脱敏)上传到指定 endpoint。 完整政策 →