vtennis_lei_v0 — 从 Flickr 采集 140,532 张,pHash 去重后经 MobileCLIP-S1 三门清洗(topic / photo / homonym),阈值 score≥0.02 留下 103,353 张。 子类目录(serve/forehand/…)是 CLIP argmax 的弱标注,非 GT。
Qwen3-VL-235B-A22B-FP8 + highlight_rubric_v2,
全量 103,353 张 · 0 错误 · 15.4 小时(1.86 img/s)。
产出 13,944 个不同分值;零分 20,765(20.1%)。
模型对 7 个维度各打 0–100,再由固定公式折成 0–1,不让模型直接吐总分:
score = in_play门 × photo_real门 × visibility乘子 × (0.30·intensity + 0.22·decisive + 0.33·difficulty + 0.15·expressiveness)
in_play 低于 30 直接归零(空场/合影/其它拍类运动);photo_real 拦邮票拼贴; visibility 只降权不归零(下限 0.4)。
用 509 条人工两两偏好校验(界面不显示分数,避免污染):无偏批上 准确率 79.5% [74.5, 83.8],非零平局 0.0%, CLIP 基线只有 68.0%。分差越大越可信——最高四分位 96.9%,最低档接近随机。