🏏 Cricket 数据集总览

五套板球数据集的来源、规模、标注方式与当前进度汇总

数据统计截止 2026-07-20 · 五套数据集:vcricket_lei_v1 · vcricket_lei_v2 · vcricket_lei_v3 · vcricket_datateam_v1 · cricketvision

5
数据集
击球图 / 投球·防守图 / 通用场景图 / 图像+视频动作 / 视频时序
748
视频总数
cricketvision 206 · datateam 542(已全标)
169,694
图像总数
lei_v1 12,956 · lei_v2 13,606 · lei_v3 92,559 · datateam 50,573
~170k
姿态质量分
几乎全部图像已 VLM 打分(击球/投防/通用三线)

标注类型总览

项目共 6 类标注。先列举每种标注是什么,再用 ✅ 矩阵标出每个数据集拥有哪些标注。

① 目标检测框 (bbox)
击球手 / 球拍(或人 / 拍)边界框
0=batsman 1=bat · 人框+拍框
② 逐图动作分类
单张图的动作类别标签
batting / bowling / fielding / none
③ 视频动作时序分段
视频内逐段动作 {start, end, action}
场景切割 + 逐帧 VLM + 多数滤波
④ 击球 AQA 学术精标
击球质量评估:类型×阶段 + 身体部位评分
StrokeType × Phase + 头/肩/手/髋/脚 + 左右手/前后脚
⑤ B/F 事件时间窗
每球补齐 投球/击球/防守 三段时间窗 + 类型/结果
GT-contact 锚定 → 场景切割 → VLM 精修
⑥ 姿态质量打分
VLM 对动作姿态打 0–1 连续分 + 5 维度(决定性瞬间/类型/技术/力量/构图)· 三条线:击球 / 投防 / 通用
Qwen3.6-27B · pose_score_v1 · bf_pose_score_v1 · generic_pose_score_v1
数据集 ① 目标框② 逐图动作③ 视频时序段④ 击球AQA⑤ B/F事件窗⑥ 姿态质量分
vcricket_lei_v1击球图像 12,956 batsman/bat·已核验 is_batting 二分 击球质量 12,956
vcricket_lei_v2投球/防守图 13,606 bowling/fielding 类目录 B/F质量 13,606(全量)
vcricket_lei_v3 NEW通用场景图 92,559 场景标签(赛/训/街/其他) 通用质量 92,559(全量)
datateam · images静图 50,573 人/拍框 38,045 4 类 38,045 击球质量 50,573(全量)
datateam · videos视频 542 542/542 已标·段
cricketvision视频 206 / 8,540 球 8,540 击球·学术GT 8,540 球·精修中
✅ = 已标注 · ◑ = 弱标/部分 · — = 不适用。⑥ 姿态质量打分现覆盖全部 4 套图像集(~170k 图,几乎全量):击球 pose_score_v1(lei_v1+datateam)· 投防 bf_pose_score_v1(lei_v2)· 通用 generic_pose_score_v1(lei_v3)。击球+投防合并为 cricket_pose_score_v1(64,346)训练打分模型 models/cricket_pose_score_v1/v2

数据集总览

数据集模态规模标注内容标注方法可靠性状态
vcricket_lei_v1 图像12,956 图batsman/bat 框 + 击球质量分Qwen3.6 VLM + 人工核验高(已核验)完成
vcricket_lei_v2 图像13,606 图bowling/fielding 类 + B/F 质量分Web 采集+CLIP 清洗;VLM 打分中(弱类标)完成
vcricket_lei_v3 · NEW 图像92,559 图场景标签(赛/训/街/其他)+ 通用姿态质量分Flickr 采集+CLIP 清洗;VLM 打分中(弱场景标)完成
vcricket_datateam_v1 · images 图像50,573 图动作4类 + 人/拍框(38k)· 击球质量分(全量)Qwen3.6 VLM中(auto,fielding 少)完成
vcricket_datateam_v1 · videos 视频542 视频(全标)时序动作分段场景切割 + 逐帧 VLM中(全自动)完成
cricketvision · GT 视频206 视频 / 8,540 击球StrokeType×Phase + 评分人工(学术标注)高(学术 GT)完成
cricketvision · cv_bf_events 视频206 视频 / 8,540 球B/F/Bat 三段时间窗口GT 锚 + VLM,人工精修中窗口高 / 标签中低精修中

① 击球图像检测 + 姿态打分

vcricket_lei_v1

图像 · 击球检测 + 姿态分 ✓ 完成 · 可训练
来源
网络 + YouTube 抓取静图(原始 27,938 张)→ CLIP 过滤排序(MobileCLIP-S1,正/负 prompt)取 top-8000;后续并入 v1.1 批 negative_for_cricket_new(5,000 张)
数据量
12,956 张入训练/验证(正样本 7,792 / 负样本 5,168);训练/验证 90/10 · 磁盘 1.5 GB
标注 ①②
2 类目标框 0=batsman 1=bat + 每张 is_batting 判定(负样本为纯背景空标签)
标注 ⑥
击球姿态质量分(pose_score_v1/lei_v1.jsonl,12,956 全量)— Qwen3.6 5 维 rubric → 0–1 final_score,用作 pose-score 打分模型训练目标
标注方法
VLM 自动标注 — Qwen3.6-27B(本地 vLLM),逐图结构化 JSON;bbox 经人工核验/修正(交互式编辑器 + QC /v/batting-bbox/)
✓ bbox 经人工逐张复核;姿态分为 VLM 自动生成(可靠性看排序而非绝对值)。正:负 ≈ 2.55:1,正样本约 83% 来自 YouTube 广播画面。姿态分 QC:/v/posescore/

② 投球 / 防守图像集

vcricket_lei_v2

图像 · bowling/fielding + 姿态分 ✓ 完成 · 已打分
动机
补齐项目投球/防守静图的缺口(击球已充足,fielding 在 datateam 仅 1,613 张最稀缺)
来源
Web 采集(Flickr r1/r2 ~94% + 搜索引擎 638 + Wikimedia Commons 75)→ CLIP 相关性过滤 + 去重。⚠ 内部研究用,勿再分发(Flickr All-Rights-Reserved)
数据量
13,606 张:bowling 7,973 / fielding 5,633(按类分目录)
标注 ②
图像级动作类(bowling / fielding,来自目录)+ 每图 CLIP 相关性分(metadata.jsonl 含 per-image license/source)
标注 ⑥
B/F 姿态质量分(bf_pose_score_v1/lei_v2.jsonl)— 复用 pose-score rubric 的投球/防守版,输出 action_class/type/phase + 0–1 分。13,606 全量已打分,域内 9,500 并入 cricket_pose_score_v1 训练集
bowling 7,973 fielding 5,633
弱类标(目录类别 = 采集查询词,非逐图核验);无目标框。姿态分已并入击球+投防合并训练集,补充投球/防守分布。

③ 通用场景图像集(新增)

vcricket_lei_v3

图像 · 全场景 + 通用姿态分 ✓ 完成 · 已打分
动机
覆盖任意角色、任意场景的通用板球图(不限击球/投球/防守),给姿态打分模型更广的域分布(泛化)
来源
Flickr 采集(~82% All-Rights-Reserved)→ CLIP 相关性过滤 + 去重 + 场景标签;排除 2,278 张"蟋蟀昆虫"混淆图。⚠ 内部研究用,勿再分发
数据量
92,559 张,按场景分目录:训练/网内 48,419 · 比赛/球场 26,383 · 其他 10,749 · 街头/野场 7,008
标注 ②
图像级场景标签(match/training/street/other,CLIP argmax 弱标,供浏览非精确)+ per-image CLIP 相关性分 + license(metadata.jsonl)
标注 ⑥
通用姿态质量分(generic_pose_score_v1/lei_v3.jsonl)— 92,559 全量已打分,域内 75,586 作通用打分训练/评测集
training 48,419 match 26,383 other street
training 48,419 match 26,383 other 10,749 street 7,008
场景标签为 CLIP 弱标(非人工核验);无目标框、无动作类。核心价值是给姿态打分提供最广的场景分布。

④ 数据团队采集:图像 + 视频动作

vcricket_datateam_v1

图像 + 视频 · 动作/时序/姿态分 ✓ 图像 + 视频 已标

数据团队采集的两部分:静图(逐图动作+框+姿态分)与视频(时序动作分段)。两者标注管线不同,分别汇总如下。

🖼️ images / cricket 已标注完成

来源抓取的板球照片,多个日期批(06-11/12/15/16 + 07-03 新批),中位 ~2048×1365 数据量50,573 张(原 38,045 + 07-03 新批 12,528) 标注 ①②逐图动作4类(batting/bowling/fielding/none)+ 人框 +(击球)拍框 —— 38,045 张 标注 ⑥击球姿态质量分 pose_score_v1/datateam_v1.jsonl —— 50,573 全量 文件vcricket_datateam_v1_actions_bbox.jsonl · pose_score_v1/datateam_v1.jsonl
batting 25,308 bowling 9,845
batting 25,308 (66.5%) bowling 9,845 fielding 1,613 none 1,276
动作4类+框覆盖原 38,045 张(分布如上;fielding 仅 ~4% 严重欠采样)。07-03 新批 12,528 张目前只有姿态分,动作/框待补。QC:/v/vcricket-act/ · 姿态分 /v/posescore/

🎬 videos 542/542 已标

来源抖音 (Douyin) 215 + YouTube 327 = 542 视频 · 21 GB(抖音按主题目录:板球防守/旋转投球/约克球…) 标注 ③时序 动作分段:每段 {start,end,action},action∈batting/bowling/fielding/none 方法场景切割 + 1fps 采样 + 逐帧 VLM 分类(帧号索引,不让模型报时间戳)+ 多数滤波 + 按镜头切割成段 进度542/542 全部产出分段(抖音 215 + YouTube 327) 文件vcricket_datateam_v1_video_actions/
batting 1288 none 1254 bowling
batting 1288 none 1254 bowling 561 fielding 378
无 GT 全自动标注(段边界来自已知帧时间/镜头切割,非模型报时);542 视频全部已产出分段

⑤ 学术数据集 + 自建 B/F 时序标注

cricketvision (UJ-AQA)

视频 · 击球 GT + B/F 时序 人工精修中
来源
学术数据集 CricketVision (UJ-AQA, Moodley & van der Haar, WACV 2025) — 击球动作质量评估(AQA)。共 47 GB
数据量
206 段长视频(9 位球员 P1–P9,25/30fps,中位 ~8.7 分钟)
标注 ④
人工标注(学术 GT):VGG-VIA 工程,8,540 次击球 / 25,717 关键帧;每次击球含 StrokeType × Phase(Buildup/Execution/FollowThrough)+ 头/肩/手/髋/脚评分 + 左右手/前后脚。仅击球,不含投球/防守
标注 ⑤
cv_bf_events(自建):为每次击球补齐 bowling / batting(GT) / fielding 三段时间窗口 + 类型/动作/结果标签 → 206 视频 / 8,540 球(现为 v3 版)
标注方法
以 GT 击球接触点(contact)为锚 → 场景切割定粗边界 → 按需 Qwen3.6 VLM 精修边界(never 让模型报时间戳)
当前状态
自动窗口已全量生成;正在通过交互式 viewer 人工复核精修(/v/bfreview/)
⚠ cv_bf_events 可靠性分级:时间窗口 = 高(GT 锚定,交付核心)· bowling.type = 低(偏 Fast)· outcome = 中低(过判 wicket ~23%)· fielding.action = 中。早期 30s-chunk 全动作 VLM 标注(annotations/cricketvision/)因时间定位失败已废弃,由 cv_bf_events 取代。