▼ v2 实验:引入 2.2万张动作图像 / 训练方法 / 结果 / 结论(点击折叠)
v2 做了什么
在 v1 时序头(冻结 YOLO GAP 序列 → 1D-CNN → 4 类)基础上,引入 vcricket_datateam_v1 的 2.2万张动作图像(VLM 标 batting/bowling/fielding/none + 目标人 bbox,batting 抽稀到 1万)一起训。
怎么融进时序头
- 图像是单帧:每张取整帧 GAP 256-d(与推理一致)→ 复制成 T=12 帧静态 clip
- 和 CricketVision 真时序 clip(带运动)混合训练
- 按「来源×类别」平衡采样:保证每 batch 里 CricketVision 时序 clip 与图像各半,运动信号不被 2.2万张静态图淹没
- 骨干仍全冻结;架构、推理与 v1 完全一致(仅换 head 权重)
训练数据
- CricketVision 时序:train 9574 clips(P1–P7)
- 图像:train 20438 张(整帧 GAP 静态 clip)
- 合并 train 30012;val 双轨:CricketVision 时序 val 1198 + 图像 val 2296
结果(双轨 val)
CricketVision 时序 0.807
v1(未加图像) 0.817
图像域 0.643
v2 CricketVision 时序 val 混淆矩阵
| non_act | batting | bowling | fielding |
| non_action | 0.83 | 0.02 | 0.10 | 0.05 |
| batting | 0.01 | 0.90 | 0.10 | 0.00 |
| bowling | 0.10 | 0.04 | 0.82 | 0.03 |
| fielding | 0.24 | 0.03 | 0.06 | 0.67 |
基本结论
- ⚠️ 静态图像没能提升视频/时序检测:CricketVision 时序 val
0.817(v1) → 0.807(v2),反而微降。
- 根因(根本性):bowling/fielding 的区分优势来自运动,而静态图像没有运动信息,只能加外观先验 —— 对 CricketVision 广播域帮助有限,还稀释了运动线索(bowling 波动)。
- 图像域本身能分(batting/bowling ~0.80),但 fielding 仍弱(0.38,样本仅 1613)。
- 本 viewer 的目的:CricketVision val 测不到「图像多样性对 test 域(手机/多样构图)泛化」的影响 —— 下方切到 test 视频,和 v1(
/v/bfv1/)对照,看 v2 在真实 test 视频上是否更稳/更准。
- 战略:要真正加强时序视频检测,需要更多视频/时序数据,而非静态图。
bowling prob
fielding prob
GT bowling 窗
GT fielding 窗
时间轴纵轴=该类概率;点峰刻度/缩略图→跳视频
点时间轴任意位置或点缩略图 → 视频跳到该时刻播放;黄线=当前播放位置 · 点峰帧/模板图放大
显示: