本页所有数字与样例均来自实际下载的数据文件(HuggingFace Homie0609/MatchTime、GitHub SoccerNet/sn-echoes),
非转述论文。视频与音频来自 CC-BY-SA-4.0 授权、未加密的 SoccerNet-VQA 2026 素材包(第 ③ 节可直接播放);SoccerNet 主库的全场视频仍受 NDA 约束。
① 最关键的分野:两种「解说文本」
选型的第一个岔路口。这两类文本的来源、粒度、噪声结构完全不同,混为一谈会选错数据集。
网页文字直播 live-text commentary
赛事网站编辑写的结构化文字播报。句子完整、事件语义明确、自带球员/球队实体,但时间戳是编辑手打的,非常粗。
转播音轨 ASR audio commentary
解说员实际说的话,Whisper 转写。时间戳精确到 0.01s、信息密度低、口语碎片、含大量回放分析与闲聊。
注意:两者可叠加——它们覆盖同一批 SoccerNet 比赛,game ID 能对上。MatchTime 的对齐 pipeline 正是用 B 类去校正 A 类的时间戳。
② 五个数据集逐个详解
③ 画面 + 语音 + 文本:8 个可播放的真实 clip
转播画面和解说语音在 SoccerNet 主库里受 NDA 约束,但 SoccerNet-VQA 2026 挑战赛的素材包是 CC-BY-SA-4.0、未加密、未 gated 的,
里面的视频切片正来自 SN-Caption-test-align 那 49 场,且带原始转播音轨。
这里的 8 个 clip 就是从中取出、并按路径里的 半场_分_秒 精确 join 回解说文本的——
画面、语音、A 类文字解说、B 类 ASR 逐字稿,四个模态在同一时间轴上。
gt_gameTime 切的(21 个 join 上的 clip 里 20 个如此)。
所以你可以直接验证:画面里发生的事 = 解说文本描述的事,而原始时间戳指向的却是别的时刻——
每个 clip 下方都并排给出了那一刻解说员实际在说什么。
④ 四轨时间线:同一个进球的 85 秒窗口
这是本页的核心。同一场比赛、同一个进球事件,在四个数据源里的呈现方式。 全部为真实数据,可直接核对。
—
四条轨道的原始内容
⑤ 时序错位实测:到底差多少
对 SN-Caption 的 49 场人工校正集(— 条标注,— 有人工 GT 时间戳)
与 MatchTime 全部 422 场自动对齐结果,逐条计算 校正后 − 原始 秒差。
负值 = 原始时间戳偏晚,需要往前移,即解说滞后于画面。
数据表(分位数,单位秒)
⑥ 真实 Schema:字段长什么样
直接从下载的文件里取的完整条目,未做删改(长文本未截断)。