「过中线」新规范 — 2D / 3D / VLM 三方对比

★ 新:把动作分解图当参考图喂给模型 → clear acc 0.693→0.792,超过此前所有方案:看这一页
← 上一轮(旧规范、以及被我修正掉的那个泄漏结论)在 这一页。

判定规范(2026-09-22)

① 持拍手 —— 单手持拍即该手;双手持拍取更靠柄下方的那只(离拍面更远的那只)。
② 中线 —— 两肩中点 → 两髋中点的连线。页面上的粉线就是它(向两端延长便于看侧)。
③ 过中线 —— 看拍面中心(橙圈):与持拍手 (黄圈)在中线同侧 = 未过;异侧 = 过。
④ 朝向 —— 球员身体面向的方向为正面,左右按球员自己的左右。

关于 ④:同侧/异侧是"两个点对同一条线"的符号比较,不需要区分左右,所以朝向不参与判定, 只作为独立字段记录(3D 那一路能真正测出它)。这一点若与你的本意不符,告诉我,判定逻辑要改。

结果:三种读法、两种姿态源,都够不到 VLM

读法镜像翻转全体 acc take_backcontactfollow_thr
A0 · YOLO 2D · 你的定义③6.3%0.5330.5710.6520.523
A2 · MediaPipe 3D · 你的定义③9.9%0.5730.5310.6870.538
A2 · 3D · 拍面 vs 持拍肩13.2%0.6030.6330.6960.585
VLM p4 自己读的同一条16.0%0.8150.8960.9000.537
acc = 用这一位(过/未过)直接判正反手能达到的最好准确率。n=302 三方可比样本。
新规范确实修好了它该修的东西:旧规范在双手握拍时"离球拍最近的手腕"掷硬币, 镜像翻转 10.6%;新规范的"取更靠柄下方那只手"是确定的,翻转降到 6.3%。
但 3D 没救回准确率,而且问题不在视角。按"肩宽/躯干长"分层(越小越侧身、这问题越无解):
条件数区间nA2 acc镜像翻转
[0.00, 0.15) 几乎完全侧身200.65015.0%
[0.15, 0.35)530.52822.6%
[0.35, 0.70)1840.66311.4%
[0.70, ∞) 最正对镜头450.6228.9%
最正对镜头的那一档也只有 0.622。不是侧身视角把线索毁了。
我的解读(比数字重要):VLM 的 across_body 根本不是在测这个几何谓词 —— 它是个好分类器但不是好测量。那 0.90 来自它把"反手感"编码进了这个字段,而不是它真量准了 拍面在中线哪一侧。佐证:几何与 VLM 对同一张图只有 48.7% 判定一致,但几何明显更稳 (6.3% vs 16.0%)—— 几何稳而测的是另一回事,VLM 不稳但测的是对结果有用的那回事。

已验证:方案 1 跑完了,证实了这段解读 —— 见下一节。

方案 1 结果:三条独立的测量路径互相印证

→ A1 的逐图结果(按它判的过线/不过线分组)在单独一页:打开
把你的原文定义用文字直接给 Opus 5(同一个模型、同一套定义、不给任何几何),只问"过没过中线", 不许它用正反手判断代替。368 张 × 2(含镜像),带思考。
测量路径判为过中线正反手 acc take_backcontactfollow_thr镜像一致
A0 · YOLO 2D 几何0.170.5330.5710.6520.52393.7%
A2 · MediaPipe 3D 几何—0.5730.5310.6870.53890.1%
A1 · VLM 拿到你的定义0.120.5950.5380.6490.54593.1%
p4 的 across_body 字段0.35–0.800.8150.8960.9000.53784.0%
三条路径互相印证:
A1 vs A0(2D 几何) 判定一致 87.4% · A1 vs A2(3D 几何) 86.3% · A1 vs p4 的 across_body 只有 57.3%

也就是说:一旦要求 VLM 按定义回答,它就变成了一个忠实的测量器 —— 和两套几何高度一致、镜像稳定性 从 84.0% 升到 93.1% —— 同时把全部正反手预测力丢光了(0.815 → 0.595,掉到几何那一档)。
结论:p4 的 across_body 根本不是在测过中线,它是「正反手信念」套了个几何字段的名字。 那 0.90 来自模型把结论偷偷塞进了这个字段,不是它量准了拍面在中线哪一侧。

对方案设计的直接后果:三条独立路径(2D 几何 / 3D 几何 / VLM 按定义读)彼此一致 86–87%, 而它们判正反手都只有 0.53–0.65。所以「过中线」这条谓词在静态照片上,无论怎么正确地测, 价值就是 0.6 左右。"先按过中线分组、再用时序解歧"这条路线的地基,正确实现之后反而比不实现更弱。
两个附带测出来的数:
① 因为一次操作失误,每张图被重复调用了一次 —— 白捡一个自我一致率:同模型同 prompt 同图跑两遍, 答案一致只有 86.3%(原图)/ 80.4%(镜像)。这是所有一致性指标的天花板。
② A1 有 21 张答 unclear、16 张未解析(共 10%)—— 模型被允许说"看不出来"时会用这个出口, 而 p4 那种问法不给出口,逼它必须给一个答案。

逐图查验

橙圈=拍面中心 · 黄圈=判定出的持拍手 · 粉线=中线(两肩中点→两髋中点)· 绿框=球员 · 橙框=球拍。 一张图要看的是左右两个角标的判定是否一致 —— 镜像不改变网球的正反手,判定本该一样。