Opus 5 × 动作分解图 — 换个模型,效果还在吗

用完全相同的三张 USTA 分解条和同一套 prompt,把 Astra 换成 Claude Opus 5 再跑一遍 eval400。
← 回 I1/I2/I3 主页 · 其它:几何探针 · 过中线三方对比 · A1 逐图

结论:增益复现了,而且更便宜

方案clear acc全体 acc 正手召回反手召回$/1k 图
Astra 文字基线0.6930.6620.3850.738$21.90
Astra + 分解图 (I1)0.7920.7570.5920.766$29.95
Opus 5 文字基线0.7300.6880.6460.710$30.36
Opus 5 + 分解图0.7770.7400.6690.729$24.29
combo(此前最佳方案)0.755———$72.86
Opus 5 + 分解图 vs Opus 5 文字基线:+0.048,救 43 / 坏 22,p=0.0125 —— 显著。
Opus 5 + 图 vs Astra + 图:−0.014,p=0.515 —— 统计上不可区分。

所以参考图的增益不是 Astra 一家的特性,换模型仍然成立。这比单模型的结果强得多。
而 Opus 5 每千张 $24.29,比 Astra+图便宜 19%、比此前最佳的 combo 便宜 67%,clear acc 还高 0.022。

但两个模型被修好的地方不一样

类别真值Astra 基线 → 加图Opus 5 基线 → 加图
forehand130召回 0.385→0.592召回 0.646→0.669
backhand107精度 0.790→0.901精度 0.768→0.848
serve80召回 0.825→0.912召回 0.850→0.900
other83精度 0.440→0.555召回 0.566→0.711
Astra 的病是正手被丢进 other(召回只有 0.385),分解图直接治好了这一条。 Opus 5 本来就没有这个病(0.646),所以那一栏几乎没动 —— 它救回的 43 张主要来自 other 被误判成正/反手(14 张)和基线干脆没作答(6 张)。

同一套参考图,在两个模型上修的是不同的错误,但都指向同一件事: 单帧不满足文字定义时该怎么归类。这也解释了幅度差异 —— 基线越差的模型,从参考图里得到的越多 (Astra +0.095 vs Opus 5 +0.048)。
两个加图版本只有 75.0% 的判定一致,都对 0.642,至少一个对 0.855。 这 0.855 是把两者当集成的理论上限,比任一单独版本高 10 个点 —— 但逐张选谁对需要真值, 不是现成可用的方案,只说明两者的错误相当互补。

逐图查验

每张卡片并排四个判定:真值 / Opus5+图 / Astra+图 / Opus5 文字基线(对绿错红), 下面是 Opus 5 的细标、它自称对上的参考图与阶段、以及它写的理由。