Opus 5 × 动作分解图 — 换个模型,效果还在吗
结论:增益复现了,而且更便宜
| 方案 | clear acc | 全体 acc |
正手召回 | 反手召回 | $/1k 图 |
| Astra 文字基线 | 0.693 | 0.662 | 0.385 | 0.738 | $21.90 |
| Astra + 分解图 (I1) | 0.792 | 0.757 | 0.592 | 0.766 | $29.95 |
| Opus 5 文字基线 | 0.730 | 0.688 | 0.646 | 0.710 | $30.36 |
| Opus 5 + 分解图 | 0.777 | 0.740 | 0.669 | 0.729 | $24.29 |
| combo(此前最佳方案) | 0.755 | — | — | — | $72.86 |
Opus 5 + 分解图 vs Opus 5 文字基线:+0.048,救 43 / 坏 22,p=0.0125 —— 显著。
Opus 5 + 图 vs Astra + 图:−0.014,p=0.515 —— 统计上不可区分。
所以参考图的增益不是 Astra 一家的特性,换模型仍然成立。这比单模型的结果强得多。
而 Opus 5 每千张 $24.29,比 Astra+图便宜 19%、比此前最佳的 combo 便宜 67%,clear acc 还高 0.022。
但两个模型被修好的地方不一样
| 类别 | 真值 | Astra 基线 → 加图 | Opus 5 基线 → 加图 |
| forehand | 130 | 召回 0.385→0.592 | 召回 0.646→0.669 |
| backhand | 107 | 精度 0.790→0.901 | 精度 0.768→0.848 |
| serve | 80 | 召回 0.825→0.912 | 召回 0.850→0.900 |
| other | 83 | 精度 0.440→0.555 | 召回 0.566→0.711 |
Astra 的病是正手被丢进 other(召回只有 0.385),分解图直接治好了这一条。
Opus 5 本来就没有这个病(0.646),所以那一栏几乎没动 —— 它救回的 43 张主要来自
other 被误判成正/反手(14 张)和基线干脆没作答(6 张)。
同一套参考图,在两个模型上修的是不同的错误,但都指向同一件事:
单帧不满足文字定义时该怎么归类。这也解释了幅度差异 —— 基线越差的模型,从参考图里得到的越多
(Astra +0.095 vs Opus 5 +0.048)。
两个加图版本只有 75.0% 的判定一致,都对 0.642,至少一个对 0.855。
这 0.855 是把两者当集成的理论上限,比任一单独版本高 10 个点 —— 但逐张选谁对需要真值,
不是现成可用的方案,只说明两者的错误相当互补。
逐图查验
每张卡片并排四个判定:真值 / Opus5+图 / Astra+图 / Opus5 文字基线(对绿错红),
下面是 Opus 5 的细标、它自称对上的参考图与阶段、以及它写的理由。