只比第三方大模型,评测集 = 全部人工 gold。
2026-09-14:新增 GPT-6 Astra(默认 / 高推理)、组合规则,并按人工 unclear 复核更新评测口径(默认只看清楚集)。本地自研的头(H3 头 / 校准头 / 几何头)在
自研模型对比页。
2026-09-14 更新 · 评测口径与 Astra 两种做法说明(点开)
- 评测子集:两套 400 张评测集已人工逐张复核(复核时不显示模型答案),把证据不足、难以判断的图标为 unclear:stroke4 45 张 (11%),hitting 74 张 (18.5%);hitting 另改正 6 个标签。页面默认显示清楚集,gold 一律用改后的标签,可在「评测子集」切换。卡片上的「难以判断」「已改标签」标出这些图。
- 两列准确率:「准确率(已作答)」只算模型给出答案的图;「准确率(未答算错)」把未作答/未解析算判错、分母为当前显示的全部图,与离线报告
results/vlm_bench/rescore_unclear_v1.json 一致(Opus 5 有 17 张未解析,两列差异主要来自它)。 - GPT-6 Astra · 高推理:模型
gpt-6-astra(OpenAI Chat Completions),prompt 与其他模型完全相同(p1:先填证据字段和一句理由,再给结论 JSON),图片长边 768。唯一区别是参数 reasoning_effort="high":默认 Astra 不做推理(reasoning tokens = 0),高推理版先在内部推理再作答,每张输出约 640 token、约 14 秒(默认版约 230 token、6 秒)。stroke4 上高推理显著好于默认(多对 21 张、多错 9 张,p=0.04),hitting 上差别不大。 - 组合:Astra 高推理 + Opus 5:不额外调用任何模型,只在两份已有结果上套一条规则——默认采用 Astra 高推理的答案;若 Astra 判「其他」而 Opus 5 判「正手」或「反手」,改用 Opus 5 的答案(400 张里 62 张被改;Opus 5 未作答时保持 Astra)。依据:Astra 的主要错误是把正手判成「其他」,而 Opus 5 的正手召回高得多。⚠️ 这条规则是看过这 400 张的结果后才设计的,分数偏乐观,需要在新数据上验证。点开大图,
source 字段显示每张用了谁的答案。 - 动作分解图指引(2026-09-22 新增的四行):把 USTA 的动作分解条作为参考图放在待判图片之前一起发给模型,让它对照「这一帧属于哪条动作序列的哪一格」,而不是去验证单帧是否满足文字定义。反手在提问时细分为单手/双手(i3 另加截击类),作答后折回 backhand / other 计分,所以与其它行完全同口径。三张图(i1)最好:clear 子集 0.693→0.792,救 53 坏 15(p=4e-06),主要来自正手召回 0.385→0.592 ——基线把 56 张正手丢进了「其他」,因为单帧拍到准备或收尾时并不满足「掌心领先穿过球」。加图反而更差:i2 换成含文字的完整教学页 −0.020 且贵 60%;i3 追加发球与截击后 −0.065,原因是截击被过度使用(78 张判截击里只有 11 张真属于「其他」,46 张是真正的正手)。⚠️ 这三版 prompt 是在这 400 张上比出来的,i1 胜出这一点本身需要在新数据上复核。
- 参考图的成本可以大幅压掉:三张参考图每次调用都完全相同,表中 tok/图 与费用是没开缓存的实测值。生产环境把参考图放进 prompt 缓存后,重复部分按缓存读取计费(远低于标准输入价),单张成本会明显低于表中数字;本轮为保证与旧轮次可比没有启用。
- 成本怎么算:每张费用 = 该任务在评测集上的平均输入/输出 token × 官方单价(推理/思考 token 按输出计费);「标完 103k」再乘全库 103,353 张,只算一个任务,两个任务都标则相加。单价($/1M token,输入/输出):GPT-6 Astra 10 / 50、GPT-5.5 5 / 30(developers.openai.com,2026-09-15 查),Claude Opus 5 5 / 25;Batch 接口都是五折。组合规则要两个模型都作答,成本 = Astra 高推理 + Opus 5;表中「按需」= 只在 Astra 判「其他」时才调 Opus 5,按本评测集比例估算,全库非击球图更多,实际会更接近全额。H3 线性头无 API 费,但特征抽取 22.3 秒/图、每组占 2 张 A100-80G,标完 103k 约 1,280 GPU·时,且要先有约 1k 张标注来训练。Qwen3.6 为本地部署,只占 GPU 时间,不计费。耗时为评测时单次请求的中位数,不含并发。