把 S23 那一轮原样搬到 SM8850(Snapdragon 8 Elite Gen 5,Hexagon v81) 上重测: 同一批量化模型(不重新量化;C 臂用打过框解码补丁的版本)、同样三个切点、同样 fp32 / uint16 两种 I/O、每个编译产物 profile 3 次。 变的只有设备。
3 次 profile 的中位(括号里是范围)。
同一个量化模型,两代 NPU 上的延迟(fp32 I/O,3 次中位)。「加速」= S23 / SM8850。
context binary 是确定值,最可靠;推理峰值内存取区间上沿、3 次的中位(括号里是范围)。
量化模型与 S23 那一轮完全相同,所以本地 QDQ 的精度数字不变(各自相对自己的 FP32);新增的是在 SM8850 真机上对拍, 确认新一代 NPU 的算子实现没有带来额外偏差。
sm8850,Hexagon v81)—— 高通参考机,非三星定制的 SM8850-AD。quant_patch_decode_encoding.py 修补后的 QDQ。--target_runtime precompiled_qnn_onnx(± --quantize_io),为 SM8850 单独编译;每个产物 profile 3 次。python scripts/quant_y11s_device_sweep.py --device "Snapdragon 8 Elite Gen 5 QRD" --tag sm8850 → quant_y11s_build_viewer.py。