← S23(SM8550)版对比 · 混合精度子页

yolo11n vs yolo11s · W8A16 · SM8850

把 S23 那一轮原样搬到 SM8850(Snapdragon 8 Elite Gen 5,Hexagon v81) 上重测: 同一批量化模型(不重新量化;C 臂用打过框解码补丁的版本)、同样三个切点、同样 fp32 / uint16 两种 I/O、每个编译产物 profile 3 次。 变的只有设备。

结论

延迟(SM8850 实测)

3 次 profile 的中位(括号里是范围)。

yolo11nyolo11sfp32 I/O

和 S23(SM8550)对比

同一个量化模型,两代 NPU 上的延迟(fp32 I/O,3 次中位)。「加速」= S23 / SM8850。

内存

context binary 是确定值,最可靠;推理峰值内存取区间上沿、3 次的中位(括号里是范围)。

峰值内存在 SM8850 上不区分模型:12 个编译产物的峰值上沿全部落在 9.6–11.3 MB,n 的 backbone 和 s 的全模型几乎一样 —— 这更像是这一代 runtime 的固定预分配,而不是模型本身的工作内存(S23 上同一批模型是 2.7–24 MB,差别明显)。 在 SM8850 上比较内存,看 context binary。

精度损失

量化模型与 S23 那一轮完全相同,所以本地 QDQ 的精度数字不变(各自相对自己的 FP32);新增的是在 SM8850 真机上对拍, 确认新一代 NPU 的算子实现没有带来额外偏差。

SM8850 真机对拍(40 张板球图)

口径