量化模型评估三部曲:为什么 BPW 和 KLD 不是部署决策的可靠指标
来源:byteshape.com — 2026-07-15
📋 概述
ByteShape 发布了一个三部分系列文章,系统性地论证了单一代用指标(BPW、perplexity、KLD)不足以指导量化模型的选择。核心发现:KLD 可以检测严重退化的量化模型,但在接近基线质量的模型之间,排名信号完全崩溃。BPW 预测存储成本,但不预测实际推理速度——更小的量化模型可能比更大的慢。唯一可靠的方法是三步法:筛选可行性→基准测试下游质量→测量目标硬件上的吞吐量。
🔑 核心要点
- KLD 和 perplexity 的排名能力在高质量量化模型之间失效:它们能检测大幅偏离 BF16 的模型,但无法区分接近基线的模型哪个更好
- BPW 是存储成本的度量,不是速度——实际吞吐量取决于量化格式、kernel 支持、张量形状和 GPU 架构
- 用图表展示了「代用指标排名」与「实际部署排名」的巨大差异:许多模型的箭头很长,方向各异
- 三步部署选择法:(1) 筛选能装进 GPU 显存的模型;(2) 在真实任务上基准测试下游质量;(3) 在目标硬件上测量实际吞吐量
- 关键洞见:KLD 测量位移,基准测试质量取决于位移的方向——量化导致的差异可能帮助、损害或无影响
💡 金句
The quant that wins the proxies is often not the quant that wins in deployment.
👍 0
👎 0
← 返回 Lobsters 首页