Qwen3.8 27B 量化实测:4-bit 撑得住,1-bit 全面崩盘(量化的损伤是非线性的)
来源: quesma.com — 2026-08-26
概述
Quesma 的 Piotr Migdał 花掉约三千美元 Modal GPU 时,系统测了 Qwen3.8 27B 各种 Unsloth 量化版本在三个基准上的表现,结论相当清晰:17GB 的 Q4_K_M 在代理编码基准 Terminal-Bench 2.1 上能和 55GB 的 BF16 全精度模型打个平手、可装进 24GB 的 RTX 4090,这符合「拥抱量化而非恐惧它」的立场;指令遵循 IFBench 上 11GB 的 2-bit 也看不出差异。但他也验证了那句「量化损伤是非线性的」:从全精度到 4-bit 几乎没有可测变化,2-bit 开始小幅回落(仍是 Opus 4.7/Gemini 3.1 Pro 级别),到 1-bit 就坠下悬崖——UD-IQ1_S 在 GPQA Diamond 上只到随机猜测水平,且推理越长反而越差,因为模型常在 token 预算耗尽后交白卷。全文还给了成本数字(Terminal-Bench 全测约 $2308)、KV-cache 是否更怕量化的未解之问,以及给普通用户的建议:别用 1-bit 干正经推理。
核心要点
55GB 的 BF16 全精度模型超出消费级硬件,而 17GB 的 Q4_K_M 在 Terminal-Bench 上与它持平
Q4_K_M 能装进 24GB 的 RTX 4090 ,还余下约 64k token 上下文
IFBench 上 2-bit(约 11GB)与全精度看不出差异 ,但 GPQA 已小幅回落
1-bit 在 GPQA Diamond 上跌到随机猜测 ,更长推理反而更差、常交白卷
量化损伤是非线性的 :先无可测变化、再小降、最后崩盘
Unsloth 声称 1-bit 保留 72% top-1 精度,但这剩下的 28% 恰恰是关键
金句
Compression eventually hits a cliff... quantization damage is nonlinear: first there is no measurable change, then a small decline, and finally a collapse.
👍 0
点赞
👎 0
沉底
返回 Lobsters 首页