Lobsters | 原文链接 | 2026-09-10 收录

Qwen3.8 27B 量化实测:4-bit 撑得住,1-bit 全面崩盘(量化的损伤是非线性的)

来源: quesma.com — 2026-08-26

概述

Quesma 的 Piotr Migdał 花掉约三千美元 Modal GPU 时,系统测了 Qwen3.8 27B 各种 Unsloth 量化版本在三个基准上的表现,结论相当清晰:17GB 的 Q4_K_M 在代理编码基准 Terminal-Bench 2.1 上能和 55GB 的 BF16 全精度模型打个平手、可装进 24GB 的 RTX 4090,这符合「拥抱量化而非恐惧它」的立场;指令遵循 IFBench 上 11GB 的 2-bit 也看不出差异。但他也验证了那句「量化损伤是非线性的」:从全精度到 4-bit 几乎没有可测变化,2-bit 开始小幅回落(仍是 Opus 4.7/Gemini 3.1 Pro 级别),到 1-bit 就坠下悬崖——UD-IQ1_S 在 GPQA Diamond 上只到随机猜测水平,且推理越长反而越差,因为模型常在 token 预算耗尽后交白卷。全文还给了成本数字(Terminal-Bench 全测约 $2308)、KV-cache 是否更怕量化的未解之问,以及给普通用户的建议:别用 1-bit 干正经推理。

核心要点

金句

Compression eventually hits a cliff... quantization damage is nonlinear: first there is no measurable change, then a small decline, and finally a collapse.
返回 Lobsters 首页