实测 Qwen3.8 27B 各档量化:4-bit 几乎无损,压到 1-bit 能力彻底崩塌
来源:quesma.com — quesma.com · 64 分 · by stared
📋 概述
作者在 Modal GPU 上花掉约三千美元,用 llama.cpp 对 Qwen3.8 27B 的 8-bit、4-bit、2-bit、1-bit 四档 GGUF 量化版逐一跑 GPQA Diamond、IFBench、Terminal-Bench 2.1 等主流基准,检验压缩到底牺牲多少真实解题能力。结果发现 17GB 的 4-bit Q4_K_M 在智能体编码基准上几乎追平完整的 55GB BF16 模型,能塞进 24GB 显卡并留出约 6.4 万 token 上下文;但压缩存在悬崖——1-bit 模型在 GPQA Diamond 上表现接近瞎猜,且推理越长反而越差。
🔑 核心要点
- 完整 BF16 模型重约 55GB,超出一众消费级硬件承受范围。
- 17GB 的 4-bit Q4_K_M 在 Terminal-Bench 2.1 上与完整模型持平,可跑在 RTX 4090 这类 24GB 卡上。
- 压缩最终会撞上悬崖:1-bit 版在 GPQA Diamond 上接近随机水平。
- 推理 effort 设置影响很大(默认 xhigh),设不对反而会过度思考。
- 作者提醒判断量化好坏要看任务结果,而非单纯的 token 预测差异。
💡 金句
如果选 4-bit 的 Q4_K_M,在这些基准上你几乎察觉不到和完整模型的差别。
👍 0
👎 0
← 返回 Hacker News 首页