Hacker News | 📄 原文链接 | 2026-09-09 收录

实测 Qwen3.8 27B 各档量化:4-bit 几乎无损,压到 1-bit 能力彻底崩塌

来源:quesma.com — quesma.com · 64 分 · by stared

📋 概述

作者在 Modal GPU 上花掉约三千美元,用 llama.cpp 对 Qwen3.8 27B 的 8-bit、4-bit、2-bit、1-bit 四档 GGUF 量化版逐一跑 GPQA Diamond、IFBench、Terminal-Bench 2.1 等主流基准,检验压缩到底牺牲多少真实解题能力。结果发现 17GB 的 4-bit Q4_K_M 在智能体编码基准上几乎追平完整的 55GB BF16 模型,能塞进 24GB 显卡并留出约 6.4 万 token 上下文;但压缩存在悬崖——1-bit 模型在 GPQA Diamond 上表现接近瞎猜,且推理越长反而越差。

🔑 核心要点

💡 金句

如果选 4-bit 的 Q4_K_M,在这些基准上你几乎察觉不到和完整模型的差别。
← 返回 Hacker News 首页