本地跑 Qwen 3.8 27B:真实 GGUF 大小、KV 缓存技巧与模板陷阱
来源:dev.to — 2026-08-14
📋 概述
Qwen 3.8 以两个不同许可的版本发布,只有一个是你能放在自己卡上的:本地最相关的是 Qwen 3.8 27B,13 日以 Apache 2.0 许可发布。模型是 27B 密集参数、64 层、hidden size 5120,有趣的在于 config.json 中 48 层线性注意力 + 16 层全注意力交错排列,只有 16 层保留 KV 缓存。文章给出各量化档真实文件大小(Q4_K_M 是 16/24GB 卡的甜点位),以及让人以为下载了坏模型的那个设置陷阱。
🔑 核心要点
Qwen 3.8 27B 以 Apache 2.0 发布,是唯一可本地自部署的版本。
架构为 48 层线性注意力加 16 层全注意力交错,仅 16 层保留 KV 缓存。
各量化档真实体积:Q4_K_M(17.1GB)是 24GB 卡的甜点位。
有一个设置陷阱会让人误以为下载了损坏的量化模型。
💡 金句
只有一层模型属于你——长上下文便宜,但有一个设置会让你以为下了坏模型。
👍 0
👎 0
← 返回 dev.to 首页