dev.to | 📄 原文链接 | 2026-08-27 收录

本地跑 Qwen 3.8 27B:真实 GGUF 大小、KV 缓存技巧与模板陷阱

来源:dev.to — 2026-08-14

📋 概述

Qwen 3.8 以两个不同许可的版本发布,只有一个是你能放在自己卡上的:本地最相关的是 Qwen 3.8 27B,13 日以 Apache 2.0 许可发布。模型是 27B 密集参数、64 层、hidden size 5120,有趣的在于 config.json 中 48 层线性注意力 + 16 层全注意力交错排列,只有 16 层保留 KV 缓存。文章给出各量化档真实文件大小(Q4_K_M 是 16/24GB 卡的甜点位),以及让人以为下载了坏模型的那个设置陷阱。

🔑 核心要点

💡 金句

只有一层模型属于你——长上下文便宜,但有一个设置会让你以为下了坏模型。
← 返回 dev.to 首页