Qwen 3.8 27B 对比 3.6 27B:同一架构,四个月,另一种升级
来源:dev.to — 2026-09-06
📋 概述
两款模型纸面几乎相同:同为稠密 27B、混合架构、262144 token 上下文、Apache 2.0 与同款视觉编码器。3.6-27B 四个月前发布时被誉为「本地开发的甜点位」,3.8-27B 上周发布后一天内登上 HN 榜首。真正的差异不在架构(两者 config 近乎相同)而在后训练:3.8 用更多数据与更强 agentic 轨迹强化学习,换来的是 agentic 与电脑使用任务上 20 分级的暴涨(OSWorld +20、WebArena +16、AndroidWorld +12),而纯推理进步有限。代价是 3.8 默认高推理档位爱过度思考、token 燃烧凶猛,社区口碑从「甜点位」翻转为「过度思考者」。结论一句话:3.8 是更强的模型,3.6 是更顺手的模型——做 agent 就升 3.8,做日常聊天补全则不必。
🔑 核心要点
- 升级的实质不是新架构而是后训练:两者 config 几乎一致,3.8 靠更多数据与 agentic 轨迹强化学习,换来 agentic/电脑使用任务上 20 分级的暴涨而非全维度小幅提升
- 关键基准:Terminal Bench 2.1 从 63.4 到 73.0,OSWorld-Verified 从 63.9 到 84.3(甚至超过表中 Opus 4.6 Max 的 72.7),而 GPQA Diamond 仅从 87.8 微升到 89.2——纯推理增益有限
- 行为差异最影响日常:3.8 默认 xhigh 推理档,社区实测它为一个 SVG 花 21 分钟烧 22276 个推理 token,写代码「过度思考到产出糟糕的灌木式代码」
- 长期上下文代价更狠:同参数规模下 3.8 的长上下文胃口更凶,128K 甚至在 V projection 量化到 Q4_0 后都塞不进某些显卡,选卡前必须算清 VRAM
- 3.8 还新增 reasoning_effort 档位(xhigh/medium/low)并把 preserve_thinking 默认开启,token 开销与 KV 缓存行为对每个会话都改变;官方也推出 FP8 量化与即将上线的 1M 上下文托管 API
💡 金句
诚实的总结是:3.8 是更强的模型,3.6 是更顺手的模型——一个是要被驯服的基准冠军,另一个是被验证过的日常主力。
👍 0
👎 0
← 返回 dev.to 首页