Hacker News | 📄 原文链接 | 2026-09-05 收录

通义 Qwen 3.8 27B 上线 Cerebras,推理速度达 1500 tokens/s

来源:inference-docs.cerebras.ai — inference-docs.cerebras.ai · 653 分 · by altertable

📋 概述

开源权重模型 Qwen 3.8 27B 现已在 Cerebras 的晶圆级推理服务上开放,宣称吞吐可达每秒 1500 个 token。对需要低延迟、高吞吐的实时应用与规模化服务而言,这一速度意味着开源小模型也能跑出接近前沿商用服务的响应手感,进一步拓宽了开源模型在云端与端侧部署的适用场景。

🔑 核心要点

💡 金句

速度从来不是模型智商的装饰品——当吞吐够快,开源小模型才配谈真正的落地。
← 返回 Hacker News 首页