通义 Qwen 3.8 27B 上线 Cerebras,推理速度达 1500 tokens/s
来源:inference-docs.cerebras.ai — inference-docs.cerebras.ai · 653 分 · by altertable
📋 概述
开源权重模型 Qwen 3.8 27B 现已在 Cerebras 的晶圆级推理服务上开放,宣称吞吐可达每秒 1500 个 token。对需要低延迟、高吞吐的实时应用与规模化服务而言,这一速度意味着开源小模型也能跑出接近前沿商用服务的响应手感,进一步拓宽了开源模型在云端与端侧部署的适用场景。
🔑 核心要点
- Qwen 3.8 27B 在 Cerebras 推理服务上开放。
- 宣称吞吐达1500 tokens/s。
- 适合低延迟、高吞吐的实时/规模化场景。
- 让开源 27B 模型更接近商用前沿的响应手感。
💡 金句
速度从来不是模型智商的装饰品——当吞吐够快,开源小模型才配谈真正的落地。
👍 0
👎 0
← 返回 Hacker News 首页