GLM 自己造出了自己的推理基础设施
来源:z.ai — z.ai · 248 分 · by whiteros_e
📋 概述
智谱在这篇文章里给出的例子已经不是「模型帮忙写代码」,而是模型直接参与造自己的运行时:GLM-5.3-Flash 的生产推理服务搭在十多万张国产 AI 加速器组成的集群上,从首次跑通到能扛住线上流量,整条系统工程里很大一部分由一个由 GLM-5.3 驱动的 Infra Agent 完成。难点写在纸面上:没人在这规模上部署过国产加速器,显存容量与带宽都偏紧,还要支持新架构、百万 token 上下文与多模态请求,生态不成熟、kernel 支持不全,很多本该有文档的地方只能靠猜。最终成果是在匿名代号 Ox-Alpha 下上了 OpenCode 与 OpenRouter,一周内成为两个平台使用量最高的模型,六天处理超 62 万亿 token。
🔑 核心要点
- 生产推理服务搭在 十多万张国产 AI 加速器上。
- 大量工程由 GLM-5.3 驱动的 Infra Agent完成,而非全靠人力。
- 优化手段包括 ReplaySSM、W8A8 量化、混合精度缓存量化、Layer Split。
- 引入 Encode-Prefill-Decode 分离架构,端到端性能提升约 3 倍。
- 匿名上线即成为 OpenCode 与 OpenRouter 使用量第一,六天 62 万亿 token。
💡 金句
模型优化系统,系统运行模型。
👍 0
👎 0
← 返回 Hacker News 首页