Hacker News | 📄 原文链接 | 2026-09-18 收录

GLM 自己造出了自己的推理基础设施

来源:z.ai — z.ai · 248 分 · by whiteros_e

📋 概述

智谱在这篇文章里给出的例子已经不是「模型帮忙写代码」,而是模型直接参与造自己的运行时:GLM-5.3-Flash 的生产推理服务搭在十多万张国产 AI 加速器组成的集群上,从首次跑通到能扛住线上流量,整条系统工程里很大一部分由一个由 GLM-5.3 驱动的 Infra Agent 完成。难点写在纸面上:没人在这规模上部署过国产加速器,显存容量与带宽都偏紧,还要支持新架构、百万 token 上下文与多模态请求,生态不成熟、kernel 支持不全,很多本该有文档的地方只能靠猜。最终成果是在匿名代号 Ox-Alpha 下上了 OpenCode 与 OpenRouter,一周内成为两个平台使用量最高的模型,六天处理超 62 万亿 token。

🔑 核心要点

💡 金句

模型优化系统,系统运行模型。
← 返回 Hacker News 首页