OpenAI 用自己的大模型设计了 Jalapeño 芯片
来源: spectrum.ieee.org — 2026-09-14
概述
IEEE Spectrum 复盘 OpenAI 在 8 月 25 日发布的加速器 Jalapeño:4 位算力最高 13.4 petaflops,搭载 232GB 最新一代内存、带宽 15.4 TB/s,官方基准显示端到端延迟比英伟达 GB300 最多低 3.6 倍且更省电。更值得关注的是设计过程本身——从架构概念到首片硅不到 20 个月,RTL 到流片只隔 9 个月,团队规模长期在 100 人以下。前端的核心是用谷歌开源的 XLS 高层综合工具链,因为它「看起来像软件」,而大模型更擅长软件。
核心要点
- 时间线被压缩到罕见程度:从概念到首片硅不到 20 个月,从第一版 RTL 到流片只有 9 个月,团队平均不到 100 人。
- 分工上 OpenAI 负责端到端系统设计(推理加速器、内存层级、网络),Broadcom 负责从门级往后的物理设计并一路带到量产。
- 前端工作流围绕谷歌开源的 XLS 展开:工程师用 DSLX 或 C++ 编写,由 XLS 转成 Verilog,因为这一步「看起来像软件」,模型能吃到好处。
- 芯片回来后,团队用内部模型自动设计基准测试的软件:DeepSeek 多头潜在注意力内核的性能从理论天花板的 0.31% 提升到 88.94%,只用了约 40 小时。
- 在 Hot Chips 2026 上他们给出物理设计优化的量化收益:矩阵乘法单元的面积相对人工调优基线减少 10%。
- 模型能力本身在项目周期内换代:开工时用 o3,收尾时已用上 GPT-6 Astra 的前身,后者能直接写 Verilog,无需借道 XLS。
- 两位负责人同时划清边界:「我们并不是说任何人都能靠 Codex 造出最前沿的 AI 加速器芯片」,芯片设计仍无法完全自动化。
金句
模型正在给我们的工程师超能力。工程师仍然主导工作,仍然是最终拍板的人,但他们能快很多,也能探索多得多的路径。
👍 0
👎 0
← 返回 Lobsters 首页