在单颗 TPU v6e 芯片上运行 Gemma 4 E2B:推理部署深度解析
来源:dev.to/gde — 2026-07-21 发布
📋 概述
作者在 Google Cloud 的 flex-start TPU v6e 芯片上部署了 Google 的 Gemma 4 E2B(20 亿参数高效模型),并进行了实时测量。普通 bf16 版本可稳定运行,单用户 213 tok/s、16ms 首 token 延迟,并发下达到约 2200 tok/s,支持函数调用和视觉问答。但量化感知训练(QAT)版本的 checkpoint 全部无法加载——int4 压缩张量导出遇到了未实现的量化路径,bf16 QAT 导出触发了加载器 Bug,原因是 Gemma 4 实现要求按层归一化,而 E2B 的 KV 共享架构不具备。此外还发现一个推理解析器的配置交互问题:未启用思考模式时,schema 强制约束会被静默绕过。
🔑 核心要点
- Gemma 4 E2B bf16 在单颗 v6e 芯片上表现优异:213 tok/s 单用户,2200 tok/s 并发,16ms TTFT。
- QAT checkpoint 全部加载失败:int4 版本遇到未实现路径,bf16 版本因 E2B 架构缺少按层归一化而触发加载器 Bug,已向上游提交 issue。
- flex-start VM 按需分配、4 小时硬上限、$1.35/芯片小时,从启动到服务就绪约 8.5 分钟。
- vLLM 在 v6e 上自动选择 fp8_e5m2 KV 缓存,最大内存消耗来自 8 位量化之前的阶段。
- 发现一个 schema 强制约束的 Bug:未启用思考模式时,tool call schema 约束被静默绕过,返回 200 状态码。
💡 金句
The plain google/gemma-4-E2B-it serves well on one v6e chip; none of its QAT siblings load at all.
👍 0
👎 0
← 返回 Dev.to 首页