Gemma 4 E2B 在单张 TPU v6e 芯片上的推理部署深度解析
来源:dev.to — 2026-07-21
📋 概述
在单张 TPU v6e 芯片(32GB HBM)上部署 google/gemma-4-E2B-it 的实测报告。这个 20 亿参数的模型在单用户场景下达 213 tok/s 吞吐、16ms 首令牌延迟,并发扩展到约 2200 tok/s。OpenAI 风格函数调用(包括并行调用和拒幻觉调用)零失误,简单视觉问答约 200ms。但 QAT 量化变体完全无法加载——int4 压缩张量导出遇到未实现的量化路径,bf16 QAT 因 Gemma 4 的 KV 共享架构缺少逐层 norm 而触发加载器 bug。
🔑 核心要点
- Gemma 4 E2B(20 亿参数)在单张 TPU v6e 上实现213 tok/s 单用户吞吐、16ms 首令牌延迟
- 并发扩展至约2200 输出 tok/s,支持 OpenAI 风格函数调用、并行调用和拒幻觉调用——零失误
- QAT 量化变体完全无法加载——int4 和 bf16 QAT 均因架构不兼容触发不同错误
- 推理配置存在一个耦合问题:思维链解析器启用时才会执行 schema 强制,关闭思维时请求无约束通过
💡 金句
The plain google/gemma-4-E2B-it serves well on one v6e chip; none of its QAT siblings load at all.
👍 0
👎 0
← 返回 Dev.to 首页