Dev.to | 📄 原文链接 | 2026-07-28 收录

Gemma 4 E2B 在单张 TPU v6e 芯片上的推理部署深度解析

来源:dev.to — 2026-07-21

📋 概述

在单张 TPU v6e 芯片(32GB HBM)上部署 google/gemma-4-E2B-it 的实测报告。这个 20 亿参数的模型在单用户场景下达 213 tok/s 吞吐、16ms 首令牌延迟,并发扩展到约 2200 tok/s。OpenAI 风格函数调用(包括并行调用和拒幻觉调用)零失误,简单视觉问答约 200ms。但 QAT 量化变体完全无法加载——int4 压缩张量导出遇到未实现的量化路径,bf16 QAT 因 Gemma 4 的 KV 共享架构缺少逐层 norm 而触发加载器 bug。

🔑 核心要点

💡 金句

The plain google/gemma-4-E2B-it serves well on one v6e chip; none of its QAT siblings load at all.
← 返回 Dev.to 首页