Dev.to | 📄 原文链接 | 2026-07-22 收录

在单颗 TPU v6e 芯片上运行 Gemma 4 E2B:推理部署深度解析

来源:dev.to/gde — 2026-07-21 发布

📋 概述

作者在 Google Cloud 的 flex-start TPU v6e 芯片上部署了 Google 的 Gemma 4 E2B(20 亿参数高效模型),并进行了实时测量。普通 bf16 版本可稳定运行,单用户 213 tok/s、16ms 首 token 延迟,并发下达到约 2200 tok/s,支持函数调用和视觉问答。但量化感知训练(QAT)版本的 checkpoint 全部无法加载——int4 压缩张量导出遇到了未实现的量化路径,bf16 QAT 导出触发了加载器 Bug,原因是 Gemma 4 实现要求按层归一化,而 E2B 的 KV 共享架构不具备。此外还发现一个推理解析器的配置交互问题:未启用思考模式时,schema 强制约束会被静默绕过。

🔑 核心要点

💡 金句

The plain google/gemma-4-E2B-it serves well on one v6e chip; none of its QAT siblings load at all.
← 返回 Dev.to 首页