Gemma 4 E2B 单 TPU v6e 芯片服务深度评测
来源:dev.to — Jul 21
📋 概述
作者实测在单个 TPU v6e 芯片(32GB HBM)上运行 Gemma 4 E2B(20 亿参数)模型。基础版本表现优异:单用户 213 tok/s、首 token 延迟 16ms、并发下可达约 2200 tok/s,支持 OpenAI 风格函数调用且零幻觉。但 QAT 量化版本全部无法加载——int4 路径未实现、bf16 遇到 loader bug。vision 问答约 200ms 响应。
🔑 核心要点
- 原始 E2B 模型在单 v6e 芯片上单用户 213 tok/s,并发 ~2200 tok/s,首 token 16ms
- 支持函数调用且零幻觉——包括并行调用和正确拒绝无依据的调用
- QAT 量化变体全部失败:int4 压缩张量遇未实现路径,bf16 触发 loader bug
- 视觉问答约 200ms 准确回答简单图像问题
💡 金句
一个 20 亿参数的模型在单块 v6e 芯片上的表现远超预期——但 QAT 检查点一个都加载不了,这是需要上游修复的真实差距。
👍 0
👎 0
← 返回 Dev.to 首页