Dev.to | 📄 原文链接 | 2026-07-24 收录

Gemma 4 E2B 单 TPU v6e 芯片服务深度评测

来源:dev.to — Jul 21

📋 概述

作者实测在单个 TPU v6e 芯片(32GB HBM)上运行 Gemma 4 E2B(20 亿参数)模型。基础版本表现优异:单用户 213 tok/s、首 token 延迟 16ms、并发下可达约 2200 tok/s,支持 OpenAI 风格函数调用且零幻觉。但 QAT 量化版本全部无法加载——int4 路径未实现、bf16 遇到 loader bug。vision 问答约 200ms 响应。

🔑 核心要点

💡 金句

一个 20 亿参数的模型在单块 v6e 芯片上的表现远超预期——但 QAT 检查点一个都加载不了,这是需要上游修复的真实差距。
← 返回 Dev.to 首页