dev.to | 📄 原文链接 | 2026-08-15 收录

在 EC2 G5g 上跑 Gemma 4:Graviton2 + NVIDIA GPU 的硬核实战

来源:dev.to — 2026-08-13 — 5 min

📋 概述

一篇关于在 AWS EC2 G5g(Graviton2 aarch64 主机 + NVIDIA T4G GPU,算力 SM 7.5)上托管 Google Gemma 4 E2B 的实战报告。三个障碍:几乎无人发布这套「aarch64 + SM 7.5」组合的构建、只有最新版 vLLM 才满足的版本下限、以及 32/64 KiB 共享内存让模型直接停摆。作者用 Deep Learning ARM64 AMI、PyTorch 2.12 + CUDA 13.2、从源码构建的 vLLM v0.27.2rc0(sm_75),打了一个补丁后取得 43.1 tok/s 单流贪心、329,579 token KV cache 的结果。G5g 是 AWS 唯一把 NVIDIA GPU 放到 Graviton 主机后的实例,2020 年发布后从未有继任者。

🔑 核心要点

💡 金句

一切都失败在你没有查找的地方——编译器不在、版本下限超出预期、共享内存不足。
← 返回 dev.to 首页