在 EC2 G5g 上跑 Gemma 4:Graviton2 + NVIDIA GPU 的硬核实战
来源:dev.to — 2026-08-13 — 5 min
📋 概述
一篇关于在 AWS EC2 G5g(Graviton2 aarch64 主机 + NVIDIA T4G GPU,算力 SM 7.5)上托管 Google Gemma 4 E2B 的实战报告。三个障碍:几乎无人发布这套「aarch64 + SM 7.5」组合的构建、只有最新版 vLLM 才满足的版本下限、以及 32/64 KiB 共享内存让模型直接停摆。作者用 Deep Learning ARM64 AMI、PyTorch 2.12 + CUDA 13.2、从源码构建的 vLLM v0.27.2rc0(sm_75),打了一个补丁后取得 43.1 tok/s 单流贪心、329,579 token KV cache 的结果。G5g 是 AWS 唯一把 NVIDIA GPU 放到 Graviton 主机后的实例,2020 年发布后从未有继任者。
🔑 核心要点
- G5g 是 AWS 唯一「Graviton 主机 + NVIDIA GPU」的实例,aarch64 且算力 7.5,几乎无人发布该组合的构建。
- 三大坑:无 aarch64+SM7.5 官方构建、只有最新 vLLM 满足版本下限、32KiB 共享内存令模型停摆。
- 环境:Deep Learning ARM64 AMI、PyTorch 2.12.0+cu132、CUDA 13.2、源码构建 vLLM v0.27.2rc0。
- 打一个补丁后达到 43.1 tok/s 单流贪心与 329,579-token KV cache。
- 难点全在你看不到的地方失败:编译器缺失、版本下限、共享内存,问题都不在你查找之处。
💡 金句
一切都失败在你没有查找的地方——编译器不在、版本下限超出预期、共享内存不足。
👍 0
👎 0
← 返回 dev.to 首页