一篇关于将 Google Gemma-4 系列模型移植到 AWS Inferentia2 的实战报告。作者记录了混合注意力头的兼容性问题、vLLM/optimum-neuron/NxD 三条路径的死胡同、以及 neuronx-cc 编译器的各种限制——这是一份踩坑实录而非成功故事。