一篇完整的部署实录:把 Gemma 4 E2B 部署到 AMD Developer Cloud 上的单张 Instinct MI300X,整条流程由一套 Python MCP 工具驱动,而操作它的工作站里根本没有 AMD 显卡。作者给出实测吞吐:单流 305 token/秒,64 并发时 10284 token/秒,折合每美元小时 2713 token。文章强调一个取舍原则:创建与销毁实例是可以按小时烧钱的决定,因此刻意留在控制台手工操作,不交给 Agent。