用编程助手技能在云端芯片上运行大模型
来源:dev.to/gde — 2026-07-21 发布
📋 概述
作者将部署 Gemma 4 到 Cloud TPU 的完整流程打包成一个 Claude Code 技能加 MCP 服务器(tpu-devops),提供约 40 个工具。从搜索可用区域容量、创建 flex-start TPU 虚拟机、配置 Docker 和 vLLM、拉取 Hugging Face token、到基准测试和自动销毁,全流程只需一条 /plugin install 命令。该技能编码了众多凌晨两点才能学到的硬核细节——默认 10GB 启动盘不足以容纳 vLLM 镜像、需通过串行控制台而非 SSH 监控启动、Gemma 4 所需的特定 vLLM 标志(如 --tool-call-parser gemma4)等。
🔑 核心要点
- 提供了 约 40 个 MCP 工具,涵盖发现容量、创建 TPU VM、服务管理、诊断、基准测试和资源销毁的完整生命周期。
- 一份 Claude Code 插件市场 命令即可安装技能和 MCP 服务器:/plugin marketplace add xbill9/tpu-skill-claude。
- 内置 Gemma-4 驱动的日志分析——自托管的模型分析自身基础设施的日志,实现自指诊断。
- 整理了多个隐藏细节:默认 10GB 启动盘不够用、TPUS_PER_TPU_FAMILY 配额对 gcloud 不可见、需用串行控制台而非 SSH。
- 包含针对 Gemma 4 优化的 vLLM 标志,如 --tool-call-parser gemma4 和 --disable_chunked_mm_input。
💡 金句
I packaged all of that into tpu-management — a Claude Code skill plus an MCP server — so you can just ask Claude to do it.
👍 0
👎 0
← 返回 Dev.to 首页