通过 MCP 操作一块 MI300X:矩阵核到底能算什么
来源:dev.to — 2026-09-17
📋 概述
作者用 12 个按 tag 划范围的 MCP 工具,把云端一块 MI300X($1.99/小时,本机没有 AMD 卡)完整管了起来,并从硅片上直接读出数值格式的真实能力:fp8 e4m3fnuz 相对 bf16 是 1.77 倍,AMD 标称同速的 int8 只有 0.69 倍,fp4 在这块卡上根本不存在。文中还记录了 fnuz 与 fn 的致命区别,以及两处一开始读错的数据。
🔑 核心要点
- 工具刻意不提供 create / destroy:创建与销毁都不该离模型一次调用这么近,那是控制台该做的决定。
- 关机并不停止计费——这条被写进工具输出而不是 README,因为它是整个服务器存在的理由。
- 虚拟化卡上的 ASD、PFP、MES、SOS 固件查询返回「系统不支持」,amd-smi 也看不到分区。
- 数值格式不能想当然:float8_e4m3fn 能往返 448,e4m3fnuz 把它变成 NaN。
- 同一负载下「坏的那版镜像夹在两个能跑的版本之间」,版本直觉并不适用。
💡 金句
448 在 H100 上是一个普通权重,在 MI300X 上是 NaN。
👍 0
👎 0
← 返回 dev.to 首页