vLLM 在 AMD GPU 上实测投机解码:草稿-验证到底快不快
来源:vllm.ai — vllm.ai · 96 分 · by ankitg12
📋 概述
vLLM 官方博客分享在 AMD Instinct MI300X / MI355X 上用 ROCm 实测投机解码(Speculative Decoding)的结果。投机解码的思路是:用一个轻量草稿组件一次提议多个候选 token,再由原模型在单次前向里从左到右验证并提交被接受的 token,从而减少逐 token 解码的往返。文章对比了 native MTP、Gemma 4 MTP、EAGLE-3、DFlash、DSpark 五种草稿方法,结论是吞吐收益因草稿方式、提议长度、模型族与接受行为而异,并非无条件加速,并给出在 ROCm 环境下的启用配置与调参建议。
🔑 核心要点
- 投机解码 = 草稿提议多个候选 + 目标模型一次前向验证提交,减少解码往返。
- 对比五种草稿方案:native MTP、Gemma 4 MTP、EAGLE-3、DFlash、DSpark。
- 结论是吞吐收益随方法、提议长度、模型族与接受率而变,并非稳赚。
- 实测环境为 AMD MI300X / MI355X + ROCm 开放平台,给出具体配置示例。
💡 金句
投机解码不是免费加速器——它的提速,取决于你的草稿够不够懂你的模型。
👍 0
👎 0
← 返回 Hacker News 首页