Hacker News | 📄 原文链接 | 2026-09-08 收录

vLLM 在 AMD GPU 上实测投机解码:草稿-验证到底快不快

来源:vllm.ai — vllm.ai · 96 分 · by ankitg12

📋 概述

vLLM 官方博客分享在 AMD Instinct MI300X / MI355X 上用 ROCm 实测投机解码(Speculative Decoding)的结果。投机解码的思路是:用一个轻量草稿组件一次提议多个候选 token,再由原模型在单次前向里从左到右验证并提交被接受的 token,从而减少逐 token 解码的往返。文章对比了 native MTP、Gemma 4 MTP、EAGLE-3、DFlash、DSpark 五种草稿方法,结论是吞吐收益因草稿方式、提议长度、模型族与接受行为而异,并非无条件加速,并给出在 ROCm 环境下的启用配置与调参建议。

🔑 核心要点

💡 金句

投机解码不是免费加速器——它的提速,取决于你的草稿够不够懂你的模型。
← 返回 Hacker News 首页