原标题:《Speculative Decoding in vLLM on AMD GPUs》 评分: 124 | 作者: ankitg12 💭 AMD 只卖卡,不准备顺手把驱动写好吗? 🎯 讨论背景 这篇讨论围绕 vLLM(一个用于大模型推理的开源服务框架)在 AMD GPU 上加入 speculative decoding 展开。speculative decoding 的思路是先让便宜的 draft model 预测多个候选 token,再由更大的 target model 一次性验证,从而把原本串行的解码变成更偏并行的验证流程。评论里很多人把焦点放在 AMD 的 ROCm(AMD 的 GPU 计算软件栈)、R9700 这类工作站卡,以及社区 fork 如 Radiance、R4D kernel、MXFP4 支持上,因为这些项目往往比官方栈更能榨出吞吐。讨论还延伸到 Qwen3.8-27B 等本地模型、RTX 3090、NVLink 和 PCIe 带宽,说明本地 LLM 推理里软件优化、显存容量和多卡通信都同样关键。 📌 讨论焦点 speculative decoding 机