微信扫码实时跟踪AI前沿
vLLM团队发布了一份关于在AMD GPU上使用推测解码(Speculative Decoding)的实用指南。推测解码允许vLLM在单次目标模型传递中验证多个草稿token,同时保持目标模型的输出行为不变,有望显著提升推理效率。该指南基于...