腾讯:自适应剪枝优化高并发推理

📅 2026/7/24 19:46:05 👁️ 阅读次数 📝 编程学习
腾讯:自适应剪枝优化高并发推理

📖标题:D-cut: Adaptive Verification Depth Pruning for Batched Speculative Decoding
🌐来源:arXiv, 2607.14647v1

🛎️文章简介
🔸研究问题:在高并发场景下,长草稿的投机解码因验证大量被拒令牌导致计算浪费,甚至性能低于自回归解码,如何解决这一验证成本爆炸问题?
🔸主要贡献:论文提出D-cut,一种基于草稿置信度和运行时成本模型的自适应跨请求剪枝策略,显著提升了高并发下的推理加速比。

📝重点思路
🔸跨请求动态剪枝:打破每个请求固定验证深度的限制,将批次内所有草稿令牌视为共享一个验证预算。利用草稿模型生成的令牌级置信度,对所有候选令牌进行全局排序,保留高置信度前缀,剪除低置信度后缀,从而将计算资源集中在更可能被接受的令牌上。
🔸运行时自适应预算分配:认识到验证成本高度依赖硬件环境(如GPU类型、并行策略),D-cut在启动阶段对系统进行 profiling,构建不同批量大小和保留比例下的延迟成本表。运行时结合预估的算法收益(基于置信度)和实测的硬件成本,动态选择能最大化整体加速比的全局验证预算比例。
🔸无损输出分布:通过仅修剪低效用后缀并保持目标模型的接受/拒绝逻辑不变,确保最终输出分布与原始目标模型完全一致,实现无损加速。

🔎分析总结
🔸高并发性能显著提升:在密集模型和MoE模型上的实验显示,D-cut将平均加速比从1.26倍提升至1.65倍。特别是在高并发下,它恢复了那些因长草稿导致验证开销过大而性能低于自回归基线的配置的性能。
🔸硬件适应性强:在计算受限的H20 GPU上,D-cut倾向于激进剪枝以降低验证延迟;在计算丰富的H800 GPU上,则保守剪枝以利用多余算力。这种自适应能力使其在不同硬件上均能接近最优固定比例的performance,无需人工调优。
🔸MoE模型加速明显:在MoE架构模型上,D-cut相比自回归解码最高可实现3.0倍的加速,证明了其在处理复杂模型结构时的高效性。

💡个人观点
论文将投机解码的优化视角从单请求的草稿生成质量,转移到了批处理层面的验证资源分配效率,利用 draft 生成时的置信度来估计每个 draft token 的"验证价值"。