三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

Beyond Prediction: Tail-Aware Scheduling for LLM Inference——超越预测:面向LLM推理的尾部感知调度

Beyond Prediction: Tail-Aware Scheduling for LLM Inference——超越预测:面向LLM推理的尾部感知调度

核心问题:当前主流的LLM调度器依赖预测请求长度来近似SJF/SRPT,虽然能优化平均延迟,但在面对长度高度可变、分布频繁变化的推理工作负载时,尾部延迟(P95/P99)表现很差,且对分布偏移、突发流量和内存压力非常脆弱。

核心主张:我们不需要预测长度来优化尾部延迟。相反,应该用轻量级统计信号驱动的“软优先级提升”策略,结合KV缓存感知的抢占管理,来实现更好的尾部性能,而且无需任何长度预测。

研究背景与动机(为什么做这个工作)

  1. 长度预测不可靠:实验表明,即使相同提示重复运行,输出长度变异系数(CV)可高达0.47,跨模型、跨任务均高度不稳定,预测本质上困难。

  2. 均值优化≠尾部优化:SJF/SRPT在理论上是最小化平均响应时间的最优策略,但它们对尾部延迟没有保证,甚至可能表现很差。而LLM服务的实际SLO瓶颈通常是P95/P99尾部延迟。

  3. 推理工作负载加剧问题:推理增强型LLM(如DeepSeek-R1)生成长度极度可变,且任务分布随时变化,预测器容易失效。

  4. KV缓存耦合带来额外挑战:LLM推理是有状态的,抢占一个长请求意味着要驱逐/重载其大型KV缓存,代价高昂。单纯追求短作业优先可能引发缓存抖动,反而拖累尾部。

主要贡献(做了什么)

1. 提出 UNIBOOST 调度框架

一个无需预测、尾部感知、KV缓存协同的LLM调度器。核心设计包含四个阶段:

阶段名称核心思想
阶段1DiSTBoost(初始方案)将预填充和解码分成独立队列,分别调度。但存在跨阶段队头阻塞问题。
阶段2UNIBOOST-BASE(统一优先级)将预填充和解码统一到单一优先级空间,使用γ-Boost软优先级函数:优先级 = 到达时间 − 提升值(短作业提升更大),平滑插值于FCFS和SRPT之间。
阶段3MEMGUARD(KV感知迟滞)引入几何量化的优先级更新阈值(256令牌),减少频繁抢占和KV交换,将对数级别的抢占次数限制在 ≤ log₂(长度/256)。
阶段4γ-Ada(自适应参数)根据实时观测到的尾部延迟分布(P95/P99),在线调整γ参数,自适应工作负载变化。

2. 理论保障

  • 在M/G/1队列模型下,证明 UNIBOOST 可达到强尾部最优性(尾部最优常数 Kπ = 1)。

  • 证明了策略不会导致长请求饥饿:最坏情况下延迟退化受交叉工作量V控制,且 E[e^{γV}] 有界。

  • 实验验证在接近饱和负载(ρ ≈ 0.99)下,长请求延迟不随到达顺序增长,无饥饿现象。

3. 系统实现与评估

  • 实现于类vLLM/SGLang的连续批处理、分块预填充架构中。

  • 测试平台:8× NVIDIA A100 80GB,模型包括 Llama-3-8B、CodeLlama-34B、Qwen-72B。

  • 工作负载涵盖对话(ShareGPT/Azure)、代码(BigCodeBench)、推理(S1K)及其混合。

核心实验结果

与SRPT(完美预测)对比

在混合推理+聊天负载下,以具有完美长度预测的TRAIL/SRPT为基线:

指标UNIBOOST相对改进
P99 TTLT提升约35%
P95 TTFT提升约97%
P99 TTFT提升约34%
吞吐量基本持平(+1.2%)

注意:UNIBOOST在平均延迟上略有牺牲(约−19%),但换来的是尾部大幅改善,这正是设计的核心权衡。

鲁棒性

  • 在分布偏移(推理占比从20%变到70%)、突发到达、高负载(ρ=0.99)下,UNIBOOST始终保持稳定,而预测驱动策略在尾部剧烈恶化。

  • SLO达成率:相比SJF,可实现2.9−8.7×更严格的TTFT SLO,1.7−4.3×更严格的TTLT SLO。

消融实验

每个阶段都有明确贡献:

  • 阶段2(统一优先级)比阶段1显著延迟了负载拐点;

  • 阶段3(MemGuard)再降低尾部1.5−2×;

  • 阶段4(自适应γ)在接近饱和时进一步将P99保持亚秒级,而替代方案已升至数秒。

与现有工作的关键区别

维度LTR/SJF(Fu等)TRAIL/SRPT(Shahout等)UNIBOOST(本文)
是否需要长度预测是(排名)是(长度)
优化目标平均延迟为主平均延迟为主尾部延迟(P95/P99)
分布鲁棒性脆弱脆弱鲁棒
KV缓存感知部分部分协同设计
理论基础SJF均值最优SRPT均值最优γ-Boost尾部最优

局限性与未来工作

  • 理论分析主要在M/G/1下,实际系统更接近M/G/k(多槽并行),相关理论尚不完善。

  • 当前为单实例调度,未来可扩展至多模型、多副本场景,结合全局路由和缓存联合优化。

  • 推理工作负载的重尾特性可进一步借鉴最新尾部优化理论来增强。

文章提出了UNIBOOST——一个无需预测请求长度、通过软优先级提升KV缓存感知抢占协同设计的LLM调度器,在无需任何长度预测的情况下,系统性地优于依赖完美预测的SRPT类调度器,在P99尾部延迟上实现35−50%的改进,同时保持吞吐量,为在线LLM服务提供了一种更鲁棒、更实用的尾部延迟优化方案。

这里是自己的论文阅读记录,感兴趣的话可以参考一下,如果需要阅读原文的话可以看这里,如下所示:

摘要

LLM服务展现出极端的长度变异性,这使得基于大小的调度在实践中变得困难。最近的LLM调度器使用预测的解码长度或排名来近似SJF/SRPT,并主要报告以均值为中心的指标(例如,TFTT/TBT)。我们表明,这些预测驱动的策略在分布偏移、突发到达和GPU内存压力下可能很脆弱,并且对支配用户体验的尾部延迟(P90-P99)的控制仍然有限——即使拥有完美的解码长度知识。我们引入了一个分布感知、无需预测的调度框架,该框架用由轻量级统计信号驱动的软优先级提升取代了显式的长度预测。我们的设计将调度与缓存感知的抢占共同优化,以考虑随工作负载混合变化的内存耦合解码动态。在生产环境和开源轨迹上的评估表明,我们的方法在推理密集型和聊天密集型等各种工作负载下,实现了比具有完美长度预测的SRPT低至多 35−50% 的P99 TTLT,以及低 34−47% 的TFTT,为在线LLM服务中的尾部延迟优化提供了一种鲁棒的替代方案。

1. 引言

大型语言模型(LLM)越来越多地部署在交互式应用中,如代码生成、对话和智能体工作负载。在这些场景中,用户体验不仅由平均性能决定,还受尾部延迟(通常定义为TFTT、TTLT和TBT的 95% 或 99% 百分位(Li等人,2025;Liu等人,2024;Agrawal等人,2025;Zhong等人,2024))的影响,这使得资源分配和调度成为平衡吞吐量和用户体验的重要领域(Duan等人,2024;Sun等人,2024;Luo等人,2025;Zhang等人,2025b)。

除了全局资源分配(如分片、解聚和路由(Chen等人,2025;Shi等人,2025;Patke等人,2024)),现代LLM本地副本调度器在平衡吞吐量和延迟权衡方面发挥着重要作用,通过考虑合适的批次大小、优先级和驱逐顺序(Agrawal等人,2024a;b)。最近,LLM中更高级的调度系统通常采用基于预测的调度,其动机是经典结果,即在作业大小已知时,最短作业优先(SJF)或最短剩余处理时间(SRPT)能够最小化平均响应时间(Qiu等人,2024;Fu等人,2024;Shahout等人,2024;Srivatsa等人,2024)。它们预测输出长度或剩余令牌数,并在实践中近似SJF/SRPT。虽然这些方法在准确预测下能有效降低平均延迟,但它们主要针对以均值为中心的指标进行优化,而优化均值的策略可能表现出较差的尾部延迟行为(Nair等人,2010;Nuyens等人,2008;Wierman和Zwart,2012)。

这一挑战因推理增强型LLM的兴起而加剧,其中的生成可能涉及多步推理、自我反思、工具调用或自适应终止。因此,解码长度高度可变。两个具有相同前缀大小的请求可能在完成时间上相差几个数量级,并且作业大小分布可能随工作负载和时间快速变化。这种固有的不可预测性使得设计依赖于作业大小估计或请求排名的调度器变得困难。

这些观察提出了一个关键问题:调度器是否需要作业长度或排名的预测来优化尾部延迟?与其尝试预测解码长度或排名,我们认为调度应该由运行时统计数据指导,并为尾部进行自适应优化。

我们的方法受到近期尾部最优调度理论进展的启发,该理论研究如何减少渐近尾部等待时间(例如,P95/P99)。一个关键启示是,不应使用基于硬性大小的排名(例如,SJF/SRPT),而应使用一种策略,该策略大致以先到先服务为基准,然后应用软性的、持续的优先级整形来改善尾部性能。具体来说,每个请求会获得一个平滑变化的分数,称为其“提升”,该分数由轻量级信号计算得出,请求按照到达时间减去提升值的递增顺序被服务。这种“提升”规则可以在部分可观测性下证明性地抑制极端延迟,因为它们温和地偏向那些可能主导尾部的请求,除非大小信息可用,否则不需要精确的长度预测(Yu和Scully,2024;Harlev等人,2025;Charlet和Van Houdt,2025;2026;Brooker,2022;Grosof等人,2021)。

然而,直接将此类策略应用于LLM服务是具有挑战性的。与经典队列不同,LLM推理是有状态的且与内存耦合:处于解码阶段的持续请求会累积大型键值(KV)缓存,使得抢占和驱逐代价高昂(Zhang等人,2025a;Kwon等人,2023)。在不考虑有限KV缓存容量和交换成本的情况下,单纯优先处理请求可能会减少排队延迟,但同时因重计算和缓存抖动而增加TTLT。

为弥补这一差距,我们提出了一种用于在线LLM服务的调度与驱逐协同设计方案。我们的方法使用轻量级、可观测的信号(例如,已解码的令牌长度、过往请求延迟分布)来驱动分布感知的提升策略,同时联合管理KV缓存驱逐,使优先级决策能够转化为实际的TTLT改进。通过将基于提升的调度与感知驱逐的执行控制相结合,我们增强了普通的提升策略,使其在内存约束和多阶段执行下依然有效。重要的是,这种设计整体上优化了TTLT,平衡了短请求和长请求、重计算成本以及请求局部性,而不是专注于单一阶段或指标。

实证结果表明,这种协同设计的方法在异构工作负载下,即使在预测器质量下降(为了换取更好的可扩展性和更低的开销)或发生分布偏移时,也能在尾部TTLT和吞吐量(令牌/秒)方面实现一致的改进。这些结果表明,分布感知、驱逐感知的调度为预测密集型的SRPT近似方法提供了一种鲁棒的替代方案,更符合推理增强型LLM服务的现实情况。

2. 背景与动机

2.1. LLM生成长度预测

相关工作:LLM服务的基于大小的调度。受经典结果(即在作业大小已知时,SJF/SRPT能最小化平均响应时间)的启发,最近的LLM服务系统采用基于预测输出长度的、基于大小的优先级划分。Fu等人提出了一种学习排序(LTR)调度器,通过预测生成长度来近似SJF,展示了在平均和P90 TFTF及令牌间延迟方面的改进(Fu等人,2024)。相关方法如TRAIL(基于嵌入的调度器)同样依赖于学习到的预测器来估计剩余执行令牌,并指导抢占式调度决策,并设有一个阈值以在后期减少抢占(Shahout等人,2024)。SGLang和vLLM中的启发式方法,如最短前缀优先(SPF),通过使用已知的预填充长度作为总作业大小的代理来避免显式的输出预测,但无法维持高吞吐量或低TTLT。

图2:两个模型在从三个数据集中随机选择的相同提示集上的输出令牌,每个提示在SGLang上以采样温度0.6运行20次(Zhao等人,2024;Zhuo等人,2024;Muennighoff等人,2025)。

在所有采样请求中观察到的高方差是一致的,且不受所选正温度的影响。

结论
在所有任务中观察到的显著输出长度方差——由采样过程中的自然随机性和数值不确定性共同驱动——使得预测模型输出长度从根本上变得困难,即使使用完全相同的提示和模型配置也是如此(Yuan等人,2025;He和Lab,2025)。

指标失配:LLM服务中的均值与尾部最优性。LLM服务通常受SLO约束:服务栈的可维持负载取决于它是否能在突发性和异构请求长度下将尾部延迟保持在预算内(Kaffes等人,2019;Yu等人,2022;Zhong等人,2024;Zhang等人,2025a;Li等人,2024;Patel等人,2023;Goel等人,2025)。因此,尾部完成时间——到最后令牌的时间(TTLT)在P95/P99处直接捕获了端到端任务的用户感知响应性,并常常成为实践中的约束性瓶颈。相比之下,关注平均TTFT/TBT可能会产生误导。首先,令牌级的均值不可组合:每个令牌的小幅减速可能会在长生成过程中累积,产生可接受的平均TTFT/TBT但较差的P95/P99 TTLT。其次,均值指标掩盖了分布性病理:偏好短请求或部分服务请求的策略可能导致饥饿或队头阻塞,尽管平均TTFT看似良好,却会增大尾部TTLT。

尽管如此,在对基于大小或预测的调度器(Fu等人,2024;Shahout等人,2024)的评估中,尾部指标(例如,P95/P99 TTFT/TTLT)常常被低估报告。更根本的是,均值最优性并不意味着尾部鲁棒性:当响应长度受限且某些轨迹更接近于轻尾分布时(例如,图8a),基于大小的优先级划分可能表现任意差。事实上,在温和条件下,PS和SRPT可能实现最差的逗留时间衰减率(与PLCFS相同)(Nuyens等人,2008;Nair等人,2010;Wierman和Zwart,2012)。

2.2. 尾部最优调度策略

相关工作:队列理论中的尾部最优调度。大量队列理论工作研究了优化响应时间尾部行为的调度策略。对于具有重尾作业大小的系统,具有相对简单优先级规则的高度抢占式策略,如最少获得服务(LAS),已知能在不需要作业大小信息的情况下实现良好的尾部特性(Nuyens等人,2008;Scully等人,2020;Scully和van Kreveld,2025)。然而,轻尾作业大小的情况更为微妙:最近的研究表明,在轻尾队列中优化尾部延迟需要一种“更软”的优先级规则。例如,Yu和Scully(2024)提出了一种称为 γ-Boost的策略,它按照“提升后到达时间”递增的顺序服务作业,该时间是作业的到达时间减去一个“提升”量,短作业的提升量更大。其效果是,短作业获得一定的优先级,但不足以让它们超越等待时间更长的作业。Harlev等人(2025)表明,相同的Boost设计框架也可用于大小未知的作业。

我们的贡献是为LLM推理实现了一个实用的 γγ-Boost版本。然而,将尾部最优策略应用于LLM服务面临着额外的挑战。

挑战 #1:需要分布感知的LLM调度器。我们研究了不同LLM推理数据集(图1)中轨迹的分布。为了在仿真和系统中分析vLLM风格的分块预填充、连续批处理、解码优先调度器中的调度分类,我们使用了各种重排序策略。我们发现没有单一的调度器占主导地位,因为最优策略对作业大小分布和到达突发性高度敏感。作业长度分布的高方差使得调度问题显著更加困难:策略必须在缓解队头(HoL)阻塞(需要抢占长作业)和防止饥饿(需要保护长作业)之间进行严格的权衡,以优化SLO达成率(稍后定义)或尾部延迟,同时保护吞吐量。图3用颜色表示批次混合,可视化了这些权衡。

在图3左侧场景中,我们展示了由作业大小驱动的HoL阻塞。一个长请求 A(解码=8,预填充=2)在 t=0 到达,延迟了交错的短请求 B,C,D,E(解码=1-2,预填充=2)。FCFS在此表现不佳,平均延迟膨胀,而SRPT/LAS抢占 A。相反,右侧场景(块大小=3)显示了不同的作业大小分布如何反过来损害尾部延迟。一系列短作业 B,C,D(解码=2,预填充=3)与 A 同时或稍后到达。SRPT/LAS(最少获得服务)对短作业的严格偏好导致 AA 饥饿,从而增大尾部(最大)延迟,而FCFS保持了更好的公平性。在这两种场景中,我们在Boost策略中选择不同的 γγ 值来在这两个极端之间插值,以改善尾部延迟。

结论
没有单一的LLM调度策略占主导地位:最佳策略取决于作业大小分布和到达突发性。为了优化尾部延迟和吞吐量,调度器需要在两个极端之间自适应地插值,并平衡缓解HoL阻塞(抢占长作业)与防止饥饿(保护长作业)。

挑战 #2:需要成本感知的LLM调度器。LLM服务中SRPT风格调度的另一个挑战源于KV缓存耦合执行和公平性。首先,SJF/SRPT可能导致长运行请求的饥饿。与之前注重公平性的设计(Sheng等人,2024)(主要关注不同客户端之间的公平性)不同,LTR提出了一个最大等待时间公平性指标,用于评估每个请求级别的公平性,以防止SJF导致的饥饿(Fu等人,2024)。一个局限性是,最大等待时间受单个最差令牌间停顿支配:瞬时的批处理/内存事件可能会使最大等待时间膨胀,并在请求并非持续饥饿时触发量子提升,这可能会破坏批处理/KV局部性并降低负载下的整体吞吐量。

在解码过程中,请求会累积大型键值(KV)缓存,这些缓存必须在抢占时保留,使得后期中断代价高昂。诸如Sarathi-Serve和PagedAttention等系统专注于改善吞吐量-延迟权衡和内存效率,但并未直接解决抢占开销下的尾部最优调度问题(Agrawal等人,2024a;Kwon等人,2023)。虽然一些基于预测的调度器引入了启发式方法来限制抢占,但它们并未从根本上缓解预测驱动的优先级反转在工作负载变化下的脆弱性。

3. 问题描述

3.1. 阶段1:预填充提升的初始方案 DiSTBoost

受Sarathi分块预填充的启发,我们的初始方法DiSTBoost将预填充和解码阶段视为独立的调度问题。

4. 评估

实验设置。我们将UNIBOOST与最先进的基线方法进行比较,并对每个设计组件进行消融研究。UNIBOOST实现了最佳的整体权衡,在各种工作负载下将尾部TTFT/TTLT降低了 37%−60%,同时在突发负载下将吞吐量提高了 1.01−1.12×。

测试平台。端到端评估测试平台是一台NVIDIA A100 DGX服务器,配备8个NVIDIA A100 80GB GPU、96个vCPU和248GB主机内存。后端默认使用分页注意力和分块预填充。我们禁用了radix cache和前缀缓存,以对调度器进行受控研究。

服务模型。我们使用了多种模型系列,包括Llama-3-8B、CodeLlama-34B和Qwen-72B。对于Qwen-72B,我们使用 TP=4 和 CP=4。为了在内存受限环境下进行压力测试,我们在 TP=1 下使用CodeLlama-34B。为了测试动态负载,我们使用Llama-3-8B,其动态QPS按Azure编码轨迹9进行缩放。所有实验均使用FP16/BF16精度。

工作负载。我们使用Azure Conversation和ShareGPT(Team, 2023; Microsoft Azure, 2024)进行对话评估,使用s1k(Muennighoff等人,2025)数据集进行推理评估。Azure轨迹还包括每个请求的时间戳,我们对其进行缩放以保留到达突发行为。对于没有时间戳的工作负载,我们使用具有不同QPS的泊松到达进行评估。我们采样了10k个请求进行评估,以减少预热和收尾影响。我们还创建了两种混合类型的工作负载,即LLM引擎同时接收推理和非推理请求(mix-1有 20% 推理,mix-2有 70% 推理,其余采样自Azure Function,或AZF轨迹)。

基线方法。我们与几种最先进的基线方法进行了比较:1)Sarathi:分块预填充、解码优先的连续批处理,在解码中采用轮询排序和搭载预填充。该策略已集成到最新版本的vLLM(v1)和SGLang(v0.5.8)中,因其有利的延迟-吞吐量权衡;2)SJF(LTR+):具有完美预测的LTR。使用LTR的饥饿预防技术(通过量子控制)改进的SJF(Fu等人,2024)。3)LAS(MLFQ+):最少获得服务:这是一种在操作系统中常用的非明视前台-后台策略的变体,从具有有限级别的离散MLFQ发展为其理想化的连续形式。然而,其在轻尾分布下的性能没有保证(Scully等人,2018)。4)SRPT(TRAIL+):具有完美预测的TRAIL。带有TRAIL在0.6解码长度后的交换预防阈值的SRPT理想化版本。该策略,如FastServe的Skip-join MLFQ(MLFQ+),在重尾分布假设下是均值最优的,但不是尾部最优的(Shahout等人,2024)。

4.1. 与基线策略的比较

为了量化调度器性能,表2计算了与作为神谕基线的TRAIL+(具有完美的解码长度知识)相比的相对改进。设置是使用Llama-8B,处理来自推理任务(70%)和Azure轨迹(30%)的混合长度提示。百分比变化计算为延迟:(基线值 - 对比值) / 基线值 ×100%×100%,吞吐量:(对比值 - 基线值) / 基线值 ×100%。正值表示相对于TRAIL+的改进。

我们从表中观察到,虽然所有调度器与TRAIL+相比在延迟指标上都有一些退化,但UNIBOOST在此工作负载中牺牲了一些平均延迟,但在所有主要尾部指标上,特别是P99 TTLT和TTFT上,展现了最显著的收益。DiSTBOOST,我们方法的初始版本,也显示出良好的改进,特别是在P99 TTLT上,但在TTFT上有所退化,原因在于它优先于预填充队列处理解码队列。Sarathi在所有指标上均显示下降,而SJF虽然在TTLT尾部上仍优于SRPT,但由于其缺乏抢占能力来为短请求回收KV内存,以及其天然对重尾工作负载的关注,经历了显著的退化。总体而言,UNIBOOST在此比较中是最有效的调度器,在各个方面提供了显著的性能提升,将P99 TTLT提高了约 35%,P95 TTFT提高了约 97%,且未牺牲吞吐量。

4.2. 跨工作负载改进的分析与鲁棒性

图6绘制了在QWen-72B推理工作负载下,各基线相对于UNIBOOST的每百分位减速百分比。出现了三个一致的模式。

(1)TTFT是所有基线最先失守的地方,并且在上尾部的损失加速。这种行为与预填充准入病理一致:当预填充未得到明确保护时,预填充工作会因解码密集的微批次而反复延迟,因此任何长运行(推理)解码的突发都会增加请求在能开始产生第一个令牌之前的等待时间。UNIBOOST通过强制执行分布感知的优先级来避免这一点,该优先级防止预填充被解码占用持续推迟,这在推理请求产生长解码驻留时间时尤为重要。

(2)TTLT的差距源于不同的尾部失效模式:长解码下的不稳定性 vs. 护航效应。在中间面板中,所有基线在百分位上均保持在 0% 以上,但在尾部附近它们急剧分化:LAS或SRPT类策略在高百分位处剧烈飙升。这是在内存耦合解码下典型的获得服务反转:LAS优先处理获得服务较少的作业,因此新到达(或最近解除阻塞)的请求反复跳到部分服务的长解码请求前面。这导致更多同时活动的请求,增加了分页/驱逐压力并引起额外停顿。结果是正反馈循环:更多交织 → 更多KV压力 → 更长驻留时间 → 更少吞吐量和更多排队 → 更差的尾部TTLT。UNIBOOST通过在服务较早到达者和较短作业之间平滑插值来避免这种情况,减少了重排和尾部振荡。

(3)TBT显示出仅靠解码优先级划分是不够的:混合增加了方差。在右侧面板中,DiSTBoost始终较慢,而LTR保持平坦然后在 ∼P70 之后恶化。两种机制解释了这一现象:(i)过度优先处理解码会增加并发解码器的数量,增加每令牌竞争,广泛损害TBT;(ii)阈值化/长度排名的切换(LTR)是脆弱的——一旦负载/混合阈值被跨越,它会翻转机制,加剧混合和异构性,触发尾部暴涨。

结论。UNIBOOST保持在帕累托前沿附近,因为它通过单一平滑控制旋钮在每次迭代中控制预填充-解码平衡和交织程度,这在高强度推理解码下稳定了TTFT准入和尾部TTLT/TBT。

4.3. 各设计阶段的消融研究

图7在1个GPU上对CodeLlama-34B进行QPS扫描。负载-延迟曲线呈现一个急剧的拐点:在所有变体中,DiSTBoost(紫色)首先失稳(0.24 QPS),P90/P99从数百毫秒上升到数秒。改为阶段2(蓝色)延迟了拐点,并在0.248 QPS附近将P99大致减半。在阶段3中添加MemGuard(绿色)进一步抑制了KV交换抖动,将尾部再降低1.5-2倍。UNIBOOST(橙色)表现最佳:在0.255 QPS时,P99保持在亚秒级,而其他替代方案则是多秒级。总体而言,与基线MLFQ+相比,UNIBOOST将拐点向右移动了4-6%,并在接近饱和时将P90/P99/平均延迟降低了高达10倍。这些图共同说明了MemGuard和Ada机制的有效性,特别是在保护高负载延迟方面。γ 变化的确切时间线见附录图9。

4.4. 跨规模和数据集的SLO达成率

对于LLM服务提供商,目标是在仍能达到达成率目标(99%或95%)的情况下,找到系统能承受的最大SLO规模。对于TTFT,CombinedBoost(UNIBOOST可互换使用)在广泛的SLO规模范围内保持了最高的达成率。相比之下,SJF对严格SLO的容忍度最低,其TTFT达成率随着SLO收紧而迅速下降。平均而言,使用UNIBOOST可以实现2.9-8.7倍更严格的SLO,其中mix-2由于其更动态的特性,差距略大。对于TTLT,更有趣的是注意到,虽然在SLO阈值上普遍有1.7-4.3倍的增益,但DiSTBoost表现略好,这是通过牺牲TTFT达成率来优先处理解码实现的。

5. 结论与未来工作

我们提出了UNIBOOST,一个用于LLM服务的无预测、尾部感知调度框架,它使用软性、连续的优先级整形,并将调度与KV成本感知的抢占协同设计,以在多样化工作负载下改善尾部延迟。受理论启发,它在高负载下在尾部性能上表现出优越性,甚至仅凭借轻量级运行时统计跟踪器就击败了基于预测的策略。该实现易于集成到现有的、具有连续批处理、预填充/解码解聚或分块预填充功能的服务栈(如vLLM和SGLang)中。结果展示在附录§A.5中。

未来工作包括将UNIBOOST扩展到多模型和多副本部署(联合路由+缓存+调度),整合更丰富的内存信号,开发能够捕捉现代LLM推理系统中抢占/驱逐成本的正式保证,并利用近期关于优化重尾队列尾部延迟的设计洞见(Li等人,2026),以更好地处理具有高度可变输出长度的推理工作负载。

← 返回列表