Interview: 多租户LLM推理平台的资源隔离与调度设计
题目解析
多租户LLM推理平台需要同时服务多个业务方,每个租户有不同的模型、SLO要求和流量模式。核心挑战在于保证租户间的性能隔离同时最大化GPU资源利用率,这两个目标本质上存在张力。这是大型企业内部AI平台建设的核心问题。
解答思路
架构设计分三层:1)接入层:按租户分配API Key和配额,实现细粒度限流和用量统计,请求携带优先级标签和SLO约束;2)调度层:实现两级调度——集群级调度将租户映射到GPU池,请求级调度在GPU内做batch组装和执行排序。支持抢占式调度,高优先级请求可抢占低优先级的计算资源;3)隔离策略:提供三种隔离级别——独占GPU(强隔离高成本)、共享GPU时间片(中等隔离)、请求级混合batching(弱隔离低成本),由租户按需选择。
关键要点
GPU资源的隔离和共享是核心矛盾。推荐分级策略:核心租户独占GPU保证SLO,普通租户共享GPU池降低成本。调度算法需要考虑请求的预估输出长度,避免长请求阻塞短请求。需要实现公平调度机制防止某个租户的突发流量影响其他租户体验。
加分回答
讨论GPU虚拟化技术(MIG、MPS)在多租户隔离中的应用实践,LoRA Adapter热切换实现不同租户使用不同微调模型但共享基座,以及基于历史流量模式预测的弹性扩缩容策略提前分配资源。
常见踩坑
隔离粒度过粗导致资源浪费严重,过细导致调度开销大抵消收益;未考虑KV Cache在多租户间的内存竞争问题;配额设计过于静态无法适应业务流量的动态波动。