返回资讯列表
面向尾部延迟的 Agentic LLM 工作流调度:将就绪与发布解耦

面向尾部延迟的 Agentic LLM 工作流调度:将就绪与发布解耦

2026年9月12日作者:AI铺子编辑部
大模型产品

10964v1 公告类型:新发布 摘要:Agentic LLM 工作流由模型轮次与工具交互交错构成,因此其端到端完成时间不仅取决于推理速度,还取决于就绪轮次何时被释放

arXiv:2609.10964v1 公告类型:新发布 摘要:Agentic LLM 工作流由模型轮次与工具交互交错构成,因此其端到端完成时间不仅取决于推理速度,还取决于就绪轮次何时被释放。大多数运行时采用"就绪即释放"策略,一旦某个轮次就绪便立即放行。在资源竞争(contention)条件下,这种急切释放策略会导致已释放但未完成的工作不断累积;这些轮次一旦提交,便无法再被工作流层面的调度策略重新排序,从而推高尾延迟。我们提出一种感知尾风险的轮次释放调度方法,联合决策下一个应释放哪个就绪轮次,以及应维持多少"已释放但未完成"的工作量。该方法采用均值—条件风险价值(CVaR)目标函数来刻画未完成工作流动态演化的尾风险,在优先级排序时融入对轮次工作量的在线估计,并根据观察到的队列压力自适应调整已释放工作的预算。我们基于软件工程任务的真实 Agent 执行轨迹,在多种 LLM 和工作流到达率下对该方法进行了评估。结果表明,该方法在轻负载下与急切释放策略表现相当,并在资源竞争条件下显著降低工作流流动时间的 P95,最高可实现 \(3.50\times\) 的加速。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明