
图源:arXiv cs.AI
SCX Router:基于 Decoder-KV 分类器与真实任务本体论的流式零样本模型选择
02292v1 发布类型:new 摘要:大语言模型(LLM)的快速普及及其应用场景日益多样化,带来了一个独特的优化机遇:为具体任务选择最合适的模型,同时在单任务层面针对速度、成本和质量进行优化
arXiv:2609.02292v1 发布类型:new
摘要:大语言模型(LLM)的快速普及及其应用场景日益多样化,带来了一个独特的优化机遇:为具体任务选择最合适的模型,同时在单任务层面针对速度、成本和质量进行优化。然而,不同推理端点在质量、价格、延迟、上下文支持、工具调用、领域专长和推理行为等方面差异显著。这种异构性使得人工启发式规则难以维护,且单凭自身难以实现稳定有利的速度—成本—质量权衡。我们推出 \router{},一种轻量级的基于 GLiClass 的 router,无需自回归生成即可为每个推理时模型标签分配 suitability score。已发布的 0.6B 参数 checkpoint 将 Qwen3 decoder 与浅层双向 scorer 相结合。其 decoder-KV 执行路径会在整个 session 中保留纯文本的 key–value cache,仅编码新增对话轮次,并对临时候选标签 token 进行评估而不将其加入持久化 cache。同一 checkpoint 还可预测任务类型、难度、推理模式和预期输出长度,并支持自定义 zero-shot 标签。对于任务生成,我们构建了一个包含 23 个任务族、115 种任务类型、345 种可路由子类型、1,173 条合成示例的任务本体,以及一个包含 30 个领域的正交维度。基于这一结构,我们生成了 150,000 条经 verifier 评分的任务和 15,000 条开放式任务。随后,我们在这些任务上训练 Qwen3 decoder,同时将学到的请求预测与针对 eligibility、成本、cache 复用、安全性和主权等属性的单任务策略显式分离。在六个 LiveBench 子集上,该 router 表现优于候选模型的均值;在选定的 1,000 任务子集上,其聚合 top-1 得分为 0.707,而最强固定模型为 0.696,且在不同 benchmark 上均有提升。
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。