返回资讯列表

面向任务自适应自精炼流程的简化反思进化机制
2026年9月29日作者:AI铺子编辑部
大模型学术
研究者提出Workflow-Designing Agents框架,用于让大语言模型按任务自动演化自我改进流程。该方法从极简提示起步,联合优化各阶段指令与顺序,并以SPLIT机制拆分累积的冗余内容。实验覆盖知识、数学。
arXiv:2609.32458v1 公告类型:新发布
摘要:反思式提示优化(reflective prompt optimization)无需更新模型权重即可改进大语言模型(LLM)系统,但固定的架构限制了自我改进(self-refinement)的组织方式。我们提出 Workflow-Designing Agents(WDA),这是一个用于任务自适应自我改进流程精简演化(streamlined reflective evolution)的框架。WDA 从最小化提示出发,联合演化各阶段指令及其顺序结构。在演化过程中,我们发现反复修订会导致冗余指令在单一提示中不断累积。为此,我们在 WDA 中提出 SPLIT 方法,将这些指令重新分配到专门的阶段中。三示例反思(three-example reflection)与局部筛选(local screening)引导选择性搜索,校准分数(calibration scores)则指导 Pareto 准入及对无益尾部更新的回滚。由此生成的流程具有任务自适应性:其指令与深度从任务数据中学习得到,随后在该任务的所有测试输入上固定不变。我们在五个 benchmark 上评估 WDA,涵盖知识、数学推理、多跳问答(multi-hop question answering)与指令遵循(instruction following)。在 Qwen3.5-9B 上,WDA 取得 51.24% 的平均分数,较初始求解器提升 8.63 个百分点,较不含 SPLIT 的变体提升 2.60 个百分点。在 GPT-4.1-mini 上,WDA 取得 49.00%,相应提升分别为 5.62 和 3.69 个百分点。这些结果支持将任务自适应自我改进作为更广义的 agentic 工作流搜索(agentic workflow search)的一个互补方向。
来源:arXiv cs.CL | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。