返回资讯列表

Scientific Agents:评测面向科学任务的专业领域系统提示词
2026年10月2日作者:AI铺子编辑部
大模型学术
一项针对科学任务系统提示词的研究表明,职业专属配置文件未能提升模型表现。测试覆盖九个科学基准和五千余道题目,匹配配置与极简基线相比准确率无显著差异。配置产生的输出token和调用成本却大幅增加,工具任务中解决率反而下降。
arXiv:2610.00084v1 公告类型:新发布
摘要:针对特定职业的详细系统提示词会推高 token 用量和每次回复的估算成本,却并未带来稳定一致的准确率提升。我们使用 Gemini 3.8 Flash(通过 OpenRouter 接入 Pi agent 运行框架)评估了 Scientific Agents——一个包含 503 个职业专属 AGENTS.md 配置文件的开源语料库。我们将匹配的职业配置文件与四种对照条件进行比较:极简基线("You are a helpful assistant")、配置文件开头的角色描述句、通用科学严谨性指南,以及来自无关领域的配置文件。在九个基于文本的科学 benchmark(4,531 道抽样题目、100 个匹配配置文件)中,4,488 个题目在经过 API 错误重试后完成了全部五种条件测试,并采用自动化、基于规则的评分方式进行打分。配置文件与基线的平均准确率差异为 -0.6 个百分点(在固定任务上 95% bootstrap 置信区间为 [-1.5, +0.2]),且没有任何一个 benchmark 呈现出统计上明确的提升。匹配配置文件产生的输出 token 数量是基线的 1.5-2.3 倍,每次成功调用的成本是基线的 2.2-4.5 倍。在 60 道使用工具的 BioMysteryBench 生物信息学问题上(基线和配置文件条件各运行三次),使用配置文件时的平均解决率为 46.7%,而基线为 56.7%,差异为 -10.0 个百分点(95% 置信区间 [-16.7, -3.3]),其原因是配置文件条件下更频繁地触发 token 和时间限制而停止。较长的提示词有一个出人意料的运维优势:在 SuperGPQA 上,由于服务商 API 频繁中断,短基线条件下仅 54.0% 的题目在首次尝试中就给出了正确答案,而使用配置文件时这一比例为 71.6%。通用提示词和不匹配领域的提示词表现相当可靠,因此这一优势源于提示词长度或格式,而非领域专业知识。对于所测试的模型和任务,默认加载完整职业配置文件并不能提升准确率,反而成本显著更高;选择性检索配置文件中的部分内容、或在开放式科学任务上是否会有不同结论,仍有待进一步验证。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。