返回资讯列表
RAP:研究注意力预测揭示目标条件化的证据获取偏差
2026年9月11日作者:AI铺子编辑部
学术
10092v1 公告类型:新发布 摘要:大语言模型(LLM)越来越多地扮演研究 Agent 的角色,但由于综述和研究想法缺乏唯一可验证的结果,评估它们追踪研究注意力转移的能力十分困难
arXiv:2609.10092v1 公告类型:新发布
摘要:大语言模型(LLM)越来越多地扮演研究 Agent 的角色,但由于综述和研究想法缺乏唯一可验证的结果,评估它们追踪研究注意力转移的能力十分困难。我们提出 Research Attention Prediction(RAP),这是一个滚动 benchmark,覆盖 278 个 AI/ML 领域和 1,390 个 episode。在每个截止点,LLM Agent 检索一个时间受限的 arXiv 语料库,并预测接下来六个月里八个冻结研究方向上的论文份额。搜索通常有帮助,但所有四个诊断模型在组合准确性上都逊于精确计数的指数加权移动平均(EWMA)基线。我们识别出两个相互关联的瓶颈。在可访问累积历史的情况下,State carry-forward 在全部四个诊断模型上都优于直接 Forecast;冻结证据回放(frozen-evidence replay)将这种反转的共同部分与面向 Forecast 的策略检索到的近期证据份额较小联系起来。即使拥有精确的历史活动数据,面向未来的更新仍然有限,只有 GPT-5.5 加上重新开放的 Search 才略微超过 EWMA。基于已实现结果进行微调,使 Qwen3-4B 在较后起点上的 held-out 领域预测 Spearman 相关系数提高了 0.105,在变化丰富的 episode 上也有提升。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。