返回资讯列表

LongSocialBench:长上下文 LLM 能否理解网络讨论串?
2026年10月6日作者:AI铺子编辑部
大模型学术产品
研究团队发布 LongSocialBench,用于检验长上下文大模型对网络讨论串的结构化社会推理能力。该基准涵盖 1,462 道人工核验选择题,取自 94 个 Hacker News、Stack Exchange 与 Reddit r/ChangeMyView 完整讨论。
arXiv:2610.04118v1 公告类型:新发布
摘要:长上下文 LLM 如今已能一次性吞入整个线上讨论串,但要理解其中的社会性话语,仅仅"读完一篇长文档"还远远不够:模型必须追踪父帖-回复关系、转折点、限定范围的子树、跨分支对比以及参与者的行为轨迹。为测试这种具备结构感知能力的社会推理,我们推出了 LongSocialBench——一个包含 1,462 道经人工核验的选择题 benchmark,题目取自 94 个完整的 Hacker News、Stack Exchange 和 Reddit r/ChangeMyView 讨论实例,token 中位数约 73K。每道题将一份完整序列化的讨论及其回复结构与一道四选一问题配对,要求模型还原结构化的社会性证据。已发布的题目均通过了可回答性、选项唯一性与证据锚定三项核验。在 18 个模型、29 种评测设置的横向测试中,当前的长上下文工作流仍远低于人类水平。单模型最佳成绩来自 Claude-Opus-4.7——在"先排除错误选项再作答"的提示下达到 63.0%,而独立人类读者的成绩为 72.4%。全部 18 个模型的平均结果显示:完整上下文 baseline 得分为 43.9%;若直接提供 gold 证据范围,得分可提升至 55.0%,这说明即便相关楼层区域已被锁定,模型仍会犯下大量错误。LongSocialBench 表明,当前缺失的能力并不只是上下文获取或提示词工程,而是对结构化回复树的社会性理解。
来源:arXiv cs.CL | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。