返回资讯列表
面向企业数据理解的学习:Data Agent 的压缩与路由技术

面向企业数据理解的学习:Data Agent 的压缩与路由技术

2026年9月23日作者:AI铺子编辑部
行业动态

arXiv:2609.25286v1 公告类型:new 摘要:企业环境中的结构化数据 Agent 必须在复杂的数据环境中进行推理,其相关证据分散在 schema、关系、策略以及反复出现的业务角色之中。

arXiv:2609.25286v1 公告类型:new 摘要:企业环境中的结构化数据 Agent 必须在复杂的数据环境中进行推理,其相关证据分散在 schema、关系、策略以及反复出现的业务角色之中。现代 Agentic 系统通常通过可复用的 markdown 风格 memory 或 skill 文件来应对这一负担,这些文件将先前发现的信息保存下来供后续查询使用,从而减少重复发现同一结构的需要。这固然有用,但它掩盖了一种自然的分工:Agent 更适合语义推理,而学习型系统更适合预测和组织反复出现的结构。我们提出 latent equivalence learning 来弥补这一鸿沟。该框架将持久的任务相关 identity 与其相对于具体数据集的 realization 分离开来。在我们的实现中,支持性与反对性证据共同塑造 support-realized Gaussian prototypes,学习这些 identity 在特定数据环境中的具体表达方式,而 soft-membership profiles 则保留了在硬分配下会丢失的区分。一个独立的学习型 query-prototype 系统表示反复出现的证据需求,并通过学习到的 compatibility function 将其映射到同一套持久的 identity 结构中。这种以 identity 为因子、受 query 条件约束的 routing,为下游推理物化了相关的数据集特定证据,使 Agent 可以在一个已经组织好的证据状态上运行,而不必在每次查询时重建跨 schema 结构。在 Data Agent Benchmark 上(涵盖 12 个异构数据集的 54 个查询),我们的完整实现在五次完整试验中取得了 94.67% 的 dataset-macro stratified Pass@1,并成功完成 258/270 次原始查询尝试;相比之下,该 benchmark 的 Claude Opus 4.6 参考 Agent 为 55.51%,在提交时于 40 个 leaderboard 条目中排名第一。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明