返回资讯列表

图源:arXiv cs.CL
PACE:基于 Agent 自动化实现自适应出版商内容提取
2026年8月31日作者:AI铺子编辑部
行业动态
27466v1 Announce Type: new Abstract: 网页内容提取是可靠 LLM 数据 pipeline 的关键环节,然而现有方法往往难以同时满足准确性、可扩展性和适应性
arXiv:2608.27466v1 Announce Type: new
Abstract: 网页内容提取是可靠 LLM 数据 pipeline 的关键环节,然而现有方法往往难以同时满足准确性、可扩展性和适应性。通用提取器适用范围广,但在出版商特定版式以及更丰富的提取目标(如元数据、图片和表格)上表现脆弱。基于 LLM 的直接提取灵活性更高,但大规模部署时会产生高昂的成本和延迟;而人工编写的出版商专用解析器虽能达到高准确率,却需要大量人力投入来构建和维护。
我们推出 PACE,一个 agentic 框架,用于从代表性页面和用户需求中学习出版商专用的提取配置。训练阶段,PACE 利用 LLM 分析页面结构并聚合可复用的提取模式。推理阶段,学习到的配置实例化为固定的确定性提取器模板,无需额外调用 LLM 即可实现可扩展的提取。
覆盖正文、元数据和多模态提取的实验表明,PACE 优于可扩展的非人工基线,同时接近人工编写的出版商专用解析器的质量。PACE 在文章文本、元数据、图片和表格的提取上表现更强,证明 agentic 配置学习能够自动化出版商专用提取,为 LLM 就绪的页面表征提供超越文章文本的提取能力。
来源:arXiv cs.CL | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。