返回资讯列表

生成式AI管道破解SEC 10-K财报数据缺失危机
2026年10月1日作者:AI铺子编辑部
大模型学术
研究团队针对SEC 10-K财报数据缺失问题,评估了多个大语言模型的信息提取能力。他们发现数据缺口影响超七成公司及半数市值,传统方法难以应对复杂文档结构。实验表明,将模型参数规模与文档复杂度相匹配可获得较高准确率。
arXiv:2609.35864v1 公告类型:新发布
摘要:SEC 10-K 文件中包含大量未在结构化数据集中被一致记录的财务信息,由此造成的数据缺失问题影响了超过 70% 的公司以及总市值的一半。这可能会不成比例地使量化分析偏向不利于小公司的方向,因为后者可能因可用数据有限而被排除在外。传统的财务信息提取方法(如 Regular Expressions (Regex) 和 BERT)已被广泛应用。然而,这些方法在解析复杂的 SEC 10-K 文件时非常脆弱,导致文件中实际存在的数据丢失,因为它们没有考虑到某个数据属性可能位于不同章节或脚注中。本研究评估了多个 Large Language Models (LLMs),包括 Llama-3 8B、Qwen-2.5 14B 和 Llama-3.3 70B,以弄清各模型在从 SEC 10-K 文本中提取特定属性时的优势与不足。提取质量在四个结构复杂度各异的财务变量上进行了评估:Cash and Cash Equivalents(表格型)、Short-Term Debt(混合型)、Credit Facilities(叙述型)以及 Research and Development(混合型)。结果表明,尽管 Llama-3 8B 等较小模型在复杂的否定式提示(negative prompting)下会出现性能下降,但将参数规模与文档复杂度相匹配可获得较高的 zero-shot 准确率。Qwen-2.5 14B 作为表格数据专精模型表现出色,在 Cash 上取得 83.33% 的 F1 分数;而 Llama-3.3 70B 则能有效处理密集的叙述性脚注,在 R&D 上达到 76.92% 的 F1 分数。这一可扩展的框架解决了量化金融数据集中的关键信息缺口,并通过更全面地分析 SEC 10-K 文件消除了缺失数据偏差。
来源:arXiv cs.CL | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。