LLM与RAG自动摘要金融新闻:2023年秋季早期实证研究
19526v1 发布类型:新论文 摘要:股市分析师和投资者每天都面临着一个挑战:财经新闻太多,时间太少
arXiv:2608.19526v1 发布类型:新论文
摘要:股市分析师和投资者每天都面临着一个挑战:财经新闻太多,时间太少。手动阅读并整合数百篇公司相关文章是不现实的,但遗漏关键信息可能直接影响投资决策。本项目于 2023 年秋季在乔治·华盛顿大学开展,探索 Large Language Models 是否能够可靠地将这一流程自动化。我们构建了一条 pipeline,从 News API 获取新闻文章、从 Wikipedia 获取公司背景信息、从 Yahoo Finance 获取股价数据,覆盖十家主要公司(AAPL、MSFT、GOOGL、AMZN、META、TSLA、JPM、NVDA、WMT、DIS)。由于 LLM 无法直接处理数值表格,我们开发了一种简单但有效的模板,将股票数据转换为自然语言叙述。随后,我们在三种开源模型(Falcon-7B-Instruct、DistilBART-CNN-12-6、BART-Large-XSum)上测试了两种摘要方法(Summarize Chains 和基于 FAISS 的 Retrieval-Augmented Generation)用于新闻摘要,并使用 GPT(text-davinci-003)生成股票摘要。Falcon-7B 配合 Summarize Chains 取得了最佳效果,准确且连贯地覆盖了所有新闻事件。RAG 虽然在理论上前景可期,但在 Falcon 中导致了严重的重复问题,且在 BART-Large 中当 k 值较大时产生了事实幻觉。两种基于 LLM 的方法在 ROUGE-1 指标上均优于简单的 Lead-3 基线。我们还构建了一个 Streamlit dashboard 用于交互式股票可视化。本项工作完成于 2023 年秋季,早于基于 RAG 的金融工具普及之时,而我们记录下的失效模式——尤其是较小模型在 RAG 下的幻觉问题——至今仍有参考价值。
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。