返回资讯列表

领域自适应预训练提升大规模水处理文献挖掘的语义表征
2026年9月23日作者:AI铺子编辑部
行业动态
arXiv:2609.26034v1 公告类型:new 摘要:水处理研究正在迅速扩展,但从这些研究中获得的大部分知识仍分散在非结构化文献中。该领域仍缺乏一个专门的语言模型,能够高效捕捉水处理特定的领域语义,以支持大规模文献挖掘。
arXiv:2609.26034v1 公告类型:new
摘要:水处理研究正在迅速扩展,但从这些研究中获得的大部分知识仍分散在非结构化文献中。该领域仍缺乏一个专门的语言模型,能够高效捕捉水处理特定的领域语义,以支持大规模文献挖掘。为此,我们开发了 WaterBERT,这是一个领域自适应的编码器模型,专为从水处理文本中进行语义表示和结构化信息提取而设计。WaterBERT 是通过在一个约 29.7 亿 token 的大规模水处理语料库上进行持续预训练而开发的。基于 WaterBERT 的三个微调模型在下游任务上进行了系统评估,在通用和领域特定的 BERT 模型中取得了最佳的整体性能,多类处理工艺分类的 F1 分数为 90.12%,命名实体识别为 79.50%,关系提取为 74.04%。除了这些基准测试任务,我们还进一步展示了 WaterBERT 在大规模文献处理方面的优势。应用于 5,144 篇 Environmental Science & Technology 文章时,WaterBERT-BERTopic 无需预定义类别即可识别出连贯、多样且领域特定的研究主题。在 WaterBERT 的基础上,我们以远低于商业 LLM 的成本处理了 693,211 篇摘要,同时保持了有竞争力的提取性能,从而构建了一个结构化的水处理知识图谱。随后,该知识图谱与词汇检索和稠密检索相结合,开发出水知识增强检索系统(WaterKERS),其相关性得分达到 77.7,大幅优于基于文本的检索基线(54.7-64.5)。通过 WaterBERT,本研究为水处理研究中的大规模信息处理和证据图谱绘制提供了一个紧凑且可扩展的语义基础。
来源:arXiv cs.CL | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。