返回资讯列表
预训练ASR伪标签技术助力嘈杂警务音频识别

预训练ASR伪标签技术助力嘈杂警务音频识别

2026年9月28日作者:AI铺子编辑部
大模型学术

研究团队针对预训练语音识别模型在嘈杂警务广播中识别率偏低的问题展开系统评估。他们测试伪标签技术适配巴尔的摩与芝加哥语料库的实际效果,发现传统置信度指标难以区分标签质量,遂引入大语言模型外部评判机制进行激进过滤。

arXiv:2609.30469v1 公告类型:new 摘要:预训练 ASR 系统在嘈杂的警务广播通讯(Broadcast Police Communication,BPC)场景下表现不佳,阻碍了理解警务决策过程的相关研究。伪标签(pseudo-labeling)为在不依赖昂贵人工标注的情况下改进 ASR 提供了一条无监督路径,但这种方法在极度嘈杂领域的有效性尚不明确。在本研究中,我们系统评估了将基础 ASR 模型(Whisper 和 Qwen3-ASR)适配到来自巴尔的摩和芝加哥的嘈杂 BPC 领域语料库时,伪标签方法的机会与局限。我们证明,现有的内部置信度指标(log-probabilities 和 STAR scores)无法区分高质量与低质量的 BPC 伪标签;为此,我们提出了一种外部 LLM-as-a-judge 过滤范式,利用参数化知识丢弃上下文上不合理的转录结果。相较于内部指标,我们的 LLM 评判过滤机制更为激进,并显著降低了巴尔的摩和芝加哥 BPC 语料库上伪标签训练集的 WER,尽管与 oracle filter 相比仍存在明显差距。我们还提出了一种新的跨模型伪标签范式,即用一个模型生成的伪标签对另一个模型进行微调,并指出该方法是未来伪标签研究的一个有前景的方向。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。