返回资讯列表
标签感知结构化文本翻译:迈向系统性理解

标签感知结构化文本翻译:迈向系统性理解

2026年9月25日作者:AI铺子编辑部
学术

研究团队针对带标签文本的翻译难题提出系统性方案。该方法融合混合数据合成、多任务能力构建与多目标对齐策略,在六个语言方向上均取得可衡量改进,完整系统显著优于现有方法。

arXiv:2609.29131v1 公告类型:新发布 摘要:互联网文本中包含大量承载结构、语义和功能信息的格式标签。当前基于大语言模型(LLM)的翻译系统在处理带标签文本时,难以在翻译流畅度与标签保真度之间取得平衡。我们认为,化解这一矛盾需要在三个相互关联的层面采取系统化方法:数据合成、能力构建与多目标对齐。在数据层面,我们识别并形式化了合成数据生成中结构标签多样性与翻译自然性之间的根本性权衡;现有方法往往以牺牲一方为代价来优化另一方。我们提出了一种混合合成策略(Hy-LST),结合基于 LLM 的合成标签方法与两阶段基于 LLM 的合成标签方法,以生成兼具多样性与自然性的带标签数据。在能力层面,我们在多任务监督微调框架下,将标签感知翻译分解为难度递增的四个子任务,从而实现针对性的能力获取与知识迁移。在对齐层面,我们在组相对策略优化(group relative policy optimization)框架下设计了三个互补的奖励函数,分别针对流畅度、标签保真度和标签范围内翻译质量这三个不同目标,并证明联合优化始终优于单一奖励方案。在六个语言方向(en2zh、en2ja、en2de、en2fr、en2ru、de2fr)上的实验表明,每个层面都能带来可衡量的改进,且完整系统显著优于现有方法。定性分析揭示了具体的错误模式,以及采用我们的方法训练后这些错误如何得到缓解。
来源:arXiv cs.CL | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。