返回资讯列表

图源:arXiv cs.CL
面向语言模型的评分标准引导强化学习综述
2026年8月31日作者:AI铺子编辑部
大模型
27505v1 Announce Type: new Abstract: 基于人类反馈的强化学习(RLHF)已成为将大语言模型(LLM)与人类偏好对齐的主流范式
arXiv:2608.27505v1 Announce Type: new
Abstract: 基于人类反馈的强化学习(RLHF)已成为将大语言模型(LLM)与人类偏好对齐的主流范式。然而,传统 RLHF 依赖缺乏可解释性的标量奖励信号,且无法捕捉回复质量的多维特性。Rubric-guided reinforcement learning 通过引入结构化、可解释的评估标准(即 rubric)作为奖励设计、反馈生成与策略优化的核心机制,解决了上述局限。在本综述中,我们提出一个贝叶斯框架:将 constitutions 定义为评估准则上的先验分布 $P(R)$,将 rubrics 定义为条件实例化 $R_x \sim P(R|x)$。在这一统一视角下,我们沿先验-后验轴对 rubric-guided RL 进行分类,涵盖 constitutional AI、实例特定 rubric、过程级监督、自进化 rubric,以及它们的 Agent 化与多模态扩展。此外,由于 rubric 是自然语言产物,我们从语言学角度分析了粒度权衡、语义漂移和语言奖励黑客(linguistic reward hacking)如何影响对齐可靠性,并指出了未来研究的关键开放问题。
来源:arXiv cs.CL | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。