返回资讯列表

模拟社会的局限:后训练与微调如何抹平文化差异
2026年9月23日作者:AI铺子编辑部
行业动态
arXiv:2609.25760v1 公告类型:新提交 摘要:使用大型语言模型(LLM)来模拟多样化的人类群体,有望改变计算社会科学的许多方面,然而许多评估只对平均回答打分,而忽略了真实群体内部的意见离散度。
arXiv:2609.25760v1 公告类型:新提交
摘要:使用大型语言模型(LLM)来模拟多样化的人类群体,有望改变计算社会科学的许多方面,然而许多评估只对平均回答打分,而忽略了真实群体内部的意见离散度。为此,我们开发了一套诊断框架,在点准确度的同时衡量离散度保持度——即预测标准差与人类标准差之比($\dr$)。该框架基于世界价值观调查(WVS)中覆盖十二个国家、六大洲的 10{,}000 组受访者—问题对。我们评估了十一个零样本语言模型,以及五个使用 SFT、DPO 和 GRPO 在 WVS 数据上微调的变体。我们发现了一种称为“共识坍缩”(\textit{consensus collapse})的失败模式:对齐训练将输出压缩为每个群体单一的刻板印象。在 Llama~3.1 70B 基座模型到 Tulu~3 检查点的后训练轨迹上,第一阶段——监督指令微调——在几乎没有提升准确度的情况下抹去了约一半的离散度($\dr$ 从 1.22 降至 0.59;准确度仅提升 $+0.9$ 个百分点),后续阶段也未能恢复离散度;与此同时,WEIRD 国家与非 WEIRD 国家之间的差距开始显现,而旨在提高点准确度的调查微调进一步加深了这一鸿沟。最准确的模型(在 WVS 上微调的 Tulu~3 70B-DPO,准确率 57.9\%)整体保留了人类离散度的一半($\dr = 0.50$),但对尼日利亚仅保留了 11\%,相比之下 WEIRD 国家为 0.70–0.87。将采样温度提高到 1.0,对两个经 DPO 微调的模型而言,其到人类分布的 Wasserstein-1 距离($\wone$)毫无改善;在 Qwen~3.5 9B 上使用 GRPO,无论采用准确度奖励还是分布形状奖励,也都无法恢复离散度。将已对齐模型与未对齐先验混合,可在留出测试集上将 $\dr$ 从 0.51 提升至 0.62,但尼日利亚仍停留在 0.36。因此,仅凭点准确度会误判这些模拟器,而当前的后训练正在以多样性换取共识。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。