返回资讯列表

合成Persona能否预测真实受众反应?无Persona基线反胜模拟研究
2026年9月23日作者:AI铺子编辑部
学术
arXiv:2609.25010v1 公告类型:新发布 摘要:越来越多的营销人员将大语言模型(LLM)用作"合成 persona",在文案发布前预测受众的反应,其依据是已有证据表明,基于画像条件化的 LLM 能够模拟人类样本。
arXiv:2609.25010v1 公告类型:新发布
摘要:越来越多的营销人员将大语言模型(LLM)用作"合成 persona",在文案发布前预测受众的反应,其依据是已有证据表明,基于画像条件化的 LLM 能够模拟人类样本。但这种预测在真实行为面前是否真的有效——persona 机制是否真的有帮助?我们开展了一项 sim-to-real 效度研究,使用 Upworthy Research Archive 作为留出(held-out)的真实基准。该数据集包含数千个在共享真实流量上进行的标题 A/B 测试,并附有实测点击率。我们将一个基于真实受众人口统计特征的十 persona 面板,与一个无 persona 的 zero-shot 基线进行对比,后者仅直接询问模型"典型读者点击的可能性有多大"。两项发现尤为突出。第一,真实基准的可靠性是制约因素:大多数 A/B 测试没有统计上可区分的胜者,因此效度只能在可靠子集(n = 399)上衡量。第二,与 persona 模拟的前提相反,persona 条件化反而降低了预测效度:无 persona 基线对变体的排序明显更好(Kendall {\tau} = 0.361,中等效应;top-1 准确率 49.2%),优于 persona 面板({\tau} = 0.084;top-1 34.6%),且置信区间不重叠。直接询问模型能够利用准确的群体层面先验;而强迫模型扮演特定 persona 则引入了偏差和噪声。该结果在三个独立的 Upworthy 数据拆分上均可复现,在另一领域的新闻数据集上方向保持一致,并且对随机种子、提示措辞和模型选择均具有稳健性——在 Gemini 的三个层级以及另一个模型家族(OpenAI gpt-4.1,配对差异显著)上均如此。结论:在预测聚合参与度方面,朴素的 LLM 排序器优于 persona 模拟——合成 persona 不仅是弱预测器,而且比不使用它们更糟。所有数字均可通过一个公开的、以 artifact 为先的复现包重新生成。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。