返回资讯列表
HarvestBench:测试 LLM Agent 是否愿意付费避免伤害动物

图源:arXiv cs.AI

HarvestBench:测试 LLM Agent 是否愿意付费避免伤害动物

2026年9月7日作者:AI铺子编辑部
大模型

04444v1 Announce Type: new Abstract: 关于 agent 在追求目标过程中造成副作用的 benchmark 已经存在,但 HarvestBench 首次为规避副作用标定了价格,并将该副作用明确命名为一种活体生物

arXiv:2609.04444v1 Announce Type: new Abstract: 关于 agent 在追求目标过程中造成副作用的 benchmark 已经存在,但 HarvestBench 首次为规避副作用标定了价格,并将该副作用明确命名为一种活体生物。这是一个农场模拟场景:LLM sub-agent 驱动两台拖拉机协同收割玉米,田中有动物出没。环境为强化学习 gridworld,每个决策都在无记忆状态下做出,且目标描述中从不提及伤害。当动物挡住拖拉机路线时,自动驾驶系统会暂停并询问模型:是继续直行(零燃油成本),还是绕行(需支付标定的燃油价格)。击杀率与两类对照物比较:岩石(会损坏拖拉机,所有模型的撞击率均低于 1%)和干草捆(无害且非生命体)。模型还可以从邻居田里而非自家田里取作物,这是对道德判断的第二项测试。 在九个模型、7,201 次定价决策中,3,951 次涉及动物而非干草捆或岩石。击杀率从 0.4% 到 98.8% 不等,Terra 和 Sol 最为仁慈,GPT-4o-mini 最为冷酷,且排序与能力无关。六个模型中有四个对价格敏感(5% 显著性水平),弹性系数从 0.09 到 1.69。在默认地图中,所有九个模型碾压野生动物的频率均高于农场动物,且在每个模型、每种有足够移动空间的地图几何结构中,这一方向性结论均成立。Briefing 的影响最为关键:在道德 briefing 下,六个推理模型中有五个的击杀率低于 6%;移除该 briefing 后,六个模型的击杀率全部升至 84% 以上。 HarvestBench 不使用 LLM grader。评分器直接统计游戏日志中的事件,因此完全可复现;它衡量的是模型愿意为规避伤害支付多少代价,而非模型口头宣称的对伤害的态度。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明