返回资讯列表
生产环境中 LLM 交易 Agent 究竟表现如何:来自两大集群六个月全量记录

图源:arXiv cs.AI

生产环境中 LLM 交易 Agent 究竟表现如何:来自两大集群六个月全量记录

2026年9月9日作者:AI铺子编辑部
大模型

05663v1 公告类型:新发布 摘要:我们呈现了一份连续、人口规模级别的测量记录,涵盖在生产环境中运行的自主语言模型交易 Agent,涉及两个具有同一设计谱系的系统:DX Terminal Pro(3,505 个用户出资的保险库,在 Base 链 memecoin 市场上交易真实 ETH,为...

arXiv:2609.05663v1 公告类型:新发布 摘要:我们呈现了一份连续、人口规模级别的测量记录,涵盖在生产环境中运行的自主语言模型交易 Agent,涉及两个具有同一设计谱系的系统:DX Terminal Pro(3,505 个用户出资的保险库,在 Base 链 memecoin 市场上交易真实 ETH,为期 21 天,2026 年 2 月至 3 月)以及 DXAP 实时 alpha 机群(500 至 599 个用户创建的 Agent 的全历史数据,91 至 117 个并发活跃,交易 Hyperliquid 永续合约,2026 年 6 月至 8 月)。该记录跨度约六个月,包含 750 万次单模型调用、约 30 万次链上操作,以及另外 231,638 次多工具回合(产生 14,596 笔成交)。本文提出四项核心发现。第一,运营层对行为的决定作用超过策略文本中的任何内容:风险滑块解释了杠杆水平(每级 +0.425),Agent 固定效应吸收了 60% 的方差,而排行榜渲染边界对选择产生了因果性的分流作用(在 top-3 截断处的回归不连续估计为 1.75 倍)。第二,仓位规模对波动率视而不见:每个波动率六分位数组的中位杠杆均为 5.0 倍,且一个姿态滑块单元(占账户簿的 11%)集中了 62% 的清算事件。第三,Agent 几乎无法把握其触及的上行空间:43.2% 的仓位在 24 小时内曾出现至少 +300 个基点的有利波动,然而其中 49.3% 以负的交易收益平仓;一套机械化的 brackets 规则可为每个仓位挽回 +39.0 个基点的收益。第四,两个机群均不具方向性优势。DXAP 机群未能实现盈利,且落后于匹配的 Hyperliquid 散户基准(往返胜率 41% 对 50%)。在 416 个捕获的生产场景上对前沿模型进行的配对回放联赛中,发现决策质量在该时间尺度上统计上不可区分,而选择稳定性在不同模型家族间差异显著。所有核心结论均通过了按日聚类的推断、置换零检验以及统一费用口径的重述;本文最后提出了一套 17 条规则的方法论规范,这是我们以自己的撤稿为代价换来的。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明