返回资讯列表
可信LLM、Agentic AI与多模态系统统一评估框架
2026年9月18日作者:AI铺子编辑部
大模型
19524v1 公告类型:新发布 摘要:仅凭 benchmark 分数,不足以全面评估现代人工智能系统的可信度
arXiv:2609.19524v1 公告类型:新发布
摘要:仅凭 benchmark 分数,不足以全面评估现代人工智能系统的可信度。大语言模型(LLM)、Agent 系统和多模态模型(MLLM)需要不同形式的评估,但其评估证据必须在开发与监督过程中保持可解释性。我们提出一个统一框架,通过八个可信度维度将输出级、轨迹级和跨模态评估连接起来:能力、鲁棒性、安全、公平、透明、治理、监督和效率。该框架在保留系统特有指标的同时,将原生测量映射到统一的性能等级,并附带不确定性估计与可追溯证据。元评估层用于检验评估本身的效度、信度和可复现性。多维画像可以暴露系统优势与短板,而安全关键覆写机制可防止综合分数掩盖关键失效。通过与治理框架、国际标准和欧盟监管要求的映射,该框架将技术评估与监督需求相衔接。它为评估系统性能以及支撑评估结论的证据可信度提供了结构化基础,而跨部署场景的实证验证仍是后续必不可少的工作。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。