返回资讯列表

图源:arXiv cs.CL
GreenBench:Apple Silicon 上开源 LLM 推理能效与碳足迹基准测试
2026年9月1日作者:AI铺子编辑部
大模型开源
28667v1 发布类型: 新论文 摘要: 大型语言模型(LLM)的快速普及引发了人们对其推理阶段环境影响的担忧
arXiv:2608.28667v1 发布类型: 新论文
摘要: 大型语言模型(LLM)的快速普及引发了人们对其推理阶段环境影响的担忧。尽管 Green AI 研究已聚焦于数据中心 GPU 和嵌入式平台,但 Apple Silicon 凭借其统一内存架构进行 LLM 推理的能耗特征尚未得到研究。本文提出 GreenBench,这是一个基准测试框架,用于评估五款开源 LLM(3-9B 参数)在配备 48 GB 统一内存的 Apple M4 Pro 上执行三项 NLP 任务时的能效、吞吐量和碳足迹。通过使用 macOS powermetrics 进行直接功耗测量,以及 Ollama 的纳秒级精度计时,我们发现 M4 Pro 在持续推理期间 CPU+GPU 封装功耗仅为 0.47 W,系统总功耗为 8-12 W,在单用户部署场景下每 token 能效比数据中心 GPU 高出 30-40 倍。较小模型(3-3.8B)比较大模型(7-9B)吞吐量高出 2.6-4.2 倍,每 token 能耗最高降低 62%。Pareto 分析表明,Qwen 2.5(7B)在 MMLU 达到 57%、速度 59 tokens/s 的条件下实现了精度与能效的最优权衡,而 Llama 3.2(3B)以 175 tokens/s 的速度适用于延迟敏感型应用。我们提供了封装级和系统级的每 token 能耗数据,并针对印度和美国电网给出了 CO2 排放估算。
来源:arXiv cs.CL | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。