[论文解读] Characterizing LLM Inference Energy-Performance Tradeoffs across Workloads and GPU Scaling
本论文在多样化的NLP任务上对一系列大型语言模型进行基准测试,以描绘推理过程中的能耗、延迟、吞吐量和内存权衡,并分析硬件 DVFS 效应与输入特征以指导能源高效部署。
LLM inference exhibits substantial variability across queries and execution phases, yet inference configurations are often applied uniformly. We present a measurement-driven characterization of workload heterogeneity and energy-performance behavior of LLM inference under GPU dynamic voltage and frequency scaling (DVFS). We evaluate five decoder-only LLMs (1B-32B parameters) across four NLP benchmarks using a controlled offline setup. We show that lightweight semantic features predict inference difficulty better than input length, with 44.5% of queries achieving comparable quality across model sizes. At the hardware level, the decode phase dominates inference time (77-91%) and is largely insensitive to GPU frequency. Consequently, reducing GPU frequency from 2842 MHz to 180 MHz achieves an average of 42% energy savings with only a 1-6% latency increase. We further provide a use case with an upper-bound analysis of the potential benefits of combining workload-aware model selection with phase-aware DVFS, motivating future energy-efficient LLM inference systems.
研究动机与目标
- 通过了解模型规模、架构、任务和硬件设置如何影响推理中的能耗和延迟,来推动可持续AI的发展。
- 在多任务上评估一系列模型(GPT-2、Falcon-7B、Mistral-7B、GPT-J-6B、GPT-Neo-2.7B、T5-3B),以绘制能耗-性能动态。
- 调查输入特征(序列长度、批量大小)对能耗、吞吐量和延迟的影响。
- 评估硬件级别DVFS对LLM推理能效和性能的影响,以识别实际可优化策略。
提出的方法
- 在NVIDIA A100 GPU 上对六个预训练模型(T5-3B、GPT-Neo-2.7B、GPT-2、Mistral-7B、Falcon-7B、GPT-J-6B)进行基准测试。
- 在包括 SQuADv2、BoolQ、XSum、HellaSwag、OpenBookQA 等任务上进行评估,使用 BLEU、F1、准确率、能量和吞吐量等指标。
- 分析输入序列长度区间(0-50、51-100、101-150、151-200)以及8宽批量在每个任务100个查询上的批量效应。
- 检验 DVFS 配置([210, 405, 615, 810, 1005, 1215, 1410] MHz)以衡量延迟与能量的权衡。
- 通过 nvidia-smi 的实时功率监测与统计分析提取洞察。
实验结果
研究问题
- RQ1不同的 NLP 任务(文本生成、问答、常识推理、摘要)如何影响不同 LLM 的能耗与性能?
- RQ2输入特征(序列长度、批量大小)在推理过程中如何影响延迟、吞吐量和能效?
- RQ3硬件 DVFS 设置对不同模型与任务的能效和性能有何影响?
主要发现
- 较小的模型(例如 GPT-2)在简单任务中持续占用更少的能量并提供更高吞吐量,适用于能量受限的场景。
- 较大中型模型(Falcon-7B、Mistral-7B)在性能与能量之间取得平衡,在如 SQuADv2 和 HellaSwag 这样的复杂任务中表现出色,但比 GPT-2 消耗更多能量。
- GPT-J-6B 与 GPT-Neo-2.7B 显示出较高的能耗和显存需求,表明在多数任务中存在低效现象。
- 将 GPU 时钟提升到较高的 DVFS(1005–1410 MHz)通过缩短运行时间来降低总体能耗,与较低时钟相比在若干任务中具有优势。
- 输入序列长度的增加通常会提高所有模型的延迟与能耗,且大型模型受影响更明显,强调对扩展上下文时的特定任务模型选择。
- 批量规模的增加(至多8)显著提升 BoolQ 和 SquadV2 任务的能效并降低延迟,强调批量优化作为实际可操作的杠杆作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。