Skip to main content
QUICK REVIEW

[论文解读] HULK: An Energy Efficiency Benchmark Platform for Responsible Natural Language Processing

Xiyou Zhou, Zhiyu Chen|arXiv (Cornell University)|Feb 14, 2020
Topic Modeling参考文献 13被引用 15
一句话总结

HULK 是一个用于自然语言处理的多任务能效基准平台,通过时间与成本作为关键指标,评估预训练模型在预训练、微调和推理阶段的能效表现。研究发现,参数量更少并不一定意味着更高的效率,且模型架构对微调速度有显著影响,例如 ALBERT 模型尽管参数量更少,但由于参数共享机制,其收敛速度反而更慢。

ABSTRACT

Computation-intensive pretrained models have been taking the lead of many natural language processing benchmarks such as GLUE. However, energy efficiency in the process of model training and inference becomes a critical bottleneck. We introduce HULK, a multi-task energy efficiency benchmarking platform for responsible natural language processing. With HULK, we compare pretrained models' energy efficiency from the perspectives of time and cost. Baseline benchmarking results are provided for further analysis. The fine-tuning efficiency of different pretrained models can differ a lot among different tasks and fewer parameter number does not necessarily imply better efficiency. We analyzed such phenomenon and demonstrate the method of comparing the multi-task efficiency of pretrained models. Our platform is available at https://sites.engineering.ucsb.edu/~xiyou/hulk/.

研究动机与目标

  • 为应对训练大型 NLP 模型带来的日益增长的环境与财务成本,特别是预训练和推理阶段的开销。
  • 提供一个实用的、多阶段基准,用于比较不同预训练模型的能效表现。
  • 通过分析真实世界的时间与成本指标,挑战‘参数越少效率越高’的假设。
  • 通过基于能效与成本效率的数据驱动模型选择,支持负责任的 AI 发展。
  • 建立一个可复现、开源的基准平台,用于评估 NLP 中端到端的能效表现。

提出的方法

  • 该平台在三个阶段(预训练、微调和推理)对模型进行基准测试,使用标准化硬件和云成本估算。
  • 采用真实世界硬件配置与定价(例如 TPU v3 为 8 美元/小时,V100 GPU 为 3.06 美元/小时),估算实际训练与推理成本。
  • 基准测试在三个标准 NLP 任务上进行:MNLI(自然语言蕴含)、SST-2(情感分析)和 CoNLL-2003(命名实体识别)。
  • 通过优化超参数(学习率、批量大小)来最小化各任务上的准确率达成时间,评估微调效率。
  • 收集各阶段的时间与成本指标,结果通过开发集输出与训练日志进行验证。
  • 平台要求提供源代码、训练日志与性能指标,以确保可复现性与透明度。

实验结果

研究问题

  • RQ1不同预训练 NLP 模型在预训练、微调与推理阶段的时间与成本效率方面如何比较?
  • RQ2更少的参数数量是否始终能带来更高的微调与推理阶段能效?
  • RQ3尽管参数量减少,模型架构(如 ALBERT 中的参数共享)如何影响微调速度?
  • RQ4微调过程中的模型性能曲线在不同任务与模型族之间差异有多大?
  • RQ5多任务、端到端的基准平台能否有效支持基于能效的负责任 AI 模型选择?

主要发现

  • 预训练成本差异显著:BERT BASE 在 4 个 TPU Pod 上运行 4 天,成本为 1,728 美元;而 XLNet LARGE 在 512 个 TPU v3 芯片上运行 2.5 天,成本高达 61,440 美元。
  • 尽管参数量与 XLNet LARGE 相当,RoBERTa LARGE 在 1024 个 V100 GPU 上预训练的成本最高,达 75,203 美元。
  • 尽管参数量仅为 1200 万,ALBERT BASE 的微调时间显著长于 BERT BASE,原因在于其计算密集型的参数共享机制。
  • 微调速度并不随参数量减少而一致提升;ALBERT 模型即使参数更少,其微调速度仍慢于 BERT 模型。
  • RoBERTa LARGE 在所有三个任务上均表现出稳定且相对较快的微调性能,表明其具有更优的优化特性。
  • MNLI 任务未遵循‘小模型收敛更快’的趋势,可能由于其更高的复杂度与更大的训练集规模。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。