Skip to main content
QUICK REVIEW

[論文レビュー] HULK: An Energy Efficiency Benchmark Platform for Responsible Natural Language Processing

Xiyou Zhou, Zhiyu Chen|arXiv (Cornell University)|Feb 14, 2020
Topic Modeling参考文献 13被引用数 15
ひとこと要約

HULK は、自然言語処理における事前学習済みモデルの pretraining, fine-tuning, 推論の各段階を、時間とコストを主な指標として用いてエネルギー効率を評価するマルチタスクのエネルギー効率ベンチマークプラットフォームです。その結果、パrameter数が少ないからといって必ずしも効率的であるとは限らず、モデルアーキテクチャが fine-tuning の速度に顕著な影響を与えることが明らかになりました。特に、パラメータ共有によりパrameter数が少ないにもかかわらず、ALBERT モデルは収束が遅い傾向にあります。

ABSTRACT

Computation-intensive pretrained models have been taking the lead of many natural language processing benchmarks such as GLUE. However, energy efficiency in the process of model training and inference becomes a critical bottleneck. We introduce HULK, a multi-task energy efficiency benchmarking platform for responsible natural language processing. With HULK, we compare pretrained models' energy efficiency from the perspectives of time and cost. Baseline benchmarking results are provided for further analysis. The fine-tuning efficiency of different pretrained models can differ a lot among different tasks and fewer parameter number does not necessarily imply better efficiency. We analyzed such phenomenon and demonstrate the method of comparing the multi-task efficiency of pretrained models. Our platform is available at https://sites.engineering.ucsb.edu/~xiyou/hulk/.

研究の動機と目的

  • 大規模 NLP モデルの学習、特に pretraining 階段と推論段階における環境的・財務的コストの増大に取り組むため。
  • 多様な事前学習済みモデル間でのエネルギー効率を比較可能な実用的でマルチフェーズのベンチマークを提供するため。
  • 実際の時間とコストの指標を分析することで、パrameter数が少ないほど効率的であるという仮定を検証するため。
  • エネルギーとコストの効率に基づくデータドリブンなモデル選択を可能にすることで、責任ある AI 発展を支援するため。
  • NLP におけるエンドツーエンドのエネルギー効率を評価する再現可能でオープンソースのベンチマークプラットフォームを確立するため。

提案手法

  • プラットフォームは、標準化されたハードウェアとクラウドコスト見積もりを用いて、pretraining, fine-tuning, 推論の3段階でモデルをベンチマーク化します。
  • 実際のハードウェア構成と価格(例:TPU v3 が1時間あたり8ドル、V100 GPU が1時間あたり3.06ドル)を用いて、実際の学習および推論コストを推定します。
  • ベンチマークは、MNLI(自然言語帰納)、SST-2(センチメント分析)、CoNLL-2003(名前付きエンティティ認識)という3つの標準的な NLP タスクで実施されます。
  • fine-tuning の効率は、各タスクで精度に到達するまでの時間を最小化するようにハイパーパramータ(学習率、バッチサイズ)を最適化することで評価されます。
  • 各段階で時間とコストの指標を収集し、開発セットの出力と学習ログを用いて結果を検証します。
  • 再現性と透明性を確保するため、プラットフォームはソースコード、学習ログ、パフォーマンス指標を必要とします。

実験結果

リサーチクエスチョン

  • RQ1pretraining, fine-tuning, 推論の各段階において、異なる事前学習済み NLP モデルの時間的・コスト的効率はどのように比較されるか?
  • RQ2パrameter数が少ないことは、fine-tuning および推論段階で一貫して高いエネルギー効率をもたらすのか?
  • RQ3パrameter共有(例:ALBERT)のようなモデルアーキテクチャの特徴は、パrameter数が少ないにもかかわらず、fine-tuning の速度にどのように影響を与えるか?
  • RQ4fine-tuning 中のモデルパフォーマンス曲線は、タスクやモデルファミリーによってどの程度異なるか?
  • RQ5マルチタスクでエンドツーエンドのベンチマークプラットフォームは、エネルギー効率に基づく責任ある AI モデル選択を効果的に支援できるか?

主な発見

  • pretraining コストは大きく異なる:BERT BASE は4つの TPU ポッドで4日間で1,728ドル、XLNet LARGE は512個の TPU v3 チップで2.5日間で61,440ドルである。
  • RoBERTa LARGE は、XLNet LARGE と同程度のパrameter数であるにもかかわらず、1,024個の V100 GPU で pretraining を行うとコストが75,203ドルに達し、最も高額である。
  • 1200万パラメータしか持たないにもかかわらず、ALBERT BASE はパラメータ共有の計算コストが高く、BERT BASE よりもはるかに長い時間 fine-tuning に要する。
  • パrameter数が少ないからといって、fine-tuning の速度が一貫して向上するわけではない。ALBERT モデルは、パrameter数が少ないにもかかわらず、BERT モデルより遅い。
  • RoBERTa LARGE は、3つのタスクすべてで安定的かつ比較的高速な fine-tuning パフォーマンスを示しており、より優れた最適化特性を示している。
  • MNLI タスクでは、小さなモデルの収束が速いという傾向に従わない。これは、タスクの複雑さと大きなトレーニングデータサイズの影響による可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。