Skip to main content
QUICK REVIEW

[論文レビュー] Multitask and Transfer Learning for Autotuning Exascale Applications

Wissam M. Sid-Lakhdar, Mohsen Mahmoudi Aznaveh|arXiv (Cornell University)|Aug 15, 2019
Machine Learning and Data Classification参考文献 29被引用数 4
ひとこと要約

本論文は、過去のチューニングタスクからの知識を活用して最適化を高速化する、マルチタスクおよびトランスファーラーニングフレームワークを提案する。OpenTuner や HpBandSter といった最先端の自動チューナーよりも平均1.5倍の実行時間改善を達成しており、低予算設定ですら、厳しいリソース制約下でも標準的手法を上回る性能を発揮する。

ABSTRACT

Multitask learning and transfer learning have proven to be useful in the field of machine learning when additional knowledge is available to help a prediction task. We aim at deriving methods following these paradigms for use in autotuning, where the goal is to find the optimal performance parameters of an application treated as a black-box function. We show comparative results with state-of-the-art autotuning techniques. For instance, we observe an average $1.5x$ improvement of the application runtime compared to the OpenTuner and HpBandSter autotuners. We explain how our approaches can be more suitable than some state-of-the-art autotuners for the tuning of any application in general and of expensive exascale applications in particular.

研究の動機と目的

  • 1回の実行あたりの計算コストが非常に高いことから、限られたチューニング予算のもとで高価なエクサスケールアプリケーションを最適化する課題に対処すること。
  • 高コストなエクサスケール環境において、ブルートフォースなグリッドサーチや標準的な自動チューナーの非効率性を克服すること。
  • 異なるワークロードにまたがる以前にチューニングされた問題からの知識を再利用することで、より速く、より正確な自動チューニングを実現すること。
  • 複数のチューニングメトリクス、リソース制約、インクリメンタルな学習をサポートするスケーラブルで適応可能なフレームワークの開発。
  • 進化を続けるハードウェアとアプリケーションワークロードにわたるパフォーマンスポータビリティと長期的なチューニング効率の向上。

提案手法

  • 複数の問題インスタンスを同時に最適化するマルチタスク学習アプローチ(MLA)を導入し、タスク間で情報を共有することで収束性を向上させる。
  • 過去のチューニングタスクから得た事前学習済みモデルを活用するトランスファーラーニングアルゴリズム(TLA1 および TLA2)を開発し、最小限または全く新しい実行を伴わずに新しいチューニングタスクを高速化する。
  • チューニングパラメータのパフォーマンスランドスケを表現するため、ガウス過程ベースのサーヴィレートモデルを用い、効率的なベイズ最適化を実現する。
  • 入力パラメータ、リソース制約、最適化メトリクスを公開するブラックボックス自動チューニングインターフェースを設計し、アプリケーションコンponent間でのモジュラーかつ合成可能なチューニングを可能にする。
  • 初期モデル学習(MLA)を実行した後、新しいタスクに対して高速かつ低コストな推論(TLA1/TLA2)を実行する階層的チューニングパイプラインを実装する。
  • 追加の評価を最小限に抑えることで、事前学習済みモデルを新しい問題インスタンスに適応させるトランスファー機構を組み込む。

実験結果

リサーチクエスチョン

  • RQ1マルチタスク学習は、エクサスケールアプリケーションにおける多様な問題インスタンスにおいて、チューニングの効率性と正確性を向上させることができるか?
  • RQ2トランスファーラーニングは、最適なパrameter設定を達成するために必要な高価なアプリケーション実行回数をどの程度削減できるか?
  • RQ3低コスト予算条件下で、マルチタスクおよびトランスファーラーニング手法は、OpenTuner や HpBandSter といった最先端の自動チューナーと比較してどの程度優れているか?
  • RQ4再訓練を完全に回避して、再訓練を完全に回避して、以前にチューニングされたタスクからの知識を、未観測の新しい問題インスタンスに効果的に転送できるか?
  • RQ5エクサスケールワークロードに一般的に見られるノイズが多い、非定常的で不連続なパフォーマンスメトリクスの下でも、これらの手法はどの程度の性能を発揮するか?

主な発見

  • 提案されたマルチタスク学習アプローチ(MLA)は、テストケースの66%でOpenTunerを上回り、アプリケーション実行時間で最大40%の改善を達成した。
  • 実行ゼロのトランスファーラーニング手法であるTLA1は、OpenTuner や HpBandSter が得た設定と同等またはそれ以上の性能を達成した。
  • 100回のアプリケーション実行のみを用いたTLA2は、500×500のScaLAPACK QR分解において最良の実行時間を5.67e-3秒にまで短縮し、100回実行のOpenTuner(7.00e-3 s)を上回り、グリッドサーチ(5.15e-3 s)に近い性能を発揮した。
  • 本フレームワークは、OpenTuner や HpBandSter よりも平均して1.5倍のアプリケーション実行時間短縮を達成しており、顕著な効率性の向上を示した。
  • これらの手法は特に低コスト予算条件下で顕著に効果を発揮し、高価なエクサスケールアプリケーションにおいて、標準的な自動チューナーよりも適していることが示された。
  • 実験結果は、トランスファーラーニングが最小限または全く新しい評価を伴わずに正確なチューニング予測を可能にすることを確認しており、フレームワークのスケーラビリティと適応性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。