Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Rank Learning Curves

Martin Wistuba, Tejaswini Pedapati|arXiv (Cornell University)|Jun 5, 2020
Machine Learning and Data Classification参考文献 23被引用数 5
ひとこと要約

本稿では、他のデータセットからの学習曲線を活用して、予測と順位付けのためのペairワイズランキング損失を用いた、転移学習に基づくLCRankNetを提案する。この手法により、非効率なモデル構成の早期終了を可能とし、ニューラルアーキテクチャサーチを最大100倍高速化し、性能の低下を最小限に抑える。既存の曲線外挿法やポイントワイズランキング手法を上回る性能を発揮する。

ABSTRACT

Many automated machine learning methods, such as those for hyperparameter and neural architecture optimization, are computationally expensive because they involve training many different model configurations. In this work, we present a new method that saves computational budget by terminating poor configurations early on in the training. In contrast to existing methods, we consider this task as a ranking and transfer learning problem. We qualitatively show that by optimizing a pairwise ranking loss and leveraging learning curves from other datasets, our model is able to effectively rank learning curves without having to observe many or very long learning curves. We further demonstrate that our method can be used to accelerate a neural architecture search by a factor of up to 100 without a significant performance degradation of the discovered architecture. In further experiments we analyze the quality of ranking, the influence of different model components as well as the predictive behavior of the model.

研究の動機と目的

  • 自動機械学習における高い計算コストを軽減するため、有望でないモデル構成の早期終了を可能とすること。
  • 長期間または多数の曲線を必要とする既存の学習曲線外挿法の限界を克服すること。
  • 絶対的な性能を予測するのではなく、ある構成が別の構成を上回る相対的な確率をモデル化することで、順位付けの性能を向上させること。
  • 他のデータセットからの転移学習を活用することで、短いまたはゼロ長の学習曲線でも効果的な早期停止を可能とすること。
  • 本手法がニューラルアーキテクチャサーチおよびハイパーパramータ最適化の加速に有効であることを示すこと。

提案手法

  • LCRankNetは、あるモデル構成が別の構成を上回る確率を直接最適化するため、ペアワイズランキング損失を採用する。
  • 部分的な学習曲線、モデルアーキテクチャ埋め込み、データセットメタデータといった複数の入力モodalitiyを統合して予測を支援する。
  • 多様なデータセットからの学習曲線で事前学習することで転移学習を実装し、観測された曲線が少なくともない新しい未学習データセットに対しても一般化可能である。
  • モデル構造から学習されたアーキテクチャ埋め込みを、曲線特徴と組み合わせることで、早期予測の精度を向上させる。
  • TPE、Regularized Evolution、強化学習を含む、さまざまな最適化フレームワークと互換性があり、NASおよびハイパーパramータチューニングに適用可能である。
  • アブレーションスタディにより、メタデータ、アーキテクチャ、曲線特徴の各コンポーネントの寄与が検証され、ペアワイズ損失とポイントワイズ損失の比較も行われる。

実験結果

リサーチクエスチョン

  • RQ1ペアワイズランキング損失は、絶対性能予測に用いるポイントワイズ回帰と比較して、モデル構成の順位付けにおける早期停止性能を向上させることができるか?
  • RQ2他のデータセットからの転移学習により、観測されたトレーニングエポクが少なくともない場合でも、学習曲線の順位付けをどれほど正確に行えるか?
  • RQ3アーキテクチャ埋め込みとメタデータは、異なるデータセットやモデルタイプ間での一般化能力にどのように寄与するか?
  • RQ4学習曲線の長さが、順位付けモデルの予測性能に及ぼす影響は何か?
  • RQ5LCRankNetは、最終モデルの性能を著しく損なうことなく、ニューラルアーキテクチャサーチを顕著に高速化できるか?

主な発見

  • LCRankNetは、完全なトレーニングと比較して、性能の低下を最小限に抑えながら、ニューラルアーキテクチャサーチを最大100倍高速化する。
  • ペアワイズランキング損失は、特に学習曲線が長くなるにつれてポイントワイズ回帰を上回る性能を示すが、非常に短い曲線ではポイントワイズ損失が優れている。
  • メタデータとアーキテクチャ埋め込みは、学習曲線データが不足する状況でもモデルの安定性と性能を確保するために不可欠である。
  • 学習曲線特徴、アーキテクチャ埋め込み、メタデータの組み合わせが最良の性能を達成し、各コンponentが最終結果に直交的に寄与している。
  • LCRankNetは、画像分類と表形式回帰の両ベンチマークにおいて、TPE、Regularized Evolution、強化学習を含む複数の最適化手法の高速化を向上させる。
  • アブレーションスタディにより、学習曲線、アーキテクチャ、メタデータのすべてのコンponentが重要であることが確認され、部分的またはゼロ長の曲線に対してもモデルの頑健性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。