Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Objective Model Selection for Time Series Forecasting

Oliver Borchert, David Salinas|arXiv (Cornell University)|Feb 17, 2022
Time Series Analysis and Forecasting被引用数 7
ひとこと要約

この論文では、44の多様なデータセットにおけるオффライン評価を活用して、最適な予測モデルのデフォルトを学習する、新しい多目的モデル選択手法ParetoSelectを紹介する。精度、遅延、学習時間の複数の目的を最適化するために、再訓練を伴わずにパラメータを決定する代替モデルを訓練することで、選定作業を著しく軽減し、複数の目的をバランスさせる。

ABSTRACT

Research on time series forecasting has predominantly focused on developing methods that improve accuracy. However, other criteria such as training time or latency are critical in many real-world applications. We therefore address the question of how to choose an appropriate forecasting model for a given dataset among the plethora of available forecasting methods when accuracy is only one of many criteria. For this, our contributions are two-fold. First, we present a comprehensive benchmark, evaluating 7 classical and 6 deep learning forecasting methods on 44 heterogeneous, publicly available datasets. The benchmark code is open-sourced along with evaluations and forecasts for all methods. These evaluations enable us to answer open questions such as the amount of data required for deep learning models to outperform classical ones. Second, we leverage the benchmark evaluations to learn good defaults that consider multiple objectives such as accuracy and latency. By learning a mapping from forecasting models to performance metrics, we show that our method PARETOSELECT is able to accurately select models from the Pareto front -- alleviating the need to train or evaluate many forecasting models for model selection. To the best of our knowledge, PARETOSELECT constitutes the first method to learn default models in a multi-objective setting.

研究の動機と目的

  • 実世界の応用において、精度、推論遅延、学習時間、モデルサイズをバランスさせる予測モデルの選択課題に対処すること。
  • 13種類の予測手法を44の異種のデータセットに対して包括的に評価し、複数の性能基準を測定する、公開可能な包括的ベンチマークを提供すること。
  • 再訓練を回避するために、未学習のデータセットに対してオフライン評価を活用してデフォルトのモデル選択を学習する手法を開発すること。
  • 高精度を維持しながら低遅延で効率的な推論を実現する多目的アンサンブル学習を可能にすること。
  • 深層学習モデルのデータ要件に関する未解決の問いと、アンサンブル化が予測に与える影響について解明すること。

提案手法

  • 著者らは、44の公開データセットに対して7つの古典的手法と6つの深層学習手法を大規模にベンチマークし、精度(nCRPS)、推論遅延、学習時間、モデルサイズを測定した。
  • オフラインベンチマークデータに基づいて代替モデルを訓練し、複数の目的における性能を予測することで、未学習のデータセットへの一般化を可能にした。
  • ParetoSelectは、予測性能に基づいて非支配的ソーティングとイプシロンネットクラスタリングを用い、パラメータフロント上の多様なモデルのセットを同定する。
  • 代替モデルが予測する指標を用いることで、再訓練を伴わず複数の目的を同時に最適化し、デフォルトモデルを選択する。
  • 多目的性能に基づいてモデルを統合するアンサンブル戦略を提案し、高精度と低遅延を両立させた。
  • 代替モデルは、データセット間でのモデル性能を予測するように訓練され、再評価なしに高速かつスケーラブルなデフォルト選択を可能にした。

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルが古典的手法を上回るために必要な学習データ量はどの程度か?
  • RQ2モデルアンサンブル化は、低推論遅延を維持したまま、予測精度を顕著に向上させることができるか?
  • RQ3どのデータセットの特徴が最良の性能を示す予測モデルを予測できるか?また、それらの特徴はモデル選択を支援するために利用可能か?
  • RQ4オフライン評価に基づいて訓練された代替モデルは、複数の目的において、新しいデータセットに対する最適なデフォルトモデルを正確に予測できるか?
  • RQ5再訓練を回避しつつ、精度、遅延、学習時間のすべての面で高い性能を達成できる多目的モデル選択戦略を学習することは可能か?

主な発見

  • 深層学習モデルが古典的手法を上回るには、数千年程度の観測値で十分であり、その利点を発揮するためのデータ量の閾値が低いことが示された。
  • ベンチマーク対象の44データセットのうち14件では、古典的手法と深層学習手法の性能に差がなく、主に高い確率的変動性や強い周期性に起因する。
  • 最も優れた古典的手法はデータセットごとに異なる(例:ARIMA、ETS、STL-AR、NPTS)ため、あらゆる分野で一貫した上位パフォーマンスを示す手法は存在しない。
  • 分野タイプ(例:小売、電力)などの単純なデータセットグループ化特徴は、モデルパフォーマンス順位を信頼性を持って予測できないため、複雑な背後パターンが存在することが示唆された。
  • ParetoSelectは、パラメータフロントから高精度でモデルを同定でき、未学習のデータセットにおける再訓練や再評価の必要性を大幅に削減した。
  • 提案された多目的アンサンブル戦略は、高精度を達成しながらも低推論遅延を維持しており、バランスの取れたモデル選択の実現可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。