Skip to main content
QUICK REVIEW

[論文レビュー] Taming the Long Tail of Deep Probabilistic Forecasting

Jedrzej Kozerawski, Mayank Sharan|arXiv (Cornell University)|Feb 27, 2022
Forecasting Techniques and Applications被引用数 6
ひとこと要約

本稿では、予測誤差の長尾分布に明示的に焦点を当てることで、平均性能を損なわずに、トラジェクトリ予測および時系列予測におけるテールエラーを顕著に低減する2つのモーメントベースの損失関数、Pareto Loss と Kurtosis Loss を提案する。一般化されたパレート分布のフィッティングと4次モーメント正則化を通じて、まれで高誤差のシナリオに重点を置くことで、深層確率的予測の性能が向上する。

ABSTRACT

Deep probabilistic forecasting is gaining attention in numerous applications ranging from weather prognosis, through electricity consumption estimation, to autonomous vehicle trajectory prediction. However, existing approaches focus on improvements on the most common scenarios without addressing the performance on rare and difficult cases. In this work, we identify a long tail behavior in the performance of state-of-the-art deep learning methods on probabilistic forecasting. We present two moment-based tailedness measurement concepts to improve performance on the difficult tail examples: Pareto Loss and Kurtosis Loss. Kurtosis loss is a symmetric measurement as the fourth moment about the mean of the loss distribution. Pareto loss is asymmetric measuring right tailedness, modeling the loss using a generalized Pareto distribution (GPD). We demonstrate the performance of our approach on several real-world datasets including time series and spatiotemporal trajectories, achieving significant improvements on the tail examples.

研究の動機と目的

  • 深層確率的予測における長尾行動を特定・解決すること。特に、まれだが重要な予測事例でモデルが失敗する問題に焦点を当てる。
  • 平均性能を損なわず、困難なテールケースの性能を向上させること。
  • 予測誤差の長尾分布に適した、原理的で解釈可能かつ効果的なモーメントベースの損失関数を開発すること。
  • 時系列およびスパatiotemporalトラジェクトリを含む多様な実世界データセットにおいて、これらの損失関数の有効性を実証すること。
  • 長尾問題を検出できるように、平均指標に加えてテール指標(例:VaR95、VaR99)を評価に組み込むことの重要性を提唱すること。

提案手法

  • Pareto Loss は、損失分布のテール部を一般化されたパレート分布(GPD)でモデル化し、高誤差サンプルに非対称な重み付けを可能にする。
  • 損失を、しきい値を超えた際に飽和するよう調整されたシフトされたモーメントの重み付き和として定式化することで、極端なケースの学習を安定化させる。
  • Kurtosis Loss は、損失分布の4次中心モーメントを用いて、重いテール行動を対称的に測定・ペナルティ化する。
  • 両損失関数とも微分可能であり、既存の深層確率的予測フレームワークに正則化または損失重み付けとして統合可能である。
  • テール例を訓練中に高優先度として扱い、損失関数への寄与度を高めることで、効果的な学習を実現する。
  • ハイパーパrameterは、テール強調と一般化のバランスをとるために調整され、アブレーション実験ではカーツィス損失では感度が顕著に、パレート損失では頑健性が確認された。
Figure 1: Log-log plot of error distribution for trajectory prediction on the ETH-UCY dataset using SoTA(Traj++EWTA). Also shown is a tail scenario with predictions using Traj++EWTA [purple] and Traj++EWTA+Pareto Margin Loss (ours) [teal].
Figure 1: Log-log plot of error distribution for trajectory prediction on the ETH-UCY dataset using SoTA(Traj++EWTA). Also shown is a tail scenario with predictions using Traj++EWTA [purple] and Traj++EWTA+Pareto Margin Loss (ours) [teal].

実験結果

リサーチクエスチョン

  • RQ1最先端の深層確率的予測モデルにおいて、長尾誤差行動は、さまざまな実世界データセットでどのように現れるか?
  • RQ2カーツィス損失やパレート損失といったモーメントベースの損失関数は、まれで高誤差の予測事例の性能向上に有効に働くか?
  • RQ3Pareto Loss と Kurtosis Loss は、極端な誤差(例:VaR99)と中程度のテール誤差(例:VaR95)の両方をどれほど効果的に低減できるか?
  • RQ4これらの損失関数は、予測ホライズンが延びるに従って、長期予測性能にどの程度向上効果をもたらすか?
  • RQ5これらの手法は、自動運転のトラジェクトリ予測など、安全が重要な応用分野において、平均性能を損なわず、モデルの信頼性を向上させられるか?

主な発見

  • Pareto Loss(PLM)は、テストした4つのデータセットすべてで、平均性能およびテール性能の両面で、ベースラインを上回る一貫した改善を達成した。
  • Kurtosis Loss は最悪ケースの誤差を顕著に低減し、VaR99 および Max 指標で最高のパフォーマンスを記録した。これは、極端なテール事象に与える影響が強いことを示している。
  • ETH-UCY Zara1 データセットでは、両手法とも、最も誤差の大きい上位5%の予測におけるFDE(最終的距離誤差)を低減した。特に予測ホライズンが長い場合に改善が顕著に現れた。
  • 長期予測の誤差分布には、テールの悪化が確認された。これは、テール誤差が時間経過とともに蓄積され、信頼性の高い長期予測を実現するには、これを対処する必要があることを裏付けている。
  • Pareto Loss はテール分布全体にわたる安定的かつスケーラブルな改善を提供するが、Kurtosis Loss は極端な外れ値に敏感であるため、最悪ケースのロバストネスに適している。
  • 結果から、テールに配慮した損失を統合することで、自動運転や電力網の異常検出といった安全が重要な予測タスクにおける信頼性の向上が明確に測定可能であることが示された。
Figure 2: Log-log plots of distribution of ground truth labels for the time series [Electricity: Top left, Traffic: Top right] and trajectory [ETH-UCY: Bottom left, nuScenes: Bottom right] forecasting datasets. The value for time series datasets represents energy and occupancy and for the trajectory
Figure 2: Log-log plots of distribution of ground truth labels for the time series [Electricity: Top left, Traffic: Top right] and trajectory [ETH-UCY: Bottom left, nuScenes: Bottom right] forecasting datasets. The value for time series datasets represents energy and occupancy and for the trajectory

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。