[論文レビュー] From Goals, Waypoints & Paths To Long Term Human Trajectory Forecasting
本稿では、マルチモーダルな不確実性をエピステミック(長期的目標)とアレアトリック(中間の経路点および経路)の成分に分解する、シーンに適合したトラジェクトリ予測モデルY-netを提案する。目的分布と経路分布を階層的にモデル化することで、短時間(SDD、ETH/UCY)および新規の長時間(最大60秒)予測ベンチマークにおいて、SOTAを達成し、長時間予測設定ではFDEで51.9%、ADEで77.1%の向上を達成した。
Human trajectory forecasting is an inherently multi-modal problem. Uncertainty in future trajectories stems from two sources: (a) sources that are known to the agent but unknown to the model, such as long term goals and (b)sources that are unknown to both the agent & the model, such as intent of other agents & irreducible randomness indecisions. We propose to factorize this uncertainty into its epistemic & aleatoric sources. We model the epistemic un-certainty through multimodality in long term goals and the aleatoric uncertainty through multimodality in waypoints& paths. To exemplify this dichotomy, we also propose a novel long term trajectory forecasting setting, with prediction horizons upto a minute, an order of magnitude longer than prior works. Finally, we presentY-net, a scene com-pliant trajectory forecasting network that exploits the pro-posed epistemic & aleatoric structure for diverse trajectory predictions across long prediction horizons.Y-net significantly improves previous state-of-the-art performance on both (a) The well studied short prediction horizon settings on the Stanford Drone & ETH/UCY datasets and (b) The proposed long prediction horizon setting on the re-purposed Stanford Drone & Intersection Drone datasets.
研究の動機と目的
- 人間のトラジェクトリ予測における本質的マルチモーダル性に対処するため、未知の長期的目標(エピステミック不確実性)と予測不能な経路変動(アレアトリック不確実性)を区別すること。
- 予測時間窓が最大60秒までにまで延長された、従来の研究と比べて1桁長い長時間予測ベンチマークを提案すること。
- 多様で正確な長時間予測を実現するため、目的と経路のマルチモーダル性を明示的にモデル化する、シーンに適合したディープラーニングモデルY-netを設計すること。
- 不確実性の因子化が、アレアトリック変動が支配的になる長時間予測において特に性能向上をもたらすことを示すこと。
提案手法
- Y-netは、エピステミック不確実性(最終的目標)とアレアトリック不確実性(中間の経路点および全トラジェクトリ)の明示的確率ヒートマップを予測するために、U-netベースのアーキテクチャを用いる。
- モデルは長期的目標(Ke)のマルチモーダル分布を推定し、各サンプルされた目標に条件づけて、中間の経路点および経路(Ka)のマルチモーダル分布を予測する。
- シーンの意味情報をトラジェクトリ予測に組み込むために、シーン条件付きアテンションとグラフベースのメッセージパッシングを採用する。
- 2段階のサンプリング戦略を用いる:まず、推定された目的分布から目的をサンプリングし、次に各目的に条件づけて経路をサンプリングする。
- 推論時における性能向上を目的として、テスト時サンプリングテクニック(TTST)を導入する。
- 異なる時間窓に条件づけることで、本フレームワークは短時間および長時間の両方の予測をサポートする。
実験結果
リサーチクエスチョン
- RQ1エピステミック不確実性とアレアトリック不確実性を因子化することで、長時間の人のトラジェクトリ予測性能がどのように向上するか?
- RQ2統一されたモデルが、最大60秒までの長期間にわたり、多様でシーンに適合したトラジェクトリを効果的に予測できるか?
- RQ3短時間モデルを再帰的に長時間予測に適用した場合、性能はどのように低下するか?
- RQ4経路のマルチモーダル性(Ka)と目的のマルチモーダル性(Ke)を増加させることで、予測精度にどのような影響があるか?
- RQ5目的と経路の不確実性を明示的にモデル化することが、統合的なマルチモーダル性のモデル化を上回るか?
主な発見
- SDDデータセットでは、短時間予測(tf = 5s)において、ADEで34.0%、FDEで51.9%の向上を達成し、SOTAを改善した。
- ETH/UCYベンチマークでは、前回SOTAを上回り、ADEで5.6%、FDEで51.9%の向上を達成した。
- 提案された長時間予測設定(tf = 30s)において、SDDデータセットではPECNetを上回り、ADEで50.6%、FDEで77.1%の向上を達成した。
- Intersection Droneデータセットでは、長時間予測においてPECNetと比較し、ADEを35.0%、FDEを55.9%削減した。
- テスト時サンプリングテクニック(TTST)は、SDDではADEを9.1%、InDでは18.5%削減し、FDEではそれぞれ30.4%および35.0%の削減を達成し、多様性と精度の向上が有効であることを示した。
- Ka(経路のマルチモーダル性)を変化させると、ADEは一貫して向上し、20倍のサンプル数を用いてもPECNetはKe = 20のY-netを下回る。これは、因子化された不確実性モデル化の優位性を裏付けている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。