Skip to main content
QUICK REVIEW

[論文レビュー] AutoFlow: Learning a Better Training Set for Optical Flow

Deqing Sun, Daniel Vlasic|arXiv (Cornell University)|Apr 29, 2021
Advanced Vision and Imaging参考文献 51被引用数 4
ひとこと要約

AutoFlowは、ターゲットデータセットにおけるモデル性能を最大化するためにレンダリングハイパーパrameterを最適化する、学習可能で2次元のレイヤード合成データ生成手法を提案する。微分可能トレーニングを用いたシンプルな2次元の動きと形状パrameter化により、AutoFlowは最先端の結果を達成する——4つの拡張済み例でのRAFTの学習が、22,872個のFlyingChairs例での学習を上回る性能を発揮する。

ABSTRACT

Synthetic datasets play a critical role in pre-training CNN models for optical flow, but they are painstaking to generate and hard to adapt to new applications. To automate the process, we present AutoFlow, a simple and effective method to render training data for optical flow that optimizes the performance of a model on a target dataset. AutoFlow takes a layered approach to render synthetic data, where the motion, shape, and appearance of each layer are controlled by learnable hyperparameters. Experimental results show that AutoFlow achieves state-of-the-art accuracy in pre-training both PWC-Net and RAFT. Our code and data are available at https://autoflow-google.github.io .

研究の動機と目的

  • 深層ネットワークの事前学習に不可欠な合成光学フローデータセットにおける原理的設計の欠如に取り組むこと。
  • FlyingChairs や FlyingThings3D といった複雑な3次元ベースの合成データセットを上回る可能性がある、よりシンプルで学習可能なレンダリングパイプラインが存在するかを調査すること。
  • モデルの一般化性と正確性に最も影響を与えるデータ特徴(例:動き統計、オブジェクト数、増幅処理)は何かを特定すること。
  • ターゲットデータセット上で直接事前学習データ分布を最適化することで、固定で手動で設計されたデータセットよりも優れた下流性能が得られるかを検討すること。

提案手法

  • AutoFlowは、各レイヤーに動き、形状、外観の学習可能なハイパーパrameterを備えた2次元レイヤードレンダリングパイプラインを用いる。
  • レンダリングプロセスは微分可能であり、勾配降下法を用いてターゲットデータセットのモデル誤差を最小化するようにハイパーパrameterをエンドツーエンド最適化できる。
  • 本手法は、合成データ生成とモデルトレーニングプロセスを同時に最適化し、ターゲットデータセットの性能を目的関数として用いる。
  • ハイパーパラメータには、前面オブジェクトの数、動きモデル(バイリニアグリッドワープを含む)、形状および外観のレンダリングパrameterが含まれる。
  • トレーニング中にデータ増幅(例:RandAugment)を適用することで、多様性を高め、一般化性能を向上させる。
  • 本アプローチの評価は、PWC-Net や RAFT を AutoFlow が生成するデータで事前学習し、Sintel および KITTI ベンチマークでの性能を測定することで実施される。

実験結果

リサーチクエスチョン

  • RQ1学習可能なハイパーパラメータを備えたシンプルな2次元レイヤードレンダリングパイプラインは、FlyingChairs や FlyingThings3D のような複雑な3次元ベースの合成データセットを上回る性能を発揮できるか?
  • RQ2特定のデータ特徴(例:動きの大きさ分布、オブジェクト数、増幅タイプ)のうち、高いモデル精度を達成するために最も重要であるのは何か?
  • RQ3ターゲットデータセット上で直接事前学習データ分布を最適化することで、固定で手動で設計されたデータセットよりも優れた一般化性能が得られるか?
  • RQ4AutoFlow が生成するデータを用いた場合、どれほど少ないトレーニング例で、大規模な合成データセットと同等の性能を達成できるか?
  • RQ5Sintel のデータセットとは顕著に異なる動き統計を持つにもかかわらず、AutoFlow がなぜ良好な性能を発揮するのか?

主な発見

  • 4つの拡張済み AutoFlow 例での RAFT の学習が、22,872 個の FlyingChairs 例(拡張あり)での学習と同等の Sintel.final における AEPE(3.57)を達成し、最終モデルでは FlyingChairs での学習より優れた 2.57 AEPE を達成する。
  • AutoFlow による事前学習により、PWC-Net の Sintel.final における AEPE は 4.42(FlyingChairs)から 2.91 に低下し、RAFT が FlyingChairs で事前学習された場合と同等の性能を発揮するようになる。
  • PWC-Net と RAFT が十分な AutoFlow データで事前学習されると、両者の性能差が著しく縮まるため、AutoFlow がより単純なモデルに対してもより効果的な学習を可能にしていることが示唆される。
  • AutoFlow の動き統計は Sintel や FlyingChairs とは異なる——中程度から高めの動きに集中し、小さな動きが不足している。これは、小さな動きが全体の誤差指標に与える寄与が小さいためと考えられる。
  • 色の増幅をオフにすると、KITTI での性能が著しく低下する(AEPE が 4.66 から 14.06 に上昇する)ため、実世界への一般化において照明変動の重要性が浮き彫りになる。
  • 本手法は良好な一般化性を示す——Sintel.final や KITTI で学習したハイパーパラメータは、両方のデータセットで同程度の性能を発揮する。これは、レンダリングパイプラインが正則化要因として機能している可能性を示唆する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。