Skip to main content
QUICK REVIEW

[論文レビュー] Learning how to be robust: Deep polynomial regression

Juan-Manuel Pérez-Rúa, Tomás Crivelli|arXiv (Cornell University)|Apr 17, 2018
Advanced Vision and Imaging参考文献 40被引用数 3
ひとこと要約

本論文では、教師付きアノテーションの必要性を回避するため、微分可能でハードウェアに組み込まれた多項式デコーダーを用いた、頑健な多項式回帰のためのディーブラーニングフレームワークを提案する。合成された外れ値を含むデータで訓練し、復元出力に対する損失関数を最適化することで、モデルは実世界のデータに一般化する能力を学習する。動画安定化タスクにおいて、従来の頑健な回帰手法を上回る性能を発揮する。

ABSTRACT

Polynomial regression is a recurrent problem with a large number of applications. In computer vision it often appears in motion analysis. Whatever the application, standard methods for regression of polynomial models tend to deliver biased results when the input data is heavily contaminated by outliers. Moreover, the problem is even harder when outliers have strong structure. Departing from problem-tailored heuristics for robust estimation of parametric models, we explore deep convolutional neural networks. Our work aims to find a generic approach for training deep regression models without the explicit need of supervised annotation. We bypass the need for a tailored loss function on the regression parameters by attaching to our model a differentiable hard-wired decoder corresponding to the polynomial operation at hand. We demonstrate the value of our findings by comparing with standard robust regression methods. Furthermore, we demonstrate how to use such models for a real computer vision problem, i.e., video stabilization. The qualitative and quantitative experiments show that neural networks are able to learn robustness for general polynomial regression, with results that well overpass scores of traditional robust estimation methods.

研究の動機と目的

  • トレーニング時に真の係数のアノテーションが不要な、汎用的で教師なしのディーブラーニング手法を、多項式回帰に適用すること。
  • 最小二乗法やRANSACといった古典的手法がバイアスを受ける、構造的外れ値の問題に取り組むこと。
  • 深層ニューラルネットワークが、外れ値の分布や比率に関する事前仮定なしに、頑健性を学習できるかどうかを調査すること。
  • 復元出力に適用する損失関数と、推定された多項式係数に適用する損失関数の有効性を比較し、一般化性能の向上に寄与するかを検証すること。
  • 本手法が、パラメトリックモーション推定や動画安定化といった実世界のコンピュータビジョンタスクに適用可能かどうかを実証すること。

提案手法

  • 入力次元に応じて1次元または2次元畳み込みを用いるスタックドアワーゴラスアーキテクチャを採用し、マルチスケールの空間的推論を可能にする。
  • 1次元/2次元畳み込みとバッチ正則化を用いたモデルベースオートエンコーダーを採用し、特徴抽出と多項式係数の回帰を実現する。
  • 予測された係数を入力データ空間に再構築する、微分可能でハードウェアに組み込まれた多項式デコーダーを導入し、係数に関する明示的な教師信号なしにエンド・ツー・エンドの訓練を可能にする。
  • ガウスノイズと構造的ポリゴナル外れ値を制御的に含む合成データセット(Data 1 および Data 2)を用いてネットワークを訓練する。
  • 標準的なL2損失に加え、外れ値に強い損失関数(例:Huber損失)を復元出力に適用し、外れ値の影響下でも一般化性能を向上させる。
  • オンラインでのデータ生成により、多様な外れ値パターンをシミュレートし、実際のアノテート済みデータセットへの依存を回避する。

実験結果

リサーチクエスチョン

  • RQ1完全に合成され、外れ値が含まれるデータで訓練されたディーブラーニングネットワークは、真の係数の教師信号なしに、頑健な多項式回帰を学習できるか?
  • RQ2復元出力(すなわち再構築信号)に損失関数を適用することで、推定された多項式係数に直接損失を適用するのと比較して、より良い一般化性能が得られるか?
  • RQ3構造的外れ値が存在する状況下で、本ネットワークの性能はRANSAC や M-推定量といった古典的手法と比べてどの程度優れているか?
  • RQ4外れ値比率が30%の合成データで訓練されたモデルは、複雑な実世界のノイズやオクルージョンを伴う実動画安定化タスクにどの程度一般化できるか?
  • RQ5マルチスケール処理や空間的認識といったアーキテクチャ的要素は、多項式回帰における頑健性を達成するために不可欠であるか?

主な発見

  • 提案手法は、構造的外れ値を伴う多項式回帰タスクにおいて、RANSAC や M-推定量といった標準的手法を上回る優れた性能を達成した。
  • 復元出力(再構築信号)に損失関数を適用することで、多項式係数そのものに損失を適用するのと比較して、より優れた一般化性能が得られた。
  • 外れ値比率30%の合成データ(Data 2)で訓練されたモデルは、追加のファインチューニングなしに、実動画安定化タスクに効果的に一般化し、高品質な結果を生成した。
  • 微分可能でハードウェアに組み込まれた多項式デコーダーの使用により、アノテートされた係数が不要なエンド・ツー・エンドの訓練が可能となり、本手法はスケーラブルで教師なしの性質を持つようになった。
  • マルチスケールで空間的に認識可能な畳み込みを備えたスタックドアワーゴラスネットワークは、構造的外れ値を効果的に抑制し、多項式構造を保持する能力を学習した。
  • グローバルモーション推定および動画安定化において、本手法は定量的・定性的な両評価で、古典的手法を上回る最先端の性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。