Skip to main content
QUICK REVIEW

[論文レビュー] LS-Net: Learning to Solve Nonlinear Least Squares for Monocular Stereo

Ronald Clark, Michael Bloesch|arXiv (Cornell University)|Sep 9, 2018
Advanced Vision and Imaging参考文献 23被引用数 22
ひとこと要約

LS-Net は、モノクロナルステレオの非線形最小二乗問題を解くために、データから事前分布を暗黙的に学習するエンドツーエンドで学習可能なニューラル最適化手法を提案する。高ノイズで不適切に定義された問題において、Levenberg-Marquardt よりも精度、速度、ロバスト性に優れる。

ABSTRACT

Sum-of-squares objective functions are very popular in computer vision algorithms. However, these objective functions are not always easy to optimize. The underlying assumptions made by solvers are often not satisfied and many problems are inherently ill-posed. In this paper, we propose LS-Net, a neural nonlinear least squares optimization algorithm which learns to effectively optimize these cost functions even in the presence of adversities. Unlike traditional approaches, the proposed solver requires no hand-crafted regularizers or priors as these are implicitly learned from the data. We apply our method to the problem of motion stereo ie. jointly estimating the motion and scene geometry from pairs of images of a monocular sequence. We show that our learned optimizer is able to efficiently and effectively solve this challenging optimization problem.

研究の動機と目的

  • モノクロナルステレオ再構成における不適切に定義された、高ノイズの非線形最小二乗問題を最適化する課題に対処すること。
  • 手作業で設計された正則化項や事前分布に依存しないように、データからそれらを暗黙的に学習すること。
  • 微分可能でエンドツーエンドで学習可能な最適化手法を開発し、光度最適化における収束性とロバスト性を向上させること。
  • 高い光度的一致性を実現しながら、モノクロナルシーケンスにおける動きと深度の同時推定を可能にすること。
  • 大規模で不定値の問題において、Levenberg-Marquardt などの古典的ソルバーを精度、速度、メモリ効率の面で上回ること。

提案手法

  • LS-Net は、残差とヤコビ行列から直接最適化ステップを計算する深層ニューラルネットワークであり、従来のガウス・ニュートン法や Levenberg-Marquardt 法のステップを置き換える。
  • 合成データ上でエンドツーエンドに学習し、光度誤差を最小化することで、有効な正則化を暗黙的に学習する。
  • 繰り返し構造を用いて複数の最適化イテレーションを処理し、深度と動きの推定値を段階的に改善する。
  • 全画像にわたる光度残差を活用することで、再構成品質を向上させる。
  • パラメータ効率が高く、推論時間が従来の方法における行列逆行列計算よりも著しく速い。
  • 伝統的な最適化構造(例:ヘッシアン近似)とニューラル学習を統合することで、精度とロバスト性のバランスを図る。

実験結果

リサーチクエスチョン

  • RQ1学習された最適化手法は、モノクロナルステレオにおける古典的非線形最小二乗ソルバー(例:Levenberg-Marquardt)よりも精度と収束速度で優れるか?
  • RQ2教師なしで、非線形最小二乗問題に対する有効な事前分布や正則化をニューラルネットワークが暗黙的に学習できるか?
  • RQ3問題のサイズ(小、中、大)やノイズレベルに応じて、学習された最適化手法の性能はどのようにスケーリングされるか?
  • RQ4広い基準点距離を持つ実世界のモノクロナルシーケンスにおいて、高い光度的一致性と正確な深度推定が達成できるか?
  • RQ5既存の学習ベースおよび古典的アプローチと比較して、モデルサイズ、推論速度、最適化精度のトレードオフはいかなるものか?

主な発見

  • KITTI、RGB-D、Sun3D データセットの全評価指標で、SIFT、FF、MATLAB、DeMoN ベースラインを上回る最高の性能を達成した。
  • KITTI データセットでは、L1相対的深度誤差が 0.210、並進誤差が 8.21 であり、DeMoN よりも顕著に優れている(0.248 と 8.918)。
  • 大規模で不定値の問題(例:128×96 の画像)において、最適化時間を LM の 532ms から 25ms/イテレーションに短縮し、収束性と精度が向上した。
  • DeMoN よりも 3 倍以上パラメータ効率が高く(11.4M 対 45.7M)、大規模ヤコビ行列を計算しているにもかかわらず、推論速度が 1.5 倍速い。
  • アブレーションスタディにより、15 イテレーションが最良の性能を示し、L1相対的深度誤差が 0.210、並進誤差が 8.21 に低下した。
  • DeMoN の RNN ファインチューニングネットワークと比較して、LS-Net ははるかに少ないパラメータで同等または優れた結果を達成し、推論が速い。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。