Skip to main content
QUICK REVIEW

[論文レビュー] Self-Supervised Motion Magnification by Backpropagating Through Optical Flow

Zhaoying Pan, Daniel Geng|arXiv (Cornell University)|Nov 28, 2023
Advanced Vision and Imaging被引用数 4
ひとこと要約

本稿では、事前学習済みのオプティカルフロー網を逆誤差伝搬によって通過させ、予測されたフローを所望の係数でスケーリングすることで、微細な動画の動きを拡大する自己教師付きの動き拡大手法を提案する。合成データを一切使用せず、実際のラベルなし動画のみで学習し、実動画および合成動画の両方で最先端の結果を達成しており、テスト時における適応とユーザー提供のマスクを用いたオブジェクト固有の拡大を可能にしている。

ABSTRACT

This paper presents a simple, self-supervised method for magnifying subtle motions in video: given an input video and a magnification factor, we manipulate the video such that its new optical flow is scaled by the desired amount. To train our model, we propose a loss function that estimates the optical flow of the generated video and penalizes how far if deviates from the given magnification factor. Thus, training involves differentiating through a pretrained optical flow network. Since our model is self-supervised, we can further improve its performance through test-time adaptation, by finetuning it on the input video. It can also be easily extended to magnify the motions of only user-selected objects. Our approach avoids the need for synthetic magnification datasets that have been used to train prior learning-based approaches. Instead, it leverages the existing capabilities of off-the-shelf motion estimators. We demonstrate the effectiveness of our method through evaluations of both visual quality and quantitative metrics on a range of real-world and synthetic videos, and we show our method works for both supervised and unsupervised optical flow methods.

研究の動機と目的

  • 従来の学習ベースの動き拡大手法が、監視のための大規模な合成データセットを必要としているという制限を解消すること。
  • 既存の市販のオプティカルフロー網を微分可能な監視信号として活用し、カスタムの学習データを必要としないこと。
  • 予測されたオプティカルフローにおける目標の拡大係数からの逸脱をペナルティとする損失関数を定式化することで、実際のラベルなし動画を用いた自己教師付き学習を可能にすること。
  • テスト時における適応と、セグメンテーションマスクを用いたユーザー主導のオブジェクト固有の拡大を可能にすること。

提案手法

  • モデルは動画フレームペアと拡大係数 α を入力とし、フローを α 倍にスケーリングした新しいフレームペアを生成する。
  • 微分可能損失関数が生成動画のオプティカルフローを推定し、入力フローの α 倍からの逸脱をペナルティとして課す。ここで使用するのは事前学習済みのオプティカルフロー網である。
  • 学習プロセスでは、オプティカルフロー網を介して勾配を逆伝搬させ、画像生成ネットワークを最適化する。
  • 視覚的外観の保存を図るため、入力フレームと生成フレームのピクセル単位の一貫性を促進する正則化損失を導入する。
  • テスト時適応は、推論時に入力動画上でモデルをファインチューニングすることで実現され、生成品質の向上を図る。
  • オブジェクト固有の拡大は、ユーザーが提供するセグメンテーションマスクを適用し、特定の領域にのみフロー拡大を制限することで達成する。

実験結果

リサーチクエスチョン

  • RQ1合成データや真値の拡大済みペアが一切ない状況でも、自己教師付きで動き拡大を効果的に学習できるか?
  • RQ2市販のオプティカルフロー網が、動き拡大のための信頼性があり微分可能な監視信号として機能するか?
  • RQ3動きの正確さと視覚的品質の観点から、教師ありベースラインおよびラグランジュ変形法と比較して、本手法の性能はどの程度か?
  • RQ4テスト時適応が、拡大動画の品質をどの程度向上できるか?
  • RQ5セグメンテーションマスクを用いて、ユーザーが選択したオブジェクトの動きのみを拡大できるか?

主な発見

  • 本手法は、定量的指標および視覚的品質の両面で、ベースラインのワープベース手法および教師あり学習手法を上回っており、特に遮蔽を伴う複雑なシーンでも顕著な優位性を示した。
  • 合成動画では、非パrametric補間を用いた場合、動き誤差が 0.61px(warp nearest)および 0.57px(warp bilinear)にまで低下し、ベースラインを著しく下回った。
  • DeepFillv2補間を用いた場合、本手法は 0.66x(サブピクセルテスト)および 0.53x(ノイズテスト)の拡大誤差を達成し、すべてのベースライン手法を上回った。
  • テスト時適応により、動き誤差は 0.61px から 0.53px(warp nearest)および 0.57px から 0.53px(warp bilinear)にまで低下し、一貫した品質向上が確認された。
  • 一部のケースでは、ギターの弦や木の枝といった細い構造物の動きも正しく拡大できたが、その領域でのオプティカルフロー推定の誤りにより、ときには失敗した。
  • 失敗事例の主な原因は、滑らかな領域や細い構造物における誤ったオプティカルフロー予測であり、それが拡大されており、本手法がオプティカルフロー網の正確性に敏感であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。