[論文レビュー] Tracking Everything Everywhere All at Once
本論文では、準3次元の標準体積と可逆な局所的標準写像を用いて、動画の全ピクセルに対してグローバルに一貫した、全長の運動軌道を推定するテスト時最適化手法であるOmniMotionを提案する。全動画にわたって運動を同時に最適化することで、TAP-Vidベンチマークにおいて長距離トラッキング、遮蔽耐性、時間的整合性の面で最先端の性能を達成した。
We present a new test-time optimization method for estimating dense and long-range motion from a video sequence. Prior optical flow or particle video tracking algorithms typically operate within limited temporal windows, struggling to track through occlusions and maintain global consistency of estimated motion trajectories. We propose a complete and globally consistent motion representation, dubbed OmniMotion, that allows for accurate, full-length motion estimation of every pixel in a video. OmniMotion represents a video using a quasi-3D canonical volume and performs pixel-wise tracking via bijections between local and canonical space. This representation allows us to ensure global consistency, track through occlusions, and model any combination of camera and object motion. Extensive evaluations on the TAP-Vid benchmark and real-world footage show that our approach outperforms prior state-of-the-art methods by a large margin both quantitatively and qualitatively. See our project page for more results: http://omnimotion.github.io/
研究の動機と目的
- 長距離の運動と遮蔽に対処できない既存のオプティカルフローおよびスパarsityトラッキング手法の限界を解消すること。
- 2フレーム間のものにとどまらず、全動画シーケンスにわたる密な、グローバルに一貫した運動推定を可能にすること。
- カメラと物体の運動の複雑な組み合わせをモデル化しながら、空間的および時間的整合性を維持すること。
- 動画内の任意の時点で全長の軌道照会を可能にする統一表現を提供すること。
- サイクル整合性を持つ標準体積と写像を用いることで、遮蔽および大規模なカメラの動きに対して耐性を高めること。
提案手法
- 本手法は、全フレームにわたるグローバルな運動構造を符号化する準3次元の標準体積を用いて動画を表現する。
- 局所フレームと標準体積との間で可逆な写像(双方向写像)を定義し、サイクル整合性を保証するとともに、前後方向のマッピングを可能にする。
- 写真的一致性およびフローの一貫性の損失関数を用いて、写真的一致性とフローの監視信号を最適化の信号として用い、標準空間内の運動推定を精緻化する。
- 困難な運動領域に重点を置くハードマイニングサンプリングを用いることで、高速または複雑な運動の精度が向上する。
- 写真的一致性とフローの監視を最適化信号として用い、標準空間内の運動推定を精緻化する。
- 本手法は、動画内の任意の連続的な空間時間座標での運動軌道照会をサポートする。

実験結果
リサーチクエスチョン
- RQ1全動画の全ピクセルに対して全長の軌道をモデル化できる統一的かつグローバルに一貫した運動表現を学習できるか?
- RQ2遮蔽に強く、長距離の一貫性を保つ運動推定はどのように実現できるか?
- RQ3可逆な写像を備えた標準体積は、局所的・フレームごとの最適化に比べて長距離トラッキングで優れた性能を発揮できるか?
- RQ4標準体積を用いたテスト時最適化は、複雑な実世界の動画においてどれほど精度を向上させるか?
- RQ5本手法は、パララックスや非剛体運動を含む、任意のカメラと物体の運動の組み合わせをどのように処理するか?
主な発見
- OmniMotionはTAP-VidベンチマークでAJスコア51.7を達成し、従来手法を大きく上回り、新たなSOTAを樹立した。
- 本手法は軌道誤差(TC)を0.74まで低減し、優れた長距離一貫性とドリフトの低減を示した。
- アブレーションスタディの結果、可逆な写像を削除するとAJが12.5に低下し、グローバル構造の維持においてその重要性が明確になった。
- 写真的一致性損失を省略するとAJが42.3に低下し、運動推定の精緻化においてその重要性が確認された。
- ドッグおよびスイングのシーケンスにおける定性的な比較から、遮蔽時にも妥当な運動経路を的確に推定できていることが示された。
- 標準体積から導出された疑似深度マップは、学習された深度順序を示しており、遮蔽時の正しい表面ソートを可能にした。
![Figure 3: Qualitative comparison of our method and baselines on DAVIS [ 50 ] . The leftmost image shows query points in the first frame, and the right three images show tracking results over time. Notably, our method tracks successfully through the occlusion events in swing and india , while baselin](https://ar5iv.labs.arxiv.org/html/2306.05422/assets/x3.png)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。