Skip to main content
QUICK REVIEW

[論文レビュー] Data-driven 6D Pose Tracking by Calibrating Image Residuals in Synthetic Domains

Bowen Wen, Chaitanya Mitash|arXiv (Cornell University)|May 29, 2021
Robot Manipulation and Learning参考文献 29被引用数 4
ひとこと要約

本論文は、分離特徴符号化とリーマン幾何学的3次元回転表現を特徴とする新規ニューラルネットワークを用いた、$se(3)$-TrackNetを提案する。この手法は、合成データにのみ訓練され、ドメインランダマイゼーションを用いることで、シミュレーションから実世界への転送を強力に可能にする6次元物体ポーズ追跡手法である。実世界のアノテーションデータを一切使用せず、合成データのみで訓練されたにもかかわらず、90.9Hzのリアルタイム性能を達成し、YCB-Videoおよび新規のYCBInEOATベンチマークで最先端の精度を実現。再初期化を必要とせず、実世界データで訓練された手法を上回る性能を発揮する。

ABSTRACT

Tracking the 6D pose of objects in video sequences is important for robot manipulation. This work presents se(3)-TrackNet, a data-driven optimization approach for long term, 6D pose tracking. It aims to identify the optimal relative pose given the current RGB-D observation and a synthetic image conditioned on the previous best estimate and the object's model. The key contribution in this context is a novel neural network architecture, which appropriately disentangles the feature encoding to help reduce domain shift, and an effective 3D orientation representation via Lie Algebra. Consequently, even when the network is trained solely with synthetic data can work effectively over real images. Comprehensive experiments over multiple benchmarks show se(3)-TrackNet achieves consistently robust estimates and outperforms alternatives, even though they have been trained with real images. The approach runs in real time at 90.9Hz. Code, data and supplementary video for this project are available at https://github.com/wenbowen123/iros20-6d-pose-tracking

研究の動機と目的

  • 高価な実世界のアノテート済みデータに依存を最小限に抑える、耐障害性がありリアルタイムな6次元物体ポーズ追跡システムの開発。
  • 合成データと実世界の画像の間のドメインシフトを解消するため、新規の分離特徴符号化アーキテクチャを提案。
  • 遮蔽、運動、視点変化などの困難な条件下でも、長期的かつ安定したポーズ追跡を実現。
  • トラッキング失敗後に再初期化を必要とせず、ベンチマークデータセットで最先端の性能を達成。
  • 動的ロボット操作シナリオにおける6次元ポーズ追跡の評価を目的とした新規ベンチマークデータセットYCBInEOATの導入。

提案手法

  • 本手法は、現在のRGB-D観測と、前回のポーズ推定に基づく物体の合成レンダリングのための別々の特徴エンコーダを備えた二重ブランチニューラルネットワークを採用。
  • 3次元回転のためのリー代数表現を用いることで、微分可能損失関数を介して相対ポーズ変換の有効な学習を可能にする。
  • ドメインシフトを低減するため、物理ベースのシミュレーションパイプラインを用いて生成された合成データにのみ、ドメインランダマイゼーションを適用して訓練。
  • 特徴符号化を分離することで、コンテンツ情報と変換情報の分離を実現し、実画像への一般化性を向上。
  • システムは連続フレーム間の相対6次元ポーズ変換($\Delta T_{\tau}$)を予測し、これを繰り返し適用することで時間経過に伴う物体ポーズの精密化を実現。
  • 対称性や物体形状の変動に対する耐性を高めるために、トレーニング中に形状マッチング損失を用いる。

実験結果

リサーチクエスチョン

  • RQ1合成データのみで訓練された6次元物体ポーズトラッキングネットワークが、実世界ベンチマークで実データで訓練されたベースラインと同等またはそれ以上の性能を達成できるか?
  • RQ2リー代数に基づく3次元回転表現は、相対ポーズ変換の正確で微分可能な学習をどの程度効果的に可能にするか?
  • RQ3分離特徴符号化は、シミュレーションから実世界への6次元ポーズ追跡におけるドメインシフトをどの程度低減できるか?
  • RQ4遮蔽や大規模な運動が生じる困難な条件下でも、再初期化を伴わず長期的な追跡精度を維持できるか?
  • RQ5動的物体相互作用を伴うロボット操作タスクを想定した新規ベンチマークデータセットで、本手法はどの程度の性能を発揮するか?

主な発見

  • YCB-Videoベンチマークにおいて、$se(3)$-TrackNetは、再初期化を一切行わず、ADDで94.71%のAUC、ADD-Sで96.93%のAUCを達成し、実データで訓練されたベースラインを上回る最先端の性能を発揮。
  • 本手法は90.9Hzで動作し、先行する最先端手法よりも顕著に高速であり、ロボット操作におけるリアルタイム応用を可能にする。
  • YCBInEOATデータセットでは、全5種類のYCBオブジェクトに対して、ADDで92.66%のAUC、ADD-Sで95.53%のAUCを達成し、動的で操作によるスリップや変形に対しても耐性があることを示した。
  • アブレーションスタディの結果、データ生成時に物理シミュレーションを除去すると、性能は91.88% AUC(ADD)に低下し、合成データに現実の力学的挙動を組み込む重要性が示された。
  • トレーニングおよび推論時に深度モダリティを除去すると、性能は75.65% AUC(ADD)に低下し、深度情報の指導による価値の重要性が裏付けられた。
  • 現在の画像とレンダリング画像の両方に共通のエンコーダを用いる場合、性能はほぼゼロ(0.28% AUC)にまで低下し、トラッキングのためには分離された特徴学習が不可欠であることが実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。