Skip to main content
QUICK REVIEW

[論文レビュー] DIRL: Domain-Invariant Representation Learning for Sim-to-Real Transfer

Ajay Kumar Tanwani|arXiv (Cornell University)|Nov 15, 2020
Machine Learning in Healthcare被引用数 7
ひとこと要約

本稿では、敵対的学習と三重項分布損失を用いて、シミュレーションと現実世界のドメイン間で周辺分布と条件付き分布を同時に整合化する、ドメイン不変表現学習手法であるDIRLを提案する。わずか数個のラベル付き現実世界例を活用することで、DIRLはドメインのベンチマークにおいて最先端の性能を達成し、シミュレーションから現実へのオブジェクト認識精度を26.8%から91.0%まで向上させ、モバイルロボットの片付けタスクにおいて86.5%の把持成功率を達成した。

ABSTRACT

Generating large-scale synthetic data in simulation is a feasible alternative to collecting/labelling real data for training vision-based deep learning models, albeit the modelling inaccuracies do not generalize to the physical world. In this paper, we present a domain-invariant representation learning (DIRL) algorithm to adapt deep models to the physical environment with a small amount of real data. Existing approaches that only mitigate the covariate shift by aligning the marginal distributions across the domains and assume the conditional distributions to be domain-invariant can lead to ambiguous transfer in real scenarios. We propose to jointly align the marginal (input domains) and the conditional (output labels) distributions to mitigate the covariate and the conditional shift across the domains with adversarial learning, and combine it with a triplet distribution loss to make the conditional distributions disjoint in the shared feature space. Experiments on digit domains yield state-of-the-art performance on challenging benchmarks, while sim-to-real transfer of object recognition for vision-based decluttering with a mobile robot improves from 26.8 % to 91.0 %, resulting in 86.5 % grasping accuracy of a wide variety of objects. Code and supplementary details are available at https://sites.google.com/view/dirl

研究の動機と目的

  • 視覚ベースのロボティクスにおけるシミュレーションから現実への転送において、シミュレーションデータが現実世界の環境にうまく一般化されないというドメインシフトの課題に対処すること。
  • 周辺分布のみを統合する自己教師ありドメイン適応手法に伴う曖昧さ、特にクラス境界が整合されていないために負の転送が生じる可能性を克服すること。
  • 限られた現実世界のラベル付きデータを活用して、共有特徴空間において周辺分布と条件付き分布を同時に統合することで、転送性能を向上させること。
  • 新しい三重項分布損失を用いて、クラス内分散を低減しクラス間分散を増加させることで、特徴の分離性を高めること。
  • シミュレーションで訓練された視覚ベースのロボットポリシーを現実世界に効果的に展開するためのサンプル効率の良い適応を可能にすること。

提案手法

  • シミュレーション(ソース)ドメインと現実世界(ターゲット)ドメイン間で、入力(周辺)分布と出力ラベル(条件付き)分布の両方を敵対的学習により統合するドメイン不変表現学習(DIRL)フレームワークを提案する。
  • 共有特徴空間におけるクラス間分離を高め、クラス内分散を低減する三重項分布損失を導入し、意味的分離性を促進する。
  • ドメイン識別器を用いて、ソースドメインとターゲットドメインの特徴分布の乖離を最小化することで、ドメイン不変な特徴表現を強制する。
  • 敵対的ドメイン統合と三重項損失を組み合わせ、特徴空間におけるドメイン不変性とクラス分離性を同時に最適化する。
  • Focal損失と特徴ピラミッドネットワークを組み合わせた変更版SSDバックボーンを採用し、周辺および条件付き乖離の両方を考慮したドメイン分類器を追加する。
  • わずかな現実世界のラベル付き例を用いてモデルを訓練し、周辺分布と条件付き分布の両方の統合をガイドする。

実験結果

リサーチクエスチョン

  • RQ1周辺分布のみを統合する手法と比較して、周辺分布と条件付き分布を同時に統合することで、シミュレーションから現実への転送における一般化性能が向上するか?
  • RQ2提案された三重項分布損失は、ドメインシフトの影響下でも特徴空間の分離性と分類性能にどのように影響を与えるか?
  • RQ3わずかな現実世界のラベル付き例を用いて、合成データで訓練された視覚ベースのロボットポリシーにおける効果的な適応がどの程度可能か?
  • RQ4大規模なドメインシフトを伴う困難なシミュレーションから現実へのベンチマークにおいて、DIRLフレームワークは最先端のドメイン適応手法を上回るか?
  • RQ5本手法は、多様な形状のオブジェクトを現実世界のロボット片付けタスクで、安定的かつ高精度に把持可能にするか?

主な発見

  • MNISTベンチマークでは、比較手法(MCD: 0.65、DANN: 0.61)を上回るmAP(平均平均精度)0.69を達成した。
  • 現実世界のテストセットでは、シミュレーション専用ベースラインの26.8%から著しく向上し、91.0%の分類精度を達成した。
  • 0.69のシルエットスコア(SS)は、特徴空間におけるクラスタの凝集性とクラス間分離性が良好であることを示しており、有効な分離性が得られていることを示している。
  • 現実世界のモバイルロボットによる片付けタスクでは、DIRLベースのオブジェクト認識モデルが89.4%の精度を達成し、把持計画ネットワークと組み合わせて86.5%の把持成功率を達成した。
  • 把持ネットワークを搭載しない場合、わずか76.2%の把持精度にとどまり、適応された視覚ポリシーが高精度な把持を可能にする上で極めて重要な役割を果たしていることが示された。
  • 本手法は、多様な形状やサイズのオブジェクトに対しても効果的に対応できており、失敗は主に小さな、逆さま、または複雑な形状(ボウルや組立部品など)のオブジェクトで観察された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。