Skip to main content
QUICK REVIEW

[論文レビュー] OpenLORIS-Object: A Robotic Vision Dataset and Benchmark for Lifelong Deep Learning

Qi She, Fan Feng|arXiv (Cornell University)|Nov 15, 2019
Domain Adaptation and Few-Shot Learning参考文献 43被引用数 5
ひとこと要約

本論文は、照明変化、遮蔽、ごみの混在といった動的課題を伴う現実世界の環境から収集された、生涯学習ロボットビジョン向けの新規RGB-Dデータセットおよびベンチマーク、OpenLORIS-Objectを紹介する。48のタスクで9つの最先端の生涯学習アルゴリズムを評価した結果、前方伝達(forward transfer)が依然として主要なボトル neck であり、複雑で順次的な状況では全体の正確性が約60%まで低下することが判明し、現在の手法が現実世界への展開において脆いことを示している。

ABSTRACT

The recent breakthroughs in computer vision have benefited from the availability of large representative datasets (e.g. ImageNet and COCO) for training. Yet, robotic vision poses unique challenges for applying visual algorithms developed from these standard computer vision datasets due to their implicit assumption over non-varying distributions for a fixed set of tasks. Fully retraining models each time a new task becomes available is infeasible due to computational, storage and sometimes privacy issues, while naïve incremental strategies have been shown to suffer from catastrophic forgetting. It is crucial for the robots to operate continuously under open-set and detrimental conditions with adaptive visual perceptual systems, where lifelong learning is a fundamental capability. However, very few datasets and benchmarks are available to evaluate and compare emerging techniques. To fill this gap, we provide a new lifelong robotic vision dataset ("OpenLORIS-Object") collected via RGB-D cameras. The dataset embeds the challenges faced by a robot in the real-life application and provides new benchmarks for validating lifelong object recognition algorithms. Moreover, we have provided a testbed of $9$ state-of-the-art lifelong learning algorithms. Each of them involves $48$ tasks with $4$ evaluation metrics over the OpenLORIS-Object dataset. The results demonstrate that the object recognition task in the ever-changing difficulty environments is far from being solved and the bottlenecks are at the forward/backward transfer designs. Our dataset and benchmark are publicly available at at \href{https://lifelong-robotic-vision.github.io/dataset/object}{\underline{https://lifelong-robotic-vision.github.io/dataset/object}}.

研究の動機と目的

  • ロボットビジョンにおける生涯学習の分野において、現実的で大規模なベンチマークの不足に取り組むこと。特に、動的で現実世界の条件下での学習を想定する。
  • 展開後、ロボットが直面するあらゆる課題、すなわち照明の変動、遮蔽、ごみの混在、物体サイズの変化を網羅的に捉えたデータセットを提供すること。
  • 順次的で変動の大きいタスク設定下で、既存の生涯学習アルゴリズムの頑健性と転移能力を評価すること。
  • 現在の生涯学習モデルにおける主な失敗モード、特に前方伝達および多様な視覚的分布間での一般化能力の欠如を特定すること。
  • 将来的な生涯学習アルゴリズムの比較を可能にするための標準化されたベンチマークを確立すること。

提案手法

  • RGB-DカメラとIMUを装備した移動型ロボットプラットフォーム(OpenLORIS)を用いたデータ収集により、高解像度で時間的に整合性のある動画シーケンスを取得する。
  • 照明、遮蔽、物体サイズ、ごみの混在の4つの主要な環境要因をそれぞれ3段階の難易度で系統立てて変化させ、合計12の順次的タスクを生成する。
  • 48の学習タスク(4要因 × 12難易度レベル)と4つの評価指標(正確性、後方伝達(BWT)、前方伝達(FWT)、全体の正確性)を含むベンチマークの構築。
  • OpenLORIS-Objectデータセット上で、9つの最先端の生涯学習アルゴリズムを、単一要因および順次的マルチ要因設定の両方で実装・評価する。
  • 動画シーケンスにおける時間的滑らかさを活用し、物体検出を支援するとともに、学習および推論時の分類の頑健性を向上させる。
  • 多様で変化し続ける視覚的条件下でも、一貫性があり再現可能な生涯学習性能の評価を可能にする実験環境の設計。

実験結果

リサーチクエスチョン

  • RQ1現実的で動的なロボットビジョンデータセットにおいて、順次的かつ高変動性の課題を伴う状況で、既存の生涯学習アルゴリズムはどの程度の性能を示すか?
  • RQ2生涯的ロボットオブジェクト認識において、全体のモデル性能に寄与する前方伝達と後方伝達の相対的寄与度はどの程度か?
  • RQ3照明、遮蔽、ごみの混在といった複数の環境要因が順次的に導入された場合、現在のアルゴリズムはどの程度性能を低下させるか?
  • RQ4メモリ消費量がタスク数に線形に増加するがゆえに現実世界への展開が不適切であるにもかかわらず、累積的再訓練ベースラインは、このベンチマークにおける性能上限としてどの程度の性能を示すか?
  • RQ5現実世界のロボットビジョンにおいて、現在の生涯学習モデルの主な失敗モードは何か。特に、オープンセットおよび非定常な分布シフトの下でどうなるか?

主な発見

  • 照明要因が最も困難であった。全アルゴリズムにおいて前方伝達(FWT)の正確性が一貫して40%~50%の間で推移し、全体の性能に著しい制限をもたらした。
  • 順次的マルチ要因学習状況では全体の正確性が約60%まで低下したが、単一要因評価では80%を超えていたことから、複雑性に伴う急激な性能低下が確認された。
  • 後方伝達(BWT)は多くのアルゴリズムで良好に保持されていたが、前方伝達は一貫して弱く、現在の生涯学習モデルにおける重要な設計上の欠陥を示している。
  • 累積的再訓練ベースラインは最高の性能を達成したが、タスク数に比例してメモリが線形に増加するため、現実世界への展開には非現実的である。
  • 既存の最先端アルゴリズムは、複数の環境変化が順次導入される長時間の順次的タスクストリームに対して、低い頑健性と安定性を示した。
  • 結果として、動的で現実世界の環境における生涯的オブジェクト認識は未解決の問題であり、前方伝達能力が主なボトル neck であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。