Skip to main content
QUICK REVIEW

[論文レビュー] Leveraging Explainability for Comprehending Referring Expressions in the Real World

Fethiye Irmak Doğan, Gaspar I. Melsion|arXiv (Cornell University)|Jul 12, 2021
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

本論文は、視覚言語モデルの説明可能性を活用することで、実世界のロボットにおける参照表現の理解のための新規手法を提案する。具体的には、事前学習済みの物体検出器に依存せずに、Grad-CAMの活性化とK-meansクラスタリングを用いて顕著な画像領域を特定する。このアプローチは、曖昧な状況やオープンボリュームの状況において、最先端のモデルを上回る性能を発揮し、特に珍しいまたは検出されない物体に対して優れている。

ABSTRACT

For effective human-robot collaboration, it is crucial for robots to understand requests from users and ask reasonable follow-up questions when there are ambiguities. While comprehending the users' object descriptions in the requests, existing studies have focused on this challenge for limited object categories that can be detected or localized with existing object detection and localization modules. On the other hand, in the wild, it is impossible to limit the object categories that can be encountered during the interaction. To understand described objects and resolve ambiguities in the wild, for the first time, we suggest a method by leveraging explainability. Our method focuses on the active regions of a scene to find the described objects without putting the previous constraints on object categories and natural language instructions. We evaluate our method in varied real-world images and observe that the regions suggested by our method can help resolve ambiguities. When we compare our method with a state-of-the-art baseline, we show that our method performs better in scenes with ambiguous objects which cannot be recognized by existing object detectors.

研究の動機と目的

  • 既存の参照表現理解手法が事前学習済みの物体検出器に依存するという制限を解消し、それらが既知の物体カテゴリに限定されるのを防ぐ。
  • 物体検出器が故障する可能性のある実世界の環境において、曖昧または珍しい物体の記述に対応するための関連画像領域をロボットが特定できるようにする。
  • 顕著な視覚的領域に基づいて、的を射た効率的な確認質問を生成することで、人間とロボットの協働を向上させる。
  • モデルの説明可能性(Grad-CAMを介して)を用いて、物体カテゴリの教師なし学習を伴わずに、言語理解を視覚的文脈に根ざさせるメカニズムを検討する。

提案手法

  • 本手法は、事前学習済みの画像キャプションモデルからGrad-CAMを用いてクラス活性化マップを生成し、指定された参照表現に対応する視覚的に顕著な領域を特定する。
  • これらの活性化マップは、シーン内の記述された物体に対応する高活性化領域を抽出するために処理される。
  • 活性化マップにK-meansクラスタリングを適用して、顕著なピクセルを一貫性のあるアクティブクラスタにグループ化し、候補領域を特定する。
  • 得られたアクティブクラスタは、後続の確認質問のためのロボットの注目対象として提案される。
  • 本手法は物体検出や局所化モジュールを必要としないため、珍しいものや未検出のものも含め、あらゆる物体カテゴリに適用可能である。
  • 本システムは、曖昧または珍しい物体を含む実世界の画像上で評価され、MAttNet(最先端の参照表現モデル)と性能を比較している。

実験結果

リサーチクエスチョン

  • RQ1モデルの説明可能性を用いて、物体検出に依存せずに、参照表現に対応する関連視覚領域を特定できるか?
  • RQ2曖昧または珍しい物体を含むシーンにおいて、説明可能性に基づく手法の性能は、最先端の参照表現モデルと比べてどうなるか?
  • RQ3顕著な画像領域に注目することで、本手法は効果的な確認質問を生成できるか?
  • RQ4本手法は、既存の物体検出器がカバーしていない物体カテゴリをどの程度処理できるか?

主な発見

  • 本手法は、複数の類似した干渉要因(例:複数の魚)があるシーンでMAttNetを上回り、ベースラインが候補を区別できない状況でも有効である。
  • 本手法は、アスパラガスやパパイアなど、検出されないまたは珍しい物体に対しても関連領域を正しく特定でき、オープンボリューム設定下での頑健性を示している。
  • 定性的な分析から、本手法は意味的に関連する画像領域(例:'パンツをはいた男'という記述ではパンツの領域)に注目しており、言語理解が視覚的文脈に適切に根ざしていることが示された。
  • 本手法が生成するアクティブクラスタは、的を射た確認質問(例:'左の魚と右の魚のどちらを指していますか?')を形成するのに効果的であり、全量の繰り返しを減らすのに寄与している。
  • 本手法により、顕著で文脈的に関連する画像領域に注目することで、曖昧な記述に対してもロボットが効率的な対応が可能となり、相互作用の効率が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。