Skip to main content
QUICK REVIEW

[論文レビュー] Object-to-Scene: Learning to Transfer Object Knowledge to Indoor Scene Recognition

Bo Miao, Liguang Zhou|arXiv (Cornell University)|Aug 1, 2021
Advanced Image and Video Retrieval Techniques被引用数 4
ひとこと要約

本稿では、セグメンテーションネットワークとオブジェクト特徴集約モジュール(OFAM)を用いて高レベルのオブジェクト特徴を抽出し、オブジェクトアテンションモジュール(OAM)とグローバル関係集約モジュール(GRAM)でオブジェクト関係をモデル化することで、インDoorシーン認識を向上させるワンストリームフレームワークであるObject-to-Scene(OTS)を提案する。OTSは追加のストリームを用いず、SOTA手法を2%以上上回る精度を達成し、明示的なオブジェクトレベル表現と関係学習により優れた性能を示している。

ABSTRACT

Accurate perception of the surrounding scene is helpful for robots to make reasonable judgments and behaviours. Therefore, developing effective scene representation and recognition methods are of significant importance in robotics. Currently, a large body of research focuses on developing novel auxiliary features and networks to improve indoor scene recognition ability. However, few of them focus on directly constructing object features and relations for indoor scene recognition. In this paper, we analyze the weaknesses of current methods and propose an Object-to-Scene (OTS) method, which extracts object features and learns object relations to recognize indoor scenes. The proposed OTS first extracts object features based on the segmentation network and the proposed object feature aggregation module (OFAM). Afterwards, the object relations are calculated and the scene representation is constructed based on the proposed object attention module (OAM) and global relation aggregation module (GRAM). The final results in this work show that OTS successfully extracts object features and learns object relations from the segmentation network. Moreover, OTS outperforms the state-of-the-art methods by more than 2\% on indoor scene recognition without using any additional streams. Code is publicly available at: https://github.com/FreeformRobotics/OTS.

研究の動機と目的

  • 現在のインDoorシーン認識手法がオブジェクトレベル特徴と関係を効果的に活用できないという限界を解決すること。
  • オブジェクトレベル特徴からシーンレベル認識へ直接知識を転送できる統合的でワンストリームのフレームワークを開発すること。
  • アテンションベースのメカニズムを用いて長距離オブジェクト関係をモデル化することで、シーン表現を向上させること。
  • マルチストリームアーキテクチャやハンドクラフト特徴に依存せずに、既存手法を上回る精度を達成すること。

提案手法

  • 本手法は、入力画像から高レベルの意味的豊かなオブジェクト特徴を抽出するために、セグメンテーションネットワークとオブジェクト特徴集約モジュール(OFAM)を組み合わせる。
  • オブジェクトアテンションモジュール(OAM)を提案し、柔軟なアテンションメカニズムを用いて、検出されたオブジェクト間の長距離依存関係や共起関係を暗黙的に学習する。
  • グローバル関係集約モジュール(GRAM)は、深度分離型およびポイントワイド畳み込みを用いてオブジェクト特徴と関係を統合し、高レベルのシーン表現ベクトルを生成する。
  • 全結合層は集約されたシーン表現に基づいて最終的なシーン分類を実行する。
  • 全フレームワークはエンドツーエンドで学習可能であり、追加の特徴ストリームを必要としないワンストリームモデルとして動作する。
  • モデルはクロスエントロピー損失を用いて学習され、標準的なインDoorシーンベンチマークで評価される。

実験結果

リサーチクエスチョン

  • RQ1オブジェクト特徴とそれらの関係を明示的にモデル化することで、従来の特徴ベースやグローバル特徴ベースの手法を上回るインDoorシーン認識が可能になるか?
  • RQ2追加のストリームを追加せずに、セグメンテーションベースのオブジェクト特徴を利用するワンストリームアーキテクチャは、どの程度有効か?
  • RQ3OAMのようなアテンションベースのモジュールは、より良いシーン表現を得るために長距離オブジェクト関係をどの程度効果的に捉えることができるか?
  • RQ4GRAMは、従来の統合手法(全結合層やプーリング層)と比較して、精度と効率の面でどの程度優れているか?

主な発見

  • OTSはインDoorシーン認識ベンチマークでトップ-1精度85.9%を達成し、追加のストリームを一切使用せず、SOTA手法を2%以上上回った。
  • アブレーションスタディの結果、2つのオブジェクトアテンションブロック(OAB)が最良の性能(85.9%)を示したが、ブロックを増やすとモデルの複雑さにより精度が低下した。
  • 提案されたオブジェクトアテンションブロックは、わずか120万パラメータと2億1,150万FLOPsで85.9%の精度を達成し、自己アテンション(84.7%)や非局所モジュール(82.3%)を上回った。
  • GRAMは最小限のパラメータ(230万)とFLOPs(230万)で最高の精度(85.9%)を達成し、精度と効率の両面で全結合層やプーリング層を顕著に上回った。
  • 失敗事例の主な原因はオブジェクト検出の誤りに起因する—例えば、鍋を便器と誤検出すると、キッチンがバスルームと誤認される—これは性能がセグメンテーションの品質に敏感であることを示している。
  • セグメンテーションネットワークからのバックボーン特徴だけでも強力なシーン認識が可能であるため、適切なオブジェクトレベル特徴学習が行われていれば、追加のストリームは不要であると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。