Skip to main content
QUICK REVIEW

[論文レビュー] Towards Context-aware Interaction Recognition

Bohan Zhuang, Lingqiao Liu|arXiv (Cornell University)|Mar 18, 2017
Multimodal Machine Learning Applications参考文献 36被引用数 7
ひとこと要約

本稿では、単語2vecで符号化された意味的文脈を用いて、文脈に適応する相互作用分類器を構築する文脈に配慮した相互作用認識フレームワークを提案する。分類器を文脈依存性に保ちつつ、1つの相互作用タイプごとに1つの分類器を維持することで、視覚的関係認識およびフレーズ検出ベンチマークにおいて、より高い精度、スケーラビリティ、ゼロショット一般化性能を達成し、VRDおよび視覚的フレーズデータセットの両方で先行手法を上回った。

ABSTRACT

Recognizing how objects interact with each other is a crucial task in visual recognition. If we define the context of the interaction to be the objects involved, then most current methods can be categorized as either: (i) training a single classifier on the combination of the interaction and its context; or (ii) aiming to recognize the interaction independently of its explicit context. Both methods suffer limitations: the former scales poorly with the number of combinations and fails to generalize to unseen combinations, while the latter often leads to poor interaction recognition performance due to the difficulty of designing a context-independent interaction classifier. To mitigate those drawbacks, this paper proposes an alternative, context-aware interaction recognition framework. The key to our method is to explicitly construct an interaction classifier which combines the context, and the interaction. The context is encoded via word2vec into a semantic space, and is used to derive a classification result for the interaction. The proposed method still builds one classifier for one interaction (as per type (ii) above), but the classifier built is adaptive to context via weights which are context dependent. The benefit of using the semantic space is that it naturally leads to zero-shot generalizations in which semantically similar contexts (subjectobject pairs) can be recognized as suitable contexts for an interaction, even if they were not observed in the training set.

研究の動機と目的

  • 既存の相互作用認識手法が、相互作用-文脈の組み合わせの増加に伴いスケーリングが悪くなる、あるいは文脈に依存しない分類器のため一般化に失敗するという限界を解消すること。
  • 各相互作用-文脈ペアを固有のクラスとして扱わないで、文脈を明示的にモデル化するスケーラブルで一般化可能なフレームワークを構築すること。
  • 単語2vecを用いた文脈表現の意味的類似性を活用することで、ゼロショット一般化を向上させること。
  • 相互作用タイプの増加に伴うパラメータの爆発を避けながら、多様な相互作用表現およびデータセットにおいて高い性能を維持すること。

提案手法

  • 本手法は、対象-主語ペアの意味的埋め込みに基づいて分類器の重みを動的に適応させる文脈に配慮した相互作用分類器を構築する。
  • 文脈(主語-対象ペア)は、事前学習済みの単語2vec埋め込みを用いて意味的空間に符号化され、意味的類似性に基づく一般化を可能にする。
  • 相互作用と文脈の両方に基づいて関連する領域に注目するように、視覚的特徴を精緻化する文脈に配慮したアテンションプーリング層を導入する。
  • 本フレームワークは、相互作用分類と文脈モデリングを分離しているが、学習された文脈固有の重み変換を通じて、相互作用分類器を文脈に依存させる。
  • 視覚的特徴(空間的および外観的)と文脈埋め込みを用いて、交差エントロピー損失を用いた分類タスクでエンドツーエンドに学習する。
  • 本手法は、Faster R-CNNを用いた物体検出と、標準的なリtrievalメトリクス(R@50、R@100)を用いて、VRDおよび視覚的フレーズデータセットで評価された。

実験結果

リサーチクエスチョン

  • RQ1文脈に配慮した相互作用認識フレームワークは、未観測の相互作用-文脈ペアへの一般化を向上させることができるか?
  • RQ2文脈依存的分類器の適応は、文脈に依存しないまたは完全に統合された分類と比較して、性能にどのように影響を与えるか?
  • RQ3単語2vecによる意味的文脈埋め込みは、どの程度相互作用認識におけるゼロショット一般化を可能にするか?
  • RQ4文脈に配慮したアテンションを組み込むことで、相互作用認識のための視覚的表現学習が向上するか?

主な発見

  • 提案手法AP+C+CATは、視覚的関係検出(VRD)データセットにおいて最先端の性能を達成し、少数ショットおよびゼロショット設定の両方で先行手法を上回った。
  • VRDデータセットでは、フレーズ検出においてR@100が86.8%、R@50が82.9%を達成し、ゼロショットフレーズ検出ではそれぞれ30.2%と18.7%を記録した。
  • 本手法は強力なゼロショット一般化性能を示し、視覚的フレーズデータセットにおいて、ベースライン手法[17]と比較してゼロショットフレーズ検出で10ポイント以上も向上した。
  • 言語的事前知識の導入はわずかな改善しかもたらさなかったため、文脈に配慮した分類器の適応が、すでに相互作用-文脈相関を暗黙的に捉えていることが示唆された。
  • 相互作用数の増加に伴っても、各相互作用-文脈ペアを固有のクラスとして分類する方法に比べ、効率的にスケーリングされた。
  • 定性的な結果では、モデルが「犬が猫を追いかける」といった未学習の文脈ペアに対しても正しく相互作用を予測していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。