Skip to main content
QUICK REVIEW

[論文レビュー] An Active Information Seeking Model for Goal-oriented Vision-and-Language Tasks.

Ehsan Abbasnejad, Qi Wu|arXiv (Cornell University)|Dec 16, 2018
Multimodal Machine Learning Applications参考文献 39被引用数 8
ひとこと要約

本論文は、不確実な知識の内部信念分布を維持することで、視覚・言語タスクにおける情報の能動的探索を行う強化学習モデルを提案する。この分布から行動をサンプリングし、情報量の増加を最大化する行動を選択することで、視覚対話と視覚的質問生成の両方で、ベースラインを上回る性能を発揮し、不確実性をより効果的に低減する。

ABSTRACT

As Computer Vision algorithms move from passive analysis of pixels to active reasoning over semantics, the breadth of information algorithms need to reason over has expanded significantly. One of the key challenges in this vein is the ability to identify the information required to make a decision, and select an action that will recover this information. We propose an reinforcement-learning approach that maintains an distribution over its internal information, thus explicitly representing the ambiguity in what it knows, and needs to know, towards achieving its goal. Potential actions are then generated according to particles sampled from this distribution. For each potential action a distribution of the expected answers is calculated, and the value of the information gained is obtained, as compared to the existing internal information. We demonstrate this approach applied to two vision-language problems that have attracted significant recent interest, visual dialogue and visual query generation. In both cases the method actively selects actions that will best reduce its internal uncertainty, and outperforms its competitors in achieving the goal of the challenge.

研究の動機と目的

  • 目的志向型の視覚・言語タスクにおける関連情報の特定と取得の課題に対処すること。
  • 情報状態の信念分布を用いて、エージェントの内部知識における不確実性を明示的にモデル化すること。
  • 期待される情報量の増加を最大化する行動の選択によって、能動的意思決定を可能にすること。
  • 情報の知的探索を通じて、視覚対話や視覚的質問生成などの視覚言語タスクのパフォーマンスを向上させること。
  • 不確実性を考慮した行動選択が、受動的またはヒューリスティックベースのアプローチよりも優れた目標達成をもたらすことを示すこと。

提案手法

  • 不確実性を表すために、内部情報状態の信念分布を維持することで、知っていること・必要とすることに関する不確実性を表現する。
  • 行動は、この信念分布からサンプリングされた粒子に基づいて生成され、潜在的な情報収集行動の探索を可能にする。
  • 候補となる各行動について、期待される回答の分布を予測することで、期待される情報量の増加を推定する。
  • 期待される回答の分布を現在の信念と比較することで情報量の増加を計算し、不確実性を最も効果的に低減する行動を優先する。
  • 視覚言語タスクにおける長期的な目標達成に基づいて、行動選択を最適化するための強化学習を用いる。
  • フレームワークは、行動が質問選択またはクエリの構築に対応する2つのタスク(視覚対話と視覚的クエリ生成)に適用される。

実験結果

リサーチクエスチョン

  • RQ1エージェントは、視覚・言語タスクにおいて、最も情報をもたらす情報を能動的に特定・取得するにはどうすればよいか?
  • RQ2内部知識の信念分布を維持することで、不確実な環境における意思決定がどの程度向上するか?
  • RQ3情報量に基づく行動選択は、非能動的またはヒューリスティックベースの戦略よりも、視覚対話とクエリ生成で優れた性能を発揮するか?
  • RQ4不確実性を考慮した行動選択は、モデルのタスク目標達成能力にどのように影響するか?

主な発見

  • 提案手法は、ベースライン手法よりも内部の不確実性をより効果的に低減する行動を能動的に選択する。
  • 視覚対話タスクでは、情報量の増加を最大化する質問を選択することで、優れたパフォーマンスを達成する。
  • 視覚的クエリ生成では、画像の高不確実性領域に注目することで、より正確で関連性の高いクエリを生成する。
  • 信念に基づく行動サンプリングを用いた強化学習フレームワークは、収束が早く、より優れた目標達成を実現する。
  • 視覚対話と視覚的クエリ生成のベンチマークにおいて、本手法は競合するベースラインを上回る性能を発揮する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。