Skip to main content
QUICK REVIEW

[論文レビュー] What Should I Ask? Using Conversationally Informative Rewards for Goal-Oriented Visual Dialog

Pushkar Shukla, Carlos Elmadjian|arXiv (Cornell University)|Jul 28, 2019
Multimodal Machine Learning Applications参考文献 23被引用数 4
ひとこと要約

本稿では、強化学習を用いて正則化情報利得(RIG)を用いることで、画像内の対象を特定するための戦略的で文脈に即した質問を生成する、エンドツーエンドの目的志向型視覚対話システムを提案する。人間の尋ね方を合理的発話行動フレームワークでモデル化することで、質問の関連性を向上させ、重複を低減し、GuessWhat?! データセット上で67.19%という新たな最先端の正確度を達成した。

ABSTRACT

The ability to engage in goal-oriented conversations has allowed humans to gain knowledge, reduce uncertainty, and perform tasks more efficiently. Artificial agents, however, are still far behind humans in having goal-driven conversations. In this work, we focus on the task of goal-oriented visual dialogue, aiming to automatically generate a series of questions about an image with a single objective. This task is challenging since these questions must not only be consistent with a strategy to achieve a goal, but also consider the contextual information in the image. We propose an end-to-end goal-oriented visual dialogue system, that combines reinforcement learning with regularized information gain. Unlike previous approaches that have been proposed for the task, our work is motivated by the Rational Speech Act framework, which models the process of human inquiry to reach a goal. We test the two versions of our model on the GuessWhat?! dataset, obtaining significant results that outperform the current state-of-the-art models in the task of generating questions to find an undisclosed object in an image.

研究の動機と目的

  • 画像内の対象を特定するための戦略的で文脈に配慮した質問を生成する目的志向型視覚対話システムの開発。
  • 合理的発話行動フレームワークを用いて人間らしい尋ね方の行動をモデル化し、情報利得と質問コストに重点を置く。
  • 正則化された報酬関数により、重複しているか、情報が得られない質問を最小限に抑えることで、対話の効率を向上させる。
  • GuessWhat?! ベンチマークにおいて、既存のベースラインを上回る正確度と一貫性を達成する。
  • 情報利得とコスト正則化を組み合わせることで、より効果的で戦略的な質問生成が可能になることを示す。

提案手法

  • 深層強化学習を用いて、期待される正則化情報利得(RIG)を最大化し、質問コストを最小化する質問生成器を訓練する。
  • 合理的発話行動フレームワークにインspiredされた、情報利得と質問コストのバランスを取る新しい報酬関数を導入する。
  • RIGに基づく損失関数に歪度係数を導入し、同義語的または重複する質問をペナルティ化し、最適な戦略にモデルを誘導する。
  • 視覚特徴と対話履歴を入力として用いるエンドツーエンドのアーキテクチャを訓練し、質問生成器(QGen)、推測者、オラクルを含む。
  • 方策勾配法を用いて質問生成方針を最適化し、RIGと標準的な情報利得、ベースライン報酬との比較を含むアブレーションスタディを実施する。
  • トレーニングと評価にGuessWhat?! データセットを用い、一般化性能を評価するため、新しい画像および新しいオブジェクトを含むテストスプリットを用いる。

実験結果

リサーチクエスチョン

  • RQ1人工エージェントは、画像内の対象についての不確実性を効果的に低減する目的志向型質問をどのように生成できるか?
  • RQ2人間は目的志向型視覚的尋ねの過程でどのような戦略を用いるのか。これらは計算的にモデル化可能か?
  • RQ3質問コストのモデル化を伴う正則化情報利得は、視覚対話システムの整合性と効率性を向上させられるか?
  • RQ4RIGベースの学習は、標準的な情報利得やベースライン報酬関数と比較して、重複する質問をどれほど低減できるか?
  • RQ5RIGを用いたエンドツーエンド強化学習は、視覚的質問生成において人間のような戦略的行動をどの程度達成できるか?

主な発見

  • 提案モデルは、GuessWhat?! データセットで67.19%という新たな最先端の正確度を達成し、以前の手法を上回った。
  • RIGを報酬関数として用いることで、新しい画像において標準的な情報利得よりも10.57%の絶対的向上が得られた。
  • 歪度係数の追加により、RIGを損失関数として用いる場合、性能が最大2.8%向上した。
  • モデルは平均して1対話あたり0.36件の繰り返し質問しか生成せず、Strubら(2017)のベースラインモデルの0.82件よりも顕著に低い。
  • アブレーションスタディの結果、情報利得のみでは最適な学習が不十分であることが判明したが、RIGにコスト正則化を組み合わせることで顕著な向上が得られた。
  • モデルは戦略的行動と質問シーケンスの相互一貫性を示し、重複しているか、情報が得られない質問を避けていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。