Skip to main content
QUICK REVIEW

[論文レビュー] Customized Nonlinear Bandits for Online Response Selection in Neural Conversation Models

Bing Liu, Tong Yu|arXiv (Cornell University)|Nov 22, 2017
Speech and dialogue systems被引用数 17
ひとこと要約

本稿では、双方向LSTMで符号化されたテキスト表現と、多項式特徴空間におけるカスタム化されたトムソンサンプリング法を用いたニューラル非線形バンディットモデル(NNBM)を提案する。このモデルにより、リtrievalベースの対話システムにおけるオンライン応答選択が可能になる。本手法は線形コンテキストバンディットを著しく上回り、限られたラベル付きデータでも低い累積後悔(cumulative regret)と高いRecall@kを達成する。

ABSTRACT

Dialog response selection is an important step towards natural response generation in conversational agents. Existing work on neural conversational models mainly focuses on offline supervised learning using a large set of context-response pairs. In this paper, we focus on online learning of response selection in retrieval-based dialog systems. We propose a contextual multi-armed bandit model with a nonlinear reward function that uses distributed representation of text for online response selection. A bidirectional LSTM is used to produce the distributed representations of dialog context and responses, which serve as the input to a contextual bandit. In learning the bandit, we propose a customized Thompson sampling method that is applied to a polynomial feature space in approximating the reward. Experimental results on the Ubuntu Dialogue Corpus demonstrate significant performance gains of the proposed method over conventional linear contextual bandits. Moreover, we report encouraging response selection performance of the proposed neural bandit model using the Recall@k metric for a small set of online training samples.

研究の動機と目的

  • 限られたラベル付きデータにおけるリtrievalベースの対話システムにおけるオンライン学習の課題に対処すること。
  • コンテキストバンディットにおける非線形報酬関数のモデリングを通じて、応答選択のパフォーマンスを向上させること。
  • 深層ニューラルネットワーク表現(双方向LSTMを介して)をコンテキストバンディットアルゴリズムと統合し、オンライン学習を可能にすること。
  • リアルタイムの対話におけるユーザーフィードバックを通じて、効率的でパーソナライズされた応答選択を実現すること。
  • ニューラルネットワークとコンテキストバンディットを組み合わせたオンライン対話学習の実現可能性と有効性を示すこと。

提案手法

  • 双方向LSTMを用いて、対話コンテキストと応答候補の分散表現を生成する。
  • モデルは、コンテキストと応答の間の複雑な相互作用を捉えるために、多項式特徴空間で近似された非線形報酬関数を採用する。
  • 非線形特徴空間における探索と活用のトレードオフを最適化するためのカスタム化されたトムソンサンプリングアルゴリズムを設計する。
  • ユーザーフィードバック(肯定/否定)を報酬として用い、リアルタイムでバンディットモデルを更新する。
  • ユーザーフィードバックに基づく段階的更新を用いて、確率的勾配降下法でオンライン学習を実行する。
  • 本手法は複数応答選択(k > 1)をサポートし、応答ランク付けの信頼度を動的に調整できる。

実験結果

リサーチクエスチョン

  • RQ1ニューラルテキスト表現を用いた非線形コンテキストバンディットモデルは、オンライン応答選択において線形バンディットを上回ることができるか?
  • RQ2提案されたカスタム化されたトムソンサンプリング法は、対話システムにおけるスパarselyな二値フィードバックから学習するのにどの程度効果的か?
  • RQ3双方向LSTMからの分散表現は、TF-IDFに比べてオンライン学習パフォーマンスをどの程度向上させるか?
  • RQ4候補応答数(k)がオンライン応答選択における学習効率とパフォーマンスに与える影響は何か?
  • RQ5わずかなオンライン学習サンプル数でも、モデルは高いRecall@kを達成できるか?

主な発見

  • 1000ラウンド経過後、RNN-NonLinear-TSモデルの平均累積後悔は0.61に達し、1ラウンドあたり正解応答を選択する確率が39%であることを示している。
  • RNN-NonLinear-TSは、累積後悔の観点でRNN-Linear-TSを大きく上回り、非線形報酬モデリングの利点を実証した。
  • わずか800件のオンライン学習サンプルで、RNN-NonLinear-TSは高いRecall@kを達成し、データが乏しい状況下でも優れた性能を示した。
  • k=1, 2, 5の全k値において、RNN-NonLinear-TSはRNN-Linear-TSを一貫して上回り、特にk=2の際の性能差が拡大した。
  • 双方向LSTM表現の使用は、最小限の計算量でTF-IDFに比べて顕著なパフォーマンス向上をもたらした。
  • モデルの真の応答に対する信頼度は、対話ラウンドが増えるにつれて上昇し、上位2位の予測との差が拡大した。これは、学習が進んでいることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。