Skip to main content
QUICK REVIEW

[論文レビュー] Online Sequence-to-Sequence Reinforcement Learning for Open-Domain Conversational Agents

Nabiha Asghar, Pascal Poupart|arXiv (Cornell University)|Dec 12, 2016
Topic Modeling被引用数 10
ひとこと要約

本稿では、1文字のユーザーフィードバックとハミング多様なビームサーチを用いた、オフラインの教師あり学習とオンラインのヒューマンインザループアクティブラーニングを組み合わせた、オープンドメイン対話型エージェント向けのオンラインでエンドツーエンドのニューラルシーケンス・ツー・シーケンスモデルを提案する。この手法により、カスタマイズ可能なパーソナ、ムード、スタイルを備えたパーソナライズド対話生成が可能となり、手作業で設計された報酬関数に依存せずに意味的に関連性があり、会話に没入できる応答が得られる。

ABSTRACT

We propose an online, end-to-end, neural generative conversational model for open-domain dialogue. It is trained using a unique combination of offline two-phase supervised learning and online human-in-the-loop active learning. While most existing research proposes offline supervision or hand-crafted reward functions for online reinforcement, we devise a novel interactive learning mechanism based on hamming-diverse beam search for response generation and one-character user-feedback at each step. Experiments show that our model inherently promotes the generation of semantically relevant and interesting responses, and can be used to train agents with customized personas, moods and conversational styles.

研究の動機と目的

  • リアルタイムでユーザーフィードバックに適応できるトレーニング可能でエンドツーエンドの対話エージェントの開発を目的とする。
  • 対話ポリシー学習におけるオフラインの監視と手作業で設計された報酬関数の限界を克服することを目的とする。
  • カスタマイズ可能なパーソナ、ムード、会話スタイルを備えたパーソナライズド対話システムの実現を目的とする。
  • 最小限のユーザーフィードバック(1文字の応答)を用いて応答生成を誘導するインタラクティブな学習メカニズムの設計を目的とする。
  • 新規のビームサーチ戦略により、生成応答の意味的関連性と多様性を向上させることを目的とする。

提案手法

  • モデルは二段階の訓練プロセスを採用する:まずオフライン対話データを用いた教師ありファインチューニングを行い、その後オンラインアクティブラーニングを実施する。
  • オンライン学習では、各ターンで1文字のユーザーフィードバックを用いて即時の最小限の監視を提供する。
  • 応答生成時には、意味的に多様な応答候補を探索するためにハミング多様なビームサーチが用いられる。
  • インタラクションループはヒューマンフィードバックをポリシー更新に統合し、生成ポリシーのリアルタイムな適応を可能にする。
  • 直接的なヒューマンフィードバックに依存することで、手作業で設計された報酬関数を回避する。
  • モデルはエンドツーエンドで訓練され、応答生成とポリシー適応の共同最適化が可能になる。

実験結果

リサーチクエスチョン

  • RQ1オフライン監視と比較して、オンラインでヒューマンインザループ学習がオープンドメイン対話システムの応答品質を向上させられるか?
  • RQ21文字のフィードバックは、意味的に関連性があり多様な応答を生成するのを効果的に誘導できるか?
  • RQ3提案手法により、異なるパーソナ、ムード、会話スタイルを持つ対話エージェントのパーソナライズが可能か?
  • RQ4ハミング多様なビームサーチは、複雑な報酬形状を必要とせずに応答の多様性と関連性を向上させられるか?
  • RQ5最小限のフィードバックでエンドツーエンド訓練を実施することで、手作業で設計された報酬関数に依存せずに高い性能が達成可能か?

主な発見

  • 手作業で設計された報酬関数に依存せずに、意味的に関連性があり、会話に没入できる応答が生成される。
  • 1文字のユーザーフィードバックが学習プロセスを効果的に誘導し、対話ポリシーのリアルタイムな適応を可能にする。
  • ハミング多様なビームサーチの活用により、応答の多様性が向上するとともに、関連性が維持される。
  • システムは、カスタマイズ可能なパーソナ、ムード、会話スタイルを備えたエージェントのトレーニングを成功裏に実現する。
  • オフライン事前学習とオンラインアクティブラーニングの組み合わせにより、純粋にオフライン手法に比べて応答品質が向上する。
  • インタラクティブな学習を通じて、モデルは inherently 興味深く、文脈的に適切な応答を生成する能力を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。