Skip to main content
QUICK REVIEW

[論文レビュー] An Ensemble Model with Ranking for Social Dialogue

Ioannis Papaioannou, Amanda Cercas Curry|arXiv (Cornell University)|Dec 20, 2017
Topic Modeling参考文献 14被引用数 7
ひとこと要約

本論文では、アマゾン・アレクサ・プライズ向けに開発された、ルールベースとニューラルモデルを統合した文脈認識型ランク付け機構を備えたアンサンブル型ソーシャル対話システムAlanaを提示する。本研究では、ノイズが多くかつスパースな実際のユーザー反応データを用いて線形ランカーを学習することで、応答選択を改善した。その結果、手作業で設計されたランカー(3.26)をわずかではあるが有意に上回る平均ユーザー評価3.28を達成した。

ABSTRACT

Open-domain social dialogue is one of the long-standing goals of Artificial Intelligence. This year, the Amazon Alexa Prize challenge was announced for the first time, where real customers get to rate systems developed by leading universities worldwide. The aim of the challenge is to converse "coherently and engagingly with humans on popular topics for 20 minutes". We describe our Alexa Prize system (called 'Alana') consisting of an ensemble of bots, combining rule-based and machine learning systems, and using a contextual ranking mechanism to choose a system response. The ranker was trained on real user feedback received during the competition, where we address the problem of how to train on the noisy and sparse feedback obtained during the competition.

研究の動機と目的

  • 長時間にわたる対話においても会話の面白さと整合性を保つオープンドメインのソーシャル対話システムを構築する課題に対処すること。
  • 単一ターンの応答評価に起因する限界を克服し、安全ではあるが退屈な応答を好む傾向を是正すること。
  • 個々のターンではなく、対話全体の結果を考慮したランク付け機構を開発すること。
  • ライブデプロイ時に収集されたノイズが多く、スパースで遅延が生じるユーザーフィードバックを効果的に活用して応答ランカーを学習すること。
  • 実世界の環境で実際のユーザー評価を継続的に学習することで、システムパフォーマンスを向上させること。

提案手法

  • ルールベースのボット(例:Persona、Eliza、NewsBot)とデータ駆動型モデル(検索ベースと生成型Seq2Seqモデル)を統合したハイブリッドアーキテクチャを採用する。
  • 意味的類似度、METEORスコア、整合性、センチメント極性、トピックの乖離度といった特徴を組み合わせた手作業で設計されたランク関数により、候補応答のスコアを算出する。
  • VowpalWabbitを用いて、アレクサ・プライズコンペティション中に収集された実際のユーザーフィードバックをもとに線形分類器ランカーを学習する。対話レベルの評価(4–5 = 正の反応、1–2 = 負の反応)をラベルとして使用する。
  • 特徴量には、文脈および応答からのbag-of-n-gram、位置に依存するn-gram、対話フローのメトリクス、ボット名の埋め込み表現が含まれる。
  • 初期段階でコールドスタートのためのパブリックデータセット(Cornell MoviesやTwitter)で学習した結果が不十分であったため、ライブデータ(6万件の対話)を用いてランカーを再学習し、一般化性能が向上した。
  • 最終的なシステムでは、訓練済みランカーを用いてアンサンブルからスコアが最も高い応答を選択し、特徴量の重み付き和に基づいて推論を行う。

実験結果

リサーチクエスチョン

  • RQ1ノイズが多く、スパースで、かつ遅延が生じる実際のユーザーフィードバックを用いて学習された応答ランキングモデルは、オープンドメインのソーシャルチャットボットのパフォーマンスを向上させることができるか?
  • RQ2実際のユーザー評価に基づいて学習されたランカーと、手作業で設計されたランク関数とを比較した場合、ユーザーの関与度と整合性の観点でどちらが優れているか?
  • RQ3ライブユーザーインタラクションからのフィードバックをもとに学習された線形分類器モデルは、実世界の対話文脈においてどの程度一般化できるか?
  • RQ4ターンレベルの特徴ではなく、対話レベルのフィードバックを組み込むことで、より会話にふさわしく、文脈的に適切な応答が得られるようになるか?
  • RQ5ライブユーザーデータを継続的に再学習することで、データのスパarsityとノイズが存在する中でも、時間の経過とともに対話システムのパフォーマンスが向上するか?

主な発見

  • アレクサ・プライズコンペティションで収集された実際のユーザーフィードバックを用いて学習した線形ランカーは、平均ユーザー評価3.28を達成し、手作業で設計されたランカー(3.26)を上回った。
  • ユーザー評価がノイズが多く、スパース(1対話につき1回の評価)であるにもかかわらず、モデルはより会話にふさわしい応答を優先する能力を効果的に学習した。
  • ライブデータを用いたランカーの再学習により、コールドスタート段階で使用したパブリックデータセット(Cornell MoviesやTwitter)からの学習に比べ、顕著なパフォーマンス向上が達成された。
  • 最終的なシステムは272件の対話を処理し、平均評価3.28を記録した。これは、実世界の環境で実際のユーザーフィードバックから学習する方法の有効性を示している。
  • 開発セットにおいて、ポジティブ対話とネガティブ対話を分類するモデルの正確度は69.40%に達し、高品質な対話の識別能力が有効に発揮された。
  • 著者らは、2017年8月から10月にかけて増加したフィードバックをもとに学習された後続のニューラルランカーが、線形モデルを上回る正確度を示したと報告しており、継続的学習の価値を裏付けている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。