Skip to main content
QUICK REVIEW

[論文レビュー] Modeling Intent, Dialog Policies and Response Adaptation for Goal-Oriented Interactions

Saurav Sahay, Shachi H Kumar|arXiv (Cornell University)|Dec 20, 2019
Speech and dialogue systems被引用数 6
ひとこと要約

本稿では、BERT埋め込みとマルチヘッドアテンション機構を活用して意図認識と対話ポリシー学習を向上させる、データ駆動型で目的志向のスピoken対話システムを提示する。限られたアノテート済みデータを用いてベースラインを上回る性能を達成し、75%の訓練データとユーザーおよびシステムメモリ統合のための二重アテンション機構で最適な結果を得た。

ABSTRACT

Building a machine learning driven spoken dialog system for goal-oriented interactions involves careful design of intents and data collection along with development of intent recognition models and dialog policy learning algorithms. The models should be robust enough to handle various user distractions during the interaction flow and should steer the user back into an engaging interaction for successful completion of the interaction. In this work, we have designed a goal-oriented interaction system where children can engage with agents for a series of interactions involving `Meet \\& Greet' and `Simon Says' game play. We have explored various feature extractors and models for improved intent recognition and looked at leveraging previous user and system interactions in novel ways with attention models. We have also looked at dialog adaptation methods for entrained response selection. Our bootstrapped models from limited training data perform better than many baseline approaches we have looked at for intent recognition and dialog action prediction.

研究の動機と目的

  • 5〜7歳児童が『ミートアンドグリート』および『シモンセーズ』のインタラクションに参加する際の、堅牢で目的志向の対話システムの開発。
  • アマゾン・メカニカル・ターキーを介して収集した限られた訓練データを用いて、意図認識と対話ポリシー学習の向上。
  • ユーザーとシステムの対話履歴をモデル化するアテンション機構を活用した対話管理の強化。
  • 言語的および構文的特徴に基づく学習分類器を用いて、文脈的に適切な応答テンプレートの選択を可能にする。
  • 音声、視覚、ジェスチャーなどのマルチモーダル信号を対話パイプラインに統合し、より豊かな相互作用モデリングを実現する。

提案手法

  • 意図分類の向上を目的に、Rasa NLUフレームワークにBERT埋め込みと追加特徴(語彙的、構文的、発話行動)を拡張した。
  • RNNベースのアテンションを用いて、ユーザー履歴、システム行動、および統合されたユーザー・システム表現を組み合わせたマルチメモリアテンション機構を設計した。
  • ユーザーとシステムメモリ表現の統合を促進するため、テンソル統合層を提案した。
  • 語彙素、品詞タグ、構文的重複、感情極性を含む243の特徴を用いて、対話適応を2値分類タスクとして定式化した。
  • 32,400件のインスタンス(うち正例2,753件、負例29,647件)を用いて決定木分類器を訓練し、文脈的に適切な応答テンプレートを選択した。
  • AMTを介して収集した独自の80件の対話データセット上でモデルを評価し、行動予測のF1スコアと応答適応の交差検証を性能指標とした。

実験結果

リサーチクエスチョン

  • RQ1事前学習された言語表現(例:BERT)は、リソースが限られた子供を対象とした対話システムにおける意図認識をどのように向上させ得るか?
  • RQ2ユーザーとシステムの対話履歴を効果的に捉えるために、どのアテンションベースのメモリ機構が対話ポリシー学習に最適か?
  • RQ3言語的および構文的特徴を用いた教師あり分類タスクとしての応答適応は、効果的にモデル化可能か?
  • RQ4訓練データサイズは、目的志向対話システムにおける意図および行動予測モデルの性能にどのように影響するか?
  • RQ5マルチモーダルメモリ統合は、対話状態追跡およびポリシー最適化にどのような影響を及えるか?

主な発見

  • 従来の特徴セットやユニバーサルセンテンスエンコーダーと比較して、BERT埋め込みの使用が意図認識性能を顕著に向上させた。
  • 最良の対話ポリシー性能は75%の訓練データで達成され、データ量の増加に伴い明確な改善トレンドが確認された。
  • ユーザーとシステムメモリを別々にアテンションする二重アテンション機構が、行動予測のF1スコアを最も高めた。
  • 対話適応分類器は交差検証で優れた性能を示し、語彙素、品詞タグ、構文構造の特徴の重複が応答選択に有効であった。
  • 提案されたアテンションベースのメモリ統合モデルは、『ミートアンドグリートとシモンセーズ』データセットおよび標準ベンチマークドメインの両方で、ベースラインのREDPポリシーを上回った。
  • 限られたデータでは予測のばらつきが高かったが、訓練データ量の増加に伴い一貫した性能向上が見られたことから、スケーラビリティの可能性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。