Skip to main content
QUICK REVIEW

[論文レビュー] Sequential Dialogue Context Modeling for Spoken Language Understanding

Ankur Bapna, Gökhan Tür|arXiv (Cornell University)|May 8, 2017
Topic Modeling被引用数 6
ひとこと要約

本稿では、会話の文脈を時系列順にモデル化することで、スプoken言語理解(SLU)を向上させる再帰的ニューラルネットワークアーキテクチャである順序付き会話エンコーダーネットワーク(SDEN)を提案する。複数ターンの会話履歴を逐次的にエンコードすることにより、前のターンのみを用いるモデルやアテンションベースのメモリネットワークと比較して、意味的フレーム誤り率を低減する。特に、より良い一般化を得るために再結合された多ドメイン会話データで訓練された場合に顕著である。

ABSTRACT

Spoken Language Understanding (SLU) is a key component of goal oriented dialogue systems that would parse user utterances into semantic frame representations. Traditionally SLU does not utilize the dialogue history beyond the previous system turn and contextual ambiguities are resolved by the downstream components. In this paper, we explore novel approaches for modeling dialogue context in a recurrent neural network (RNN) based language understanding system. We propose the Sequential Dialogue Encoder Network, that allows encoding context from the dialogue history in chronological order. We compare the performance of our proposed architecture with two context models, one that uses just the previous turn context and another that encodes dialogue context in a memory network, but loses the order of utterances in the dialogue history. Experiments with a multi-domain dialogue dataset demonstrate that the proposed architecture results in reduced semantic frame error rates.

研究の動機と目的

  • 従来のSLUシステムが前のシステムターンのみを文脈として使用するという限界を解消し、未解決の曖昧性を回避すること。
  • RNNを用いて会話文脈を順序的・時系列的にモデル化することで、スプoken言語理解を向上させること。
  • より豊かな会話履歴を活用することで、多ドメイン・マルチターンの目的志向会話における意味的フレーム誤り率を低減すること。
  • 複雑で混合ドメインの会話を模倣するためのデータ拡張技術(会話再結合)を開発すること。
  • 順序付き文脈モデリングが、現実世界のSLUタスクにおいて、アテンションベースのメモリネットワークや単一ターン文脈よりも優れているかどうかを評価すること。

提案手法

  • HREDの拡張版として、クエリレベルのエンコーディングと現在の発話表現をセッションレベルのエンコーディングの前に統合する順序付き会話エンコーダーネットワーク(SDEN)を提案する。
  • 発話を順番にエンコードする階層的RNNアーキテクチャを採用し、会話履歴の時間的順序を保持する。
  • 現在の発話と歴史的発話を比較するためのコサイン類似度ベースのアテンションを備えたメモリネットワークを採用するが、発話の順序は保持しない。
  • 単一ドメインの会話を統合して多ドメインセッションを生成する会話再結合技術を適用し、トレーニングデータの複雑さと発話長を増加する。
  • 多ドメイン会話データセット上で、RNNベースのタギングヘッドを用いて意図・ドメイン・スロット分類を統合して訓練する。
  • フレーム誤り率(FER)を用いて性能を評価し、曖昧な発話におけるモデル行動の解釈を可能にするためにアテンション分布を分析する。

実験結果

リサーチクエスチョン

  • RQ1時系列順に会話文脈をモデル化することで、前のターンのみを用いるモデルと比較して、スプoken言語理解の性能が向上するか?
  • RQ2順序付きRNNベースの文脈エンコーダーは、発話順序を失うアテンションベースのメモリネットワークを上回るか?(多ドメイン会話において)
  • RQ3会話再結合によるデータ拡張は、複雑で混合ドメインのテストセットにおけるモデルの一般化性と性能にどのような影響を与えるか?
  • RQ4モデルアーキテクチャの複雑さは、低データ環境下における合成的文脈の利点にどの程度影響を与えるか?
  • RQ5複数の歴史的発話が補足的情報を提供する状況で、順序付き文脈モデリングは曖昧なユーザー発話をより効果的に解消できるか?

主な発見

  • 再結合会話で訓練された場合、順序付き会話エンコーダーネットワーク(SDEN)は、前のターン文脈モデルおよびメモリネットワークを上回るフレーム誤り率を達成する。
  • SDENは、より長く混合ドメインの会話が含まれるテストセットで最も優れた性能を示しており、現実世界の会話複雑性への一般化能力が優れていることを示している。
  • メモリネットワークは再結合なしで最も良い性能を示すが、文脈が複雑になると著しく性能が低下し、多ドメイン環境への一般化が不十分であることが示唆される。
  • 会話再結合は、特にSDENのような複雑なアーキテクチャにおいて、トレーニングデータの多様性と発話長を増加させることで、モデル性能を顕著に向上させる。
  • アテンション可視化の結果、SDENは関連性の高い最近の発話を的確に注目している一方、メモリネットワークは広範にわたるアテンションを示しており、文脈の利用が不正確であることがわかる。
  • 再結合なしでは、SDENは低データ環境で一般化に失敗し、パラメータ数が多く、アーキテクチャが複雑であるため、過学習に陥りやすいことが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。