[論文レビュー] Towards Open Intent Discovery for Conversational Text
本稿では、会話文から訓練中に見られなかった意図を含め、複数の明示的ユーザー意図を検出・抽出できる二段階のニューラルフレームワークであるTOP-IDを紹介する。双方向LSTM、CRF系列タギング、自己注意機構、敵対的訓練を組み合わせることで、1ドメインあたり100件未満のラベル付き例でさえも使用し、最先端のベースラインより5–15%高いF1スコアを達成する。
Detecting and identifying user intent from text, both written and spoken, plays an important role in modelling and understand dialogs. Existing research for intent discovery model it as a classification task with a predefined set of known categories. To generailze beyond these preexisting classes, we define a new task of extit{open intent discovery}. We investigate how intent can be generalized to those not seen during training. To this end, we propose a two-stage approach to this task - predicting whether an utterance contains an intent, and then tagging the intent in the input utterance. Our model consists of a bidirectional LSTM with a CRF on top to capture contextual semantics, subject to some constraints. Self-attention is used to learn long distance dependencies. Further, we adapt an adversarial training approach to improve robustness and perforamce across domains. We also present a dataset of 25k real-life utterances that have been labelled via crowd sourcing. Our experiments across different domains and real-world datasets show the effectiveness of our approach, with less than 100 annotated examples needed per unique domain to recognize diverse intents. The approach outperforms state-of-the-art baselines by 5-15% F1 score points.
研究の動機と目的
- 既存の意図検出システムが事前に定義された意図クラスに限定されたクローズドワールド設定を仮定しているという制限に対処すること。
- 1つの発話または対話ターン内で、複数の多様でかつ事前に未確認のユーザー意図を検出できること。
- 異なる会話的ドメインにわたり一貫性があり、実行可能な形式で意図を抽出できるドメイン汎用フレームワークを開発すること。
- 新しいドメインへの有効な少サンプル適応を可能にすることで、大規模なアノテート済みデータに依存するのを減らすこと。
- 技術的サポート会話などの現実世界の対話において、ユーザーの行動項目を細かく、現実的かつ的確に要約できること。
提案手法
- 二段階のアプローチ:まず、双方向LSTMの上に配置されたソフトマックス分類器が、発話に明示的な意図が含まれるかどうかを判断する。
- 第二に、双方向LSTMにCRF層を組み合わせた系列タギングモデルが、入力テキスト内の個々の意図スパンを特定・抽出する。
- 自己注意機構を統合して長距離依存関係をモデル化し、文脈表現を向上させる。
- 下位層で敵対的訓練を適用することで、耐障害性とドメイン一般化性能を向上させる。
- 限定的なラベル付き例を用いたファインチューニングの前に、ターゲットドメインデータ上で自己教師ありの方法で事前学習を行う。
- 多様なドメインにまたがる25,000件のクラウドソーシングされた会話発話の新規データセットを収集・アノテートし、汎用的意図発見を目的としている。
実験結果
リサーチクエスチョン
- RQ1事前に意図カテゴリを知らなくても、ニューラル系列タギングモデルが会話文から複数の明示的なユーザー意図を検出・抽出できるか?
- RQ2特にラベル付きデータが極めて少ない状況下でも、このようなモデルが未確認の意図タイプにどれほど一般化できるか?
- RQ3限定的な監視情報のもとで、異なる会話的ドメイン間でのモデルの適応度はどの程度か?
- RQ4自己注意機構と敵対的訓練の統合が、オープンワールドの意図発見における性能と耐障害性をどの程度向上させるか?
- RQ5技術的サポート会話などの現実世界の対話において、モデルがユーザーの意図を細かく、実行可能な要約として提供できるか?
主な発見
- TOP-IDは、複数の現実世界のデータセットおよびドメインにおいて、最先端のベースラインよりF1スコアで5–15ポイント高い性能を達成した。
- 1ドメインあたり100件未満のラベル付き例でさえも使用し、強力な少サンプル一般化性能を示した。
- Ubuntu Dialog Corpusでは、TOP-IDが1回の複数ターン会話内で10種類以上の異なるユーザー意図を正しく特定した。例えば、破損したUbuntuインストールの修復やドライバのアップグレードといった複雑な行動も含まれる。
- 「アルバムを再生する」「イベントを検索する」「特別な食事をリクエストする」などの細かく分類された意図タイプを、複雑な発話文の中にあっても正確に検出できた。
- 別個のスロットフィリングモジュールを必要とせず、意図と関連する文脈的エンティティ(例:曲名、映画タイトル、システムファイル)を同時に抽出できた。
- 主にStack Exchangeデータで学習したにもかかわらず、カスタマーサポート、音楽、レストラン予約など、さまざまなドメインにわたり良好な一般化性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。