Skip to main content
QUICK REVIEW

[論文レビュー] Open Intent Discovery through Unsupervised Semantic Clustering and Dependency Parsing

Pengfei Liu, Youzhang Ning|arXiv (Cornell University)|Apr 25, 2021
Topic Modeling参考文献 52被引用数 7
ひとこと要約

本稿では、事前学習された文埋め込みと従属構文解析を用いて、教師なしの2段階枠組みを提案する。新たなバランススコア指標を用いて意味空間における発話のクラスタリングを行い、最適なクラスタ数を決定する。その後、頻出する従属関係のペアを用いて人間が理解可能な ACTION-OBJECT 意図ラベルを生成する。SNIPSで93.5%のF1スコアを達成し、意図の完全一致を実現した。

ABSTRACT

Intent understanding plays an important role in dialog systems, and is typically formulated as a supervised learning problem. However, it is challenging and time-consuming to design the intents for a new domain from scratch, which usually requires a lot of manual effort of domain experts. This paper presents an unsupervised two-stage approach to discover intents and generate meaningful intent labels automatically from a collection of unlabeled utterances in a domain. In the first stage, we aim to generate a set of semantically coherent clusters where the utterances within each cluster convey the same intent. We obtain the utterance representation from various pre-trained sentence embeddings and present a metric of balanced score to determine the optimal number of clusters in K-means clustering for balanced datasets. In the second stage, the objective is to generate an intent label automatically for each cluster. We extract the ACTION-OBJECT pair from each utterance using a dependency parser and take the most frequent pair within each cluster, e.g., book-restaurant, as the generated intent label. We empirically show that the proposed unsupervised approach can generate meaningful intent labels automatically and achieve high precision and recall in utterance clustering and intent discovery.

研究の動機と目的

  • 目的指向対話システムにおける新規ドメイン向けの意図オントロジーを手作業で定義する際の高コストとスケーラビリティの問題に対処すること。
  • 人間によるラベルなしで、生のラベルなし会話データから意味的に整合性のある意図を自動で発見すること。
  • 従属構文解析を用いて、ACTION-OBJECT ペアの形で意味的で人間が理解可能な意図ラベルを生成すること。
  • バランスの取れたデータセット向けに最適なクラスタ数を決定するための新しいバランススコア指標を用いて、クラスタリング性能を向上させること。
  • 実世界の対話システムやソーシャルメディア分析に適用可能なスケーラブルでリソースが少ない意図発見を可能にすること。

提案手法

  • 各発話を、特にユニバーサル文埋め込みを用いて事前学習された文埋め込みで表現し、発話を共通の意味的空間にマッピングする。
  • 不均衡なクラスタ分布をペナルティとして課すバランススコア指標を組み込んだ、変更されたK-meansクラスタリングアルゴリズムを適用し、最適なクラスタ数を決定する。
  • 各発話から従属構文解析器を用いて、動詞とその直接目的語の間の文法的関係を特定し、ACTION-OBJECT ペアを抽出する。
  • 各クラスタの内部で最も頻出する ACTION-OBJECT ペアを選択することで、そのクラスタの意図ラベルを生成する。
  • 複数の評価指標において最高の性能を示したため、ユニバーサル文埋め込み表現を意味的表現として採用する。
  • SNIPSベンチマークデータセットを用い、正解ラベルを用いて、精度、再現率、F1スコア、NMI、ARIを用いてクラスタリング性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1教師なし枠組みは、人間によるラベルなしで、生のラベルなし会話データから意味的な意図を効果的に発見できるか?
  • RQ2バランススコア指標は、バランスの取れたデータセットにおいて、クラスタ品質と最適Kの推定をどの程度向上できるか?
  • RQ3従属構文解析は、各発見クラスタに対して解釈可能で意味的に正確な意図ラベルとしての ACTION-OBJECT ペアを抽出できるか?
  • RQ4事前学習された文埋め込みの選択が、意図クラスタリングおよび発見の性能にどの程度影響を与えるか?
  • RQ5提案された枠組みは、高精度・高再現率の意図認識を達成すると同時に、人間が読みやすい意図ラベルを生成できるか?

主な発見

  • 提案された枠組みは、SNIPSデータセットで93.5%の高いF1スコアを達成し、すべての正解意図ラベルが発見されたクラスタと完全に一致した。
  • ユニバーサル文埋め込みモデルは、F1(0.935)、NMI(0.865)、ARI(0.855)を含むすべての指標で、他の事前学習表現を上回った。
  • バランススコア指標は、不均衡な分布を好まないことでクラスタ品質を著しく向上させ、この文脈ではシルエットスコアなどの標準的指標を上回った。
  • 各意図クラスタに対して、最も頻出する ACTION-OBJECT ペア(例:book-restaurant、play-music)が、人間の理解と一致する正確で解釈可能なラベルとして機能した。
  • この枠組みはSNIPSデータセットの7つの正解意図をすべて発見し、個々のF1スコアは0.826から0.989の範囲にあり、多様な意図タイプにわたる堅牢な性能を示した。
  • この手法は優れた一般化能力を示しており、第一段階(クラスタリング)は、明確な ACTION-OBJECT パatters を持たないデータセットでも有効に機能し、複雑または非公式な対話においても意図発見が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。