Skip to main content
QUICK REVIEW

[論文レビュー] Discovering New Intents via Constrained Deep Adaptive Clustering with Cluster Refinement

Ting-En Lin, Hua Xu|arXiv (Cornell University)|Nov 20, 2019
Topic Modeling参考文献 27被引用数 13
ひとこと要約

本稿では、限定的なラベル付きデータからペアワイズ制約を統合し、高信頼度の割り当てを用いてクラスタを精錬することで、クラスタ数に頼りにくくなるように設計されたエンドツーエンドのクラスタリング手法CDAC+を提案する。制約付き深層クラスタリングと精錬を統合的に最適化することで、3つのベンチマークデータセットで最先端の性能を達成する。

ABSTRACT

Identifying new user intents is an essential task in the dialogue system. However, it is hard to get satisfying clustering results since the definition of intents is strongly guided by prior knowledge. Existing methods incorporate prior knowledge by intensive feature engineering, which not only leads to overfitting but also makes it sensitive to the number of clusters. In this paper, we propose constrained deep adaptive clustering with cluster refinement (CDAC+), an end-to-end clustering method that can naturally incorporate pairwise constraints as prior knowledge to guide the clustering process. Moreover, we refine the clusters by forcing the model to learn from the high confidence assignments. After eliminating low confidence assignments, our approach is surprisingly insensitive to the number of clusters. Experimental results on the three benchmark datasets show that our method can yield significant improvements over strong baselines.

研究の動機と目的

  • 意図の分類体系が未知で、ラベルなしデータにノイズが含まれるオープンドメイン対話システムにおいて、新しいユーザーの意図を発見する課題に対処すること。
  • 特徴量の手作業設計に依存しやすく、クラスタ数に敏感な従来手法の限界を克服すること。
  • 事前学習された言語モデルと限定的なラベル付きデータを事前知識として活用し、クラスタリングをガイドするエンドツーエンドのクラスタリングフレームワークを開発すること。
  • 低信頼度の割り当てを繰り返し削除することでクラスタを精錬し、クラスタ数などのハイパーパrameter選択への感受性を低減することで、クラスタリングのロバスト性を向上させること。

提案手法

  • 会話データ内の発話文の文脈的表現を抽出するためにBERTを用いる。
  • ラベル付きデータから導出された類似度ラベルまたは動的類似度閾値を用いてペアワイズ分類タスクを構築し、クラスタリングをガイドする。
  • 手作業による特徴量設計を置き換えるために、ペアワイズ制約を事前知識として導入し、クラスタリングプロセスを制約する。
  • モデルがトレーニング中に高信頼度のクラスタ割り当てに集中するよう促すために、ターゲット分布とカルバック・ライブラー距離損失を採用する。
  • 低信頼度の割り当てを繰り返し削除することでクラスタを精錬し、より安定的で正確なクラスタ構造を達成する。
  • エンドツーエンドのアプローチにより、意図表現とクラスタ割り当てを同時に最適化することで、表現学習とクラスタリングを統合的に実現する。

実験結果

リサーチクエスチョン

  • RQ1特徴量の手作業設計に依存せずに、深層クラスタリング手法が新しいユーザーの意図を効果的に発見できるか。
  • RQ2限定的なラベル付きデータをペアワイズ制約として組み込むことで、オープンドメイン意図発見におけるクラスタリング性能がどのように向上するか。
  • RQ3高信頼度の割り当てに基づくクラスタ精錬が、事前に定義されたクラスタ数への感受性をどの程度低減するか。
  • RQ4未知の意図の割合が高く、クラス不均衡やラベル付きデータの割合が低いといった困難な状況下でも、本手法はどの程度の性能を示すか。

主な発見

  • CDAC+は、SNIPS、DBPedia、StackOverflowの3つのベンチマークデータセットにおいて、強力なベースライン(DAC、CDAC-KM、BERT-Semi)を著しく上回る性能を達成した。
  • 正解クラスタ数の4倍までクラスタ数を増やしても、CDAC+は高い性能を維持しており、クラスタ数への感受性が低いことが示された。
  • ラベル付きデータの割合がたった0.01の状況下でも、CDAC+はStackOverflowデータセットでBERT-Semiを上回る結果を達成し、低ス upward な環境下での一般化性能に優れていることが示された。
  • 未知クラスの割合が75%に達する状況下でもCDAC+はロバストに機能するが、BERT-Semiはインスタンスレベルの制約に過適合することで性能が急激に低下した。
  • 不均衡なデータセットにおいても、CDAC+はバランスの取れたデータで学習したベースラインを上回り、低保持確率(γ = 0.1)でも最小限の性能低下にとどまった。
  • t-SNEの可視化結果から、CDAC+はコンパクトで明確に分離された意図表現を学習していることが確認され、混同行列から、BookRestaurant や SearchCreativeWork といった以前に見られなかった意図に対しても正確なクラスタリングが実現していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。