Skip to main content
QUICK REVIEW

[논문 리뷰] Discovering New Intents via Constrained Deep Adaptive Clustering with Cluster Refinement

Ting-En Lin, Hua Xu|arXiv (Cornell University)|2019. 11. 20.
Topic Modeling참고 문헌 27인용 수 13
한 줄 요약

이 논문은 제한된 레이블된 데이터에서 유사도 제약 조건을 통합하고 높은 신뢰도 할당을 통해 클러스터를 정교화함으로써 클러스터 수에 대해 강건한 종단 간 클러스터링 방법인 CDAC+를 제안한다. 제약 조건이 있는 딥 클러스터링을 통한 표현 학습과 클러스터 할당의 동시 최적화를 통해 세 가지 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Identifying new user intents is an essential task in the dialogue system. However, it is hard to get satisfying clustering results since the definition of intents is strongly guided by prior knowledge. Existing methods incorporate prior knowledge by intensive feature engineering, which not only leads to overfitting but also makes it sensitive to the number of clusters. In this paper, we propose constrained deep adaptive clustering with cluster refinement (CDAC+), an end-to-end clustering method that can naturally incorporate pairwise constraints as prior knowledge to guide the clustering process. Moreover, we refine the clusters by forcing the model to learn from the high confidence assignments. After eliminating low confidence assignments, our approach is surprisingly insensitive to the number of clusters. Experimental results on the three benchmark datasets show that our method can yield significant improvements over strong baselines.

연구 동기 및 목표

  • 의도 분류 체계가 알려져 있지 않고 레이블이 없는 데이터가 노이즈가 많은 오픈 도메인 대화 시스템에서 새로운 사용자 의도를 탐지하는 문제에 대응한다.
  • 기존 방법들이 강력한 특징 공학에 의존하고 클러스터 수에 민감한 점을 극복한다.
  • 사전 훈련된 언어 모델과 제한된 레이블된 데이터를 사전 지식으로 활용하여 클러스터링을 이끄는 종단 간 클러스터링 프레임워크를 개발한다.
  • 낮은 신뢰도 할당을 반복적으로 제거하여 클러스터를 정교화함으로써 클러스터 수와 같은 하이퍼파라미터 설정에 대한 민감도를 줄여 클러스터링의 강건성을 향상시킨다.

제안 방법

  • 대화 데이터의 발화문에 대해 BERT를 사용하여 문맥적 문장 표현을 추출한다.
  • 레이블된 데이터에서 유도된 유사도 레이블 또는 동적 유사도 임계값을 사용하여 이변량 분류 작업을 구성하여 클러스터링을 이끈다.
  • 사용자 지정 특징 공학을 대체하기 위해 클러스터링 과정을 제약하는 사전 지식으로서의 이변량 제약 조건을 도입한다.
  • 모델이 훈련 중에 높은 신뢰도의 클러스터 할당에 집중하도록 하는 목표 분포와 킬리버크-라이블러 발산 손실을 활용한다.
  • 낮은 신뢰도 할당을 반복적으로 제거함으로써 더 안정적이고 정확한 클러스터 구조를 도출하는 클러스터 정교화를 적용한다.
  • 의도 표현과 클러스터 할당을 종단 간 방식으로 동시 최적화하여 표현 학습과 클러스터링을 통합한다.

실험 결과

연구 질문

  • RQ1심층 클러스터링 방법이 광범위한 특징 공학 없이도 새로운 사용자 의도를 효과적으로 탐지할 수 있는가?
  • RQ2제한된 레이블된 데이터를 이변량 제약 조건으로 통합하면 오픈 도메인 의도 탐지에서 클러스터링 성능가 향상되는가?
  • RQ3높은 신뢰도 할당 기반 클러스터 정교화가 사전 정의된 클러스터 수에 대한 민감도를 어느 정도 감소시키는가?
  • RQ4알 수 없는 의도 비율, 클래스 불균형, 낮은 레이블 데이터 비율과 같은 도전적인 조건에서 이 방법의 성능은 어떠한가?

주요 결과

  • CDAC+는 SNIPS, DBPedia, StackOverflow의 세 벤치마크 데이터셋에서 DAC, CDAC-KM, BERT-Semi와 같은 강력한 베이스라인을 모두 뛰어넘는 성능을 보였다.
  • 정의된 클러스터 수가 진실값의 네 배까지 증가하더라도 CDAC+는 높은 성능을 유지하여 클러스터 수에 대한 민감도가 낮음을 입증했다.
  • StackOverflow 데이터셋에서 레이블된 데이터 비율이 0.01일 때도 CDAC+는 BERT-Semi보다 더 나은 성능을 달성하여 저수준 지도 학습에서도 뛰어난 일반화 능력을 보였다.
  • 알 수 없는 클래스 비율이 최대 75%까지 증가하더라도 CDAC+는 강건하게 유지되며, BERT-Semi는 인스턴스 수준 제약 조건에 대한 과적합으로 인해 성능이 급격히 떨어졌다.
  • 불균형 데이터셋에서도 CDAC+는 균형 잡힌 데이터로 훈련된 베이스라인을 능가했으며, 저조한 유지 확률(γ = 0.1)에서도 성능 저하가 최소한이었다.
  • t-SNE 시각화 결과 CDAC+가 밀도가 높고 잘 분리된 의도 표현을 학습했으며, 혼동 행렬을 통해 BookRestaurant 및 SearchCreativeWork와 같이 이전에 본 적 없는 의도에 대해서도 정확한 클러스터링을 수행하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.