Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Open Intent Discovery for Conversational Text

Nikhita Vedula, Nedim Lipka|arXiv (Cornell University)|2019. 04. 17.
Topic Modeling참고 문헌 51인용 수 9
한 줄 요약

이 논문은 대화 텍스트에서 훈련 중에 볼 수 없었던 의도까지도 검출하고 추출할 수 있는 두 단계의 신경망 프레임워크인 TOP-ID를 소개한다. 양방향 LSTM, CRF 시퀀스 태깅, 자기 주의 메커니즘, 그리고 적대적 훈련을 결합함으로써, 최신 기준 모델보다 F1 점수를 5–15% 높게 달성하며, 도메인당 100개 미만의 레이블이 필요한 것으로 나타났다.

ABSTRACT

Detecting and identifying user intent from text, both written and spoken, plays an important role in modelling and understand dialogs. Existing research for intent discovery model it as a classification task with a predefined set of known categories. To generailze beyond these preexisting classes, we define a new task of extit{open intent discovery}. We investigate how intent can be generalized to those not seen during training. To this end, we propose a two-stage approach to this task - predicting whether an utterance contains an intent, and then tagging the intent in the input utterance. Our model consists of a bidirectional LSTM with a CRF on top to capture contextual semantics, subject to some constraints. Self-attention is used to learn long distance dependencies. Further, we adapt an adversarial training approach to improve robustness and perforamce across domains. We also present a dataset of 25k real-life utterances that have been labelled via crowd sourcing. Our experiments across different domains and real-world datasets show the effectiveness of our approach, with less than 100 annotated examples needed per unique domain to recognize diverse intents. The approach outperforms state-of-the-art baselines by 5-15% F1 score points.

연구 동기 및 목표

  • 기존의 의도 탐지 시스템이 사전에 정의된 의도 클래스가 있는 닫힌 세계 설정을 가정한다는 한계를 해결하기 위해.
  • 단일 발화나 대화 턴에서 다수의 다양하고 사전에 알려지지 않은 사용자 의도를 탐지할 수 있도록 하기 위해.
  • 다양한 대화 도메인 간에 일관되고 실행 가능한 형식으로 의도를 추출할 수 있는 도메인 일반화 프레임워크를 개발하기 위해.
  • 새로운 도메인에 효과적인 소수의 예제로의 적응을 가능하게 하여 대규모 애너테이션 데이터에 대한 의존도를 줄이기 위해.
  • 기술 지원 대화와 같은 실제 대화 상황에서 사용자 행동 항목을 세밀하고 현실적으로 요약할 수 있도록 하기 위해.

제안 방법

  • 두 단계의 접근 방식: 첫 번째로, 양방향 LSTM 위에 위치한 소프트맥스 분류기가 발화에 명시적인 의도가 포함되어 있는지 여부를 판단한다.
  • 두 번째로, 양방향 LSTM에 CRF 레이어를 추가한 시퀀스 태깅 모델이 입력 텍스트 내에서 개별 의도 스파이크를 식별하고 추출한다.
  • 자기 주의 메커니즘을 통합하여 장거리 의존성과 더 나은 문맥 표현을 모델링한다.
  • 하위 레이어에서 적대적 훈련을 적용하여 모델의 강건성과 도메인 일반화 능력을 향상시킨다.
  • 제한된 레이블 예제로의 테스트 전에 타겟 도메인 데이터를 기반으로 자기 지도 학습 방식으로 사전 훈련한다.
  • 다양한 도메인에서 25,000개의 커뮤니티 기반 대화 발화를 수집하고 애너테이션 처리하여 일반 목적의 의도 탐지에 적합한 새로운 데이터셋을 구축한다.

실험 결과

연구 질문

  • RQ1의도 카테고리에 대한 사전 지식 없이도 신경 시퀀스 태깅 모델이 대화 텍스트에서 다수의 명시적 사용자 의도를 검출하고 추출할 수 있는가?
  • RQ2특히 적은 레이블 데이터로도 이러한 모델이 추론 도중에 알려지지 않은 의도 유형으로 일반화하는 데 얼마나 잘 성능을 내는가?
  • RQ3제한된 감독 하에 다양한 대화 도메인 간에 모델이 얼마나 잘 적응할 수 있는가?
  • RQ4자기 주의 메커니즘과 적대적 훈련의 통합이 개방형 세계 의도 탐지에서 성능과 강건성에 어떻게 기여하는가?
  • RQ5모델이 실제 대화 상황, 예를 들어 기술 지원 대화에서 사용자 의도의 세밀하고 실행 가능한 요약을 제공할 수 있는가?

주요 결과

  • TOP-ID는 다양한 실제 데이터셋과 도메인에서 최신 기준 모델보다 F1 점수를 5–15% 높게 달성한다.
  • 모델은 도메인당 100개 미만의 레이블 예제로도 효과적인 소수의 예제 일반화를 보이며 의도 탐지 성능을 확보한다.
  • Ubuntu 대화 코퍼스에서 TOP-ID는 한 번의 다중 턴 대화에서 심지어 10개 이상의 서로 다른 사용자 의도를 성공적으로 식별했으며, 손상된 Ubuntu 설치 복구나 드라이버 업그레이드와 같은 복잡한 작업도 포함되었다.
  • 모델은 '앨범 재생', '행사 검색', '특수 식사 요청'과 같은 세밀한 의도 유형을 복잡한 문장 내에 포함되어 있어도 정확하게 탐지한다.
  • 별도의 슬롯 채우기 모듈 없이도 의도와 관련된 맥락적 엔터티(예: 노래 제목, 영화 제목, 시스템 파일)를 동시에 추출할 수 있다.
  • Stack Exchange 데이터로 주로 훈련되었음에도 불구하고, 고객 지원, 음악, 레스토랑 예약 등 다양한 도메인으로의 일반화 능력이 뛰어나다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.