Skip to main content
QUICK REVIEW

[논문 리뷰] Automatic Data Expansion for Customer-care Spoken Language Understanding

Shahab Jalalvand, Andrej Ljolje|arXiv (Cornell University)|2018. 09. 27.
Speech Recognition and Synthesis참고 문헌 14인용 수 5
한 줄 요약

이 논문은 고객 케어 대화 이해(SLU)를 위한 n-gram 기반 자동 데이터 확장 방법을 제안한다. 이 방법은 사전 NLU 모델을 활용해 각 의도에 대해 정보성 높은 n-gram을 식별한 후, 이러한 n-gram을 사용해 관련성이 높은 도메인 외부(OOD) 데이터를 선별하여 언어 모델 및 NLU 모델을 향상시킨다. 제안된 방법은 기준 모델 대비 분류 오류율(CER)을 30% 감소시키며, TF-IDF, 임베딩, 준지도 학습 방법보다 뛰어난 성능을 보인다.

ABSTRACT

Spoken language understanding (SLU) systems are widely used in handling of customer-care calls.A traditional SLU system consists of an acoustic model (AM) and a language model (LM) that areused to decode the utterance and a natural language understanding (NLU) model that predicts theintent. While AM can be shared across different domains, LM and NLU models need to be trainedspecifically for every new task. However, preparing enough data to train these models is prohibitivelyexpensive. In this paper, we introduce an efficient method to expand the limited in-domain data. Theprocess starts with training a preliminary NLU model based on logistic regression on the in-domaindata. Since the features are based onn= 1,2-grams, we can detect the most informative n-gramsfor each intent class. Using these n-grams, we find the samples in the out-of-domain corpus that1) contain the desired n-gram and/or 2) have similar intent label. The ones which meet the firstconstraint are used to train a new LM model and the ones that meet both constraints are used to train anew NLU model. Our results on two divergent experimental setups show that the proposed approachreduces by 30% the absolute classification error rate (CER) comparing to the preliminary modelsand it significantly outperforms the traditional data expansion algorithms such as the ones based onsemi-supervised learning, TF-IDF and embedding vectors.

연구 동기 및 목표

  • 고객 케어 애플리케이션에서 SLU 시스템의 내부 도메인 학습 데이터가 부족한 문제를 해결하기 위해.
  • 내부 도메인 데이터가 소량일 경우 언어 모델(LM) 및 NLU 모델 성능을 향상시키기 위해.
  • 사전 NLU 모델에서 유의미한 n-gram을 추출해 관련성이 높은 도메인 외부 데이터를 선별하는 데이터 확장 기법을 개발하기 위해.
  • 낮은 데이터 환경에서의 SLU 작업에서 기존의 데이터 확장 방법(예: TF-IDF, 단어 임베딩, 준지도 학습)을 능가하기 위해.

제안 방법

  • n-gram(n=1,2) 특징을 사용해 내부 도메인 데이터에서 로지스틱 회귀를 활용해 사전 NLU 모델을 훈련한다.
  • 훈련된 NLU 모델의 특징 가중치를 분석하여 각 의도별로 가장 정보성 높은 n-gram을 추출한다.
  • 목표 n-gram을 포함하는 OOD 샘플을 선별해 언어 모델(LM)을 재학습한다.
  • 목표 n-gram과 의도 레이블이 일치하는 OOD 샘플을 선별해 NLU 모델을 재학습한다.
  • 선택된 OOD 데이터를 사용해 언어 모델 및 NLU 모델을 피지테이닝하여 새로운 SLU 작업에서의 일반화 성능을 향상시킨다.
  • 제한된 내부 도메인 데이터를 가진 두 가지 다양한 SLU 작업에서 분류 오류율(CER)을 사용해 성능을 평가한다.

실험 결과

연구 질문

  • RQ1사전 NLU 모델에서 유도된 n-gram 특징이 SLU 모델 훈련을 위한 관련 도메인 외부 데이터 선별에 효과적으로 기여할 수 있는가?
  • RQ2TF-IDF 및 단어 임베딩 기반 방법과 비교해 n-gram 기반 데이터 확장 방법은 CER 감소 측면에서 어떻게 성능을 내는가?
  • RQ3내부 도메인 데이터가 부족할 경우(예: 1개 의도당 10개 샘플), 데이터 확장 기법이 성능 향상에 얼마나 기여하는가?
  • RQ4OOD 코퍼스에 존재하지 않는 새로운 의도 레이블을 포함한 작업에서 이 방법의 성능은 어떠한가?

주요 결과

  • 제안된 n-gram 기반 데이터 확장 기법은 내부 도메인 데이터만으로 훈련된 기준 모델 대비 분류 오류율(CER)을 30% 감소시켰다.
  • 작업 A에서, 48,000개의 선택된 OOD 발화 문장을 사용해 CER가 44.21%에 도달했으며, 이는 기준 일반 언어 모델과 내부 도메인 NLU 모델(71.28% CER)을 크게 능가한 성능이었다.
  • 이 방법은 OOD 코퍼스에서 3,030개의 고유어를 추출했으며, 이는 TF-IDF(2,169개) 및 임베딩 기반 방법(2,572개)보다 더 높은 데이터 다양성을 보여주었다.
  • 내부 도메인 샘플이 1개 의도당 10개 뿐이어도 CER 향상 효과가 뚜렷했으며, 내부 도메인 데이터 크기가 150개로 증가함에 따라 성능 격차가 여전히 유의미하게 유지되었다.
  • 이 방법은 새로운 의도 레이블을 다룰 때도 강력한 내재성을 보였으며, 문자열 매칭을 통해 유사한 의도 레이블을 식별하고 데이터 확장을 통해 성능 향상을 이룬 바 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.