Skip to main content
QUICK REVIEW

[논문 리뷰] Joint Multiple Intent Detection and Slot Filling via Self-distillation

Lisong Chen, Peilin Zhou|arXiv (Cornell University)|2021. 08. 18.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 다중의도 검출을 약한 지도 학습 문제로 공식화하고, 다중 예제 학습(MIL)을 사용하여 다중의도 검출을 다루는 자기-정규화 연합 NLU 모델인 SDJN을 제안한다. 또한 의도와 슬롯 예측 간의 이중 방향 지식 전이를 가능하게 하기 위해 세 개의 디코더로 구성된 보조 루프(초기 슬롯 디코더, MIL 의도 디코더, 최종 슬롯 디코더)를 도입한다. 이 방법은 두 개의 공개 다중의도 데이터셋에서 최신 기술 수준의 성능을 달성하며, 강력한 기준 모델 대비 MixATIS에서 전체 정확도를 3.8% 향상시키고 MixSNIPS에서는 1.5% 향상시킨다.

ABSTRACT

Intent detection and slot filling are two main tasks in natural language understanding (NLU) for identifying users' needs from their utterances. These two tasks are highly related and often trained jointly. However, most previous works assume that each utterance only corresponds to one intent, ignoring the fact that a user utterance in many cases could include multiple intents. In this paper, we propose a novel Self-Distillation Joint NLU model (SDJN) for multi-intent NLU. First, we formulate multiple intent detection as a weakly supervised problem and approach with multiple instance learning (MIL). Then, we design an auxiliary loop via self-distillation with three orderly arranged decoders: Initial Slot Decoder, MIL Intent Decoder, and Final Slot Decoder. The output of each decoder will serve as auxiliary information for the next decoder. With the auxiliary knowledge provided by the MIL Intent Decoder, we set Final Slot Decoder as the teacher model that imparts knowledge back to Initial Slot Decoder to complete the loop. The auxiliary loop enables intents and slots to guide mutually in-depth and further boost the overall NLU performance. Experimental results on two public multi-intent datasets indicate that our model achieves strong performance compared to others.

연구 동기 및 목표

  • 대화 시스템에서 각 발화에 대해 단일 의도를 가정하는 기존 모델들이 다루기 어려운 연합 다중의도 검출 및 슬롯 채우기 문제를 해결하기 위해.
  • 약한 지도 학습 기반 다중 예제 학습(MIL)을 통해 세분화된 토큰 수준의 의도 정보를 활용하여 성능을 향상시키기 위해.
  • 세 개의 순서된 디코더로 구성된 자기-정규화 보조 루프를 통해 의도와 슬롯 예측 간의 이중 방향 지식 전이를 가능하게 하기 위해.
  • 단지 부드러운 타깃만이 아닌 중간 수준의 지도 정보(힌트)를 통합하여 표현 학습을 향상시키기 위해.
  • 의도와 슬롯 간의 상호의존성을 활용하여 실제 다중의도 데이터셋에서 연합 NLU 성능을 초우수 수준으로 향상시키기 위해.

제안 방법

  • 토큰을 인스턴스로, 발화를 백으로 간주하여 다중의도 검출을 약한 지도 학습 기반의 다중 예제 학습(MIL) 문제로 공식화하고, 인스턴스 수준의 의도 분포를 예측한다.
  • 세 개의 디코더로 구성된 보조 루프를 도입한다: 초기 슬롯 디코더, MIL 의도 디코더, 최종 슬롯 디코더로, 각 디코더의 출력이 다음 디코더의 보조 지식이 된다.
  • 최종 슬롯 디코더를 교사 모델로 활용하여 소프트 타깃 또는 중간 수준의 힌트를 통해 지식을 초깃단 슬롯 디코더로 정규화한다.
  • 의도 수준의 레이블을 얻기 위해 토큰 수준의 의도 예측을 집계하는 어텐션 기반 함수를 사용하여 다중의도 상황에서 효과적이다.
  • 온도 스케일링을 적용한 자기-정규화와 힌트 기반 지식 전이를 통해 중간 표현 학습과 모델 일반화를 향상시킨다.
  • 슬롯 채우기, 의도 검출, 정규화 목표를 포함하는 다중 태스크 손실을 최적화하며, 각 데이터셋에 맞게 하이퍼파라미터를 조정한다.

실험 결과

연구 질문

  • RQ1토큰 수준의 예측을 기반으로 발화 수준의 레이블을 유추함으로써, 다중의도 검출을 약한 지도 학습 기반의 다중 예제 학습(MIL) 문제로 효과적으로 모델링할 수 있는가?
  • RQ2세 개의 디코더로 구성된 보조 루프는 다중의도 NLU에서 의도와 슬롯 예측의 연합 성능을 어떻게 향상시키는가?
  • RQ3소프트 타깃 대비 중간 수준의 힌트를 지식 소스로 사용할 경우 표현 학습과 성능에 어떤 영향을 미치는가?
  • RQ4의도와 슬롯 예측 간의 이중 방향 지식 전이가 단방향 또는 상호작용 없음과 비교해 전체 NLU 성능을 더 좋게 만드는가?
  • RQ5제안된 자기-정규화 프레임워크는 공개 벤치마크에서 기존의 다중의도 NLU 모델을 초월할 수 있는가?

주요 결과

  • SDJN은 MixATIS와 MixSNIPS 양쪽 데이터셋에서 모든 기준 모델을 능가하며, MixATIS에서는 전체 정확도를 3.8% 향상시키고 MixSNIPS에서는 1.5% 향상시켰다.
  • 최적의 기준 모델(AGIF) 대비 슬롯 채우기 F1 점수를 MixATIS에서 1.5% 향상시키고 MixSNIPS에서는 0.2% 향상시켜 세분화된 의도 지도 학습의 유용성을 입증했다.
  • MIL 의도 디코더를 도입함으로써 의도 검출 성능이 크게 향상되었으며, 초깃단 슬롯 디코더 이후에 추가할 경우 전체 정확도가 5.3% 향상되었다.
  • 정규화 시 힌트를 지식 소스로 사용할 경우, 온도 2와 4일 때 각각 소프트 타깃보다 1.1%와 1.5% 더 높은 전체 정확도를 기록했다.
  • 제거 실험 결과 각 디코더가 성능 향상에 기여하며, 정규화 기반의 전체 모델이 의도와 슬롯 예측 간 최적의 균형을 달성함을 확인했다.
  • 최종 레이어의 소프트 타깃만에 의존하는 것보다 중간 수준의 지도 정보(힌트)를 통한 자기-정규화 메커니즘이 더 강력한 표현 학습을 이끌어냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.