Skip to main content
QUICK REVIEW

[논문 리뷰] Are Pretrained Transformers Robust in Intent Classification? A Missing Ingredient in Evaluation of Out-of-Scope Intent Detection

Jianguo Zhang, Kazuma Hashimoto|arXiv (Cornell University)|2021. 06. 08.
Adversarial Robustness in Machine Learning인용 수 8
한 줄 요약

이 논문은 소수의 예제로 의도 분류를 수행할 때 사전에 미리 훈련된 트랜스포머의 강건성에 대해 조사하며, 도메인 내에서 벗어난(out-of-scope, OOS) 예시—의미적으로 유사하지만 지원되지 않는 의도—에 대해선 성능이 떨어지는 것으로 드러나지만, 도메인 외 OOS 및 인-스코프 사례에선 뛰어난 성능을 보인다. 저자들은 CLINC-Single-Domain-OOS 및 BANKING77-OOS라는 두 가지 새로운 데이터셋을 구축하여, BERT, RoBERTa, ToD-BERT와 같은 모델들이 인-스코프로 잘못 분류하는 ID-OOS 예시에 대해 높은 신뢰도를 보이며 잘못된 분류를 한다는 점을 입증한다. 이는 키워드가 겹치는 경우에도 마스킹 처리를 한 후에도 여전히 발생하며, 평가 및 모델의 강건성에 심각한 격차가 있음을 시사한다.

ABSTRACT

Pre-trained Transformer-based models were reported to be robust in intent classification. In this work, we first point out the importance of in-domain out-of-scope detection in few-shot intent recognition tasks and then illustrate the vulnerability of pre-trained Transformer-based models against samples that are in-domain but out-of-scope (ID-OOS). We construct two new datasets, and empirically show that pre-trained models do not perform well on both ID-OOS examples and general out-of-scope examples, especially on fine-grained few-shot intent detection tasks. To figure out how the models mistakenly classify ID-OOS intents as in-scope intents, we further conduct analysis on confidence scores and the overlapping keywords, as well as point out several prospective directions for future work. Resources are available on https://github.com/jianguoz/Few-Shot-Intent-Detection.

연구 동기 및 목표

  • 소수의 예제로 의도 분류를 수행할 때 사전에 미리 훈련된 트랜스포머의 강건성, 특히 도메인 내에서 벗어난(ID-OOS) 예시에 대해 조사한다.
  • 실제 대화 시스템에서 흔한 의미적으로 유사하지만 도메인 내에서 지원되지 않는 OOS 예시에 대한 평가 부족 문제를 해결한다.
  • 세분화된 소수의 예제 설정에서 ID-OOS 및 일반적인 OOS 의도 탐지에 특화된 두 가지 새로운 데이터셋—CLINC-Single-Domain-OOS 및 BANKING77-OOS—를 구축하고 공개한다.
  • 모델이 ID-OOS 예시를 잘못 분류하는 이유를 분석하며, 키워드 겹침과 신뢰도 분포에 초점을 맞춘다.
  • 현재 평가 프로토콜의 심각한 한계를 밝히고, 강건한 OOS 탐지 향향 향후 연구 방향을 제안한다.

제안 방법

  • 인-스코프 클래스에서 유사하지만 지원되지 않는 의도를 추출하여 ID-OOS 예시를 구성함으로써, CLINC-Single-Domain-OOS 및 BANKING77-OOS라는 두 가지 새로운 데이터셋을 구축하였다.
  • 개발 세트에서 임계값을 최적화한 신뢰도 기반 OOS 탐지 방법을 사용하여 BERT, RoBERTa, ALBERT, ELECTRA, ToD-BERT의 다섯 가지 사전에 미리 훈련된 모델을 평가하였다.
  • ID-OOS 예시의 상위 5개 겹치는 유니그램을 [MASK] 토큰으로 대체하여 언어 모델링 방법을 적용함으로써, 키워드 겹침이 잘못 분류에 미치는 영향을 평가하였다.
  • 표준 평가 지표를 보고: 인-스코프 정확도(A_in), OOS 재현율(R_oos), OOS 정밀도(P_oos)이며, A_in과 R_oos의 조화 평균을 최대화하기 위해 임계값을 최적화하였다.
  • 신뢰도 점수 분포와 오분류 행렬에 대한 분석 및 제거 실험을 수행하여 잘못 분류의 패턴을 식별하였다.
  • 소수의 예제(5-shot) 및 전체 예제 설정 간 성능을 비교하여, 훈련 데이터 크기의 영향을 ID-OOS 탐지에 대해 평가하였다.

실험 결과

연구 질문

  • RQ1의미적으로 인-스코프 의도와 유사한 도메인 내에서 벗어난(ID-OOS) 예시를 마주했을 때, 사전에 미리 훈련된 트랜스포머는 의도 분류에서 강건한가?
  • RQ2ID-OOS 탐지에서 사전에 미리 훈련된 모델의 성능은 도메인 외 OOS(OOD-OOS) 및 인-스코프 예시에서의 성능과 비교해 볼 때 어떻게 되는가?
  • RQ3ID-OOS와 인-스코프 의도 간의 키워드 겹침이 마스킹 처리 후에도 모델의 잘못된 분류에 얼마나 기여하는가?
  • RQ4의도가 잘못 분류되었음에도 불구하고 모델이 ID-OOS 예시에 대해 높은 신뢰도 점수를 부여하는 이유는 무엇인가?
  • RQ5대조 학습 기반 기존의 소수의 예제 학습 방법은 ID-OOS 예시의 OOS 탐지 성능을 향상시킬 수 있는가?

주요 결과

  • 사전에 미리 훈련된 모델은 ID-OOS 예시에서 OOD-OOS 예시보다 인-스코프 정확도가 유의미하게 낮으며, 모델의 복잡도가 증가할수록 성능 격차가 커진다.
  • ID-OOS 탐지에 대해 OOS 재현율과 정밀도가 OOD-OOS에 비해 상당히 낮아, 의미적으로 유사하지만 지원되지 않는 의도에 대해 일반화가 잘 되지 않는다는 것을 시사한다.
  • ID-OOS와 인-스코프 의도 쌍 간의 상위 5개 겹치는 유니그램을 마스킹한 후에도 모델은 잘못된 인-스코프 클래스에 대해 높은 신뢰도 점수(예: 0.84 및 0.86)를 부여한다. 이는 키워드 외의 문맥적 단서에 의존하고 있음을 시사한다.
  • RoBERTa가 다른 모델들보다 일반적으로 더 잘 수행하지만, 특히 BANKING77와 같은 세분화되고 다양성이 높은 도메인에서는 ID-OOS 예시를 인-스코프 예시와 구분하지 못한다.
  • ToD-BERT는 작업 지향 대화 데이터로 사전에 미리 훈련되었지만 ID-OOS 탐지에서 떨어지는 성능을 보이며, 도메인 특화 사전 훈련이 OOS 의도 탐지에 강건성을 보장하지는 않음을 보여준다.
  • 대조 학습 기반 방법은 OOS 탐지 성능 향상에 유의미한 개선을 가져오지 못하며, 이는 현재의 소수의 예제 학습 기법이 ID-OOS 과제를 다루기에 충분하지 않음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.