Skip to main content
QUICK REVIEW

[논문 리뷰] Estimating Confidence of Predictions of Individual Classifiers and Their Ensembles for the Genre Classification Task

Mikhail Lepekhin, Serge Sharoff|arXiv (Cornell University)|2022. 06. 15.
Authorship Attribution and Profiling인용 수 4
한 줄 요약

이 논문은 텍스트 장르 분류를 위한 개별 및 앙상블 분류기의 강건성 평가 및 향상을 위해 몬테카를로 드롭아웃을 통한 예측 신뢰도 추정을 제안한다. 실험 결과, XLM-RoBERTa와 로지스틱 회귀 모델의 앙상블이 잘못된 예측 대비 올바른 예측에서 유의미하게 높은 신뢰도 갭을 보이며, 특히 데이터셋 이동 조건에서 더 신뢰할 수 있고 정확한 장르 분류를 가능하게 한다.

ABSTRACT

Genre identification is a subclass of non-topical text classification. The main difference between this task and topical classification is that genres, unlike topics, usually do not correspond to simple keywords, and thus they need to be defined in terms of their functions in communication. Neural models based on pre-trained transformers, such as BERT or XLM-RoBERTa, demonstrate SOTA results in many NLP tasks, including non-topical classification. However, in many cases, their downstream application to very large corpora, such as those extracted from social media, can lead to unreliable results because of dataset shifts, when some raw texts do not match the profile of the training set. To mitigate this problem, we experiment with individual models as well as with their ensembles. To evaluate the robustness of all models we use a prediction confidence metric, which estimates the reliability of a prediction in the absence of a gold standard label. We can evaluate robustness via the confidence gap between the correctly classified texts and the misclassified ones on a labeled test corpus, higher gaps make it easier to improve our confidence that our classifier made the right decision. Our results show that for all of the classifiers tested in this study, there is a confidence gap, but for the ensembles, the gap is bigger, meaning that ensembles are more robust than their individual models.

연구 동기 및 목표

  • 대규모 소셜미디어 코퍼스에서 데이터셋 이동 상황에서도 텍스트 장르 분류의 신뢰성을 향상시키기 위해.
  • 몬테카를로 드롭아웃 기반의 신뢰도 지표를 사용하여 개별 분류기와 그 앙상블의 강건성을 평가하기 위해.
  • 앙상블 모델이 개별 모델 대비 예측 신뢰도와 분류 정확도 측면에서 우월한가를 조사하기 위해.
  • 저자원 및 도메인 외부 설정에서 모델 아키텍처와 하이퍼파라미터가 장르 분류 성능에 미치는 영향을 평가하기 위해.
  • 오픈세트 장르 분류에 신뢰도 임계값을 사용하는 것이 가능한가를 탐색하기 위해.

제안 방법

  • 추론 중 드롭아웃을 활성화한 다중 순방향 전파를 통해 유도된 불확실도를 기반으로 1 - 불확실도로 정의된 지표를 사용해 예측 신뢰도를 추정한다.
  • 모든 레이어(임bedding 및 최종 분류 레이어 포함)에 드롭아웃 확률 0.1을 적용하여 다중 확률 분포를 생성한다.
  • n개의 확률 분포를 융합하여 풀링된 분포 p̂를 생성하며, 여기서 최대값이 신뢰도 점수로 사용된다.
  • 이전 실험에서 확보한 최적의 하이퍼파라미터를 사용해 러시아 FTD 코퍼스에서 XLM-RoBERTa와 RuBERT를 훈련 및 미세조정한다.
  • XLM-RoBERTa, RuBERT, 그리고 로지스틱 회귀 분류기를 조합하여 앙상블을 구성하며, 추론은 평균화 또는 투표 방식으로 수행된다.
  • 보류된 테스트 세트에서 모델 성능을 평가하고, 맨-위트니 U 검정을 사용해 올바르게 분류된 예와 잘못 분류된 예 사이의 신뢰도 갭을 측정한다.

실험 결과

연구 질문

  • RQ1장르 분류에서 개별 분류기와 그 앙상블 간에 올바른 예측과 잘못된 예측 사이의 신뢰도 갭이 유의미하게 다른가?
  • RQ2데이터셋 이동 조건에서 앙상블 모델이 개별 모델보다 더 높은 분류 정확도와 더 신뢰할 수 있는 예측을 달성할 수 있는가?
  • RQ3약한 분류기(예: 로지스틱 회귀)를 앙상블에 포함시키는 것이 전체 성능과 신뢰도에 어떤 영향을 미치는가?
  • RQ4다양한 소셜미디어 플랫폼 간 장르 분포는 어느 정도로 다를 수 있으며, 이는 모델 일반화에 어떤 영향을 미치는가?
  • RQ5낮은 신뢰도 예측을 거부함으로써 신뢰도 추정이 오픈세트 장르 분류에 효과적으로 활용될 수 있는가?

주요 결과

  • 앙상블 모델은 개별 분류기보다 항상 더 넓은 신뢰도 갭을 보이며, 이는 더 높은 강건성을 의미한다.
  • 로지스틱 회귀 분류기를 포함한 앙상블이 대부분의 장르에서 가장 높은 f1-스코어와 가장 안정적인 신뢰도 갭을 기록하여, 개별 모델과 다른 앙상블 구성보다 뛰어난 성능을 보였다.
  • 앙상블에 로지스틱 회귀 분류기를 추가함으로써 계산 비용을 거의 증가시키지 않으면서도 정확도가 크게 향상되어, 경량이지만 효과적인 구성 요소임을 입증했다.
  • 신뢰도 지표는 낮은 신뢰도를 보이는 잘못 분류된 예를 성공적으로 식별하여, 오픈세트 분류 시나리오에서의 활용 가능성을 뒷받침했다.
  • XLM-RoBERTa와 RuBERT 모델은 FTD 코퍼스에서 높은 정확도를 달성하여, BERT 기반 미세조정 최적 실천 방법이 러시아어 및 다국어 환경으로도 확장 가능함을 입증했다.
  • 카이제곱 검정 결과, 소셜미디어 플랫폼 간 장르 분포에 유의미한 차이가 있음을 확인했으며(예: LiveJournal에는 더 많은 논증적 텍스트, VK에는 더 많은 개인 보고 텍스트), 이는 도메인 이동 문제를 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.