Skip to main content
QUICK REVIEW

[논문 리뷰] Bayesian Methods for Semi-supervised Text Annotation

Kristian Miok, Gregor Pirš|arXiv (Cornell University)|2020. 10. 28.
Hate Speech and Cyberbullying Detection참고 문헌 54인용 수 5
한 줄 요약

이 논문은 혐오 발언 탐지에서 텍스트 주석 품질과 BERT 모델 성능을 향상시키기 위해 두 가지 베이지안 준지도 학습 방법을 제안한다: (1) 몬테 카를로 드롭아웃을 BERT에 적용하여 재주석이 필요한 불확실하고 신뢰할 수 없는 주석을 식별하고, (2) 다수의 모델 예측을 결합하기 위해 베이지안 앙상블(MM 모델)을 적용하여 校정성과 정확도를 향상시킨다. 결과적으로 불확실한 인스턴스를 제거하고 앙상블을 사용할 경우 F1 스코어가 상승하며, 특히 저품질 데이터셋에서 두드러진다.

ABSTRACT

Human annotations are an important source of information in the development of natural language understanding approaches. As under the pressure of productivity annotators can assign different labels to a given text, the quality of produced annotations frequently varies. This is especially the case if decisions are difficult, with high cognitive load, requires awareness of broader context, or careful consideration of background knowledge. To alleviate the problem, we propose two semi-supervised methods to guide the annotation process: a Bayesian deep learning model and a Bayesian ensemble method. Using a Bayesian deep learning method, we can discover annotations that cannot be trusted and might require reannotation. A recently proposed Bayesian ensemble method helps us to combine the annotators' labels with predictions of trained models. According to the results obtained from three hate speech detection experiments, the proposed Bayesian methods can improve the annotations and prediction performance of BERT models.

연구 동기 및 목표

  • 주석 과정 중에 신뢰할 수 없는 레이블을 식별하여 인간 주석 오류를 줄이고 데이터셋 품질을 향상시키기 위해.
  • 피팅 전에 불확실하거나 모호한 주석을 걸러내어 BERT 모델 성능을 향상시키기 위해.
  • annotator가 확률적 예측을 통해 일관성 있고 신뢰할 수 있는 주석을 내릴 수 있도록 지원하기 위해.
  • 저자원 및 多국어 혐오 발언 탐지 환경에서 베이지안 불확실성 추정과 앙상블 방법의 효과를 평가하기 위해.

제안 방법

  • 드롭아웃이 활성화된 상태에서 여러 번의 순방향 전파를 수행함으로써 예측 불확실성을 추정하기 위해 BERT에 몬테 카를로 드롭아웃(MCD)을 적용한다.
  • MCD 예측의 분산을 불확실성 측도로 사용하여 재주석이 필요한 인스턴스를 식별한다.
  • 고불확실성 인스턴스를 훈련 세트에서 제거하여 BERT 피팅을 위한 더 깔끔하고 균일한 데이터셋을 만든다.
  • 다양한 모델(BERT, 랜덤 포레스트, SVM)의 확률적 예측을 결합하기 위해 다변량 정규 분포 혼합 조건부 우도(MM) 모델을 적용한다.
  • 베이지안 추론을 활용해 예측을 校정하고 앙상블하여 전체 모델의 강인성과 校정성 향상.
  • 세 언어(영어, 크로아티아어, 슬로베니아어)에 걸쳐 불확실성 및 앙상블 성능을 평가한다.

실험 결과

연구 질문

  • RQ1BERT에서 몬테 카를로 드롭아웃이 재주석이 필요한 불신뢰성 있거나 모호한 주석을 효과적으로 식별할 수 있는가?
  • RQ2훈련 세트에서 고불확실성 인스턴스를 제거하면 BERT의 혐오 발언 탐지 성능이 향상되는가?
  • RQ3베이지안 앙상블 방법(MM)이 개별 모델 대비 예측 성능과 校정성 향상에 기여하는가?
  • RQ4제안된 방법의 성능은 저자원 및 고자원 언어 환경에서 어떻게 달라지는가?

주요 결과

  • 불확실한 인스턴스를 훈련 세트에서 제거함으로써 크로아티아어 데이터셋의 BERT F1 스코어는 0.70에서 0.66으로, 슬로베니아어 데이터셋은 0.71에서 0.59로 향상되어 저품질 데이터에서 일반화 능력 향상이 확인되었다.
  • 정제된 데이터셋은 수렴 속도를 빠르게 하고 검증 F1 스코어를 높였으며, 정제된 영어 데이터셋에서 BERT는 4번째 에포크에 F1 0.98을 달 đạt했다.
  • MM 베이지안 앙상블은 모든 언어에서 F1 스코어를 향상시켰다: 영어는 BERT 단독 시 0.91에서 MM로 0.92로, 크로아티아어는 0.72에서 0.74로, 슬로베니아어는 0.71에서 0.72로 향상되었다.
  • 캘리브레이션 플롯(그림 1)을 통해 MM 앙상블은 BERT 단독 모델 대비 더 잘 校정된 예측을 생성했다.
  • 특히 크로아티아어 데이터셋처럼 주석 품질이 낮은 데이터셋에서 이 방법이 특히 효과적이며, 이 경우 성능 향상이 가장 두드러졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.