Skip to main content
QUICK REVIEW

[논문 리뷰] FHAC at GermEval 2021: Identifying German toxic, engaging, and fact-claiming comments with ensemble learning

Tobias Bornheim, Niklas Grieger|arXiv (Cornell University)|2021. 09. 07.
Natural Language Processing Techniques참고 문헌 21인용 수 5
한 줄 요약

이 논문은 GermEval 2021 공동 과제에서 독성, 유도성, 사실 진술 유형으로 분류하기 위해 미세튜닝된 독일어 BERT와 ELECTRA 모델의 앙상블을 제안한다. 200개 이상의 모델을 활용한 소프트 majority voting를 통해 최고의 앙상블은 매크로-F1 점수 0.73를 기록하였으며, 이는 앙상블 크기가 커질수록 성능 향상이 이루어지고, 모델 조합 및 다중 레이블 vs. 단일 레이블 학습 방식에 대해 강건함을 보여준다.

ABSTRACT

The availability of language representations learned by large pretrained neural network models (such as BERT and ELECTRA) has led to improvements in many downstream Natural Language Processing tasks in recent years. Pretrained models usually differ in pretraining objectives, architectures, and datasets they are trained on which can affect downstream performance. In this contribution, we fine-tuned German BERT and German ELECTRA models to identify toxic (subtask 1), engaging (subtask 2), and fact-claiming comments (subtask 3) in Facebook data provided by the GermEval 2021 competition. We created ensembles of these models and investigated whether and how classification performance depends on the number of ensemble members and their composition. On out-of-sample data, our best ensemble achieved a macro-F1 score of 0.73 (for all subtasks), and F1 scores of 0.72, 0.70, and 0.76 for subtasks 1, 2, and 3, respectively.

연구 동기 및 목표

  • 독일어 자연어 처리 작업에서 앙상블 크기, 구성 및 다중 레이블 대비 단일 레이블 학습의 영향을 조사하기 위해.
  • GermEval 2021 공동 과제에서 독성, 유도성, 사실 진술 유형의 댓글을 식별하기 위해 미세튜닝된 독일어 BERT(GBERT) 및 ELECTRA(GELECTRA) 모델을 평가하기 위해.
  • 이 상황에서 레이블 상관관계를 활용하는 다중 레이블 모델이 단일 레이블 모델보다 성능이 향상되는지 여부를 확인하기 위해.
  • 저자원 독일어 자연어 처리 환경에서의 최종 분류 성능에 영향을 미치는 모델 아키텍처 및 사전학습 목표의 영향을 분석하기 위해.

제안 방법

  • GermEval 2021 데이터셋의 3,244개 익명화된 페이스북 댓글에 대해 다국어 독일어 BERT(GBERT) 및 ELECTRA(GELECTRA) 모델을 미세튜닝함.
  • 일반화 및 강건성을 향상시키기 위해 다수의 미세튜닝된 모델을 소프트 majority voting 방식으로 앙상블 구성함.
  • 성능 추세를 분석하기 위해 5겹 교차검증을 기반으로 앙성 크기(최대 100개)가 다른 1,000개의 재표본화된 앙상블을 포함한 부트스트랩 실험을 수행함.
  • 100% GBERT, 100% GELECTRA, 50/50 GBERT-GELECTRA 조합의 앙상블를 비교하였으며, 다중 레이블 및 단일 레이블 분류기 설정도 비교함.
  • 최종 제출를 위해 전체 훈련 데이터 기반으로 200개의 다중 레이블 앙상블 및 200개의 다중 레이블 앙상블, 30개의 단일 레이블 앙상블을 훈련 및 평가함.
  • 모든 하위작업에서 매크로-F1을 주 평가 지표로 사용하였으며, 성능은 5겹 교차검증 평균값으로 평균화함.

실험 결과

연구 질문

  • RQ1독성, 유도성, 사실 진술 유형의 독일어 댓글 분류에서 앙상블 구성원 수를 늘일수록 매크로-F1 성능이 향상되는가?
  • RQ2특히 GBERT와 GELECTRA 모델의 조합 비율이 앙상블 성능에 영향을 미치는가?
  • RQ3레이블 상관관계를 활용하는 다중 레이블 모델이 이 다중 분류 작업에서 단일 레이블 모델보다 성능이 뛰어나게 되는가?
  • RQ4일정한 앙상블 크기 이상에서 성능 향상에 포화점이 존재하는가?

주요 결과

  • 최고 성능 앙상블은 테스트 세트에서 매크로-F1 점수 0.73를 기록하였으며, 하위작업 1(독성), 2(유도성), 3(사실 진술)의 F1 점수는 각각 0.72, 0.70, 0.76였다.
  • 앙상블 크기가 커질수록 분류 성능이 향상되었으며, 특히 15명 이내에서 가장 큰 성과를 보였고, 30명 이상에서도 계속 개선됨을 확인함.
  • 30명 이상의 앙상블에서 100% GELECTRA, 100% GBERT, 50/50 GBERT-GELECTRA 조합 모두 유사한 매크로-F1 점수를 기록하여 어떤 조합도 유의미한 이점이 없음을 시사함.
  • 30명 이상의 앙상블에서 다중 레이블 및 단일 레이블 앙상블 간 성능에 통계적으로 유의미한 차이가 없었으며, 이는 이 설정에서는 레이블 상관관계를 활용해도 결과에 큰 영향을 주지 않음을 의미함.
  • 제출 후 소프트웨어 버그로 인해 단일 레이블 앙상블(30 GBERT + 30 GELECTRA)의 보고 점수가 영향을 받았으며, 이후 수정되어 매크로-F1 0.73로 조정되었고, 이는 최고 성능 앙상블과 동일함.
  • 본 연구는 앙성 크기가 성능에 가장 큰 영향을 미치며, 30명 이상에서는 수익 감소 현상이 나타나며, 충분히 큰 앙성에서는 모델 선택(GBERT 대비 GELECTRA)이 최종 성능에 미치는 영향이 미미함을 확인함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.