Skip to main content
QUICK REVIEW

[논문 리뷰] WLV-RIT at GermEval 2021: Multitask Learning with Transformers to Detect Toxic, Engaging, and Fact-Claiming Comments

Skye Morgan, Tharindu Ranasinghe|arXiv (Cornell University)|2021. 07. 30.
Hate Speech and Cyberbullying Detection인용 수 4
한 줄 요약

이 논문은 GermEval 2021에 제출된 WLV-RIT의 결과로, 독성, 참여 유도, 사실 주장 여부를 동시에 탐지하기 위해 독일어 최적화된 트랜스포머 모델—gBERT 및 gELECTRA를 사용한 다중 작업 학습(MTL) 방법을 제안한다. MTL은 모든 세 가지 작업에서 단일 작업 학습(STL)을 뛰어넘는 성능을 보였으며, 가장 우수한 시스템은 사실 주장 여부 탐지에서 F1 스코어 0.7653, 참여 유도 댓글 탐지에서 0.7198을 기록했다.

ABSTRACT

This paper addresses the identification of toxic, engaging, and fact-claiming comments on social media. We used the dataset made available by the organizers of the GermEval-2021 shared task containing over 3,000 manually annotated Facebook comments in German. Considering the relatedness of the three tasks, we approached the problem using large pre-trained transformer models and multitask learning. Our results indicate that multitask learning achieves performance superior to the more common single task learning approach in all three tasks. We submit our best systems to GermEval-2021 under the team name WLV-RIT.

연구 동기 및 목표

  • 독일어 소셜미디어 플랫폼에서 독성, 참여 유도, 사실 주장 여부 댓글을 다중 유형으로 탐지하는 과제를 해결하기 위해.
  • 공유된 트랜스포머 표현을 활용한 다중 작업 학습(MTL)이 이와 유사한 분류 과제에서 단일 작업 학습(STL) 대비 성능 향상을 이끌 수 있는지 조사하기 위해.
  • 다중 작업 학습(MTL)의 맥락에서 사전 훈련된 언어 모델(LM)의 미세조정이 모델 성능에 미치는 영향을 평가하기 위해.
  • 이 공통 과제에서 다국어 BERT(mBERT)와 독일어 전용 대규모 언어 모델(gBERT 및 gELECTRA) 간의 효과성을 비교하기 위해.
  • GermEval 2021 공동 과제에 최고 성능을 보인 시스템을 제출하고, 테스트 세트에서의 성능을 분석하기 위해.

제안 방법

  • GermEval 2021 데이터셋에 대해 mBERT, gBERT, gELECTRA와 같은 대규모 사전 훈련된 트랜스포머 모델을 미세조정하여 세 가지 관련 분류 과제를 수행했다.
  • 단일 모델이 독성, 참여 유도, 사실 주장 여부 세 가지 레이블을 동시에 예측하는 다중 작업 학습(MTL) 프레임워크를 구현했다.
  • 공유 표현 학습의 성능 향상을 평가하기 위해 MTL을 단일 작업 학습(STL)과 비교했다.
  • 일반화 성능 향상을 위해 미세조정 중에 마스킹 언어 모델링(MLM) 사전 훈련을 보조 목적(LM)으로 통합했다.
  • 다양한 랜덤 시드를 가진 다섯 개의 모델에서 다수결 투표를 통해 예측의 견고성을 향상시켰다.
  • 검증 세트 성능를 기반으로 하이퍼파rameter(초기 학습률 = 1e-5, 에포크 수 = 3, 배치 크기 = 8)를 최적화하고 조기 정지 기법을 적용했다.

실험 결과

연구 질문

  • RQ1공유된 트랜스포머 표현을 활용한 다중 작업 학습(MTL)이 단일 작업 학습(STL) 대비 독성, 참여 유도, 사실 주장 여부 댓글 탐지 성능을 향상시키는가?
  • RQ2이 다중 레이블 분류 과제에서 독일어 전용 대규모 언어 모델(gBERT, gELECTRA)과 다국어 BERT(mBERT)의 성능는 어떻게 비교되는가?
  • RQ3마스킹 언어 모델링(LM)을 통한 사전 훈련이 다중 작업 설정에서 성능 향상에 얼마나 기여하는가?
  • RQ4모델 아키텍처와 학습 전략(MTL 대 STL, LM 대 미사용)의 어떤 조합이 세 과제 모두에서 가장 높은 F1 스코어를 달성하는가?
  • RQ5유사한 과제 간의 공유 학습이 독일어 소셜미디어 텍스트와 같은 저자원 NLP 환경에서 계산 비용을 줄이고 성능을 향상시킬 수 있는가?

주요 결과

  • 다중 작업 학습(MTL)은 모든 세 과제에서 단일 작업 학습(STL)을 일관되게 뛰어넘었으며, MTL 설정에서 가장 높은 F1 스코어를 기록했다.
  • 언어 모델링(LM)과 MTL을 모두 적용한 gELECTRA 모델이 전체적으로 가장 뛰어난 성능을 보였으며, 독성 댓글 탐지에서 F1 스코어 0.7342, 참여 유도 댓글 탐지에서 0.7198, 사실 주장 여부 탐지에서 0.7653을 기록했다.
  • gELECTRA와 gBERT는 모든 과제에서 mBERT를 뛰어넘었으며, 이는 언어별 사전 훈련이 독일어 텍스트 처리 성능 향상에 기여함을 시사한다.
  • 미세조정 중 언어 모델링(LM)을 통합함으로써 여러 설정에서 성능 향상이 관찰되었으며, 특히 MTL 설정에서 두드러졌다.
  • 가장 뛰어난 성능을 보인 모델들(gELECTRA with LM+MTL, gELECTRA with MTL, gBERT with LM+MTL)은 세 과제 모두에서 테스트 세트에서 상위 3개 내에 진입했다.
  • 결과는 MTL을 통한 공유 표현 학습이 일반화 능력과 효율성을 향상시키며, 과제들이 의미적으로 유사할 경우 尤 향상된다는 점을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.