Skip to main content
QUICK REVIEW

[논문 리뷰] NLPDove at SemEval-2020 Task 12: Improving Offensive Language Detection with Cross-lingual Transfer

Hwijeen Ahn, Jimin Sun|arXiv (Cornell University)|2020. 08. 04.
Hate Speech and Cyberbullying Detection참고 문헌 31인용 수 5
한 줄 요약

이 논문은 SemEval-2020 Task 12에서 성능 향상을 위해 다국어 간 전이와 데이터 증강을 활용하는 다국어 공격적 언어 탐지 시스템인 NLPDove를 제시한다. 다른 언어에서 전이 가능한 예제를 선별하기 위해 번역 임베딩 거리(TED)를 도입하고, mBERT의 언어별 사전처리를 통한 미세조정을 강화하여 그리스어(1위), 덴마크어(3위), 터키어(5위)에서 최신 기술 성과를 달성한다.

ABSTRACT

This paper describes our approach to the task of identifying offensive languages in a multilingual setting. We investigate two data augmentation strategies: using additional semi-supervised labels with different thresholds and cross-lingual transfer with data selection. Leveraging the semi-supervised dataset resulted in performance improvements compared to the baseline trained solely with the manually-annotated dataset. We propose a new metric, Translation Embedding Distance, to measure the transferability of instances for cross-lingual data selection. We also introduce various preprocessing steps tailored for social media text along with methods to fine-tune the pre-trained multilingual BERT (mBERT) for offensive language identification. Our multilingual systems achieved competitive results in Greek, Danish, and Turkish at OffensEval 2020.

연구 동기 및 목표

  • 다른 언어로 번역된 공격적 언어 탐지 문제를 해결하기 위해 이중 공격/비공격 레이블만 존재하는 저자원 다국어 환경에서의 도전 과제를 다루기.
  • 반감독 학습 레이블과 다국어 간 데이터 전이를 활용하여 모델의 일반화 능력과 강건성을 향상시키기.
  • 공격적 단어 존재 여부에만 의존하는 것의 한계를 극복하기 위해 데이터 증강과 사전처리를 통해 맥락 이해를 장려하기.
  • 노이즈가 많은 소셜 미디어 텍스트에 적합한 맞춤형 사전처리를 통한 다국어 BERT 미세조정의 효과를 탐구하기.
  • 다국어 간 학습에서 효과적인 데이터 선택을 위해 언어 간 예제의 전이 가능성 수치화를 위한 신뢰할 수 있는 메트릭 개발하기.

제안 방법

  • 영어 데이터셋에 대해 반감독 학습 데이터셋에서 고신뢰도 예측을 필터링하고 학습 세트에 통합함으로써 데이터 증강을 적용한다.
  • 다국어 간 데이터 선택을 위한 새로운 메트릭으로 번역 임베딩 거리(TED)를 제안한다.
  • 사용자 언급, URL, 해시태그, 이모티콘 등을 처리하기 위한 언어별 사전처리 파이프라인을 구현한다.
  • 다양한 표현 레이어, 풀링 메커니즘, 랜덤 시드를 사용하여 mBERT를 미세조정하여 강건성을 향상시킨다.
  • 다양한 풀링 메커니즘과 랜덤 시드를 가진 여러 mBERT 변종을 조합한 앙상블 모델을 구축하여 예측 안정성과 성능을 향상시킨다.
  • 학습 중 공격적 어휘를 마스킹하여 맥락 인식 학습을 장려하지만, 이는 정량적 성과 향상에 기여하지 못했다.

실험 결과

연구 질문

  • RQ1모델 예측에서 유도된 반감독 레이블이 저자원 환경에서 공격적 언어 탐지 성능 향상에 기여하는가?
  • RQ2다양한 언어 간 전이 가능한 예제를 선택함으로써 다국어 간 전이가 공격적 언어 탐지에 얼마나 효과적인가?
  • RQ3제안된 번역 임베딩 거리(TED) 메트릭이 다국어 간 전이를 위한 데이터 선택에 얼마나 기여하는가?
  • RQ4소셜 미디어 텍스트에 특화된 사전처리가 노이즈가 많고 비공식적인 언어에서 모델 성능 향상에 기여하는가?
  • RQ5학습 중 공격적 단어를 마스킹하는 것이 맥락 이해를 향상시키고 어휘적 단서 의존도를 감소시키는가?

주요 결과

  • 반감독 레이블의 사용은 수동으로 레이블링된 데이터만으로 학습한 기준 모델 대비 성능 향상을 이끌었다.
  • 제안된 TED 메트릭은 전이 가능한 예제를 효과적으로 식별하여 다국어 간 전이 성능 향상에 기여했다.
  • 다양한 풀링 메커니즘과 랜덤 시드를 가진 mBERT 앙상블 모델은 강력한 성과를 기록했으며, 그리스어(1위)에서 매크로 F1 점수 0.85, 덴마크어(3위)에서 0.79, 터키어(5위)에서 0.80을 기록했다.
  • 노력에도 불구하고 학습 중 단어 마스킹은 성능 향상에 기여하지 못했으며, 실제로는 악영향을 줄 수 있었는데, 이는 실제로 공격적인 어휘까지 과도하게 마스킹했기 때문일 것이다.
  • 정성적 분석 결과, 모델은 여전히 "f*cking awesome"과 같은 비공격적 맥락에서도 공격적 어휘에 과도하게 의존하는 것으로 나타났다.
  • 영어(15위/86명)와 아랍어(20위/54명)에서도 경쟁력 있는 성과를 기록하여, 자원 수준이 다양한 언어 간에서도 이 방법의 확장성이 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.