Skip to main content
QUICK REVIEW

[논문 리뷰] Fighting Offensive Language on Social Media with Unsupervised Text Style Transfer

Cícero Nogueira dos Santos, Igor Melnyk|arXiv (Cornell University)|2018. 05. 20.
Hate Speech and Cyberbullying Detection인용 수 4
한 줄 요약

이 논문은 병렬 훈련 데이터가 필요 없이 공격적인 소셜 미디어 게시물을 비공격적인 버전으로 변환하는 비지도 텍스트 스타일 전이 방법을 제안한다. 공동 분류기, 어텐션 메커니즘, 사이클 일致성 손실을 조합함으로써, 모델은 스타일 전이에서 최신 기술 수준의 성능을 달성하여, 텍스트의 내용을 유지하면서도 자연스럽고 비공격적인 출력을 생성함으로써 트위터와 레딧 데이터에서 이전 연구를 능가한다.

ABSTRACT

We introduce a new approach to tackle the problem of offensive language in online social media. Our approach uses unsupervised text style transfer to translate offensive sentences into non-offensive ones. We propose a new method for training encoder-decoders using non-parallel data that combines a collaborative classifier, attention and the cycle consistency loss. Experimental results on data from Twitter and Reddit show that our method outperforms a state-of-the-art text style transfer system in two out of three quantitative metrics and produces reliable non-offensive transferred sentences.

연구 동기 및 목표

  • 공격적인 언어를 필터링하는 대신, 원래 의미를 유지하면서 공격적인 내용을 예의 바르고 비공격적인 버전으로 변환함으로써 소셜 미디어에서의 공격적 언어 문제를 해결하고자 한다.
  • 병행 훈련 데이터가 존재하지 않는 공격적 언어에서 비공격적 언어로의 번역에 대비해, 병행 데이터가 없는 비지도 텍스트 스타일 전이 프레임워크를 개발하고자 한다.
  • 지표 문장 쌍이 없는 상황에서 어텐션과 사이클 일치성 손실을 활용하여 내용 보존 및 스타일 전이 품질을 향상시키고자 한다.
  • 실제 트위터와 레딧 데이터를 기반으로 한 공격적에서 비공격적 텍스트 스타일 전이를 위한 두 가지 벤치마크 데이터셋을 제안하고자 한다.

제안 방법

  • 입력 문장을 인코딩하고 목표 스타일(공격적 → 비공격적)로 디코딩하기 위해 GRU 기반 RNN을 사용하는 인코더-디코더 아키텍처를 사용한다.
  • 스태이블한 훈련을 위해 적대적 판별기를 대체하여 스타일 전이를 위한 훈련 신호를 제공하는 공동 분류기(CNN)를 도입한다.
  • 디코딩 중 은닉 상태를 정렬하기 위해 어텐션 메커니즘을 활용하여 생성된 문장의 내용 유지 및 유창성 향상을 도모한다.
  • 원래 문장을 재구성하기 위해 전환된 문장을 다시 역변환함으로써 사이클 일치성 손실을 적용하여 내용 보존을 강화한다.
  • 동일 스타일 재구성에 대한 교차 엔트로피 손실과 사이클 일치성, 분류 손실을 조합하여 모델을 종합적으로 훈련한다.
  • 트위터와 레딧에서의 공격적 및 비공격적 문장 비병행 코퍼스를 사용하여, 스타일 레이블만을 감독 신호로 사용해 모델을 훈련한다.

실험 결과

연구 질문

  • RQ1비지도 텍스트 스타일 전이가 병행 데이터 없이 공격적인 소셜 미디어 언어를 비공격적이고 자연스럽고 의미적으로 보존된 버전으로 효과적으로 변환할 수 있는가?
  • RQ2제안된 방법은 스타일 전이 정확도, 내용 보존, 유창성 측면에서 최신 비지도 스타일 전이 기법과 비교해 어떻게 성능을 내는가?
  • RQ3어텐션과 사이클 일치성 손실이 스타일 전이 동안 내용 보존에 얼마나 기여하는가?
  • RQ4모델 출력에서 흔히 발생하는 오류는 무엇이며, 이는 퍼플렉서티와 의미적 충실도에 어떤 영향을 미치는가?

주요 결과

  • 레딧 데이터셋에서 모델은 분류 정확도 99.54%, 내용 보존도 0.933, 퍼플렉서티 115.75를 기록하여 셴 등(2017)의 연구를 내용 보존도와 정확도 측면에서 능가했다.
  • 트위터 데이터셋에서 모델은 정확도 99.63%, 내용 보존도 0.947, 퍼플렉서티 162.75를 기록하여 스타일 전이 및 내용 유지 측면에서 뛰어난 성능을 보였다.
  • 제거 실험 결과, 어텐션과 역전이 손실을 모두 제거할 경우 내용 보존도는 0.876으로 떨어지고 퍼플렉서티는 751.56으로 상승하여, 이 두 요소가 유창성과 충실도의 균형을 이루는 데 핵심적인 역할을 함을 입증했다.
  • 정성적 분석 결과, 기존 모델들이 종종 문장 내용을 크게 변경하는 데 반해, 본 모델은 공격적인 단어를 비공격적인 동등어로 효과적으로 대체하면서도 문장 구조를 유지하는 데 성공했다.
  • 높은 정확도와 내용 보존도에도 불구하고, 일부 경우에서 일반적인 비공격적 단어(예: 'f***ing'에 대해 'big')의 과도한 사용으로 자연스럽지 않은 어조가 발생하여 퍼플렉서티가 높아졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.