Skip to main content
QUICK REVIEW

[논문 리뷰] APPDIA: A Discourse-aware Transformer-based Style Transfer Model for Offensive Social Media Conversations

Katherine Atwell, Sabit Hassan|arXiv (Cornell University)|2022. 09. 17.
Hate Speech and Cyberbullying Detection인용 수 11
한 줄 요약

이 논문은 펜 논의 트리뱅크와 비판적 구조 이론을 통해 논의 관계를 통합함으로써 모호성 없는 의미를 유지하면서 레딧 댓글의 모욕성을 감소시키는 discourse-aware Transformer 기반 스타일 전이 모델인 APPDIA를 소개한다. 인간 평가에서 내용 보존(48% 선호도 대비 기준 36%)과 일관성(37% 대비 32%) 측면에서 유의미한 향상을 이룩하였으며, 특히 명시적인 논의 구조를 지닌 댓글에서 두드러진 성능 향상을 보였다.

ABSTRACT

Using style-transfer models to reduce offensiveness of social media comments can help foster a more inclusive environment. However, there are no sizable datasets that contain offensive texts and their inoffensive counterparts, and fine-tuning pretrained models with limited labeled data can lead to the loss of original meaning in the style-transferred text. To address this issue, we provide two major contributions. First, we release the first publicly-available, parallel corpus of offensive Reddit comments and their style-transferred counterparts annotated by expert sociolinguists. Then, we introduce the first discourse-aware style-transfer models that can effectively reduce offensiveness in Reddit text while preserving the meaning of the original text. These models are the first to examine inferential links between the comment and the text it is replying to when transferring the style of offensive Reddit text. We propose two different methods of integrating discourse relations with pretrained transformer models and evaluate them on our dataset of offensive comments from Reddit and their inoffensive counterparts. Improvements over the baseline with respect to both automatic metrics and human evaluation indicate that our discourse-aware models are better at preserving meaning in style-transferred text when compared to the state-of-the-art discourse-agnostic models.

연구 동기 및 목표

  • 소셜 미디어에서 모욕성에서 비모욕성 스타일 전이를 위한 병렬이며 전문가가 주석 처리한 데이터셋의 부족 문제를 해결하기 위해.
  • 모욕성 레딧 댓글의 스타일 전이 과정에서 논의 구조를 통합하여 의미적 내용 보존을 향상시키기 위해.
  • 댓글과 그 부모 게시물 간의 추론적 연결을 활용하는 논의 인식 기반 Transformer 모델을 개발하고 평가하기 위해.
  • 논의 인식 기반 모델이 자동 평가 및 인간 평가 지표 모두에서 논의 무관 기반 베이스라인을 능가함을 입증하기 위해.
  • 모욕성 레딧 댓글과 그 비모욕성 대응어, 논의 관계 태그가 포함된 첫 번째 공개 가능한 전문가 주석 처리 데이터셋을 제공하기 위해.

제안 방법

  • 전문 사회언어학자들을 활용해 약 2,000개의 모욕성 레딧 댓글을 비모욕성 대응어와 함께 주석 처리하여 병렬 코퍼스를 구축한다.
  • 개별 댓글 내부의 논의 구조를 모델링하기 위해 펜 논의 트리뱅크 관계를 통합한다.
  • 댓글-부모 게시물 쌍을 비판적 구조 이론(Rhetorical Structure Theory, RST) 논의 트리로 분석하여 문장 간 관계를 모델링한다.
  • 논의 인식 주의 메커니즘을 갖춘 프리트레인된 Transformer 모델(BART, T5 등)을 미세조정하여 스타일 전이를 유도한다.
  • 내부 댓글 관계를 사용하는 버전과 문장 간 RST 관계를 사용하는 버전을 별도로 학습한다.
  • 내용 보존, 일관성, 총합 선호도 평가를 포함한 자동 평가 및 인간 평가를 통해 모델을 평가한다.

실험 결과

연구 질문

  • RQ1논의 인식 통합이 논의 무관 기반 베이스라인 대비 의미적 내용 보존을 향상시키는가?
  • RQ2댓글 내 논의 관계의 존재가 스타일 전이 모델의 성능에 어떤 영향을 미치는가?
  • RQ3논의 인식 모델이 짧은 소셜 미디어 텍스트에서 모욕성을 감소시키는 동안 원본 의미를 어느 정도 유지하는가?
  • RQ4다양한 논의 프레임워크(예: PDTB 및 RST)를 결합하면 단일 프레임워크 사용보다 더 나은 내용 보존을 이룰 수 있는가?
  • RQ5논의 구문 분석이 모욕성 댓글의 스타일 전이 결과물의 일관성과 의미 정확도를 향상시키는가?

주요 결과

  • 논의 인식 모델은 내용 보존에 대해 48%의 선호도를 기록하여 논의 무관 기반 베이스라인의 36%보다 유의미하게 높게 나타났다.
  • 논의 관계를 포함한 댓글의 경우, 논의 인식 모델은 내용 보존에서 56%의 선호도를 기록했고, 베이스라인은 30%에 그쳤다.
  • 논의 인식 모델은 일관성 측면에서 37%로 베이스라인의 32%를 상회했으며, 특히 내용 보존 측면에서 더 두드러진 효과를 보였다.
  • 인간 평가 결과, 논의 인식 모델은 총합에서 40%의 선호도를 기록했고, 베이스라인은 29%였다.
  • 결과는 논의 통합이 부모 콘텐츠와의 추론적 또는 비판적 연결이 명시적으로 존재하는 댓글에서 특히 효과적임을 시사한다.
  • 본 연구는 논의 인식 기반 모델가 표준 미세조정된 Transformer보다 모욕성에서 비모욕성 스타일 전이 과정에서 의미적 의미를 더 잘 유지함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.