Skip to main content
QUICK REVIEW

[논문 리뷰] Generate, Prune, Select: A Pipeline for Counterspeech Generation against Online Hate Speech

Wanzheng Zhu, Suma Bhat|arXiv (Cornell University)|2021. 06. 03.
Hate Speech and Cyberbullying Detection참고 문헌 54인용 수 5
한 줄 요약

이 논문은 온라인 혐오 발언에 대비해 다양하고 관련성이 높은 대응 발언을 생성하기 위한 세 단계 파이프라인인 GPS를 제안한다. 먼저 다수의 후보를 생성하고, BERT를 사용해 문법적으로 잘못된 반응을 필터링한 후, 새로운 검색 기반 방법을 통해 가장 관련성이 높은 반응을 선택함으로써 GPS는 자동 평가 및 인간 평가를 통해 세 가지 벤치마크 데이터셋에서 다양성과 관련성 측면에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Countermeasures to effectively fight the ever increasing hate speech online without blocking freedom of speech is of great social interest. Natural Language Generation (NLG), is uniquely capable of developing scalable solutions. However, off-the-shelf NLG methods are primarily sequence-to-sequence neural models and they are limited in that they generate commonplace, repetitive and safe responses regardless of the hate speech (e.g., "Please refrain from using such language.") or irrelevant responses, making them ineffective for de-escalating hateful conversations. In this paper, we design a three-module pipeline approach to effectively improve the diversity and relevance. Our proposed pipeline first generates various counterspeech candidates by a generative model to promote diversity, then filters the ungrammatical ones using a BERT model, and finally selects the most relevant counterspeech response using a novel retrieval-based method. Extensive Experiments on three representative datasets demonstrate the efficacy of our approach in generating diverse and relevant counterspeech.

연구 동기 및 목표

  • 기존의 순차적-순차적 모델이 혐오 발언에 대해 다양하고 관련성이 높은 대응 발언을 생성하는 데에 한계를 보이고 있는 문제를 해결하기 위해.
  • 생성, 필터링, 선택을 별도의 단계로 분리함으로써 품질을 향상시키는 가용성 있고 모듈러한 파이프라인을 개발하기 위해.
  • 생성된 반응이 일반적이고 반복적이거나 관련이 없는 답변을 피하면서 언어적 품질을 유지하도록 보장하기 위해.
  • 세 가지 벤치마크 데이터셋에서의 종합적 평가를 통해 파이프라인의 효과성을 입증하기 위해.

제안 방법

  • 후보 생성 모듈은 사전 훈련된 생성 모델을 사용하여 각 혐오 발언 입력에 대해 다양한 대응 발언 후보의 큰 풀을 생성한다.
  • 후보 필터링 모듈은 미세조정된 BERT 모델을 적용하여 후보 풀에서 문법적으로 잘못되었거나 품질이 낮은 반응을 제거한다.
  • 응답 선택 모듈은 혐오 발언과 필터링된 후보 간의 의미 유사도를 비교하여 가장 관련성이 높은 대응 발언을 선택하는 새로운 검색 기반 방법을 활용한다.
  • 파이프라인은 세 가지 별도의 단계로 통합된다: 다양성을 위한 생성, 품질을 위한 필터링, 관련성을 위한 검색 기반 선택.
  • 검색 기반 선택 방법은 조밀한 벡터 표현을 사용하여 주어진 혐오 발언 인스턴스에 가장 맥락적으로 적합한 대응 발언을 식별한다.

실험 결과

연구 질문

  • RQ1모듈러한 파이프라인 접근 방식이 종단 간 순차적-순차적 모델에 비해 대응 발언의 다양성과 관련성 향상에 기여할 수 있는가?
  • RQ2BERT 기반 필터링이 생성된 대응 발언 후보의 문법적 품질을 얼마나 향상시킬 수 있는가?
  • RQ3검색 기반 선택이 혐오 발언에 대해 맥락적으로 관련성이 높은 대응 발언을 선택하는 데서 생성 모델보다 우수한가?
  • RQ4GPS 파이프라인이 자동 평가 및 인간 평가 지표 측면에서 기존 방법과 비교해 어떻게 성능을 내는가?

주요 결과

  • GPS는 자동 평가 지표에서 세 가지 벤치마크 데이터셋에서 다양성과 관련성 측면에서 최신 기술 수준의 성능을 달성하며, 기존 생성 모델을 능가한다.
  • 인간 평가 결과, GPS가 생성한 반응은 기준 모델에 비해 유의미하게 더 관련성이 높고 반복적이지 않다는 것이 확인되었다.
  • 필터링 모듈은 문법적으로 잘못된 반응을 효과적으로 제거하여 후보 풀의 전체 품질을 향상시켰다.
  • 검색 기반 선택 방법은 맥락적으로 가장 적절한 대응 발언을 성공적으로 식별하여 관련 없거나 범위를 벗어난 반응의 수를 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.