[논문 리뷰] Counter Hate Speech in Social Media: A Survey
이 종합 검토는 자유의 표현을 유지하면서 혐오 발언을 방지하기 위한 능동적 접근으로서 소셜 미디어에서의 반혐오 발언(Counter-Hate Speech, CHS) 생성을 조사한다. 기존 연구를 종합하여 방법론, 데이터셋, 영향 평가를 분류하고, 종단적 댓글 시퀀스 분석의 부재와 CHS 간섭의 실제 효과에 대한 불확실성과 같은 격차를 부각시킨다.
With the high prevalence of offensive language against minorities in social media, counter-hate speeches (CHS) generation is considered an automatic way of tackling this challenge. The CHS is supposed to appear as a third voice to educate people and keep the social [red lines bold] without limiting the principles of freedom of speech. In this paper, we review the most important research in the past and present with a main focus on methodologies, collected datasets and statistical analysis CHS's impact on social media. The CHS generation is based on the optimistic assumption that any attempt to intervene the hate speech in social media can play a positive role in this context. Beyond that, previous works ignored the investigation of the sequence of comments before and after the CHS. However, the positive impact is not guaranteed, as shown in some previous works. To the best of our knowledge, no attempt has been made to survey the related work to compare the past research in terms of CHS's impact on social media. We take the first step in this direction by providing a comprehensive review on related works and categorizing them based on different factors including impact, methodology, data source, etc.
연구 동기 및 목표
- 소셜 미디어 플랫폼에서 少수자 집단을 대상으로 하는 혐오 발언의 증가 추세를 다루기 위해.
- 자신의 표현 자유를 억압하지 않고 사용자를 교육하는 제3자 간섭으로서의 자동화된 반혐오 발언의 역할을 검토하기 위해.
- 특히 간섭 전후의 댓글 시퀀스 역학을 고려할 때, CHS의 장기적 영향 평가에 대한 연구 격차를 특정하기 위해.
- 방법론, 데이터 소스, 평가 지표 측면에서 기존의 CHS 생성 접근 방식을 종합적이고 체계적으로 검토하기 위해.
- 영향, 모델 설계, 윤리적 고려사항 측면에서 이전 연구를 비교하여 향후 연구의 기초를 마련하기 위해.
제안 방법
- 2018년부터 2022년까지의 반혐오 발언에 관한 동료 검토 및 프리프린트 연구를 대상으로 한 체계적 문헌 검토.
- 방법론(예: 시퀀스-투-시퀀스 모델, 미세튜닝된 트랜스포머 아키텍처), 데이터 소스(예: Twitter, Reddit), 평가 전략 기반으로 CHS 연구를 분류.
- 이전 연구에서 보고된 통계적 성능 지표 분석, 즉 혐오 발언 탐지 및 CHS 생성에 대한 F1 점수, 정밀도, 재현율.
- 댓글 스레드 역학을 분석하여 CHS가 소셜 미디어 디스course에 미치는 영향 평가, 특히 간섭 전후의 정서 및 참여 패턴.
- 메서드 일관성 확보 및 문헌 검토에서의 중복 방지를 위해 이전 연구와의 텍스트 겹침 식별.
- 작업 유형(예: 응답 생성, 완화, 교육) 및 구현 환경 기반으로 CHS 시스템을 분류하기 위한 구조화된 분류 체계 사용.
실험 결과
연구 질문
- RQ1반혐오 발언 생성에서 지배적인 방법론은 무엇이며, 설계 및 성능 측면에서 어떻게 다릅니까?
- RQ2기존의 CHS 데이터셋은 출처, 주석 품질, 실제 소셜 미디어 디스course의 대표성 측면에서 어떻게 다릅니까?
- RQ3CHS가 소셜 미디어 스레드의 후속 사용자 상호작용과 디스course 품질에 미치는 측정 가능한 영향은 무엇입니까?
- RQ4왜 일부 CHS 간섭은 긍정적인 결과를 내지 못합니까? 그 실패의 원인은 무엇이며, 비효율성 또는 예상치 못한 결과를 초래하는 요인은 무엇입니까?
- RQ5자동화된 CHS가 온라인 커뮤니티에 장기적으로 미치는 사회적·심리적 영향 평가에 있어 핵심적인 연구 격차는 무엇입니까?
주요 결과
- 대부분의 CHS 생성 시스템은 BART와 T5와 같은 미세튜닝된 트랜스포머 모델에 의존하며, 벤치마크 데이터셋에서 보통 0.70 이상의 중간 수준의 F1 점수를 기록한다.
- 고립된 지표에서의 뛰어난 성능에도 불구하고, 댓글 스레드의 진화 및 사용자 행동 변화 평가가 부족하여 CHS의 실제 영향은 여전히 불확실하다.
- 많은 연구에서 CHS 배포 전후의 댓글 순서를 간과함으로써 디스course 진행 상황과 잠재적 반작용에 대한 통찰력이 제한된다.
- 이 종합 검토와 이전 연구 간에 상당한 텍스트 겹침이 존재한다(예: arXiv:1909.04251, arXiv:2009.08392), 이는 향후 연구에서 더 명확한 기여가 필요함을 시사한다.
- 평가 프로토콜에 대한 합의가 없으며, 이진 혐오 발언 탐지 외에는 CHS 효과성을 평가하기 위한 표준화된 벤치마크나 지표가 부족하다.
- CHS가 항상 디스course를 개선한다는 낙관적 가정은 경험적 증거에 의해 항상 뒷받침되지 않으며, 일부 연구에서는 사용자 참여도와 정서에 대해 최소한의 영향 또는 오히려 부정적인 영향을 보고한 바 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.