Skip to main content
QUICK REVIEW

[논문 리뷰] When the Echo Chamber Shatters: Examining the Use of Community-Specific Language Post-Subreddit Ban

Milo Z. Trujillo, Sam Rosenblatt|arXiv (Cornell University)|2021. 01. 01.
Hate Speech and Cyberbullying Detection참고 문헌 30인용 수 14
한 줄 요약

이 연구는 레딧에서 서브레딧 금지 전후 사용자 행동과 공동체 특화 언어를 탐지하기 위한 비지도 학습 방법을 제안한다. 금지 조치가 상위 사용자에게 더 심하게 영향을 주며, 공동체 유형에 따라 효과가 다름을 발견했으며, 백인 우월주의 및 파시즘 서브레딧은 가장 강한 반응을 보였고, 어두운 유머 공동체는 거의 영향을 받지 않았다.

ABSTRACT

Community-level bans are a common tool against groups that enable online harassment and harmful speech. Unfortunately, the efficacy of community bans has only been partially studied and with mixed results. Here, we provide a flexible unsupervised methodology to identify in-group language and track user activity on Reddit both before and after the ban of a community (subreddit). We use a simple word frequency divergence to identify uncommon words overrepresented in a given community, not as a proxy for harmful speech but as a linguistic signature of the community. We apply our method to 15 banned subreddits, and find that community response is heterogeneous between subreddits and between users of a subreddit. Top users were more likely to become less active overall, while random users often reduced use of in-group language without decreasing activity. Finally, we find some evidence that the effectiveness of bans aligns with the content of a community. Users of dark humor communities were largely unaffected by bans while users of communities organized around white supremacy and fascism were the most affected. Altogether, our results show that bans do not affect all groups or users equally, and pave the way to understanding the effect of bans across communities.

연구 동기 및 목표

  • 레딧에서 공동체 수준의 금지 조치가 사용자 활동과 내부 공동체 언어 사용에 미치는 영향을 이해하는 것.
  • 레이블이 부여된 혐오 발언 데이터에 의존하지 않고도 공동체 특화 언어 서명을 식별할 수 있는 융통성 있고 비지도 학습 기반의 방법을 개발하는 것.
  • 서브레딧 금지의 효과성이 서로 다른 유형의 공동체와 사용자 역할 간에 달라지는지 조사하는 것.
  • 금지 전 사용자 활동 수준과 공동체 콘텐츠가 금지 후 행동 변화와 관련이 있는지 평가하는 것.

제안 방법

  • 유해한 콘텐츠로 분류하지 않고도, 한 서브레딧에서 레딧 전체 대비 과도하게 빈도가 높은 단어를 식별하기 위해 단어 빈도의 분산을 사용한다.
  • 15개의 금지된 서브레딧에 이 방법을 적용하여, 금지 전후 사용자 활동과 내부 공동체 어휘 사용의 변화를 추적한다.
  • 행동 반응을 비교하기 위해 사용자를 '상위'(높은 활동) 및 '무작위'(낮은 활동) 그룹으로 분류한다.
  • 혐오 발언이나 독성에 대한 사전 레이블이 필요 없는 비지도 자연어 처리 기법을 사용하여 언어적 이동을 탐지한다.
  • 사용자 수준의 활동과 내부 공동체 어휘 사용 변화를 분석하여 행동적 영향을 평가한다.
  • 서브레딧의 콘텐츠 유형(예: 백인 우월주의, 어두운 유머 등)에 따라 분류하여, 서로 다른 공동체 유형 간 금지 조치의 효과성을 비교한다.

실험 결과

연구 질문

  • RQ1서브레딧 금지가 사용자 활동 수준에 어떤 영향을 미치는가. 특히 상위 사용자와 무작위 사용자 간에 어떻게 다를까?
  • RQ2서브레딧 금지 후 사용자들이 내부 공동체 언어 사용을 얼마나 줄이는가?
  • RQ3금지된 서브레딧의 콘텐츠 유형(예: 백인 우월주의, 어두운 유머 등)이 금지 조치의 효과성에 영향을 주는가?
  • RQ4금지 전 활동 수준에 따라 사용자 반응에 체계적인 차이가 있는가?
  • RQ5금지 후 금지된 공동체의 언어 패턴은 어떻게 변화하는가. 이는 공동체의 유대감과 적응 능력에 대해 무엇을 드러내는가?

주요 결과

  • 상위 사용자들은 서브레딧 금지 후 전체 활동과 내부 공동체 언어 사용을 둘 다 유의미하게 줄였다.
  • 무작위 사용자들은 전체 활동에 변화가 없이 내부 공동체 어휘 사용을 줄였는데, 이는 이성적 탈동원(언어적 탈동원)이지만 참여 중단은 아니라는 것을 시사한다.
  • 백인 우월주의 및 파시즘 중심의 공동체는 금지 조치에 가장 강한 행동 반응을 보였으며, 이러한 집단에 대해 금지 조치의 효과가 높다는 것을 시사한다.
  • 어두운 유머 공동체는 금지 후 행동 변화가 거의 없었으며, 이는 이러한 공동체에 대해 금지 조치의 효과가 낮다는 것을 시사한다.
  • 무작위 사용자 활동은 금지 후 전반적으로 유의미한 감소가 없었지만, 내부 공동체 어휘 사용은 평균 -0.2에서 -0.3 정도로 약간 감소했다.
  • 연구 결과, 금지 조치의 효과성이 공동체의 콘텐츠 유형과 관련이 있음을 확인했으며, 이는 콘텐츠 유형이 사용자 반응 형성에 핵심 요소임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.