Skip to main content
QUICK REVIEW

[논문 리뷰] Sockpuppet Detection in Wikipedia: A Corpus of Real-World Deceptive Writing for Linking Identities

Thamar Solorio, Ragib Hasan|arXiv (Cornell University)|2013. 10. 24.
Authorship Attribution and Profiling참고 문헌 7인용 수 15
한 줄 요약

이 논문은 실제 관리자 조사 기록을 통해 수집한 반복적인 웹 위키 소켓퍼프 케이스를 바탕으로, 공개된 첫 번째 실제 세계의 위장 글쓰기 코퍼스를 소개한다. 정규화된 쌍별 특성 차이를 사용한 서포트 벡터 머신을 통해 저자들이 73%의 F-측정치를 달성하였으며, 이는 적대적인 온라인 환경에서의 자동 저자 할당에 대한 기준선을 설정한다.

ABSTRACT

This paper describes the corpus of sockpuppet cases we gathered from Wikipedia. A sockpuppet is an online user account created with a fake identity for the purpose of covering abusive behavior and/or subverting the editing regulation process. We used a semi-automated method for crawling and curating a dataset of real sockpuppet investigation cases. To the best of our knowledge, this is the first corpus available on real-world deceptive writing. We describe the process for crawling the data and some preliminary results that can be used as baseline for benchmarking research. The dataset will be released under a Creative Commons license from our project website: http://docsig.cis.uab.edu.

연구 동기 및 목표

  • 적대적인 온라인 환경에서의 위장 글쓰기용 실제 세계 데이터셋의 부족을 해결하기 위해.
  • 수동적이고 개인정보 침해가 가능한 IP 확인에 의존하는 것을 줄이기 위한 자동화된 소켓퍼프 탐지 도구를 개발하기 위해.
  • 소셜 미디어 콘텐츠와 유사한 짧고 적대적인 텍스트에서의 저자 할당에 대한 기준 데이터셋을 제공하기 위해.
  • 인위적이거나 자기 동기를 가진 왜곡이 아닌 실제 세계의 위장 조건에서의 문체 분석 연구를 가능하게 하기 위해.
  • 온라인 커뮤니티에서 확장 가능하고 개인정보 보호를 고려한 탐지 시스템 개발을 지원하기 위해.

제안 방법

  • 공개된 대화 페이지 논의를 기반으로, 실제 관리자 조사 기록에서 623개의 위키백과 소켓퍼프 조사(SPI) 케이스를 반자동 웹 크롤링 및 정제한 결과.
  • 대화 페이지 내용이 없는 케이스를 수동으로 걸러내어 최종적으로 305개의 확인된 SPI 케이스와 318개의 비소켓퍼프 케이스를 확보.
  • 에디터의 댓글 벡터 간 정규화된 쌍별 차이를 기반으로 한 특성 공학, 포함된 특성으로는 n-그램, 문자 수준 통계, 문법적 특성 등.
  • 두 에디터가 동일한 사람일 가능성이 있는지 판단하기 위해, 쌍별 에디터 비교를 기반으로 서포트 벡터 머신(SVM) 분류기 학습.
  • 성능 평가 및 주요 특성 그룹 식별을 위해 10겹 교차 검증을 수행.
  • 모든 특성 그룹을 사용한 기준 모델 평가 후, 하나의 특성 그룹씩 제거하면서 아블레이션 분석 수행.

실험 결과

연구 질문

  • RQ1위키백과 소켓퍼프에서 유래한 실제 세계의 위장 글쓰기 콘텐츠를 신뢰성 있게 수집하고 정제하여 공개 데이터셋으로 만들 수 있는가?
  • RQ2IP 데이터 없이도 문체적 특성을 사용한 기계 학습 접근법이 소켓퍼프 관계 탐지에 얼마나 효과적인가?
  • RQ3어느 특성 그룹이 소켓퍼프 탐지 성능에 가장 크게 기여하는가?
  • RQ4이 데이터셋은 적대적 환경에서의 저자 할당에 현실적으로 유용한 기준선으로 활용될 수 있는가?
  • RQ5실제 세계 데이터에서의 성능는 인위적이거나 자기 동기를 가진 왜곡 데이터셋과 비교해 어떻게 다른가?

주요 결과

  • 최종 코퍼스는 총 623개의 케이스를 포함하며, 확인된 소켓퍼프 케이스 305개와 비소켓퍼프 케이스 318개로 구성되었으며, 평균 각 케이스당 180개의 댓글과 각 에디터당 평균 83개의 댓글을 포함한다.
  • 이 데이터셋은 연구 목적을 위해 크리에이티브 커먼즈 라이선스 하에 공개되었다.
  • 모든 특성 그룹을 사용한 서포트 벡터 머신 분류기가 F-측정치 73%를 달성하여 향후 연구에 강력한 기준선을 제공한다.
  • 개별 특성 그룹을 제거할 경우 성능 저하가 발생하여, 각 그룹이 탐지 정확도 향상에 의미 있는 기여를 하고 있음을 확인하였다.
  • 이 코퍼스는 저자들이 의도적으로 신원을 숨기고 있는 짧고 적대적인 텍스트의 첫 번째 실제 세계 데이터셋으로, 소셜 미디어 및 보안 응용 분야에서 매우 관련성이 높다.
  • 결과적으로, IP 주소에 대한 특권적 관리자 접근이 없이도 텍스트적 특성만으로도 자동 소켓퍼프 탐지가 가능하다는 점을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.