[논문 리뷰] Fighting Authorship Linkability with Crowdsourcing
이 논문은 커뮤니티 리뷰 플랫폼에서 저자 연계 가능성을 줄이기 위해 군중 활용과 기계 번역을 활용하는 방안을 제안한다. 아마존 MTurk에서 무작위 사용자가 리뷰를 재작성하거나 여러 언어로 번역함으로써 문체적 특징이 충분히 변형되어 기존의 연계 기법이 무력화되며, 독해성과 의미는 유지된다.
Massive amounts of contributed content -- including traditional literature, blogs, music, videos, reviews and tweets -- are available on the Internet today, with authors numbering in many millions. Textual information, such as product or service reviews, is an important and increasingly popular type of content that is being used as a foundation of many trendy community-based reviewing sites, such as TripAdvisor and Yelp. Some recent results have shown that, due partly to their specialized/topical nature, sets of reviews authored by the same person are readily linkable based on simple stylometric features. In practice, this means that individuals who author more than a few reviews under different accounts (whether within one site or across multiple sites) can be linked, which represents a significant loss of privacy. In this paper, we start by showing that the problem is actually worse than previously believed. We then explore ways to mitigate authorship linkability in community-based reviewing. We first attempt to harness the global power of crowdsourcing by engaging random strangers into the process of re-writing reviews. As our empirical results (obtained from Amazon Mechanical Turk) clearly demonstrate, crowdsourcing yields impressively sensible reviews that reflect sufficiently different stylometric characteristics such that prior stylometric linkability techniques become largely ineffective. We also consider using machine translation to automatically re-write reviews. Contrary to what was previously believed, our results show that translation decreases authorship linkability as the number of intermediate languages grows. Finally, we explore the combination of crowdsourcing and machine translation and report on the results.
연구 동기 및 목표
- 동일한 개인이 여러 계정에서 작성한 리뷰의 문체적 연계 가능성으로 인한 증가하는 프라이버시 위험을 해결하기 위해.
- 군중 활용을 통한 재작성 방식이 리뷰의 의미를 유지하면서도 저자적 문체적 특징을 효과적으로 은폐할 수 있는지 조사하기 위해.
- 다중 언어 기계 번역이 연계 가능성을 줄이는 데 미치는 영향을 평가하고 독해성의 상충 관계를 분석하기 위해.
- 군중 활용과 번역을 조합한 하이브리드 접근 방식을 통해 최적의 프라이버시-유용성 균형을 도출하기 위해.
- 저자들이 리뷰 플랫폼에서 익명화 과정을 자동화할 수 있도록 실용적인 플러그인 프레임워크를 개발하기 위해.
제안 방법
- 원본 리뷰를 무작위 작업자들이 재작성하도록 아마존 메카니컬 터크를 활용하여, 작업당 0.12달러의 명목 수당을 지급하였다.
- 재작성된 리뷰를 수집하고, 인간 평가를 통해 독해성과 원본 텍스트와의 의미 유사도를 평가하였다.
- 다양한 중간 언어로 리뷰를 번역하여 문체적 이질성을 증가시켰다.
- 기존의 Writeprints 기능 중 일부를 사용하여 재사용된 스타일리스틱 분석을 통해 원본, 재작성된, 번역된 리뷰의 연계 가능성을 측정하였다.
- 군중 활용과 기계 번역을 조합하여 번역된 리뷰의 독해성을 향상시키면서도 낮은 연계 가능성을 유지하였다.
- 브라우저 플러그인을 설계하여 군중 활용 플랫폼에 작업 제출 및 익명화된 리뷰 수령을 자동화할 수 있도록 하였다.
실험 결과
연구 질문
- RQ1군중 활용을 통한 재작성은 독해성 손실 없이 리뷰 플랫폼에서 저자 연계 가능성을 얼마나 줄일 수 있는가?
- RQ2중간 번역 언어의 수를 늘일수록 저자 연계 가능성은 어떻게 영향을 받는가?
- RQ3기계 번역된 리뷰는 실용적인 익명화 도구로 충분히 독해 가능하게 만들 수 있는가?
- RQ4군중 활용과 기계 번역의 조합은 연계 가능성과 리뷰 품질에 어떤 영향을 미치는가?
- RQ5실제 리뷰 플랫폼에 이러한 익명화 기법을 구현하는 데 있어 실현 가능성과 확장성은 어느 정도인가?
주요 결과
- 군중 활용을 통한 재작성은 저자 연계 가능성을 거의 무력화시켰으며, 재작성된 리뷰에 대해 연계 기법의 정확도가 10%에 불과했다.
- 인간 평가를 통해 재작성된 리뷰가 원본과 높은 독해성과 의미 유사성을 유지하고 있음을 확인하였다.
- 다중 언어 번역은 연계 가능성을 크게 감소시켰으며, 중간 언어 수가 많을수록 더 큰 은폐 효과를 보였다.
- 기계 번역된 리뷰는 군중 재작성보다 독해성이 낮았지만, 군중 활용과 조합함으로써 독해성이 향상되었다.
- 군중 활용 비용은 낮았으며(평균 리뷰당 0.12달러), 일반적인 리뷰 모니터링 지연 시간을 감안할 때 지연 시간도 수용 가능했다.
- 플랫폼 정책과 대규모로 원본과 재작성된 콘텐츠를 연계할 수 없는 점으로 인해 요청자 및 작업자 모두에 대한 프라이버시 위험은 최소한이었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.