[논문 리뷰] Generating Sentiment-Preserving Fake Online Reviews Using Neural Language Models and Their Human- and Machine-based Detection
이 논문은 실제 리뷰 데이터로 GPT-2를 피지터링하고, BERT 기반 감성 분류기를 사용해 출력을 필터링함으로써 감성 유지를 보장하는 저숙련자 수준의 가짜 온라인 리뷰 생성 방법을 제안한다. 생성된 리뷰는 유창성과 탐지성에서 인간이 작성한 리뷰와 구분이 가지 않으며, 인간 평가자들이 가짜 리뷰를 무작위로 식별할 때 정확도가 낮고, 자동 탐지기에서는 등가오차율(EER)이 22.5%에 불과하여 탐지에 큰 도전 과제가 있음을 시사한다.
Advanced neural language models (NLMs) are widely used in sequence generation tasks because they are able to produce fluent and meaningful sentences. They can also be used to generate fake reviews, which can then be used to attack online review systems and influence the buying decisions of online shoppers. To perform such attacks, it is necessary for experts to train a tailored LM for a specific topic. In this work, we show that a low-skilled threat model can be built just by combining publicly available LMs and show that the produced fake reviews can fool both humans and machines. In particular, we use the GPT-2 NLM to generate a large number of high-quality reviews based on a review with the desired sentiment and then using a BERT based text classifier (with accuracy of 96%) to filter out reviews with undesired sentiments. Because none of the words in the review are modified, fluent samples like the training data can be generated from the learned distribution. A subjective evaluation with 80 participants demonstrated that this simple method can produce reviews that are as fluent as those written by people. It also showed that the participants tended to distinguish fake reviews randomly. Three countermeasures, Grover, GLTR, and OpenAI GPT-2 detector, were found to be difficult to accurately detect fake review.
연구 동기 및 목표
- 비전문가가 공개된 사전 훈련된 언어 모델을 사용해 고품질의 감성 유지 가짜 리뷰를 생성할 수 있는지 조사하기 위해.
- 이러한 가짜 리뷰가 인간 및 기계 기반 탐지에서 얼마나 효과적으로 회피되는지 평가하기 위해.
- 기존 자동 탐지 방법(Grover, GLTR, OpenAI GPT-2 탐지기)이 이러한 생성된 리뷰에 대해 얼마나 잘 작동하는지 평가하기 위해.
- 온라인 리뷰 시스템을 공격하기 위한 확장 가능하고 저비용의 위협 모델을 구축할 수 있는지 탐색하기 위해.
제안 방법
- 원하는 감성을 가진 시드 리뷰를 기반으로, 실제 Amazon 및 Yelp 리뷰 데이터셋으로 GPT-2를 피지터링하여 리뷰를 생성하기 위해.
- 감성 분류기(96% 정확도)를 사용해 원하지 않는 감성을 가진 리뷰를 필터링하고, 목표 감성만 유지된 리뷰만 선택하기 위해.
- 시드 리뷰를 프롬프트로 사용해 자동적으로 샘플링하는 방식으로, 피지터링된 GPT-2 모델에서 대규모 가짜 리뷰를 생성하기 위해.
- 후처리 또는 단어 수준의 수정을 적용하지 않아, 훈련 데이터의 유창성과 일관성을 유지하기 위해.
- 80명의 참가자를 대상으로 주관적 평가를 실시해 가짜 리뷰의 유창성과 탐지 가능성 평가하기 위해.
- 등가오차율(EER)을 주요 지표로 사용해, 세 가지 자동 탐지 방법(Grover, GLTR, OpenAI GPT-2 탐지기)의 성능 평가하기 위해.
실험 결과
연구 질문
- RQ1저숙련자 공격자가 공개된 사전 훈련된 언어 모델만을 사용해 감성과 유창성을 유지하는 가짜 리뷰를 생성할 수 있는가?
- RQ2이 방법으로 생성된 가짜 리뷰를 인간 평가자가 실제 리뷰와 가짜 리뷰를 구분하는 데 얼마나 효과적인가?
- RQ3기존 자동 탐지 시스템(Grover, GLTR, GPT-2 탐지기)이 이러한 가짜 리뷰를 식별하는 데 얼마나 잘 작동하는가?
- RQ4여러 탐지 방법을 조합했을 때 전체 탐지 성능에 어떤 영향을 미치는가?
주요 결과
- Amazon 기반 리뷰의 경우 생성된 가짜 리뷰 평균 유창성 점수는 3.23(1~5 척도 기준)이며, Yelp 기반 리뷰는 3.30으로, 각각 실제 리뷰의 평균 점수(2.95 및 3.49)와 유사한 수준을 보였다.
- 주관적 평가 결과, 참가자들이 무작위로 선택한 가짜 리뷰를 실제 리뷰로 잘못 식별한 비율은 20.8%에서 34.6% 사이였으며, 이는 거의 우연의 성능에 가까운 수준임을 시사한다.
- 가장 높은 성능을 보인 자동 탐지 방법인 OpenAI GPT-2 탐지기는 Amazon 데이터셋에서 등가오차율(EER)이 23.5%를 기록했으며, 이는 탐지 능력이 제한적임을 의미한다.
- Grover와 GLTR를 융합했을 경우 EER는 34.9%로 상승했고, 세 탐지기를 모두 융합했을 경우 최저 EER 22.5%를 기록했지만, 여전히 완벽한 탐지에 도달하지 못했다.
- 낮은 EER 값은 현재 탐지 시스템이 이러한 유형의 가짜 리뷰 생성에 대해 취약함을 시사하며, 온라인 리뷰 시스템에 심각한 취약점이 있음을 드러낸다.
- 후처리 없이 피지터링과 훈련만으로도 고품질의 가짜 리뷰를 생성할 수 있음을 보여주며, 이는 낮은 숙련도로도 효과적인 가짜 리뷰 생성이 가능함을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.