[논문 리뷰] Fake Review Detection Using Behavioral and Contextual Features
이 논문은 행동적 및 문맥적 특징을 사용하여 가짜 리뷰 탐지 모델을 제안하며, 새로운 행동적 특징으로 '리뷰어 이질성(reviewer deviation)'을 도입하고, BM25 가중치를 통해 텍스트 유사도를 평가한다. 실제 Yelp 데이터셋에서 리뷰어 이질성과 문맥적 특징을 조합함으로써 분류 정확도와 재현율이 향상됨을 입증하였으며, Random Forest가 SVM보다 우수하고, BM25가 NNC 및 TF-IDF보다 텍스트 유사도 측정에서 뛰어난 성능을 보였다.
User reviews reflect significant value of product in the world of e-market. Many firms or product providers hire spammers for misleading new customers by posting spam reviews. There are three types of fake reviews, untruthful reviews, brand reviews and non-reviews. All three types mislead the new customers. A multinomial organization "Yelp" is separating fake reviews from non-fake reviews since last decade. However, there are many e-commerce sites which do not filter fake and non-fake reviews separately. Automatic fake review detection is focused by researcher for last ten years. Many approaches and feature set are proposed for improving classification model of fake review detection. There are two types of dataset commonly used in this research area: psuedo fake and real life reviews. Literature reports low performance of classification model real life dataset if compared with pseudo fake reviews. After investigation behavioral and contextual features are proved important for fake review detection Our research has exploited important behavioral feature of reviewer named as "reviewer deviation". Our study comprises of investigating reviewer deviation with other contextual and behavioral features. We empirically proved importance of selected feature set for classification model to identify fake reviews. We ranked features in selected feature set where reviewer deviation achieved ninth rank. To assess the viability of selected feature set we scaled dataset and concluded that scaling dataset can improve recall as well as accuracy. Our selected feature set contains a contextual feature which capture text similarity between reviews of a reviewer. We experimented on NNC, LTC and BM25 term weighting schemes for calculating text similarity of reviews. We report that BM25 outperformed other term weighting scheme.
연구 동기 및 목표
- 실제 전자상거래 데이터셋에서의 가짜 리뷰 탐지 성능 향상을 목표로 하며, 이는 종종 합성 또는 가짜 리뷰 데이터셋에 비해 성능이 열등한 경향이 있기 때문이다.
- 특히 '리뷰어 이질성'을 포함한 행동적 특징이 가짜 리뷰 분류에 미치는 영향을 조사하는 것.
- 가짜 리뷰 탐지에서 리뷰어 콘텐츠 유사도(RCS)를 측정하기 위한 다양한 용어 가중치 기법(NNC, LTC, BM25)의 성능을 평가하는 것.
- 제안된 특징 세트를 사용하여 실제 세계 데이터셋에서 분류기 성능(SVM, RF 등)을 비교하는 것.
- 데이터셋 스케일링과 특징 중요도 분석을 통해 가짜 리뷰 탐지에서의 클래스 불균형 문제를 해결하는 것.
제안 방법
- 동일한 사업체에 대해 제출한 리뷰의 일관되지 않은 평점 패턴을 캡처하기 위해 새로운 행동적 특징인 '리뷰어 이질성'을 제안하였다.
- 리뷰어 콘텐츠 유사도(RCS)를 계산하기 위해 세 가지 용어 가중치 기법을 사용하였다: 기준선으로서의 TF-IDF, NNC, BM25. 이는 리뷰어가 자신의 리뷰들 간의 텍스트 유사도를 측정하기 위함이다.
- 리뷰어 이질성과 RCS를 다른 문맥적 및 행동적 특징들과 통합하여 분류를 위한 통합 특징 세트를 구성하였다.
- 실제 Yelp 데이터셋을 기반으로 SVM, 의사결정트리, Random Forest 등의 다양한 분류기를 훈련하고 평가하였다.
- 각 특징의 기여도를 평가하기 위해 특징 중요도 순위를 활용하였으며, 리뷰어 이질성은 중요도 순위에서 9위를 기록하였다.
- 데이터 크기의 영향을 평가하기 위해 데이터셋을 스케일링하였으며, 스케일링이 이루어질수록 정확도와 재현율이 향상됨을 입증하였다.
실험 결과
연구 질문
- RQ1리뷰어 이질성이라는 행동적 특징이 실제 데이터셋에서의 가짜 리뷰 탐지 성능에 어떤 영향을 미치는가?
- RQ2NNC, LTC, BM25 중 어떤 용어 가중치 기법이 가짜 리뷰 탐지에서 리뷰어 콘텐츠 유사도(RCS) 측정에 가장 뛰어난 성능을 보이는가?
- RQ3제안된 특징 세트를 사용할 때, 다양한 분류기(SVM, Random Forest 등)는 실제 Yelp 데이터에서 어떤 성능을 보이는가?
- RQ4데이터셋 스케일링이 가짜 리뷰 탐지 모델의 재현율과 정확도에 얼마나 기여하는가?
- RQ5문맥적 특징과 행동적 특징의 중요도 점수를 비교할 때, 특히 제안된 '리뷰어 이질성' 특징의 중요도는 어떻게 평가되는가?
주요 결과
- 제안된 특징 세트, 특히 '리뷰어 이질성'을 포함한 특징 세트는 Mukherjee 등과 Zhang 등이 사용한 이전 특징 세트에 비해 실제 Yelp 데이터셋에서 가짜 리뷰 탐지 성능을 향상시켰다.
- 리뷰어 이질성은 선택된 특징들 중 중요도 순위에서 9위를 기록하였으며, 이는 분류 모델에 의미 있는 기여를 한다는 것을 확인한다.
- RCS 측정에서 BM25는 NNC 및 TF-IDF보다 뛰어난 성능을 보였으며, 더 높은 평가 점수를 기록하였다.
- 실제 데이터셋에서 Random Forest는 SVM보다 가짜 리뷰 탐지 성능에서 뛰어났으며, 이는 이전 연구 결과와 일치한다.
- 데이터셋 스케일링이 재현율과 정확도를 향상시켰으며, 이는 데이터 크기가 불균형한 가짜 리뷰 탐지 작업에서 모델 성능에 상당한 영향을 미친다는 것을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.