Skip to main content
QUICK REVIEW

[논문 리뷰] Yelp Review Rating Prediction: Machine Learning and Deep Learning Models

Zefang Liu|arXiv (Cornell University)|2020. 12. 12.
Topic Modeling참고 문헌 12인용 수 6
한 줄 요약

이 논문은 리뷰 텍스트에서 Yelp 레스토랑 평점 예측을 위한 기계학습 및 트랜스포머 기반 딥러닝 모델 간의 비교 연구를 제안한다. Yelp 오픈 데이터셋에서 유의미한 균형 잡힌 훈련 데이터셋을 활용하여, 기존 모델(Logistic Regression, SVM, Random Forest, Naive Bayes)과 최신 트랜스포머(BERT, DistilBERT, RoBERTa, XLNet)를 평가한 결과, XLNet가 테스트 세트에서 70.44%의 최고 정확도를 기록하며 기계학습 모델 중 가장 우수한 성능을 보였다. 이는 Logistic Regression(64%)보다 유의하게 뛰어난 성능이다.

ABSTRACT

We predict restaurant ratings from Yelp reviews based on Yelp Open Dataset. Data distribution is presented, and one balanced training dataset is built. Two vectorizers are experimented for feature engineering. Four machine learning models including Naive Bayes, Logistic Regression, Random Forest, and Linear Support Vector Machine are implemented. Four transformer-based models containing BERT, DistilBERT, RoBERTa, and XLNet are also applied. Accuracy, weighted F1 score, and confusion matrix are used for model evaluation. XLNet achieves 70% accuracy for 5-star classification compared with Logistic Regression with 64% accuracy.

연구 동기 및 목표

  • 리뷰 텍스트만을 사용하여 1~5점 Yelp 레스토랑 평점을 예측하고, 이를 다중분류 문제로 정의한다.
  • Yelp 오픈 데이터셋의 데이터 불균형 문제를 해결하기 위해, 각 평점 클래스당 250,000개의 샘플을 포함하는 균형 잡힌 훈련 세트를 구성한다.
  • 기계학습 모델과 최신 트랜스포머 기반 모델의 평점 예측 성능을 평가한다.
  • 모델 아키텍처, 케이스 대/소문자 토크나이제이션, 하이퍼파라미터 설정이 정확도 및 F1 점수에 미치는 영향을 비교한다.
  • 실제 리뷰 평점 시스템에 구현할 때 성능, 추론 속도, 계산 비용 간의 상호 상충 관계를 이해하는 데 기여한다.

제안 방법

  • 원본 Yelp 오픈 데이터셋에서 125,000개의 리뷰(각 평점 등급당 250,000개)를 재표본화하여 데이터 불균형을 완화한 균형 잡힌 훈련 데이터셋을 구축했다.
  • 일반화된 텍스트 벡터화 기법으로서 Count Vectorizer와 TF-IDF Vectorizer를 사용하였으며, 일원어, 이원어, 소문자 변환, 정지어 제거 및 최소 문서 빈도 5를 적용했다.
  • 엔지니어링된 특징을 기반으로 네 가지 기존 기계학습 모델(Naive Bayes, Logistic Regression, Random Forest, Linear SVM)을 훈련시켰다.
  • BERT, DistilBERT, RoBERTa, XLNet와 같은 네 가지 트랜스포머 기반 모델을 사용자 지정된 케이스 기반 및 대소문자 구분 기반의 기본 아키텍처로 미세조정하였으며, 최대 시퀀스 길이를 128로 설정했다.
  • 배치 크기(16), 학습률, 훈련 에포크 수(1) 등의 하이퍼파라미터를 최적화하고, 검증 및 테스트 세트에서 모델 성능을 평가했다.
  • 정확도, 가중 평균 F1 점수, 혼동 행렬을 사용하여 클래스별 성능 및 예측 편향을 분석하였다.

실험 결과

연구 질문

  • RQ1기계학습 모델과 트랜스포머 기반 모델 간의 Yelp 리뷰 평점 예측 성능는 어떻게 비교되는가?
  • RQ2데이터 불균형이 모델 성능에 미치는 영향은 무엇이며, 균형 잡힌 훈련 세트를 만들기 위해 재표본화 전략은 얼마나 효과적인가?
  • RQ3BERT, DistilBERT, RoBERTa, XLNet 중 어떤 트랜스포머 아키텍처가 Yelp 평점 예측 작업에서 가장 높은 정확도와 F1 점수를 기록하는가?
  • RQ4대소문자 구분 토크나이제이션과 모델 크기(기본 vs. 대용량)는 예측 성능 및 계산 효율성에 어떤 영향을 미치는가?
  • RQ5혼동 행렬을 통해 인접한 평점 범주(예: 4점 vs. 5점)를 구분하는 데 모델의 강점과 약점을 어떻게 파악할 수 있는가?

주요 결과

  • XLNet가 테스트 세트에서 가장 높은 정확도 70.44%를 기록하였으며, 동일한 테스트 세트에서 Logistic Regression의 64% 정확도를 뚜렷이 뛰어넘었다.
  • RoBERTa가 BERT보다 높은 성능을 보였으며, 테스트 정확도 69.61%와 가중 평균 F1 점수 0.6999를 기록하여 사전학습 과정에서의 강건성 향상을 확인할 수 있었다.
  • DistilBERT는 BERT와 동일한 정확도(69.61%)를 기록했지만, 약 0.5% 낮은 정확도를 기록했으며, 거의 두 배의 빠른 추론 속도를 보여 자원 제약 환경에서 강력한 후보가 되었다.
  • 혼동 행렬 분석 결과, 특히 XLNet와 RoBERTa와 같은 트랜스포머 모델은 대각선 성향이 뚜렷하여, 2~4점 평점 간의 분류 능력이 뛰어나다는 점을 확인하였다.
  • 일반적으로 대소문자 구분 모델이 소문자 모델보다 높은 성능을 보였으며, 특히 케이스 구분 XLNet가 가장 높은 정확도를 기록하여, 이 작업에 있어서 대소문자 민감도가 표현 학습에 유리하다는 점을 시사했다.
  • 최고 성능을 기록한 모델(XLNet)은 가중 평균 F1 점수 0.7044를 기록하였으며, 기계학습 모델 중 가장 우수한 성능을 보인 Logistic Regression(0.64)보다 뚜렷한 향상을 보였다. 이는 평점 예측 작업에서 문맥 기반 표현의 우수성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.