Skip to main content
QUICK REVIEW

[논문 리뷰] Fault in your stars: An Analysis of Android App Reviews

Rahul Aralikatte, Giriprasad Sridhara|arXiv (Cornell University)|2017. 08. 16.
Software Engineering Research참고 문헌 19인용 수 5
한 줄 요약

이 논문은 Android 앱 리뷰에서 리뷰 텍스트의 감성과 할당된 평점이 일치하지 않는 불일치한 별점 평가를 탐지하기 위한 딥러닝 접근법을 제안한다. 의존성 기반 컨볼루션 신경망(DCNN)을 사용하여, 실제 검증 결과로 87%의 정확도를 기록한 시스템은 92%의 정확도로 불일치 리뷰를 식별했으며, 10개의 인기 앱에서 약 16%에서 26%의 앱 리뷰가 평점-리뷰 불일치를 보였음을 드러냈다.

ABSTRACT

Mobile app distribution platforms such as Google Play Store allow users to share their feedback about downloaded apps in the form of a review comment and a corresponding star rating. Typically, the star rating ranges from one to five stars, with one star denoting a high sense of dissatisfaction with the app and five stars denoting a high sense of satisfaction. Unfortunately, due to a variety of reasons, often the star rating provided by a user is inconsistent with the opinion expressed in the review. For example, consider the following review for the Facebook App on Android; "Awesome App". One would reasonably expect the rating for this review to be five stars, but the actual rating is one star! Such inconsistent ratings can lead to a deflated (or inflated) overall average rating of an app which can affect user downloads, as typically users look at the average star ratings while making a decision on downloading an app. Also, the app developers receive a biased feedback about the application that does not represent ground reality. This is especially significant for small apps with a few thousand downloads as even a small number of mismatched reviews can bring down the average rating drastically. In this paper, we conducted a study on this review-rating mismatch problem. We manually examined 8600 reviews from 10 popular Android apps and found that 20% of the ratings in our dataset were inconsistent with the review. Further, we developed three systems; two of which were based on traditional machine learning and one on deep learning to automatically identify reviews whose rating did not match with the opinion expressed in the review. Our deep learning system performed the best and had an accuracy of 92% in identifying the correct star rating to be associated with a given review.

연구 동기 및 목표

  • 리뷰 텍스트의 감성이 할당된 평점과 일치하지 않는 불일치한 별점 평가가 Android 앱 리뷰에 얼마나 널리 퍼져 있는지 조사한다.
  • 수작업으로 이러한 불일치를 탐지하는 것은 스케일을 고려할 때 시간이 많이 걸리고 비실용적이므로, 자동화된 솔루션이 필요하다는 점을 입증한다.
  • 불일치 평점을 가진 리뷰를 정확하게 식별할 수 있는 기계학습 및 딥러닝 모델을 개발하고 평가한다.
  • 수작업으로 레이블링된 데이터와 다양한 앱에서의 실제 사용자 리뷰를 사용하여 시스템 성능을 검증한다.
  • 인기 있는 Android 애플리케이션에서 리뷰-평가 불일치의 실제 발생 빈도를 추정한다.

제안 방법

  • 10개의 인기 Android 앱에서 8,600개의 리뷰를 수작업으로 분석하여 기준 불일치 비율을 확립한다.
  • 세 가지 자동화된 시스템을 개발했다: TF-IDF 기반의 전통적 기계학습 모델 두 개와 의존성 기반 컨볼루션 신경망(DCNN)을 사용한 딥러닝 모델 하나.
  • DCNN 모델은 리뷰 텍스트의 문법적 관계를 포착하기 위해 의존성 구문 분석을 활용하여 평가 예측을 위한 감성 표현을 향상시킨다.
  • 모델 학습 및 평가에 수작업 레이블링 데이터셋을 사용하여 교차 검증을 수행하여 성능을 평가한다.
  • 23명의 참가자가 66개의 다른 앱에 대해 총 115개의 리뷰를 작성한 최종 사용자 평가를 실시하였으며, 시스템의 예측 평점과 사용자가 제공한 평점을 비교하였다.
  • 학습된 DCNN 모델을 사용하여 Google 플레이 스토어의 10개의 인기 Android 앱에 대해 불일치 비율을 추정하였다.

실험 결과

연구 질문

  • RQ1인기 있는 Android 앱에서 리뷰-평가 불일치 문제의 정도는 어느 정도인가?
  • RQ2기계학습 및 딥러닝 모델은 리뷰 감성과 할당된 별점 간의 불일치를 효과적으로 탐지할 수 있는가?
  • RQ3전통적 기계학습 접근법에 비해 딥러닝 모델의 성능은 불일치 평점 식별에서 어떻게 비교되는가?
  • RQ4다양한 앱에서의 실제 사용자 리뷰에 대해 평가했을 때 시스템의 정확도는 어느 정도인가?
  • RQ5실제 Android 앱 생태계에서 리뷰-평가 불일치의 실제 발생 빈도는 얼마인가?

주요 결과

  • 10개의 인기 Android 앱에서 수작업으로 분석한 8,600개의 리뷰 중 약 20%가 리뷰 텍스트와 할당된 별점 평점 간에 불일치를 보였다.
  • 의존성 기반 컨볼루션 신경망(DCNN) 모델은 수작업 레이블링 데이터셋에서 불일치 리뷰 식별에 대해 교차 검증 정확도 92%를 달성했다.
  • 최종 사용자 평가에서 DCNN 시스템은 66개의 다른 앱에서 작성된 115개의 사용자 리뷰 중 87%의 경우에서 의도한 평점을 정확하게 예측했다.
  • 연구 대상 10개 앱에서 리뷰-평가 불일치의 발생 비율은 16%에서 26%로 다양했으며, 이는 광범위한 문제임을 시사한다.
  • 설문 조사 결과, 사용자들은 리뷰 텍스트를 수정할 때 자주 평점을 갱신하지 않아 불일치 문제의 원인이 된다는 것이 확인되었다.
  • 본 연구는 평가 불일치를 탐지하지 못한 채 평균 별점에만 의존할 경우, 특히 소규모 앱의 경우 잘못된 앱 성능 지표를 유도하고 다운로드 수가 감소할 수 있음을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.