Skip to main content
QUICK REVIEW

[논문 리뷰] Applying Naive Bayes Classification to Google Play Apps Categorization

Olabenjo Babatunde|arXiv (Cornell University)|2016. 08. 30.
Web Data Mining and Analysis참고 문헌 17인용 수 14
한 줄 요약

이 논문은 Multinomial Naïve Bayes와 TF-IDF 기능 추출을 사용하여 Google Play 스토어 앱을 적절한 카테고리로 자동 분류하는 방법을 제안하며, 그룹화된 게임 앱에 대해 F1 스코어 0.85를 달성하고, 단어 빈도에 민감한 점을 고려해 Bernoulli Naïve Bayes를 능가한다. 이 방법은 주요 개발자 앱의 메타데이터를 활용하여 앱 탐색성과 유통업체 수익을 향상시킨다.

ABSTRACT

There are over one million apps on Google Play Store and over half a million publishers. Having such a huge number of apps and developers can pose a challenge to app users and new publishers on the store. Discovering apps can be challenging if apps are not correctly published in the right category, and, in turn, reduce earnings for app developers. Additionally, with over 41 categories on Google Play Store, deciding on the right category to publish an app can be challenging for developers due to the number of categories they have to choose from. Machine Learning has been very useful, especially in classification problems such sentiment analysis, document classification and spam detection. These strategies can also be applied to app categorization on Google Play Store to suggest appropriate categories for app publishers using details from their application. In this project, we built two variations of the Naive Bayes classifier using open metadata from top developer apps on Google Play Store in other to classify new apps on the store. These classifiers are then evaluated using various evaluation methods and their results compared against each other. The results show that the Naive Bayes algorithm performs well for our classification problem and can potentially automate app categorization for Android app publishers on Google Play Store

연구 동기 및 목표

  • Google Play 스토어에서 잘못된 앱 분류 문제를 해결하여 앱 탐색성과 개발자 수익을 향상시키는 것.
  • 성공한 개발자들로부터의 메타데이터를 활용해 신규 앱에 최적의 카테고리를 제안하는 기계학습 기반 솔루션을 개발하는 것.
  • TF-IDF 기능을 사용하여 앱 분류 작업에서 Multinomial 및 Bernoulli Naïve Bayes 분류기의 성능을 평가하고 비교하는 것.
  • 사용자 탐색성과 Google Play 스토어 유통업체 수익 향상을 위해 앱 분류 정확도를 향상시키는 것.

제안 방법

  • 연구는 Google Play 스토어의 상위 평가 앱에서 공개된 메타데이터를 학습 데이터로 사용하는 지도 학습을 적용한다.
  • 어휘적 기능을 추출하고 가중치를 부여하기 위해 단어 빈도-역문서 빈도(DF-IDF) 기법을 적용한다.
  • 동일한 데이터셋에 대해 비교 분석을 위해 Multinomial 및 Bernoulli 두 가지 유형의 Naïve Bayes 분류기를 훈련하고 평가한다.
  • 정밀도, 재현율, F1 스코어, 혼동 행렬 등을 포함한 평가 지표와 함께 k-폴드 교차검증, 셔플-스플릿 교차검증을 통해 모델 성능을 평가한다.
  • 학습 데이터 증가에 따른 일반화 능력 평가 및 과적합 여부 탐지를 위해 학습 곡선을 분석한다.
  • 향후 성능 향상을 위해 2-그램 기능(예: "알람 시계" 또는 "화를 내는 새들" 등)을 제안한다.

실험 결과

연구 질문

  • RQ1Multinomial Naïve Bayes 분류기는 Bernoulli 버전에 비해 Google Play 스토어 앱 분류에 얼마나 효과적인가?
  • RQ2앱 분류 작업에서 단어 빈도는 성능에 어떤 영향을 미치는가?
  • RQ3왜 게임 앱은 다른 카테고리에 비해 더 높은 오분류 비율을 보이는가?
  • RQ4TF-IDF 기반 기능 향상이 Naïve Bayes를 사용한 앱 분류 정확도 향상에 기여하는가?
  • RQ5상위 개발자들로부터의 데이터 품질과 레이블 일관성은 분류기 성능에 어떤 영향을 미치는가?

주요 결과

  • Multinomial Naïve Bayes 분류기는 Bernoulli 버전을 능가하여, 그룹화된 게임 앱에 대해 F1 스코어 0.85, 모든 카테고리에 대해 0.727를 기록했다.
  • Bernoulli Naïve Bayes 모델은 오직 게임 앱에 대해 F1 스코어 0.67을 기록하여, 단어 빈도가 중요한 경우에 한계를 드러냈다.
  • TRANSPORTATION, MEDICAL, WEATHER 등의 비게임 카테고리에서 가장 높은 성능을 보였으며, 고유하고 드문 키워드 덕분에 정밀도 100%를 달성했다.
  • 게임 카테고리에서의 오분류는 "아케이드"와 "액션" 게임 등 하위 카테고리 간에 겹치는 용어로 인해 흔히 발생했다.
  • 학습 곡선 분석 결과, 더 큰 학습 데이터 세트를 사용할수록 과적합 현상이 감소하여 일반화 능력이 향상됨을 확인했다.
  • 한계가 있음에도 불구하고, 제한된 학습 데이터로도 빠르고 효과적인 성능을 보여, Naïve Bayes는 앱 분류의 강력한 기준 모델로 남아있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.