[論文レビュー] Fault in your stars: An Analysis of Android App Reviews
本稿では、レビュー本文のセンチメントと割り当てられた評価が一致しないAndroidアプリレビューにおける不一致評価を検出するためのディープラーニング手法を提案する。依存関係に基づく畳み込みニューラルネットワーク(DCNN)を用いたシステムは、不一致レビューの同定において92%の正確度を達成しており、実世界の検証ではユーザーが作成したレビューにおいて87%の正確度を示した。10の一般的なアプリにおいて16%~26%のアプリレビューが評価-レビュー不一致を示していることが判明した。
Mobile app distribution platforms such as Google Play Store allow users to share their feedback about downloaded apps in the form of a review comment and a corresponding star rating. Typically, the star rating ranges from one to five stars, with one star denoting a high sense of dissatisfaction with the app and five stars denoting a high sense of satisfaction. Unfortunately, due to a variety of reasons, often the star rating provided by a user is inconsistent with the opinion expressed in the review. For example, consider the following review for the Facebook App on Android; "Awesome App". One would reasonably expect the rating for this review to be five stars, but the actual rating is one star! Such inconsistent ratings can lead to a deflated (or inflated) overall average rating of an app which can affect user downloads, as typically users look at the average star ratings while making a decision on downloading an app. Also, the app developers receive a biased feedback about the application that does not represent ground reality. This is especially significant for small apps with a few thousand downloads as even a small number of mismatched reviews can bring down the average rating drastically. In this paper, we conducted a study on this review-rating mismatch problem. We manually examined 8600 reviews from 10 popular Android apps and found that 20% of the ratings in our dataset were inconsistent with the review. Further, we developed three systems; two of which were based on traditional machine learning and one on deep learning to automatically identify reviews whose rating did not match with the opinion expressed in the review. Our deep learning system performed the best and had an accuracy of 92% in identifying the correct star rating to be associated with a given review.
研究の動機と目的
- レビュー本文のセンチメントと割り当てられた評価が一致しないAndroidアプリレビューにおける不一致評価の広がりと影響を調査すること。
- このような不一致を手作業で検出することはスケールが大きくなると時間的にかかるし現実的ではないため、自動化されたソリューションの必要性を示すこと。
- 不一致評価を正確に同定できる機械学習およびディープラーニングモデルの開発と評価を行うこと。
- 手作業でアノテートされたデータと多様なアプリからの実際のユーザー生成レビューを用いて、システムの性能を検証すること。
- 一般的なAndroidアプリにおけるレビュー-評価不一致の実世界での広がりを推定すること。
提案手法
- 本研究では、10の一般的なAndroidアプリから抽出した8,600件のレビューを手作業で分析し、不一致率のベースラインを確立した。
- 3つの自動化システムを開発した:TF-IDFを用いた従来の機械学習手法(さまざまな分類器を用いて)と、依存関係に基づく畳み込みニューラルネットワーク(DCNN)を用いたディープラーニングモデル。
- DCNNモデルは、レビュー本文内の構文的関係を抽出することで、評価予測のためのセンチメント表現を向上させている。
- モデルの学習と評価には、手作業でアノテートされたデータセットを用いた交差検証を実施し、性能を評価した。
- 23名の参加者が66種類の異なるアプリについて合計115件のレビューを書き、システムが予測した評価とユーザーが提供した評価を比較するエンドユーザー評価を実施した。
- 訓練されたDCNNモデルを用いて、Google Playストアの10の一般的なAndroidアプリにおける不一致の広がりを推定した。
実験結果
リサーチクエスチョン
- RQ1一般的なAndroidアプリにおいて、レビュー-評価不一致問題はどの程度広がっているか?
- RQ2機械学習およびディープラーニングモデルは、レビューのセンチメントと割り当てられた星評価の不一致を効果的に検出できるか?
- RQ3従来の機械学習アプローチと比較して、ディープラーニングモデルの不一致評価同定における性能はどの程度か?
- RQ4多様なアプリからの実際のユーザー生成レビューに対して評価した場合、システムの正確度はどの程度か?
- RQ5実世界のAndroidアプリエコシステムにおいて、レビュー-評価不一致の実際の広がりはどの程度か?
主な発見
- 10の一般的なAndroidアプリにおける8,600件の手作業で分析されたレビューのうち約20%が、レビュー本文と割り当てられた星評価の間で不一致を示した。
- 依存関係に基づく畳み込みニューラルネットワーク(DCNN)モデルは、アノテート済みデータセット上で交差検証の正確度が92%を達成した。
- エンドユーザー評価では、66種類の異なるアプリから得られた115件のユーザー生成レビューに対して、DCNNシステムが87%のケースで意図された評価を正しく予測した。
- 調査対象の10アプリにおけるレビュー-評価不一致の広がりは16%~26%の間であり、広範にわたる問題であることが示された。
- アンケート結果から、ユーザーはレビュー本文を修正する際によく評価を更新しないことが判明し、不一致問題の要因となっていることが確認された。
- 本研究では、不一致を検出しないまま平均星評価に依存すると、特に小さなアプリにおいて誤ったアプリパフォーマンス指標が得られ、ダウンロード数が減少する可能性があることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。