[論文レビュー] Evaluating Pre-Trained Models for User Feedback Analysis in Software Engineering: A Study on Classification of App-Reviews
本研究では、ソフトウェア工学的問題に分類するための事前学習トランスフォーマーモデル(PTM)を評価し、複数の設定において先行手法と比較している。アプリレビューのドメイン特化型PTMは、一般向けPTMおよび従来のモデルと比較して、特に多クラスおよびゼロショット設定において、精度と推論速度の両面で優れている。
Context: Mobile app reviews written by users on app stores or social media are significant resources for app developers.Analyzing app reviews have proved to be useful for many areas of software engineering (e.g., requirement engineering, testing). Automatic classification of app reviews requires extensive efforts to manually curate a labeled dataset. When the classification purpose changes (e.g. identifying bugs versus usability issues or sentiment), new datasets should be labeled, which prevents the extensibility of the developed models for new desired classes/tasks in practice. Recent pre-trained neural language models (PTM) are trained on large corpora in an unsupervised manner and have found success in solving similar Natural Language Processing problems. However, the applicability of PTMs is not explored for app review classification Objective: We investigate the benefits of PTMs for app review classification compared to the existing models, as well as the transferability of PTMs in multiple settings. Method: We empirically study the accuracy and time efficiency of PTMs compared to prior approaches using six datasets from literature. In addition, we investigate the performance of the PTMs trained on app reviews (i.e. domain-specific PTMs) . We set up different studies to evaluate PTMs in multiple settings: binary vs. multi-class classification, zero-shot classification (when new labels are introduced to the model), multi-task setting, and classification of reviews from different resources. The datasets are manually labeled app review datasets from Google Play Store, Apple App Store, and Twitter data. In all cases, Micro and Macro Precision, Recall, and F1-scores will be used and we will report the time required for training and prediction with the models.
研究の動機と目的
- アプリレビュー内のソフトウェア工学的問題を分類するための事前学習トランスフォーマーモデル(PTM)の有効性を、先行手法と比較して評価すること。
- アプリレビューのデータで微調整されたドメイン特化型PTM(CPTM)が、汎用PTMよりも分類性能を向上させるかどうかを調査すること。
- 異なるデータセット、プラットフォーム(Google Play、Apple App Store、Twitter)、分類タスク(二値分類、多クラス分類、ゼロショット、マルチタスク)におけるPTMの汎用性を評価すること。
- 特にデータ量やラベル構成の変化に伴う、PTMと従来のモデルの学習および推論における時間的効率を測定すること。
- ラベル付きデータが限られている場合や、新しい問題カテゴリが登場する場合に、PTMの最適な使用状況を特定すること。
提案手法
- Google Play、Apple App Store、Twitterからの手動ラベル付アプリレビューを含む、6つの既存データセットを選定した。
- 従来の手法(SVM、NB)、アンサンブル手法、単語埋め込みを用いたディープラーニングと比較して、6種類のPTM(例:BERT、RoBERTa、DistilBERT)を評価した。
- Google Playから収集したアプリレビューを用いて、ドメイン固有のテキストを事前学習に組み込んだ、カスタムPTM(CPTM)を訓練した。
- 二値分類対比多クラス分類、ゼロショット学習、マルチタスク学習、リソース間分類の複数の設定でモデルを評価した。
- 評価指標として、マイクロF1、マクロF1、精度、再現率を用い、時間的効率分析のための学習時間および推論時間を報告した。
- ストラティフィードk分割交差検証を適用し、データの不均衡に対処するために、慎重なラベル統合と検証戦略を採用した。

実験結果
リサーチクエスチョン
- RQ1事前学習トランスフォーマーモデル(PTM)は、アプリレビューのソフトウェア工学的問題に分類する際、従来の手法と比較してどのように異なるか?
- RQ2アプリ固有のレビューでPTMを事前学習(つまり、カスタムPTM)することで、さまざまな設定において分類性能が向上するか?
- RQ3ラベル付き学習データが存在しない新しい問題カテゴリに対して、PTMのゼロショット分類性能はどの程度効果的か?
- RQ4データソース(例:Google Play 対 Twitter)がPTMの性能および一般化能力に与える影響は何か?
- RQ5特にデータ量やラベル構成の変化に伴う、PTMと従来のモデルの学習および推論における効率性は、どのように比較されるか?
主な発見
- 事前学習トランスフォーマーモデル(PTM)は、二値分類および多クラス分類タスクの両方で、従来の手法よりも高いマイクロF1およびマクロF1スコアを達成した。
- アプリレビューで事前学習されたカスタムPTM(CPTM)は、すべての評価設定において一般PTMおよび従来のモデルを一貫して上回り、最高のF1スコアを記録した。
- より多くのアプリレビューのデータで学習されたCPTMは顕著に高い性能を示し、最大のCPTMバリアントで最高のF1スコアが観察された。
- CPTMを用いることで推論時間の短縮が確認され、実装における効率性の向上が示された。
- 複数リソース分類(例:複数のソースからのデータを統合)の設定では、アンサンブル手法や単語埋め込みを用いたディープラーニングが一般PTMを上回ったが、CPTMは依然として最高順位を維持した。
- CPTMを用いることでゼロショット分類性能が向上し、未観測ラベルへの一般化能力が向上しているが、少しだけのショットや完全な教師あり設定に比べて性能は低いままであった。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。