[論文レビュー] A Comparative Study of Text Embedding Models for Semantic Text Similarity in Bug Reports
本研究では、バグレポートの重複検出における意味的テキスト類似度を評価するために、TF-IDF、FastText、Gensim、BERT、ADA(GPT-3.5)の5つのテキスト埋め込みモデルを検証した。ソフトウェア欠陥データセットを用いて、BERTが複数のリポジトリで最高のリCALLを達成し、ADA、Gensim、FastText、TF-IDFを上回った。これは、このタスクにおいて文脈を考慮した埋め込み表現が優れていることを示している。
Bug reports are an essential aspect of software development, and it is crucial to identify and resolve them quickly to ensure the consistent functioning of software systems. Retrieving similar bug reports from an existing database can help reduce the time and effort required to resolve bugs. In this paper, we compared the effectiveness of semantic textual similarity methods for retrieving similar bug reports based on a similarity score. We explored several embedding models such as TF-IDF (Baseline), FastText, Gensim, BERT, and ADA. We used the Software Defects Data containing bug reports for various software projects to evaluate the performance of these models. Our experimental results showed that BERT generally outperformed the rest of the models regarding recall, followed by ADA, Gensim, FastText, and TFIDF. Our study provides insights into the effectiveness of different embedding methods for retrieving similar bug reports and highlights the impact of selecting the appropriate one for this task. Our code is available on GitHub.
研究の動機と目的
- 意味的テキスト類似度を用いたバグレポートの重複検出において、さまざまなテキスト埋め込みモデルの有効性を評価すること。
- 実世界のバグレポートデータセットにおける、従来型(TF-IDF、FastText、Gensim)と最先端(BERT、ADA)の両方の埋め込みモデルの性能を比較すること。
- ソフトウェア工学ワークフローにおける効率的な重複バグレポート検出のためのモデル選定と評価手法に関する実用的知見を提供すること。
- 検索空間を親レポートや固有レポートに限定することの限界を強調し、評価にすべての関連レポートを含めるべきであると提言すること。
提案手法
- Firefox、Eclipse、MozillaCore、JDT、Thunderbirdプロジェクトのバグレポートを含むソフトウェア欠陥データセットを活用した。
- 5つの埋め込みモデル(TF-IDF(ベースライン)、FastText、Gensim(LDAベース)、BERT、ADA(GPT-3.5))を適用し、バグレポートの要約および説明の密集表現を生成した。
- クエリレポートとデータベース内すべての既存レポート間のコサイン類似度を用いて意味的類似度を計算した。
- 複数のリポジトリにおけるリCALL@k(k=5)を用いてモデルの性能を評価した。日付制約の有無を含めた評価も実施した。
- 検索空間サイズと年齢ベースのフィルタリングのアブレーションスタディを実施し、検索効率に与える実用的影響を評価した。
- 真値ラベル付けと評価のため、子レポートをその親レポートにリンクするハッシュマップを用いた。

実験結果
リサーチクエスチョン
- RQ1異なるテキスト埋め込みモデルは、重複バグレポート検出におけるリCALL@5において、どのように比較されるか?
- RQ2検索空間に親レポートに加えて固有レポートを含めることで、親レポートのみを用いる場合と比較して、より現実的な性能評価が可能になるか?
- RQ3作成日時で検索空間を制限することは、リtrieval性能とモデルランクにどのように影響するか?
- RQ4BERT や ADA のような大規模言語モデルは、TF-IDF や FastText といった従来モデルを上回って、バグレポートの意味的類似度タスクで優れた性能を示せるか?
- RQ5トップ-k推薦を制限することで、トライエージェントの効率を向上させる実用的インパクトは何か?
主な発見
- BERTはすべてのリポジトリで最高のリCALLを達成し、FirefoxとEclipseでは最大のリCALL@5が35に達し、他のモデルを顕著に上回った。
- ADA(GPT-3.5)は強力な性能を示し、リCALL@5が32~38の範囲で2位にランクされた。これは意味的類似度タスクにおける優れた一般化能力を示している。
- GensimとFastTextはBERTやADAより劣り、Gensimは最大でリCALL@5が25に達した。FastTextは一部のケースでTF-IDFのベースラインをわずかに上回ったにとどまった。
- TF-IDFは弱いベースラインとして機能し、リCALL@5は9~19の範囲にとどまり、意味的理解の限界が顕著に現れた。
- 特定の日付範囲内に作成されたレポートに制限することで、不適切な結果が減少し、実際の親レポートの順位付けが向上した。
- 固有レポートを検索空間から除外した場合、実際のトライエージェントがすべての既存レポートを検索する現実の状況を反映せず、性能が誇張された評価となった。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。