Skip to main content
QUICK REVIEW

[論文レビュー] A Case Study on the Impact of Similarity Measure on Information Retrieval based Software Engineering Tasks

Md. Masudur Rahman, Saikat Chakraborty|arXiv (Cornell University)|Aug 8, 2018
Software Engineering Research参考文献 8被引用数 3
ひとこと要約

本論文は、ソフトウェア工学(SE)タスクにおける情報検索(IR)のパフォーマンスに、さまざまな類似度測定法がどのように影響するかを調査している。テキストおよびコードのアーティファクトに対して、VSM、LSI、BM25、WMDを評価した。その結果、文脈に配慮したモデル(LSI、WMD)はテキストで優れたパフォーマンスを示す一方、ボックスト・オブ・ワードモデルはコードで優れていることが判明した。BM25は、テキストとコードが混在するタスクで最もバランスの取れたパフォーマンスを示し、SEツールの効果を高めるには、アーティファクトの種別に応じてモデル選択を行う必要があることが示された。

ABSTRACT

Information Retrieval (IR) plays a pivotal role in diverse Software Engineering (SE) tasks, e.g., bug localization and triaging, code retrieval, requirements analysis, etc. The choice of similarity measure is the core component of an IR technique. The performance of any IR method critically depends on selecting an appropriate similarity measure for the given application domain. Since different SE tasks operate on different document types like bug reports, software descriptions, source code, etc. that often contain non-standard domain-specific vocabulary, it is essential to understand which similarity measures work best for different SE documents. This paper presents two case studies on the effect of different similarity measure on various SE documents w.r.t. two tasks: (i) project recommendation: finding similar GitHub projects and (ii) bug localization: retrieving buggy source file(s) correspond to a bug report. These tasks contain a diverse combination of textual (i.e. description, readme) and code (i.e. source code, API, import package) artifacts. We observe that the performance of IR models varies when applied to different artifact types. We find that, in general, the context-aware models achieve better performance on textual artifacts. In contrast, simple keyword-based bag-of-words models perform better on code artifacts. On the other hand, the probabilistic ranking model BM25 performs better on a mixture of text and code artifacts. We further investigate how such an informed choice of similarity measure impacts the performance of SE tools. In particular, we analyze two previously proposed tools for project recommendation and bug localization tasks, which leverage diverse software artifacts, and observe that an informed choice of similarity measure indeed leads to improved performance of the existing SE tools.

研究の動機と目的

  • 類似度測定法の選択が、多様なソフトウェア工学アーティファクトにおいてIRパフォーマンスに与える影響を理解すること。
  • VSM、LSI、BM25、WMDが、テキストおよびコードベースのSE文書の異なるタイプに対してどれほど効果的であるかを評価すること。
  • 適切な類似度測定法の選択が、プロジェクト推薦およびバグロケーションのための既存のIRベースのSEツールのパフォーマンスを向上させることを調査すること。
  • 最適なSEツールパフォーマンスを達成するため、類似度測定法を文書タイプにマッチングするための実証的指針を提供すること。

提案手法

  • 2つのケーススタディを実施:プロジェクト推薦(GitHubプロジェクト1,832件)およびバグロケーション(バグレポート1,100件)。
  • 4つの類似度測定法を評価:ベクトル空間モデル(VSM)、顕在的意味インデクシング(LSI)、BM25、ワードモーバー距離(WMD)。
  • 公平な比較を確保するため、すべてのモデルで標準化された前処理(ストップワード除去、ステミング)を実施。
  • ラベル付け済み関連性判断に基づき、標準的なIR評価指標(例:精度、再現率、MAP)を用いてパフォーマンスを測定。
  • 純粋なテキスト、純粋なコード、およびテキストとコードが混在するアーティファクトごとに、モデルのパフォーマンスを別々に分析。
  • 最適化された類似度測定法を用いて、2つの既存のSEツール(プロジェクト推薦およびバグロケーション用)を再評価し、パフォーマンス向上の有無を評価。

実験結果

リサーチクエスチョン

  • RQ1異なる種類のソフトウェアアーティファクトにおいて、IRベースのプロジェクト推薦に最も適した類似度測定法は何か?
  • RQ2バグレポートからバグのあるソースファイルを検索する際、IRモデルのパフォーマンスはどのように変化するか?
  • RQ3アーティファクトの種別に応じて類似度測定法を選択することで、既存のSEツールのパフォーマンスが向上するか?
  • RQ4文脈に配慮したモデル(LSI、WMD)とキーワードベースのモデル(VSM、BM25)は、コードと自然言語アーティファクトの両方でどのように比較されるか?

主な発見

  • 文脈に配慮したモデル(LSI、WMD)は、バグレポートやプロジェクト概要など、純粋なテキストアーティファクトで優れたパフォーマンスを発揮する。
  • シンプルなボックスト・オブ・ワードモデル(VSM)は、ソースコードの構造的・低曖昧性の性質を考慮すると、コードアーティファクトで優れたパフォーマンスを示す。
  • BM25は、テキストとコードが混在するアーティファクトにおいて、多様な文書タイプにわたるパフォーマンスのバランスを最適化し、最も優れた全体的パフォーマンスを示す。
  • 既存のSEツールをタスク固有の類似度測定法に再設定することで、測定可能なパフォーマンス向上が得られ、適切なモデル選択の影響を裏付けた。
  • 本研究は、あらゆるアーティファクトタイプに最適な類似度測定法が存在しないこと、モデル選択はデータ駆動的かつアーティファクトに配慮したものでなければならないことを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。