[論文レビュー] CUPID: Leveraging ChatGPT for More Accurate Duplicate Bug Report Detection
Cupidは、バグレポートから重要な意味的情報を抽出するためにゼロショット設定でOpenAIのChatGPTを活用するハイブリッドアプローチを提案する。その情報は、最先端の従来型DBRD手法REPに供給され、この組み合わせにより、Recall Rate@10スコアが0.59から0.67の範囲で、従来のディープラーニングおよび従来型手法を最大79.2%上回る新たなSOTA性能を達成する。
Duplicate bug report detection (DBRD) is a long-standing challenge in both academia and industry. Over the past decades, researchers have proposed various approaches to detect duplicate bug reports more accurately. With the recent advancement of deep learning, researchers have also proposed several deep learning-based approaches to address the DBRD task. In the bug repositories with many bug reports, deep learning-based approaches have shown promising performance. However, in the bug repositories with a smaller number of bug reports, i.e., around 10k, the existing deep learning approaches show worse performance than the traditional approaches. Traditional approaches have limitations, too, e.g., they are usually based on the bag-of-words model, which cannot capture the semantics of bug reports. To address these aforementioned challenges, we seek to leverage a state-of-the-art large language model (LLM) to improve the performance of the traditional DBRD approach. In this paper, we propose an approach called CUPID, which combines the bestperforming traditional DBRD approach (i.e., REP) with the state-of-the-art LLM (i.e., ChatGPT). We conducted an evaluation by comparing CUPID with three existing approaches on three datasets. The experimental results show that CUPID achieves state-of-theart results, reaching Recall Rate@10 scores ranging from 0.602 to 0.654 across all the datasets analyzed. In particular, CUPID improves over the prior state-ofthe-art approach by 5% - 8% in terms of Recall Rate@10 in the datasets. CUPID also surpassed the state-of-the-art deep learning-based DBRD approach by up to 82%.
研究の動機と目的
- 通常のリポジトリ(約1万件のバグ)において、ディープラーニングベースの重複バグレポート検出(DBRD)が低い性能を示す理由を解決すること。これは、モデルの効果的な学習に必要なデータが不足しているためである。
- 従来型DBRDアプローチの限界を克服すること。これらの手法はbag-of-wordsモデルに依存しており、意味的意味を捉えることができない。
- 大規模言語モデル(LLM)であるChatGPTが、データが少ない状況下で意味的特徴を抽出することで、DBRDの正確性を向上させられるかどうかを検証すること。
- プロンプト工学とLLM選定の影響が、ハイブリッドDBRDシステムのパフォーマンスに与える影響を評価すること。
提案手法
- バグレポートを個別に分析し、ChatGPTをゼロショット設定で活用して、重要な意味的キーワードやフレーズを抽出する。
- 抽出されたキーパラメータを、意味的類似性と特徴工学に基づく高パフォーマンスな従来型DBRD手法REPに入力として供給する。
- ChatGPTによる情報抽出の質を最適化するために、複数のプロンプトテンプレートと選択ルールを設計・評価する。
- Cupidのパフォーマンスを3つのベースラインと比較する:先行SOTAのディープラーニングモデルSABD、従来型REP手法、Llama 2-13Bを用いた強力なベースライン。
- 一般的なプロジェクト規模を想定し、通常サイズのリポジトリ(約1万件のバグ)を想定した3つの実世界データセットを用いて実験を行い、一般化可能性を確保する。
- 上位10件の結果内に重複レポートを効果的に検出できるかどうかを測る主な指標として、Recall Rate@10を用いる。
実験結果
リサーチクエスチョン
- RQ1RQ1: 通常の数のバグ(約1万件)を有するリポジトリにおいて、ChatGPTのような大規模言語モデルを統合することで、従来型DBRD手法のパフォーマンスを顕著に向上させられるか?
- RQ2RQ2: プロンプトテンプレートと選択ルールの違いが、CupidのLLMベースの情報抽出ステップのパフォーマンスにどのように影響するか?
- RQ3RQ3: Cupidは、Recall Rate@10の観点から、SOTAのディープラーニングベースおよび従来型DBRDアプローチと比較して、どのように差をつけるか?
- RQ4RQ4: WizardLM-13B、Vicuna-13B、Llama 2-13B-ChatといったオープンソースLLMは、このDBRD設定においてChatGPTと同等のパフォーマンスを達成できるか?
主な発見
- Cupidは、評価した3つのデータセットすべてでRecall Rate@10スコアが0.59から0.67の範囲にあり、通常のリポジトリにおけるDBRDの新たなSOTAを達成した。
- Cupidは、先行SOTAのディープラーニングアプローチ(SABD)を最大79.2%上回るRecall Rate@10を達成し、顕著なパフォーマンス向上を示した。
- Cupidは、最高性能を示した従来型手法(REP)を6.7%から8.7%上回るRecall Rate@10を達成し、データが少ない状況下ではLLMを活用した従来型手法が、純粋なディープラーニングモデルを上回ることを示した。
- プロンプト工学はパフォーマンスに顕著な影響を与え、最適化されたテンプレートと選択ルールにより、抽出された特徴の質が明確に向上した。
- WizardLM-13Bは、ChatGPTと同等のパフォーマンスを達成し、Recall Rate@10でわずか2%の低下にとどまり、このタスクにおけるオープンソースLLMの強力な潜在能力を示した。
- 本研究では、ChatGPTのパフォーマンスがデータの記憶に起因するものではないことが示された。異なるプロンプト構造でも不自然に高いスコアを示さず、データリークの懸念が軽減された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。