Skip to main content
QUICK REVIEW

[논문 리뷰] CUPID: Leveraging ChatGPT for More Accurate Duplicate Bug Report Detection

Ting Zhang, Ivana Clairine Irsan|arXiv (Cornell University)|2023. 08. 19.
Software Engineering Research인용 수 5
한 줄 요약

Cupid는 버그 리포트에서 핵심 의미 정보를 추출하기 위해 Zero-shot 설정에서 OpenAI의 ChatGPT를 활용하는 하이브리드 접근법을 제안한다. 이 정보는 최신 기존 DBRD 방법인 REP에 입력되며, 이 조합은 Recall Rate@10가 0.59에서 0.67 사이로 새로운 SOTA 성능을 달성한다. 이는 이전의 딥러닝 및 기존 방법보다 최대 79.2% 향상된 성능이다.

ABSTRACT

Duplicate bug report detection (DBRD) is a long-standing challenge in both academia and industry. Over the past decades, researchers have proposed various approaches to detect duplicate bug reports more accurately. With the recent advancement of deep learning, researchers have also proposed several deep learning-based approaches to address the DBRD task. In the bug repositories with many bug reports, deep learning-based approaches have shown promising performance. However, in the bug repositories with a smaller number of bug reports, i.e., around 10k, the existing deep learning approaches show worse performance than the traditional approaches. Traditional approaches have limitations, too, e.g., they are usually based on the bag-of-words model, which cannot capture the semantics of bug reports. To address these aforementioned challenges, we seek to leverage a state-of-the-art large language model (LLM) to improve the performance of the traditional DBRD approach. In this paper, we propose an approach called CUPID, which combines the bestperforming traditional DBRD approach (i.e., REP) with the state-of-the-art LLM (i.e., ChatGPT). We conducted an evaluation by comparing CUPID with three existing approaches on three datasets. The experimental results show that CUPID achieves state-of-theart results, reaching Recall Rate@10 scores ranging from 0.602 to 0.654 across all the datasets analyzed. In particular, CUPID improves over the prior state-ofthe-art approach by 5% - 8% in terms of Recall Rate@10 in the datasets. CUPID also surpassed the state-of-the-art deep learning-based DBRD approach by up to 82%.

연구 동기 및 목표

  • 기존의 딥러닝 기반 중복 버그 리포트 탐지(DBRD) 방법이 약 10,000개의 이슈를 가진 일반적인 저장소에서는 데이터셋 크기가 너무 작아 효과적인 모델 훈련이 어려워 성능이 열 劣하다는 문제를 해결하기 위해.
  • 기존 DBRD 접근법이 bag-of-words 모델에 의존하여 의미적 의미를 포착하지 못한다는 한계를 극복하기 위해.
  • LLM(대규모 언어 모델)인 ChatGPT와 같은 모델이 낮은 데이터 환경에서 의미 있는 의미 특징을 추출함으로써 DBRD 정확도를 향상시킬 수 있는지 탐색하기 위해.
  • 프롬프트 엔지니어링 및 LLM 선택이 하이브리드 DBRD 시스템 성능에 미치는 영향을 평가하기 위해.

제안 방법

  • 각 버그 리포트를 분석하고 핵심 의미 키워드 및 어휘를 추출하기 위해 ChatGPT를 Zero-shot 설정에서 활용한다.
  • 추출된 핵심 정보를 기반으로 의미 유사도와 특징 공학에 기반한 고성능 기존 DBRD 방법인 REP 알고리즘에 입력한다.
  • ChatGPT가 추출하는 정보의 품질을 최적화하기 위해 다양한 프롬프트 템플릿과 선택 규칙을 설계하고 평가한다.
  • 세 가지 베이스라인과 성능을 비교한다: 이전 SOTA 딥러닝 모델인 SABD, 기존의 REP 방법, Llama 2-13B를 사용한 강력한 베이스라인.
  • 일반적인 프로젝트 규모를 반영하기 위해 약 10,000개의 이슈를 가진 세 개의 실제 워크로드 데이터셋에서 실험을 수행하여 일반화 가능성을 확보한다.
  • 상위 10개 결과 내에서 중복 리포트를 검색하는 데 효과성을 측정하기 위해 Recall Rate@10를 주요 평가 지표로 사용한다.

실험 결과

연구 질문

  • RQ1RQ1: 일반적인 이슈 수(~10,000개)를 가진 저장소에서 ChatGPT와 같은 대규모 언어 모델을 통합함으로써 기존 DBRD 방법의 성능을 크게 향상시킬 수 있는가?
  • RQ2RQ2: 다양한 프롬프트 템플릿과 선택 규칙은 Cupid의 LLM 기반 정보 추출 단계 성능에 어떤 영향을 미치는가?
  • RQ3RQ3: Cupid는 Recall Rate@10 측면에서 SOTA 딥러닝 기반 및 기존 DBRD 접근법과 비교해 어떻게 성능을 내는가?
  • RQ4RQ4: WizardLM-13B, Vicuna-13B, Llama 2-13B-Chat와 같은 오픈소스 LLM은 이 DBRD 환경에서 ChatGPT와 유사한 성능을 낼 수 있는가?

주요 결과

  • Cupid는 평가된 세 데이터셋 전반에서 Recall Rate@10가 0.59에서 0.67 사이로 나타나 일반적인 저장소에서 DBRD의 새로운 SOTA를 달성한다.
  • Cupid는 이전 SOTA 딥러닝 접근법인 SABD보다 Recall Rate@10에서 최대 79.2% 향상되어 뚜렷한 성능 향상을 보였다.
  • Cupid는 최고 성능을 보인 기존 방법인 REP보다 Recall Rate@10에서 6.7%에서 8.7% 향상되어, 낮은 데이터 환경에서 LLM을 보완한 기존 방법이 순수 딥러닝 모델보다 뛰어난 성능을 낼 수 있음을 보여준다.
  • 프롬프트 엔지니어링은 성능에 큰 영향을 미치며, 최적화된 템플릿과 선택 규칙은 추출된 특징의 품질 향상에 명확한 기여를 한다.
  • WizardLM-13B는 Recall Rate@10에서 ChatGPT에 비해 오직 2%의 성능 하락만을 보이며 유사한 성능을 달성하여, 이 작업에 있어 오픈소스 LLM의 잠재력이 높다는 것을 시사한다.
  • 본 연구는 ChatGPT의 성능가 데이터 기억화 때문인 것이 아니며, 다양한 프롬프트 구조에서 비현실적으로 높은 점수를 보이지 않아 데이터 泄露에 대한 우려를 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.