Skip to main content
QUICK REVIEW

[논문 리뷰] A Comparative Study of Text Embedding Models for Semantic Text Similarity in Bug Reports

Avinash Patil, Kihwan Han|arXiv (Cornell University)|2023. 08. 17.
Software Engineering ResearchComputer Science인용 수 3
한 줄 요약

이 연구는 버그 리포트 중복 검출에서 의미적 텍스트 유사도를 위해 다섯 가지 텍스트 임베딩 모델—TF-IDF, FastText, Gensim, BERT, ADA(GPT-3.5)—을 평가한다. 소프트웨어 결함 데이터셋을 사용하여 BERT는 여러 레포지터리에서 가장 높은 리콜을 기록했으며, ADA, Gensim, FastText, TF-IDF를 모두 앞서며 이 작업에 있어서 문맥 기반 임베딩의 우수성을 입증한다.

ABSTRACT

Bug reports are an essential aspect of software development, and it is crucial to identify and resolve them quickly to ensure the consistent functioning of software systems. Retrieving similar bug reports from an existing database can help reduce the time and effort required to resolve bugs. In this paper, we compared the effectiveness of semantic textual similarity methods for retrieving similar bug reports based on a similarity score. We explored several embedding models such as TF-IDF (Baseline), FastText, Gensim, BERT, and ADA. We used the Software Defects Data containing bug reports for various software projects to evaluate the performance of these models. Our experimental results showed that BERT generally outperformed the rest of the models regarding recall, followed by ADA, Gensim, FastText, and TFIDF. Our study provides insights into the effectiveness of different embedding methods for retrieving similar bug reports and highlights the impact of selecting the appropriate one for this task. Our code is available on GitHub.

연구 동기 및 목표

  • 의미적 텍스트 유사도를 이용한 중복 버그 리포트 식별에 있어 다양한 텍스트 임베딩 모델의 효과성을 평가하는 것.
  • 실제 소프트웨어 버그 리포트 데이터셋에서 기존 모델(TF-IDF, FastText, Gensim)과 최신 기술 모델(BERT, ADA) 간의 성능을 비교하는 것.
  • 소프트웨어 공학 워크플로우에서 효율적인 중복 버그 리포트 검출을 위한 모델 선택 및 평가 방법론에 대한 실용적 통찰을 제공하는 것.
  • 검색 공간을 부모 리포트 또는 유일한 리포트로만 제한하는 것의 한계를 부각하고, 평가에 모든 관련 리포트를 포함할 것을 주장하는 것.

제안 방법

  • Firefox, Eclipse, MozillaCore, JDT, Thunderbird 프로젝트의 버그 리포트를 포함한 소프트웨어 결함 데이터셋을 사용하였다.
  • 다섯 가지 임베딩 모델—TF-IDF(기준), FastText, Gensim(LDA 기반), BERT, ADA(GPT-3.5)—을 적용하여 버그 리포트 요약 및 설명의 조밀한 벡터 표현을 생성하였다.
  • 쿼리 리포트와 데이터베이스 내 모든 기존 리포트 간의 코사인 유사도를 사용해 의미적 유사도를 계산하였다.
  • 여러 레포지터리에서 일정 기간(예: k=5) 기준 리콜@k를 사용해 모델 성능을 평가하였으며, 날짜 기반 제약 조건 유무에 따라 평가를 수행하였다.
  • 검색 공간 크기와 연령 기반 필터링에 대한 분석을 통해 검색 효율성에 미치는 실용적 영향을 평가하였다.
  • 기본값 레이블링 및 평가를 위해 자식 리포트를 그 부모 리포트에 연결하기 위해 해시 맵을 사용하였다.
Figure 1: Accuracy vs Number of Recommendations.
Figure 1: Accuracy vs Number of Recommendations.

실험 결과

연구 질문

  • RQ1다양한 텍스트 임베딩 모델은 중복 버그 리포트 검출의 리콜@5 기준으로 어떻게 비교될 수 있는가?
  • RQ2검색 공간에 부모 리포트뿐만 아니라 유일한 리포트도 포함할 경우, 부모 리포트만 사용하는 것보다 더 현실적인 성능 평가가 가능한가?
  • RQ3생성 일자 기반으로 검색 공간을 제약할 경우, 검색 성능과 모델 순위에 어떤 영향을 미치는가?
  • RQ4BERT 및 ADA와 같은 대규모 언어 모델이 TF-IDF 및 FastText와 같은 기존 모델보다 버그 리포트의 의미적 유사도 작업에서 뛰어난 성능을 보일 수 있는가?
  • RQ5상위-k 추천을 제한하는 것이 트리에 엔지니어의 효율성을 향상시키는 데 실용적인 함의가 있는가?

주요 결과

  • BERT는 모든 레포지터리에서 가장 높은 리콜을 기록했으며, Firefox와 Eclipse에서는 최대 리콜@5가 35로 다른 모델들을 크게 앞섰다.
  • ADA(GPT-3.5)는 강력한 성능을 보였으며, 리콜@5 값이 32~38로 두 번째로 높게 기록되어 의미적 유사도 작업에 대해 뛰어난 일반화 능력을 보였다.
  • Gensim과 FastText는 BERT와 ADA에 비해 성능이 열등했으며, Gensim는 최대 리콜@5가 25에 그쳤고, FastText는 일부 경우에서 TF-IDF 기준선을 약간 넘어서는 수준이었다.
  • TF-IDF는 약한 기준선으로서 리콜@5 값이 9에서 19 사이로 나타나 의미적 이해 능력이 제한됨을 시사했다.
  • 특정 일자 범위 내에서 생성된 리포트로 검색 공간을 제한함으로써 관련 없는 결과가 감소하고 실제 부모 리포트의 순위가 향상되었다.
  • 유일한 리포트를 검색 공간에서 제외할 경우 성능이 과도하게 높아지는 결과가 발생했으며, 실제 트리에 과정에서는 모든 기존 리포트를 검색해야 하므로 이는 현실과 다름을 보여주었다.
Figure 2: Recall Comparison for Each Bug Database.
Figure 2: Recall Comparison for Each Bug Database.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.