[논문 리뷰] Beyond ChatGPT: Enhancing Software Quality Assurance Tasks with Diverse LLMs and Validation Techniques
이 논문은 소프트웨어 품질 보증(SQA) 분야에서 장애 국소화 및 취약성 탐지 작업을 위해 다양한 LLM(GPT-3.5, GPT-4o, LLaMA-3-70B, LLaMA-3-8B, Gemma-7B, Mixtral-8x7B)을 평가한다. 투표 기반 메커니즘과 검증 프롬프트를 활용한 교차 검증을 제안하여 GPT-3.5 대비 10% 이상 향상된 성능을 달성했으며, 장애 국소화 분야에선 최대 16% 향상된 성능을 기록했다.
With the advancement of Large Language Models (LLMs), their application in Software Quality Assurance (SQA) has increased. However, the current focus of these applications is predominantly on ChatGPT. There remains a gap in understanding the performance of various LLMs in this critical domain. This paper aims to address this gap by conducting a comprehensive investigation into the capabilities of several LLMs across two SQA tasks: fault localization and vulnerability detection. We conducted comparative studies using GPT-3.5, GPT-4o, and four other publicly available LLMs (LLaMA-3-70B, LLaMA-3-8B, Gemma-7B, and Mixtral-8x7B), to evaluate their effectiveness in these tasks. Our findings reveal that several LLMs can outperform GPT-3.5 in both tasks. Additionally, even the lower-performing LLMs provided unique correct predictions, suggesting the potential of combining different LLMs' results to enhance overall performance. By implementing a voting mechanism to combine the LLMs' results, we achieved more than a 10% improvement over the GPT-3.5 in both tasks. Furthermore, we introduced a cross-validation approach to refine the LLM answer by validating one LLM answer against another using a validation prompt. This approach led to performance improvements of 16% in fault localization and 12% in vulnerability detection compared to the GPT-3.5, with a 4% improvement compared to the best-performed LLMs. Our analysis also indicates that the inclusion of explanations in the LLMs' results affects the effectiveness of the cross-validation technique.
연구 동기 및 목표
- GPT-3.5를 초월한 다양한 LLM의 성능이 장애 국소화 및 취약성 탐지와 같은 핵심 SQA 작업에서 어떻게 나타나는지 조사하기 위해.
- 모델 크기, 아키텍처, 작업 복잡도에 따라 LLM 간 성능 차이를 규명하기 위해.
- 집단 기법인 투표 및 검증 프롬프트를 활용한 교차 검증을 통해 LLM 기반 SQA 결과를 향상시키기 위해.
- 설명 품질이 교차 검증 정밀화 과정의 효과성에 미치는 영향을 평가하기 위해.
- 단일 모델(GPT-3.5)에 의존하는 것에서 벗어나 SQA 워크플로우에서 LLM을 선택하고 조합하는 데 기초가 되는 벤치마크 제공하기 위해.
제안 방법
- 이전 연구에서 사용된 표준화된 데이터셋을 활용해, 여섯 종류의 LLM(GPT-3.5, GPT-4o, LLaMA-3-70B, LLaMA-3-8B, Gemma-7B, Mixtral-8x7B)을 두 가지 SQA 작업에 대해 비교 분석하였다.
- 다양한 강점을 보완하기 위해, 최종 예측 결과를 다수결 원칙에 따라 결정하는 투표 기반 메커니즘을 적용하였다.
- 한 LLM의 출력 결과를 다른 LLM의 응답을 기반으로 검증하는 교차 검증 방식을 설계하였으며, 전용 검증 프롬프트를 사용하였다.
- 장애 국소화 작업에서는 GPT-4o와 LLaMA-3-70B를 주요 정밀화 쌍으로, 취약성 탐지 작업에서는 GPT-4o와 Gemma-7B를 사용하였다.
- 장애 국소화의 경우 Top-1 정확도, 취약성 탐지의 경우 F1 점수를 표준 평가 지표로 사용하였다.
- 결과의 안정성 확보 및 평가 과정에서의 무작위성 감소를 위해 각 LLM에 대해 3회 별도의 실행을 수행하였다.

실험 결과
연구 질문
- RQ1GPT-3.5가 현재 SQA 연구에서 기준 모델로 사용되고 있음에도 불구하고, 다양한 LLM이 장애 국소화 및 취약성 탐지 작업에서 GPT-3.5와 비교해 어떻게 성능을 내는가?
- RQ2여러 LLM의 예측 결과를 투표 방식으로 조합하면 개별 모델 성능을 초월하는 SQA 작업 성능 향상이 가능한가?
- RQ3검증 프롬프트를 활용한 교차 검증이 SQA 작업에서 LLM 예측 정확도를 유의미하게 향상시키는가?
- RQ4LLM 출력 결과에 설명을 포함할 경우, 교차 검증 정밀화 과정의 효과성이 어떻게 영향을 받는가?
- RQ5파rameter 수가 적은 소형 LLM인 Gemma-7B는 특정 SQA 작업에서 성능 경쟁력이 있는가?
주요 결과
- GPT-4o는 장애 국소화에서 가장 높은 성능을 기록하여, GPT-3.5 대비 Top-1 정확도를 16.24% 향상시켰다.
- Gemma-7B는 연구에서 가장 작은 모델임에도 불구하고, 취약성 탐지에서 GPT-3.5 대비 정확도 7.8% 향상된 성과를 기록했다.
- 투표 기반 메커니즘은 장애 국소화에서 GPT-3.5 대비 13.7% 향상되었고, 취약성 탐지에서는 11.2% 향상되었다.
- GPT-4o의 출력 결과를 LLaMA-3-70B가 검증하는 교차 검증 방식은 장애 국소화에서 GPT-3.5 대비 16% 향상되었으며, LLaMA-3-70B 단독 성능 대비 4.1% 향상되었다.
- 취약성 탐지 분야에서는 GPT-4o의 출력 결과를 Gemma-7B가 검증함으로써 GPT-3.5 대비 12% 향상되었고, GPT-4o 단독 성능 대비 7.1% 향상되었다.
- 교차 검증의 효과성은 LLM 출력 결과의 설명 품질에 영향을 받았으며, Gemma-7B와 같은 모델은 제한된 정밀화 능력을 보였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.