Skip to main content
QUICK REVIEW

[논문 리뷰] Empirical Evaluation of ChatGPT on Requirements Information Retrieval Under Zero-Shot Setting

Jianzhang Zhang, Yiyang Chen|ArXiv.org|2023. 04. 25.
Software Engineering Research인용 수 5
한 줄 요약

이 논문은 제로샷 설정에서 ChatGPT의 요구사항 정보 검색(IR) 작업에 대한 성능을 평가한다. 이는 기능 요구사항 및 비기능 요구사항(NFR) 분류, 도메인 용어 추출을 포함한다. 두 가지 아티팩트 유형(앱 리뷰 및 앱 설명서)에 걸쳐 네 개의 벤치마크 데이터셋을 사용한 결과, 높은 리콜을 보였지만 정밀도는 낮아, 검색의 관련성은 뛰어나지만 구체성은 제한됨을 시사한다.

ABSTRACT

Recently, various illustrative examples have shown the impressive ability of generative large language models (LLMs) to perform NLP related tasks. ChatGPT undoubtedly is the most representative model. We empirically evaluate ChatGPT's performance on requirements information retrieval (IR) tasks to derive insights into designing or developing more effective requirements retrieval methods or tools based on generative LLMs. We design an evaluation framework considering four different combinations of two popular IR tasks and two common artifact types. Under zero-shot setting, evaluation results reveal ChatGPT's promising ability to retrieve requirements relevant information (high recall) and limited ability to retrieve more specific requirements information (low precision). Our evaluation of ChatGPT on requirements IR under zero-shot setting provides preliminary evidence for designing or developing more effective requirements IR methods or tools based on LLMs.

연구 동기 및 목표

  • 제로샷 설정에서 파라미터 미세조정 없이 ChatGPT가 요구사항 관련 정보를 검색하는 데 얼마나 효과적인지 평가하기 위해.
  • ChatGPT와 같은 생성형 LLM이 자연어 프롬프트만으로 다양한 요구사항 IR 작업을 얼마나 잘 수행할 수 있는지 조사하기 위해.
  • 요구사항 공학(RE) 분야에서 더 효과적인 LLM 기반 도구 설계를 위한 실증적 근거를 제공하기 위해.
  • 앱 리뷰 및 설명서와 같은 도메인 특화 요구사항 아티팩트를 처리할 때 현재 LLM의 강점과 한계를 규명하기 위해.
  • 미래의 연구를 위한 프롬프트 엔지니어링, 도메인 특화 LLM 적응, NLP4RE를 위한 벤치마크 개발을 안내하기 위해.

제안 방법

  • 연구는 네 개의 공개된 요구사항 IR 벤치마크 데이터셋을 활용한 제로샷 평가 프레임워크를 사용한다.
  • 네 가지 IR 작업을 평가한다: 기능 요구사항 분류, 비기능 요구사항(NFR) 분류, 앱 리뷰 및 앱 설명서에서의 도메인 용어 추출.
  • 각 작업은 ChatGPT가 특정 응답을 유도하도록 설계된 표준화된 프롬프트를 사용하여 평가되며, 실제 사용자 질의를 시뮬레이션한다.
  • 평가 지표로는 정밀도, 리콜, F1 점수를 사용하여 검색 성능을 정량적으로 평가한다.
  • 오답 결과 및 추론 패턴을 분석하기 위해 정성적 분석도 실시한다.
  • 평가 대상은 사용자가 생성한 앱 리뷰와 공식 앱 설명서의 두 가지 아티팩트 유형이다.
Figure 1: The Framework for Evaluating ChatGPT on Requirements IR Tasks
Figure 1: The Framework for Evaluating ChatGPT on Requirements IR Tasks

실험 결과

연구 질문

  • RQ1제로샷 설정에서 ChatGPT는 앱 리뷰와 앱 설명서에서 기능 요구사항을 얼마나 잘 검색하는가?
  • RQ2동일한 아티팩트 유형에서 ChatGPT는 비기능 요구사항(NFR)을 식별하는 데 얼마나 성능이 좋은가?
  • RQ3파라미터 미세조정 없이 ChatGPT는 요구사항 관련 텍스트에서 도메인 특화 용어를 얼마나 효과적으로 추출하는가?
  • RQ4다양한 IR 작업에서 정밀도와 리콜 측면에서 ChatGPT의 강점과 한계는 무엇인가?
  • RQ5결과는 요구사항 공학을 위한 미래의 LLM 기반 도구 설계에 어떻게 기여하는가?

주요 결과

  • ChatGPT는 모든 작업에서 높은 리콜을 보이며, 관련 요구사항 정보를 효과적으로 검색할 수 있음을 시사한다.
  • 그러나 정밀도는 낮은 편이며, 특히 기능 요구사항 및 NFR 분류 작업에서 높은 비율의 관련 없거나 잘못된 결과를 출력함을 나타낸다.
  • 분류 작업 대비 도메인 용어 추출 작업에서 더 나은 성능을 보였지만, 여전히 뚜렷한 오류율을 보였다.
  • 정성적 분석 결과, ChatGPT는 종종 타당해 보이지만 잘못된 분류를 생성하는 경향이 있으며, 특히 기능 요구사항과 비기능 요구사항을 구분하는 데 어려움을 겪는다.
  • 앱 리뷰의 맥락적 특수성에서 어려움을 겪어, 사용자 의견을 요구사항으로 잘못 분류하는 경우가 많다.
  • 한계가 있음에도 불구하고, 결과는 ChatGPT가 요구사항 공학 분야에서 종단 간 채팅 기반 요구사항 검색 도구 개발의 유망한 기반으로 활용될 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.