Skip to main content
QUICK REVIEW

[论文解读] Empirical Evaluation of ChatGPT on Requirements Information Retrieval Under Zero-Shot Setting

Jianzhang Zhang, Yiyang Chen|ArXiv.org|Apr 25, 2023
Software Engineering Research被引用 5
一句话总结

本文评估了 ChatGPT 在零样本设置下在需求信息检索(IR)任务中的表现,包括功能需求与非功能性需求(NFR)分类以及领域术语提取。基于两种类型(应用评论与应用描述)的四个基准数据集的实验结果表明,召回率较高但精确率较低,表明其在相关性检测方面表现良好,但在检索的特异性方面表现有限。

ABSTRACT

Recently, various illustrative examples have shown the impressive ability of generative large language models (LLMs) to perform NLP related tasks. ChatGPT undoubtedly is the most representative model. We empirically evaluate ChatGPT's performance on requirements information retrieval (IR) tasks to derive insights into designing or developing more effective requirements retrieval methods or tools based on generative LLMs. We design an evaluation framework considering four different combinations of two popular IR tasks and two common artifact types. Under zero-shot setting, evaluation results reveal ChatGPT's promising ability to retrieve requirements relevant information (high recall) and limited ability to retrieve more specific requirements information (low precision). Our evaluation of ChatGPT on requirements IR under zero-shot setting provides preliminary evidence for designing or developing more effective requirements IR methods or tools based on LLMs.

研究动机与目标

  • 评估在零样本设置下,未经微调的 ChatGPT 在检索需求相关信息方面的有效性。
  • 研究类似 ChatGPT 的生成式大语言模型仅通过自然语言提示即可执行多项需求信息检索任务的能力。
  • 为设计更高效的基于大语言模型的需求工程(RE)工具提供实证依据。
  • 识别当前大语言模型在处理领域特定需求文档(如应用评论与描述)方面的优势与局限。
  • 为未来在提示工程、领域特定大语言模型适配以及 NLP4RE 基准开发方面的研究提供指导。

提出的方法

  • 本研究采用零样本评估框架,使用四个公开可用的需求信息检索基准数据集。
  • 评估了四项信息检索任务:功能需求分类、非功能性需求(NFR)分类,以及从应用评论和应用描述中提取领域术语。
  • 每项任务均使用标准化提示,旨在从 ChatGPT 中引出特定响应,模拟真实用户查询。
  • 评估指标包括精确率、召回率和 F1 分数,以定量评估检索性能。
  • 开展定性分析,以考察检索结果的性质,特别是误报情况与推理模式。
  • 评估涵盖两种文档类型:用户生成的应用评论与官方应用描述。
Figure 1: The Framework for Evaluating ChatGPT on Requirements IR Tasks
Figure 1: The Framework for Evaluating ChatGPT on Requirements IR Tasks

实验结果

研究问题

  • RQ1在零样本设置下,ChatGPT 在从应用评论与应用描述中检索功能需求方面的表现如何?
  • RQ2ChatGPT 在同一类文档中识别非功能性需求(NFRs)的性能如何?
  • RQ3在未进行微调的情况下,ChatGPT 在从需求相关文本中提取领域特定术语方面的有效性如何?
  • RQ4在不同信息检索任务中,ChatGPT 在精确率与召回率方面的优势与局限是什么?
  • RQ5这些结果如何为未来基于大语言模型的需求工程工具设计提供指导?

主要发现

  • ChatGPT 在所有任务中均表现出高召回率,表明其在检索相关需求信息方面具有强大能力。
  • 然而,精确率仍然较低,特别是在功能需求与 NFR 分类任务中,表明存在较高的无关或错误结果比例。
  • 与分类任务相比,模型在领域术语提取任务中表现更好,尽管仍存在显著的错误率。
  • 定性分析显示,ChatGPT 经常生成看似合理但错误的分类结果,尤其是在区分功能需求与非功能性需求方面。
  • 模型在应用评论中的上下文特异性细微差别方面表现吃力,常将用户意见误分类为需求。
  • 尽管存在局限,结果表明 ChatGPT 仍可作为构建端到端、基于聊天的需求检索工具在需求工程中应用的有前景基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。