Skip to main content
QUICK REVIEW

[论文解读] How LLMs Aid in UML Modeling: An Exploratory Study with Novice Analysts

Beian Wang, Chong Wang|arXiv (Cornell University)|Apr 27, 2024
Business Process Modeling and Analysis被引用 4
一句话总结

本研究探讨了大型语言模型(LLMs)如何协助初学者软件工程学生创建UML用例图、类图和时序图。通过一项针对45名本科生的探索性实验,作者发现LLMs能提供有用的指导并提高建模效率,但在准确捕捉关系和处理格式特定约束方面存在局限,凸显了在教育和专业环境中改进提示工程和人工监督的必要性。

ABSTRACT

Since the emergence of GPT-3, Large Language Models (LLMs) have caught the eyes of researchers, practitioners, and educators in the field of software engineering. However, there has been relatively little investigation regarding the performance of LLMs in assisting with requirements analysis and UML modeling. This paper explores how LLMs can assist novice analysts in creating three types of typical UML models: use case models, class diagrams, and sequence diagrams. For this purpose, we designed the modeling tasks of these three UML models for 45 undergraduate students who participated in a requirements modeling course, with the help of LLMs. By analyzing their project reports, we found that LLMs can assist undergraduate students as novice analysts in UML modeling tasks, but LLMs also have shortcomings and limitations that should be considered when using them.

研究动机与目标

  • 探讨LLMs在支持初学者进行UML建模任务中的作用。
  • 评估LLMs在生成准确且完整的UML图(特别是用例图、类图和时序图)方面的有效性。
  • 识别LLMs在协助初学者进行需求建模方面的优势与局限。
  • 通过评估LLMs作为辅助工具在软件工程教育中的应用,为教学提供依据,同时不取代核心建模能力。
  • 通过识别关键故障点(如关系识别错误和格式相关的信息丢失),为AI辅助建模工具的未来发展提供指导。

提出的方法

  • 在一门需求建模课程中,对45名软件工程专业本科生开展了一项受控实验。
  • 学生被要求使用自然语言提示,借助LLMs生成三种类型的UML模型(用例图、类图、时序图)。
  • 收集并人工分析了学生项目报告,包括最终的UML模型和人-LLM交互日志。
  • 采用二元评分系统(正确/错误)对每个标准进行评估,以衡量模型的准确性和完整性。
  • 比较不同LLM输出格式(如文本与PlantUML)对建模元素识别和图表质量的影响。
  • 识别LLM生成模型中的重复性错误和局限,特别是在建模关系和保持结构保真度方面。
Figure 1 : The process of the experiment
Figure 1 : The process of the experiment

实验结果

研究问题

  • RQ1LLMs在多大程度上能协助初学者生成准确且完整的UML用例图?
  • RQ2LLMs在支持生成类图方面有多有效,特别是在建模类属性、方法和关联关系方面?
  • RQ3LLMs在生成时序图方面以何种方式提供支持或造成阻碍,特别是在建模消息流和生命线方面?
  • RQ4不同LLM输出格式(如自然语言与PlantUML)如何影响最终UML模型的质量和正确性?
  • RQ5LLMs在UML建模中的主要局限是什么,这些局限如何影响AI生成模型对初学者的可靠性?

主要发现

  • LLMs显著协助初学者生成UML模型,提供有用的建议并加速建模过程。
  • LLMs在生成基本结构元素(如参与者、类和消息)方面表现良好,但在处理复杂关系(如关联和依赖)方面表现不佳。
  • 使用结构化输出格式(如PlantUML)相比自由文本输出,显著提高了模型元素的准确性,减少了格式和语法错误。
  • 一个显著的局限是LLM倾向于遗漏或错误表示与关系相关的元素,导致图表不完整或语义错误。
  • 在将LLM生成的文本描述转换为图表格式时,信息丢失现象明显,尤其在时序图和类图中更为突出。
  • 学生频繁需要手动修正或重做LLM生成的模型,表明LLMs更适合用作辅助工具,而非自主建模工具。
Figure 2 : Distribution of the participants with/without experience of using LLMs
Figure 2 : Distribution of the participants with/without experience of using LLMs

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。