Skip to main content
QUICK REVIEW

[论文解读] Large Language Models for Failure Mode Classification: An Investigation

Michael Stewart, Melinda Hodkiewicz|arXiv (Cornell University)|Sep 15, 2023
Text Readability and Simplification被引用 7
一句话总结

本文研究了大型语言模型(LLMs)在故障模式分类(FMC)中的应用,表明在小规模高质量标注数据集上微调GPT-3.5可显著提升FMC性能(F1=0.80),相比基线文本分类器(F1=0.60)和零样本GPT-3.5(F1=0.46),证明微调在特定领域维护任务中实现高精度是必不可少的。

ABSTRACT

In this paper we present the first investigation into the effectiveness of Large Language Models (LLMs) for Failure Mode Classification (FMC). FMC, the task of automatically labelling an observation with a corresponding failure mode code, is a critical task in the maintenance domain as it reduces the need for reliability engineers to spend their time manually analysing work orders. We detail our approach to prompt engineering to enable an LLM to predict the failure mode of a given observation using a restricted code list. We demonstrate that the performance of a GPT-3.5 model (F1=0.80) fine-tuned on annotated data is a significant improvement over a currently available text classification model (F1=0.60) trained on the same annotated data set. The fine-tuned model also outperforms the out-of-the box GPT-3.5 (F1=0.46). This investigation reinforces the need for high quality fine-tuning data sets for domain-specific tasks using LLMs.

研究动机与目标

  • 评估大型语言模型(LLMs)在工业维护中关键任务——故障模式分类(FMC)中的有效性。
  • 探究仅通过提示工程是否可在无需微调的情况下实现强大的FMC性能。
  • 确定在特定领域标注数据上微调LLMs是否能提升FMC准确率,相比传统文本分类模型。
  • 评估在工业环境中部署LLMs进行FMC时面临的实际障碍,包括推理稳定性、成本和数据隐私问题。

提出的方法

  • 本研究使用GPT-3.5作为主要LLM,评估了零样本提示和微调推理在FMC中的表现。
  • 采用提示工程策略,将22个ISO 14224故障模式代码列表嵌入系统提示中,以限制输出。
  • 在从维护工单中整理的502对(观测,标签)的精选数据集上进行微调,其中验证集和测试集各包含62个样本。
  • 使用F1-score评估性能,并与在相同数据上训练的Flair文本分类模型进行比较。
  • 数据集源自真实维护工单,通过命名实体识别提取故障观测内容,标签由领域专家分配。
  • 推理通过OpenAI API执行,温度设置为0,以减少评估期间的非确定性输出。

实验结果

研究问题

  • RQ1哪种提示格式最能有效支持LLM在不进行微调的情况下执行FMC?
  • RQ2在使用LLM进行FMC时,微调是否为实现高性能所必需?
  • RQ3微调后的LLM与在相同FMC任务上表现的Flair等传统文本分类模型相比,性能如何?
  • RQ4在工业环境中部署LLMs进行FMC时,会遇到哪些实际挑战?

主要发现

  • 在小规模高质量标注数据集上微调GPT-3.5,F1得分达到0.80,显著优于零样本GPT-3.5(F1=0.46)。
  • 微调后的LLM也优于在相同数据上训练的Flair文本分类器,后者F1得分为0.60。
  • 仅通过提示工程(无微调)的性能表现较差(F1=0.46),表明提示设计本身不足以实现FMC的高准确率。
  • 微调后的LLM在少数类故障模式上表现出更好的泛化能力,可能得益于其在多样化语料库上预训练所获得的广泛知识基础。
  • 推理过程稳定且成本可控,每次实验成本约为1美元,尽管在推理过程中观察到速率限制和非确定性输出问题。
  • 本研究强调,高质量标注数据对于在特定领域维护应用中实现有效的LLM微调至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。