Skip to main content
QUICK REVIEW

[论文解读] GPLA-12: An Acoustic Signal Dataset of Gas Pipeline Leakage

Jie Li, Lizhong Yao|arXiv (Cornell University)|Jun 19, 2021
Water Systems and Optimization参考文献 28被引用 9
一句话总结

本文介绍了GPLA-12,这是一个公开可用的声学信号数据集,涵盖12种气体管道泄漏类别,共684个时间序列样本,数据源自真实管道系统,采用双麦克风采集,并预处理为1460点离散信号。深度学习模型,尤其是卷积神经网络(CNN),在故障分类任务中表现优于传统分类器,证明了该数据集在基于时间序列的故障诊断研究中的价值。

ABSTRACT

In this paper, we introduce a new acoustic leakage dataset of gas pipelines, called as GPLA-12, which has 12 categories over 684 training/testing acoustic signals. Unlike massive image and voice datasets, there have relatively few acoustic signal datasets, especially for engineering fault detection. In order to enhance the development of fault diagnosis, we collect acoustic leakage signals on the basis of an intact gas pipe system with external artificial leakages, and then preprocess the collected data with structured tailoring which are turned into GPLA-12. GPLA-12 dedicates to serve as a feature learning dataset for time-series tasks and classifications. To further understand the dataset, we train both shadow and deep learning algorithms to observe the performance. The dataset as well as the pretrained models have been released at both www.daip.club and github.com/Deep-AI-Application-DAIP

研究动机与目标

  • 为解决工业故障检测领域,特别是管道系统中公开可用声学信号数据集稀缺的问题。
  • 提供一个标准化的、开放获取的数据集,用于时间序列分类和故障诊断应用中的特征学习。
  • 评估浅层与深度学习模型在受控管道环境中真实声学泄漏信号上的性能表现。
  • 通过在www.daip.club和GitHub上发布数据集及预训练模型,支持可复现的研究。
  • 为基于声学的故障检测未来基准测试建立基线性能指标。

提出的方法

  • 使用双麦克风装置(MAX4466及另一未指定型号)从一条完全运行的气体管道系统中采集声学信号,其灵敏度和频率响应特性各不相同。
  • 在受控条件下进行数据采集,通过在不同压力点(0.2、0.4、0.5 MPa)人工引入泄漏,并在有噪与无噪环境中分别记录。
  • 每个5秒的音频样本均被预处理为1460个点的离散时间序列信号,以确保机器学习处理的一致性。
  • 数据集被划分为12个带标签的类别,通过在不同运行和环境条件下随机选择样本以保持类别平衡。
  • 采用10折交叉验证和70/30训练-测试划分对11种分类器(包括SVM、KNN、RF、GNB、CNN、RNN和DBN)进行了全面评估。
  • 性能通过F1-score进行衡量,并对各类模型在不同类别上的分类表现进行了详细分析。

实验结果

研究问题

  • RQ1传统机器学习分类器(如SVM、KNN、GNB)在分类气体管道泄漏声学信号方面的有效性如何?
  • RQ2深度学习模型(如CNN、RNN、DBN)在分类复杂管道故障声学信号方面,相较于浅层模型的性能提升程度如何?
  • RQ3在分类GPLA-12数据时,主要挑战是什么,特别是类别不平衡以及类别间信号相似性问题?
  • RQ4不同麦克风配置如何影响所采集声学信号的多样性与质量?
  • RQ5GPLA-12数据集能否作为未来基于声学的故障诊断研究的可靠基准?

主要发现

  • 基于CNN的模型在所有类别中均取得了最高的F1-score,表明其在1维声学时间序列数据上具有卓越的特征提取能力。
  • 高斯朴素贝叶斯(GNB)整体表现良好,可能是因为数据集中泄漏声学信号的分布近似高斯分布。
  • K最近邻(KNN)表现较差,许多F1-score降至零,表明欧氏距离不适合作为该数据集特征空间的度量标准。
  • 类别1在大多数分类器中均表现出持续偏低的F1-score,表明该类别可能存在固有的模糊性或信号区分度低。
  • 数据集的多样性——涵盖多种压力、噪声水平和麦克风类型——支持对二分类与多分类模型的稳健评估。
  • 在GitHub和daip.club上发布GPLA-12数据集及预训练模型,支持可复现的基准测试,并加速了声学故障诊断领域的研究进程。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。