[论文解读] Feature Selection based on Principal Component Analysis for Underwater Source Localization by Deep Learning
本文提出了一种基于PCA的可解释特征选择方法,用于使用深度学习进行水下声源定位,结合主成分回归(PCR)与两步半监督框架。通过仅从单水听器数据中选择最相关的频率分量,该方法将训练时间减少了95%,同时在SWellEx-96数据集上提升了鲁棒性和准确性,尤其在标签数据较少的情况下表现更优。
In this paper, we propose an interpretable feature selection method based on principal component analysis (PCA) and principal component regression (PCR), which can extract important features for underwater source localization by only introducing the source location without other prior information. This feature selection method is combined with a two-step framework for underwater source localization based on the semi-supervised learning scheme. In the framework, the first step utilizes a convolutional autoencoder to extract the latent features from the whole available dataset. The second step performs source localization via an encoder multi-layer perceptron (MLP) trained on a limited labeled portion of the dataset. The proposed approach has been validated on the public dataset SwllEx-96 Event S5. The result shows the framework has appealing accuracy and robustness on the unseen data, especially when the number of data used to train gradually decreases. After feature selection, not only the training stage has a 95\% acceleration but the performance of the framework becomes more robust on the depth and more accurate when the number of labeled data used to train is extremely limited.
研究动机与目标
- 通过利用半监督学习中的已标注和未标注数据,解决水下声源定位中标签数据有限的挑战。
- 通过识别并仅选择原始信号数据中最具信息量的特征,减轻深度学习模型在水下声学中的计算负担。
- 开发一种仅依赖源位置信息的可解释特征选择过程,无需预先获取环境或传播模型数据。
- 提升模型在未见数据上的泛化能力和鲁棒性,尤其是在训练数据稀缺的情况下。
- 证明在低数据条件下,特征选择可同时提升半监督和纯监督学习设置下的性能。
提出的方法
- 对原始单水听器信号应用离散傅里叶变换(DFT),将其预处理为频域表示。
- 使用主成分分析(PCA)提取能最大化方差并消除输入分量相关性的潜在特征。
- 使用源位置作为响应变量执行主成分回归(PCR),基于回归系数的大小识别显著特征。
- 选择绝对PCR系数较大的特征,重点关注那些解释至少50%数据方差且位于载荷图中两个同心圆之间的特征。
- 将所选特征整合进两步半监督框架:首先,卷积自编码器(CAE)以无监督方式学习潜在表示;其次,编码器-MLP在有限的已标注数据上进行有监督微调。
- 使用均方误差(MSE)损失训练最终模型,并在SWellEx-96事件S5公开数据集上评估性能。
实验结果
研究问题
- RQ1在无环境先验知识的前提下,基于PCA的特征选择能否有效识别出对水下声源定位最具信息量的频率分量?
- RQ2仅使用所选特征时,其对低标签数据条件下训练速度和模型性能的影响如何?
- RQ3与标准监督学习相比,所提出的半监督两步框架在未见数据上的鲁棒性和准确性提升程度如何?
- RQ4所选特征是否可进行物理解释,以确认其与源特性(如深度和发射电平)的相关性?
- RQ5当标签数据极度有限时,特征选择是否能在半监督和纯监督学习场景中均提升性能?
主要发现
- 所提出的PCA-PCR特征选择方法在平均不显著降低性能的前提下,将训练时间减少了95%。
- 当仅使用12.5%的数据进行训练时,该特征选择方法在半监督和纯监督设置下均提升了定位准确性。
- 该框架在未见数据上表现出更强的鲁棒性,尤其在标签数据较少的情况下。
- 相关性载荷图显示,127、145、198、232、280、335和385 Hz(浅源)以及238、338、388 Hz(深源)的频率最为显著,与物理预期一致。
- 与最高发射信号电平和391 Hz等音调相关的特征与源位置具有强相关性,而靠近原点的其他特征被认为不显著,可能为噪声。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。