[论文解读] Additional Representations for Improving Synthetic Aperture Sonar Classification Using Convolutional Neural Networks
本论文通过利用未被充分利用的信号表征——特别是单视复数(SLC)图像相位的二维功率谱密度(PSD)以及微调预训练的ImageNet卷积神经网络(CNN)——来提升合成孔径声呐(SAS)目标分类性能,实验表明在结合多种表征时,AUC值更高,且特征空间之间的互信息增加,分类性能得到提升。
Object classification in synthetic aperture sonar (SAS) imagery is usually a data starved and class imbalanced problem. There are few objects of interest present among much benign seafloor. Despite these problems, current classification techniques discard a large portion of the collected SAS information. In particular, a beamformed SAS image, which we call a single-look complex (SLC) image, contains complex pixels composed of real and imaginary parts. For human consumption, the SLC is converted to a magnitude-phase representation and the phase information is discarded. Even more problematic, the magnitude information usually exhibits a large dynamic range (>80dB) and must be dynamic range compressed for human display. Often it is this dynamic range compressed representation, originally designed for human consumption, which is fed into a classifier. Consequently, the classification process is completely void of the phase information. In this work, we show improvements in classification performance using the phase information from the SLC as well as information from an alternate source: photographs. We perform statistical testing to demonstrate the validity of our results.
研究动机与目标
- 解决SAS目标分类中数据稀缺、类别不平衡的问题,其中大多数图像为无害的海底背景。
- 探究未被充分利用的SLC表征(尤其是相位及其导出的PSD)是否能提升分类器性能。
- 通过微调预训练的现成CNN(VGG-16)探索迁移学习在SAS强度图像上的应用。
- 分析内部特征表征,以理解不同输入如何影响学习到的表征,以及模态之间的协同作用。
提出的方法
- 在多种SAS图像表征上训练一种带有跳跃连接和ReLU激活的自定义CNN架构:动态范围压缩后的强度、原始相位,以及SLC图像相位的二维功率谱密度(PSD)。
- 采用多输入CNN设计,为强度和PSD分别设置并行分支,将特征在最终层前进行拼接,以实现联合学习。
- 通过在SAS强度图像上微调预训练的VGG-16网络实现迁移学习,利用从自然图像中学习到的特征。
- 使用受试者工作特征曲线下面积(AUC)作为性能评估指标,并通过统计显著性检验来应对训练过程中的随机性。
- 对特征空间激活进行t-SNE可视化,以分析基于试验的无监督聚类模式,且不依赖标签信息。
- 测量内部特征表征之间的互信息(MI),以量化不同输入模态之间特征空间的统计依赖性。
实验结果
研究问题
- RQ1能否从复数SLC图像中提取的表征——尤其是相位及其PSD——在仅使用强度输入的基础上进一步提升SAS分类性能?
- RQ2将多种表征(如强度与PSD)结合是否能带来分类性能的协同增益?
- RQ3能否将一个在自然图像上预训练的现成CNN(如VGG-16)有效微调用于SAS目标分类?
- RQ4内部特征表征是否表现出有意义的结构,例如在无试验标签参与训练的情况下,仍能实现基于试验名称的无监督聚类?
- RQ5当多个输入联合训练时,与单独训练相比,特征空间之间的互信息如何变化?
主要发现
- 将SLC相位的二维功率谱密度(PSD)引入分类任务,显著提升了AUC值,相较于仅使用强度输入,证明了此前被丢弃的相位信息具有实际价值。
- 在强度+PSD网络中取得了最高的AUC值,且与仅使用强度或仅使用PSD的基线模型相比,差异具有统计显著性。
- 当多种表征联合训练时,特征空间之间的互信息(MI)增加,尤其在强度与PSD之间,表明特征协同性得到增强。
- 无监督的t-SNE可视化显示,在强度+PSD网络中,特征点按试验名称呈现出明显的聚类,尽管训练过程中未使用试验标签。
- CNN第一层卷积滤波器具有可解释性,对输入表征中的物理特征(如边缘和纹理)表现出敏感性。
- 在SAS强度图像上微调在ImageNet上预训练的VGG-16网络,取得了优异的分类性能,验证了迁移学习在SAS自动目标识别(ATR)中的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。