Skip to main content
QUICK REVIEW

[논문 리뷰] Convolutional neural networks for classification and regression analysis of one-dimensional spectral data

Ine L. Jernelv, Dag Roar Hjelme|arXiv (Cornell University)|2020. 05. 15.
Spectroscopy and Chemometric Analyses인용 수 13
한 줄 요약

이 연구는 NIR, MIR 및 라만 분광법에서 유도된 1차원 스펙트럼 데이터의 분류 및 회귀에 대해 컨volutional 신경망(CNNs)의 성능을 평가한다. 원시 데이터에서 CNNs는 SVM 및 PLSR와 같은 전통적인 화학계량학적 방법보다 뛰어나지만, 특히 분류 작업에서 성능이 뛰어나며, 최적의 사전 처리 및 특징 선택을 적용할 경우 성능 격차는 크게 줄어든다.

ABSTRACT

Convolutional neural networks (CNNs) are widely used for image recognition and text analysis, and have been suggested for application on one-dimensional data as a way to reduce the need for pre-processing steps. Pre-processing is an integral part of multivariate analysis, but determination of the optimal pre-processing methods can be time-consuming due to the large number of available methods. In this work, the performance of a CNN was investigated for classification and regression analysis of spectral data. The CNN was compared with various other chemometric methods, including support vector machines (SVMs) for classification and partial least squares regression (PLSR) for regression analysis. The comparisons were made both on raw data, and on data that had gone through pre-processing and/or feature selection methods. The models were used on spectral data acquired with methods based on near-infrared, mid-infrared, and Raman spectroscopy. For the classification datasets the models were evaluated based on the percentage of correctly classified observations, while for regression analysis the models were assessed based on the coefficient of determination (R$^2$). Our results show that CNNs can outperform standard chemometric methods, especially for classification tasks where no pre-processing is used. However, both CNN and the standard chemometric methods see improved performance when proper pre-processing and feature selection methods are used. These results demonstrate some of the capabilities and limitations of CNNs used on one-dimensional data.

연구 동기 및 목표

  • 원시 및 사전 처리된 1차원 스펙트럼 데이터에 대해 분류 및 회귀 작업을 수행하는 데 있어 컨volutional 신경망(CNNs)의 성능을 평가하는 것.
  • 여러 스펙트럼 데이터셋을 통해 표준 화학계량학적 방법(SVM을 통한 분류, PLSR를 통한 회귀)과 CNNs를 비교하는 것.
  • CNNs가 화학계량학 분석에서 흔히 요구되는 시간이 오래 걸리는 사전 처리 및 특징 선택 단계에 대한 의존도를 줄이는지 조사하는 것.
  • 다양한 분광 기술(NIR, MIR, Raman)에서 사전 처리 및 특징 선택의 영향을 모델 정확도에 미치는 영향을 평가하는 것.

제안 방법

  • 원시 스펙트럼 데이터에서 계층적인 스펙트럼 특징을 직접 추출하기 위해 다수의 컨볼루션 및 풀링 레이어를 포함한 1D-CNN 아키텍처를 학습시켰다.
  • 동일한 데이터셋에서 표준 화학계량학 모델(SVM을 통한 분류, PLSR를 통한 회귀)과의 성능을 CNNs와 비교했다.
  • 노이즈 필터링, 스케일링, 스펙트럼 미분, 바이닝 등의 다양한 사전 처리 기법을 적용하여 데이터 품질을 향상시켰다.
  • 워랩 기반 특징 선택 방법(GA, 순차적 전진 선택, 이동 창)과 임bedded 방법(에라스틱넷)을 사용하여 관련 있는 스펙트럼 영역을 식별했다.
  • 다수의 CNN 학습 런에 걸쳐 일관되게 중요한 스펙트럼 영역을 식별하기 위해 안정성 기반 특징 선택을 활용했다.
  • 분류 정확도(정확히 분류된 비율)와 회귀 성능(R² 계수 결정도)를 사용하여 모델을 평가했다.

실험 결과

연구 질문

  • RQ11D-CNNs는 표준 화학계량학적 방법보다 원시 스펙트럼 데이터에서 분류 및 회귀 성능을 뛰어나게 달성할 수 있는가?
  • RQ2사전 처리가 CNNs와 전통적인 화학계량학 모델의 성능을 얼마나 향상시키는가?
  • RQ3기존 방법에 비해 CNNs가 광범위한 사전 처리 및 특징 선택이 필요한 정도를 줄이는가?
  • RQ4다양한 특징 선택 전략이 스펙트럼 분석에서 모델 정확도에 어떤 영향을 미치는가?
  • RQ5여러 번의 학습 런 동안 CNN이 일관되게 중요한 것으로 식별하는 특정 스펙트럼 영역이 존재하는가?

주요 결과

  • CNNs는 원시 스펙트럼 데이터에서 특히 분류 작업에서 표준 화학계량학적 방법(SVM 및 PLSR)을 뛰어넘었다.
  • 최적의 사전 처리 및 특징 선택을 적용할 경우 CNNs와 기존 모델 간의 성능 격차는 크게 줄어들었다.
  • 노이즈 필터링, 스케일링, 스펙트럼 미분, 바이닝(요인 2–4) 등의 사전 처리 방법은 모든 모델에서 일관되게 정확도를 향상시켰다.
  • 특징 선택, 특히 유전 알고리즘을 통한 선택은 분류 및 회귀 모두에서 예측 정확도를 향상시켰으며, 안정성 기반 CNN 특징 선택 결과와 잘 일치했다.
  • CNNs는 포도당 용액에서 1800–900 cm⁻¹ 범위와 같은 화학적으로 관련 있는 흡수를 반영하는 의미 있는 스펙트럼 영역을 식별했다.
  • 비록 CNNs가 원시 데이터에서 직접 학습할 수 있지만, 하이퍼파rameter 조정(커널 크기, 스트라이드 등)이 여전히 필요하여 단순한 모델보다 계산 효율성에서의 이점이 제한되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.