[논문 리뷰] Denoising convolutional autoencoder based B-mode ultrasound tongue image feature extraction
이 논문은 스펙클 노이즈 및 영상 왜곡에 대해 강건한 성능을 발휘하는 컨volution 레이어를 활용하여 B-mode 초음파 혀 영상으로부터 비지도적 특징 추출을 위한 노이즈 제거 컨volution 오토인코더(DCAE)를 제안한다. DCAE는 2010년 Silent Speech Interface 챌린지에서 6.17%의 워드 오류률(WER)을 기록하여 최신 DCT 기반 방법(6.45%)과 다른 오토인코더 변종들을 능가한다.
B-mode ultrasound tongue imaging is widely used in the speech production field. However, efficient interpretation is in a great need for the tongue image sequences. Inspired by the recent success of unsupervised deep learning approach, we explore unsupervised convolutional network architecture for the feature extraction in the ultrasound tongue image, which can be helpful for the clinical linguist and phonetics. By quantitative comparison between different unsupervised feature extraction approaches, the denoising convolutional autoencoder (DCAE)-based method outperforms the other feature extraction methods on the reconstruction task and the 2010 silent speech interface challenge. A Word Error Rate of 6.17% is obtained with DCAE, compared to the state-of-the-art value of 6.45% using Discrete cosine transform as the feature extractor. Our codes are available at https://github.com/DeePBluE666/Source-code1.
연구 동기 및 목표
- 노이즈가 많고 SNR가 낮은 B-mode 초음파 혀 영상에서 강건하고 말과 관련된 특징을 추출하는 문제를 해결하기 위해.
- 초음파 기반 침묵된 말 인터페이스(SSI)에서 차원 축소 및 특징 학습을 위한 비지도적 딥 러닝 방법을 탐색하기 위해.
- 컨볼루션 아키텍처의 불변성 특성을 활용하여 재구성 정확도와 인식 성능을 향상시키기 위해.
- 재구성 및 말 인식 작업 모두에서 DCT, PCA, 표준 오토인코더와 같은 기존 방법들과의 비교를 통해 DCAE 모델의 성능을 평가하기 위해.
제안 방법
- 비지도적 방식으로 초음파 혀 영상의 압축되고 노이즈에 강건한 표현을 학습하기 위해 노이즈 제거 컨볼루션 오토인코더(DCAE)를 사용한다.
- 입력 영상에 노이즈를 도입하고 원본 영상의 재구성을 최적화함으로써 스펙클 노이즈 및 아티팩트에 대한 강건성을 향상시킨다.
- 계층적인 공간적 특징을 학습하기 위해 스트라이드 컨볼루션과 역전치 컨볼루션을 사용한 대칭적 인코더-디코더 아키텍처를 사용한다.
- DCAE의 버블넥 레이어에서 특징을 추출하고, 이를 DNN-HMM 음향 모델의 입력으로 사용하여 말 인식을 수행한다.
- MSE 및 CW-SSIM 지표를 사용하여 DCAE의 성능을 DCT, 딥 오토인코더(DAE), 노이즈 제거 오토인코더(DAE), 표준 컨볼루션 오토인코더(CAE)와 비교한다.
- Kaldi를 사용하여 인식 시스템을 구현하기 위해 2010년 Silent Speech Interface 챌린지 데이터셋에 특징 추출 파이프라인을 적용한다.
실험 결과
연구 질문
- RQ1노이즈 제거 컨볼루션 오토인코더는 DCT 및 PCA와 같은 전통적 특징 추출 방법보다 초음파 혀 영상의 재구성에서 우수한 성능을 보일 수 있는가?
- RQ2재구성 정확도와 노이즈에 대한 강건성 측면에서 DCAE 모델은 표준 오토인코더와 컨볼루션 오토인코더와 비교해 어떻게 성능을 내는가?
- RQ3DCAE 기반 특징 표현은 최신 기술 대비 침묵된 말 인식에서 더 낮은 워드 오류률(WER)을 달성하는가?
- RQ4DCAE 아키텍처의 공간 불변성과 노이즈 강건성은 초음파 영상 시퀀스에서 말과 관련된 발음 역학을 어느 정도 유지하는가?
주요 결과
- DCAE 모델은 2010년 Silent Speech Interface 챌린지에서 6.17%의 최저 워드 오류률(WER)을 기록하여 최신 DCT 기반 방법(6.45%)을 능가했다.
- 재구성 작업에서 DCAE는 60차원 특징 벡터를 사용하여 테스트 MSE 71.28과 CW-SSIM 0.6577을 달성했으며, DCT, DAE, CAE 모델보다 뛰어난 성능을 보였다.
- 동일한 설정에서 표준 CAE 대비 DCAE는 MSE가 1.5% 감소하고 CW-SSIM이 0.012 증가하여 더 뛰어난 노이즈 강건성을 보였다.
- DCAE 기반 특징은 30차원 특징을 사용할 때 6.24%의 WER을 기록하여 저차원에서도 뛰어난 성능을 보였다.
- 시각적 비교 결과, DCAE는 다른 모델 대비 혀의 형태를 더 잘 유지하고 스펙클 아티팩트를 줄여 더 우수한 재구성 영상을 제공했다.
- 비컨볼루션 오토인코더보다 DCAE 모델이 일관되게 향상된 성능을 보였으며, 이는 컨볼루션 인덕티브 바이어스가 초음파 영상에서 특징 품질을 향상시킨다는 것을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.