Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Ultrasound Tongue Image Reconstruction from Lip Images Using Self-supervised Learning and Attention Mechanism

Haiyang Liu, Jihan Zhang|arXiv (Cornell University)|2021. 06. 20.
Speech and Audio Processing참고 문헌 39인용 수 5
한 줄 요약

이 논문은 자가학습(Self-supervised), 이중 스트림 CNN-LSTM 네트워크에 주목력 메커니즘을 통합하여 립 영상 시퀀스에서 초음파 혀 영상을 재구성하는 방법을 제안한다. 광학 흐름과 시간 모델링을 활용함으로써 기준 모델 대비 뛰어난 재구성 정확도를 달성하였으며, 사용자 연구에서 평균 유사도 점수 3.01을 기록하고, SSIM(0.728)과 MSD(4.953) 지표에서도 향상된 성능을 보였다.

ABSTRACT

Speech production is a dynamic procedure, which involved multi human organs including the tongue, jaw and lips. Modeling the dynamics of the vocal tract deformation is a fundamental problem to understand the speech, which is the most common way for human daily communication. Researchers employ several sensory streams to describe the process simultaneously, which are incontrovertibly statistically related to other streams. In this paper, we address the following question: given an observable image sequences of lips, can we picture the corresponding tongue motion. We formulated this problem as the self-supervised learning problem, and employ the two-stream convolutional network and long-short memory network for the learning task, with the attention mechanism. We evaluate the performance of the proposed method by leveraging the unlabeled lip videos to predict an upcoming ultrasound tongue image sequence. The results show that our model is able to generate images that close to the real ultrasound tongue images, and results in the matching between two imaging modalities.

연구 동기 및 목표

  • 쌍체 초음파 데이터가 필요 없이 가시적인 립 운동에서 초음파 혀 영상을 재구성하는 문제를 해결하기 위해.
  • 자기학습 학습을 통해 립 영상과 초음파 혀 영상 간의 다중모달 매핑을 향상시키기 위해.
  • 시간 모델링과 주목력 메커니즘을 통해 재구성 품질을 향상시키기 위해.
  • 사용자 주관 평가와 SSIM, CW-SSIM, MSD와 같은 객관적 지표를 사용하여 방법을 평가하기 위해.
  • 광학 흐름과 주목력 메커니즘이 재구성 정밀도 향상에 기여하는 정도를 조사하기 위해.

제안 방법

  • 한 스트림은 원본 립 영상, 다른 스트림은 연속 프레임 간의 광학 흐름을 처리하는 이중 스트림 컨볼루션 리커런트 신경망(TS-CNN-LSTM) 아키텍처를 사용한다.
  • 비지도 립 영상 시퀀스를 사용해 향후 초음파 혀 영상을 예측하도록 자기학습 학습을 통해 네트워크를 훈련시킨다.
  • 특징 융합 이후 주목력 메커니즘을 통합하여 잠재 표현 내 관련 공간 및 시간적 특징을 강조한다.
  • 배치 크기 32로 평균 제곱오차(MSE) 손실을 사용하고 약 50 에포크 후 조기 종료를 적용하여 모델을 훈련시킨다.
  • 추론 과정에서는 두 스트림의 임베딩을 연결하여 전결합층을 거쳐 재구성된 초음파 영상을 생성한다.
  • 기준 모델인 ConvLSTM과의 성능 비교를 수행하고, 광학 흐름과 주목력 메커니즘과 같은 구성 요소를 제거한 실험을 통해 각 성분의 기여도를 평가한다.

실험 결과

연구 질문

  • RQ1쌍체 초음파 데이터가 없이도 자기학습 학습이 립 영상 시퀀스에서 초음파 혀 영상을 효과적으로 재구성할 수 있는가?
  • RQ2광학 흐름 통합이 립 영상에서 혀 운동을 재구성하는 데 어떤 영향을 미치는가?
  • RQ3주목력 메커니즘이 재구성된 초음파 영상의 품질 향상에 어느 정도 영향을 미치는가?
  • RQ4제안된 구성 요소(TS-CNN-LSTM + 주목력)가 기준 모델인 ConvLSTM에 비해 정량적·정성적으로 어떻게 비교되는가?
  • RQ5입력 모odal(원본 영상 대비 광학 흐름)이 재구성 성능에 어떤 영향을 미치는가?

주요 결과

  • 주목력 메커니즘을 통합한 제안된 TS-CNN-LSTM은 주관 평가에서 평균 유사도 점수 3.01을 기록하여 기준 모델인 ConvLSTM(2.67)을 뛰어넘었다.
  • 구조적 유사도 지수(SSIM)는 0.728, 복합 웨이블릿 SSIM(CW-SSIM)은 0.765를 기록하여 영상 재구성의 높은 정밀도를 입증했다.
  • 수작업으로 추출한 혀 윤곽 간 평균 거리 합(MSD)은 4.953로 실제 초음파 영상과의 유사도가 높음을 시사했다.
  • 제거 실험 결과, 광학 흐름이 성능 향상에 가장 큰 기여를 했고, 주목력 메커니즘은 일관되지만 더 작은 향상 효과를 보였다.
  • 광학 흐름과 주목력 메커니즘을 모두 통합한 모델이 모든 다른 구성보다 뛰어난 성능을 보였으며, 시간적 모델링과 주목력 메커니즘 간 상호보완적 효과를 확인했다.
  • 결과적으로, 자기학습 학습과 주목력 메커니즘을 활용한 립 운동과 혀 운동 간 다중모달 매핑이 가능하고 효과적임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.