Skip to main content
QUICK REVIEW

[논문 리뷰] A CNN-based tool for automatic tongue contour tracking in ultrasound images

Jian Zhu, Will Styler|arXiv (Cornell University)|2019. 07. 24.
Speech and Audio Processing참고 문헌 26인용 수 12
한 줄 요약

이 논문은 U-Net과 Dense U-Net 컨volution 신경망을 사용하여 초음파 영상에서 혀 윤곽을 추적하는 오픈소스이자 완전 자동화된 도구를 제시한다. 이 방법은 최소한의 인간 간섭으로도 높은 정확도를 달성하며, 손실 함수와 데이터 증강 기법이 성능에 큰 영향을 미친다는 점을 입증한다. 또한, U-Net에 비해 더 나은 일반화 성능을 보이지만, 추론 속도는 느린 Dense U-Net이 다양한 데이터셋 간의 일반화 능력에서 뛰어나다는 점을 확인한다.

ABSTRACT

For speech research, ultrasound tongue imaging provides a non-invasive means for visualizing tongue position and movement during articulation. Extracting tongue contours from ultrasound images is a basic step in analyzing ultrasound data but this task often requires non-trivial manual annotation. This study presents an open source tool for fully automatic tracking of tongue contours in ultrasound frames using neural network based methods. We have implemented and systematically compared two convolutional neural networks, U-Net and DenseU-Net, under different conditions. Though both models can perform automatic contour tracking with comparable accuracy, Dense U-Net architecture seems more generalizable across test datasets while U-Net has faster extraction speed. Our comparison also shows that the choice of loss function and data augmentation have a greater effect on tracking performance in this task. This public available segmentation tool shows considerable promise for the automated tongue contour annotation of ultrasound images in speech research.

연구 동기 및 목표

  • 초음파 음성 연구에서 혀 윤곽의 수작업 표기 작업이 오래 걸리는 문제를 해결하기 위해.
  • 초음파 영상에서 혀 윤곽을 분할하기 위한 완전 자동화된 오픈소스 도구를 개발하기 위해.
  • 다양한 조건에서 U-Net과 Dense U-Net 아키텍처의 성능을 비교하기 위해.
  • 손실 함수와 데이터 증강 기법이 분할 정확도에 미치는 영향을 평가하기 위해.
  • 다른 초음파 기기와 다양한 화자 데이터셋 간의 모델 일반화 능력을 평가하기 위해.

제안 방법

  • 이 방법은 초음파 영상에서 혀-조직 인터페이스에 해당하는 가장 밝은 가장자리 영역을 분할하기 위해 U-Net과 Dense U-Net 아키텍처를 사용한다.
  • U-Net은 인코더 경로와 디코더 경로 사이의 스킵 커넥션을 통해 공간적 세부 정보를 유지한다.
  • Dense U-Net은 인코더 경로에 DenseNet 블록을 통합하고, 밀집 스킵 커넥션을 사용하여 특징 재사용을 향상시킨다.
  • 시그모이드 활성화 함수를 가진 1×1 컨볼루션 레이어가 최종 분할 마스크를 생성한다.
  • 후처리 단계에서는 분할 마스크를 부드럽고 연속적인 혀 윤곽 곡선으로 변환한다.
  • 모델은 다양한 손실 함수(예: Dice 손실 및 복합 손실)와 데이터 증강 전략을 사용하여 강건성을 향상시키기 위해 훈련된다.

실험 결과

연구 질문

  • RQ1U-Net과 Dense U-Net은 다양한 초음파 데이터셋에서 자동 혀 윤곽 추적 성능에서 어떻게 나타나는가?
  • RQ2이 작업에서 다양한 손실 함수가 분할 정확도에 어떤 영향을 미치는가?
  • RQ3데이터 증강은 모델의 일반화 능력과 성능에 어떤 영향을 미치는가?
  • RQ4모델은 다른 초음파 기기와 화자 특성 간에도 일반화 가능한가?
  • RQ5실제 응용에서 U-Net과 Dense U-Net 간의 추론 속도는 어떻게 비교되는가?

주요 결과

  • Dense U-Net은 64×64 해상도에서 NS 테스트 세트에서 평균 거리 합계(MSD)가 5.03 픽셀(SD 2.52)로 가장 낮게 기록되어 이 설정에서 U-Net을 능가했다.
  • U-Net은 약 63 프레임/초의 평균 추론 속도를 기록했고, Dense U-Net은 소비자용 랩탑에서 약 29 프레임/초의 속도로 처리했다.
  • 모든 모델과 데이터셋에서 복합 손실 함수가 Dice 손실보다 더 우수한 성능을 보였으며, 특히 더 도전적인 UltraSpeech 데이터셋에서 안정성 향상에 기여했다.
  • Dense U-Net은 더 뛰어난 일반화 능력을 보였으며, 복합 손실을 사용한 U-Net 대비 UltraSpeech 데이터셋에서 MSD가 5.72 픽셀(SD 2.88)로 낮게 기록되었다.
  • 이미지 해상도가 성능에 비단조화적인 영향을 미쳤으며, Dense U-Net의 경우 64×64가 최적의 세부 정보 대 노이즈 균형을 이룬 것으로 나타나 최고의 성능을 냈다.
  • 이 도구는 수작업 표기 작업을 크게 줄여주며, 최소한의 인간 간섭으로도 완전 자동 윤곽 추출을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.