Skip to main content
QUICK REVIEW

[논문 리뷰] IrisNet: Deep Learning for Automatic and Real-time Tongue Contour Tracking in Ultrasound Video Data using Peripheral Vision

M. Hamed Mozaffari, Md. Aminur Rab Ratul|arXiv (Cornell University)|2019. 11. 10.
Traditional Chinese Medicine Studies참고 문헌 62인용 수 9
한 줄 요약

IrisNet는 인간의 주변시를 모방하는 딥러닝 모델을 제안하여 초음파 영상 데이터에서 실시간, 자동, 정확한 혀 윤곽 추적을 가능하게 한다. 주변시에 영감을 받은 컨볼루션 모듈을 활용함으로써 다양한 초음파 혀 데이터셋에 걸쳐 최신 기술 수준의 일반화 성능를 달성하였으며, 정성적 및 정량적 평가에서 기존 방법들을 능가한다.

ABSTRACT

The progress of deep convolutional neural networks has been successfully exploited in various real-time computer vision tasks such as image classification and segmentation. Owing to the development of computational units, availability of digital datasets, and improved performance of deep learning models, fully automatic and accurate tracking of tongue contours in real-time ultrasound data became practical only in recent years. Recent studies have shown that the performance of deep learning techniques is significant in the tracking of ultrasound tongue contours in real-time applications such as pronunciation training using multimodal ultrasound-enhanced approaches. Due to the high correlation between ultrasound tongue datasets, it is feasible to have a general model that accomplishes automatic tongue tracking for almost all datasets. In this paper, we proposed a deep learning model comprises of a convolutional module mimicking the peripheral vision ability of the human eye to handle real-time, accurate, and fully automatic tongue contour tracking tasks, applicable for almost all primary ultrasound tongue datasets. Qualitative and quantitative assessment of IrisNet on different ultrasound tongue datasets and PASCAL VOC2012 revealed its outstanding generalization achievement in compare with similar techniques.

연구 동기 및 목표

  • 초음파 영상 데이터에서 혀 윤곽 추적을 위한 완전 자동화되고 실시간인 시스템을 개발하는 것.
  • 다양한 초음파 혀 데이터셋 간 높은 변동성과 상관관계 문제를 해결하기 위해 일반화 가능한 딥러닝 모델을 구축하는 것.
  • 심층 신경망 아키텍처에 인간의 눈 주변시 메커니즘을 모방함으로써 추적 정확도와 속도를 향상시키는 것.
  • 다중 모odal 초음파 기반 피드백을 활용한 언어 치료 및 발음 훈련 분야의 실용적 응용을 가능하게 하는 것.

제안 방법

  • 모델는 인간의 눈 주변시를 모방하도록 설계된 새로운 컨볼루션 모듈을 사용하여 공간적 맥락 인식 능력을 향상시킨다.
  • 스킵 연결을 갖춘 U-Net 유사 인코더-디코더 아키텍처를 사용하여 정밀한 윤곽 세분화를 위한 공간적 세부 정보를 유지한다.
  • 지상 진술 윤곽 주석이 있는 다양한 초음파 혀 데이터셋을 대상으로 지도 학습을 통해 엔드 투 엔드로 학습된다.
  • 국소적 혀 세부 사항과 전반적인 구조적 맥락을 모두 포착하기 위해 다중 척도 특징 추출 전략을 적용한다.
  • 표준 하드웨어에서 실시간 성능를 확보하기 위해 추론 속도 최적화가 이루어진다.
  • 학습 중 데이터 증강 및 도메인 적응 기법을 적용하여 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1주변시에 영감을 받은 딥러닝 모델이 초음파 영상 데이터에서 실시간으로 정확한 혀 윤곽 추적을 달성할 수 있는가?
  • RQ2제안된 모델은 다양한 이미징 조건을 가진 다양한 초음파 혀 데이터셋 간에 얼마나 잘 일반화되는가?
  • RQ3분할 정확도 및 추론 속도 측면에서 기존 최신 기술 수준의 방법들과 비교해 IrisNet의 성능는 어떠한가?
  • RQ4주변시에 영감을 받은 모듈이 혀의 외관 변화 및 노이즈에 대해 얼마나 높은 강건성을 향상시키는가?

주요 결과

  • IrisNet는 여러 초음파 혀 데이터셋에서 정성적 및 정량적 평가에서 최신 기술 수준의 성능를 달성한다.
  • 모델는 훈련에 사용되지 않은 데이터셋에서도 잘 작동함으로써 높은 전이 능력을 보이며, 강력한 일반화 성능를 입증한다.
  • PASCAL VOC2012 및 초음파 데이터셋에서의 정량적 결과는 기준 방법들에 비해 뛰어난 Dice 점수와 경계 정확도를 보였다.
  • 모델는 실시간 추론 속도를 유지하여 표준 GPU 하드웨어에서 30 FPS 이상의 초음파 영상 프레임 처리 성능를 확보하였다.
  • 주변시에 영감을 받은 모듈은 저대비 및 노이즈가 많은 초음파 영상에서 윤곽 검출의 강건성을 크게 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.