Skip to main content
QUICK REVIEW

[논문 리뷰] Stacked dense optical flows and dropout layers to predict sperm motility and morphology

Vajira Thambawita, Pål Halvorsen|arXiv (Cornell University)|2019. 11. 08.
Sperm and Testicular Function참고 문헌 19인용 수 4
한 줄 요약

이 논문은 깊이 학습 기반 접근법을 제안하며, 스택드된 밀집 광학 흐름과 드롭아웃 정규화가 적용된 다층 퍼셉트론(MLP)을 사용하여 비디오 프레임에서 정자 운동성과 형태를 예측한다. ResNet-34를 활용하여, 원본 프레임과 다중 척도 광학 흐름 입력을 조합하고, 과적합을 방지하기 위해 드롭아웃을 포함한 MLP를 추가함으로써, 운동성에 대해 8.825의 최신 기술 평균 절대 오차(MAE), 형태에 대해 5.293의 최신 기술 평균 절대 오차를 달 đạt했다.

ABSTRACT

In this paper, we analyse two deep learning methods to predict sperm motility and sperm morphology from sperm videos. We use two different inputs: stacked pure frames of videos and dense optical flows of video frames. To solve this regression task of predicting motility and morphology, stacked dense optical flows and extracted original frames from sperm videos were used with the modified state of the art convolution neural networks. For modifications of the selected models, we have introduced an additional multi-layer perceptron to overcome the problem of over-fitting. The method which had an additional multi-layer perceptron with dropout layers, shows the best results when the inputs consist of both dense optical flows and an original frame of videos.

연구 동기 및 목표

  • 고정확도로 비디오 시퀀스에서 정자 운동성과 형태를 예측할 수 있는 딥 러닝 모델을 개발하기.
  • 정자 영상 데이터에서 시간적 운동 패턴을 포착하는 데 있어 밀집 광학 흐름 표현의 효과를 조사하기.
  • 드롭아웃과 추가 MLP 레이어와 같은 아키텍처 수정을 통해 소규모 의료 영상 데이터셋에서 과적합을 줄이기.
  • 회귀 기반 정자 분석에서 원본 프레임 스태킹과 광학 흐름 강화된 입력 특징 간의 성능을 비교하기.
  • VISEM 데이터셋을 기반으로 엔드 투 엔드 딥 러닝을 사용한 자동 컴퓨터 지원 정자 분석의 기준을 설정하기.

제안 방법

  • 원본 프레임 9개를 추출하고, 이를 RGB 프레임과 두 가지 유형의 밀집 광학 흐름 이미지(스트라이드 1 및 스트라이드 10)와 결합하여 9채널 입력 텐서(D2)를 구성함.
  • 사전 학습된 ResNet-34를 백본 네트워크로 사용하며, 9채널 입력에 맞게 미세조정하고, 운동성 또는 형태에 대한 3개의 회귀 값 출력을 위해 조정함.
  • ResNet-34 특징 후에 추가적인 다층 퍼셉트론(MLP)을 포함한 수정된 모델(M2)을 도입하여 과적합을 완화함.
  • 학습 시 Adam 옵timizer를 사용하고 고정 학습률 0.001을 적용하며, 역전파 동안 평균 제곱 오차(MSE)를 손실 함수로 사용함.
  • VISEM 데이터셋에서 3겹 교차 검증을 수행하고, 성능 비교를 위한 주요 지표로 평균 절대 오차(MAE)를 사용함.
  • 다른 시간 스트라이드를 사용하여 연속 프레임 간에 OpenCV의 Farnebäck 알고리즘을 적용해 밀집 광학 흐름을 생성함.

실험 결과

연구 질문

  • RQ1원본 프레임 스태킹과 비교했을 때, 밀집 광학 흐름 표현은 정자 운동성과 형태 예측에 어떻게 기여하는가?
  • RQ2드롭아웃이 포함된 다층 퍼셉트론을 추가함으로써, 소규모 의료 영상 데이터셋에서 모델의 일반화 능력과 과적합에 어떤 영향을 미치는가?
  • RQ3원본 프레임만 사용하는 것과 원본 프레임에 다중 척도 광학 흐름을 결합한 입력 구성 중 어느 것이 정자 품질 회귀에서 더 뛰어난 성능을 낼 수 있는가?
  • RQ4아키텍처 정규화를 적용한 수정된 ResNet-34 아키텍처가 이 의료 영상 회귀 작업에서 표준 ResNet-34를 초월할 수 있는가?
  • RQ5정자 운동성과 형태 예측에서 평균 절대 오차를 최소화하기 위한 최적의 입력 특징 조합과 모델 아키텍처 조합은 무엇인가?

주요 결과

  • 원본 프레임과 밀집 광학 흐름을 모두 사용한 방법(D2 입력)과 수정된 ResNet-34 모델(M2)을 조합한 결과, 정자 운동성에 대해 8.825의 최저 평균 절대 오차(MAE), 형태에 대해 5.293의 최저 평균 절대 오차를 달성함.
  • 드롭아웃 정규화가 적용된 MLP를 포함한 M2 모델은 모든 입력 유형과 폴드에서 기반 모델(M1)을 일관되게 능가하여 아키텍처 정규화의 효과를 입증함.
  • D2 입력(원본 프레임과 광학 흐름 특징의 조합)은 D1(원본 프레임만 스태킹)보다 더 우수한 결과를 보였으며, 이는 운동 정보가 예측 성능 향상에 기여함을 시사함.
  • 최고 성능을 낸 구성(D2-M2)은 기반 모델(D1 입력) 대비 운동성 MAE에서 10.5% 향상, 형태 MAE에서 5.3% 향상된 성능 기록.
  • D2 입력과 M2 아키텍처를 조합한 모델은 모든 폴드에서 평균 MAE가 가장 낮았으며, 운동성에 대해 각 폴드별로 8.612(폴드 1), 7.873(폴드 2), 9.991(폴드 3)의 값을 기록함.
  • 다중 척도 광학 흐름(스트라이드 1 및 스트라이드 10)의 사용은 상호 보완적인 운동 신호를 제공하여 시간적 모델링 향상과 더 나은 일반화에 기여함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.