Skip to main content
QUICK REVIEW

[論文レビュー] Stacked dense optical flows and dropout layers to predict sperm motility and morphology

Vajira Thambawita, Pål Halvorsen|arXiv (Cornell University)|Nov 8, 2019
Sperm and Testicular Function参考文献 19被引用数 4
ひとこと要約

本稿では、スタックド密度的光-flowとドロップアウト正則化付きマルチレイヤーパーセプトロン(MLP)を組み合わせた深層学習手法を提案し、動画フレームから精子の運動性および形態を予測する。原始フレームとマルチスケール光-flow入力を統合し、過学習を防ぐためにドロップアウトを含むMLPを追加することで、運動性のための最先端の平均絶対誤差(MAE)8.825および形態のためのMAE 5.293を達成した。

ABSTRACT

In this paper, we analyse two deep learning methods to predict sperm motility and sperm morphology from sperm videos. We use two different inputs: stacked pure frames of videos and dense optical flows of video frames. To solve this regression task of predicting motility and morphology, stacked dense optical flows and extracted original frames from sperm videos were used with the modified state of the art convolution neural networks. For modifications of the selected models, we have introduced an additional multi-layer perceptron to overcome the problem of over-fitting. The method which had an additional multi-layer perceptron with dropout layers, shows the best results when the inputs consist of both dense optical flows and an original frame of videos.

研究の動機と目的

  • 動画シーケンスから高精度に精子の運動性および形態を予測する深層学習モデルの開発。
  • 精子動画データにおける時間的運動パターンを捉えるために、密度的光-flow表現の有効性の調査。
  • ドロップアウトや追加のMLP層といったアーキテクチャの変更を通じて、小規模な医療動画データセットにおける過学習の低減。
  • 回帰ベースの精子分析において、原始フレームのスタックと光-flow強化入力特徴の性能比較。
  • VISEMデータセットを用いたエンドツーエンドの深層学習による自動コンピュータ支援精子分析のためのベースライン確立。

提案手法

  • 9つの連続したグレースケールフレーム(D1)を抽出し、それらをRGBフレームおよび2種類の密度的光-flow画像(ストライド1およびストライド10)と組み合わせ、9チャネル入力テンソル(D2)を形成した。
  • 事前学習済みのResNet-34をバックボーンネットワークとして使用し、9チャネル入力に対応させるために微調整し、運動性または形態の3つの回帰値を出力するように変更した。
  • ResNet-34の特徴量の後に追加のマルチレイヤーパーセプトロン(MLP)を導入した修正モデル(M2)を提案し、過学習の緩和にドロップアウト層を組み込んだ。
  • バックプロパゲーション中にAdam最適化アルゴリズムを用い、固定学習率0.001と平均二乗誤差(MSE)を損失関数として使用した。
  • VISEMデータセットを用いて3分割交差検証を実施し、性能比較の主な指標として平均絶対誤差(MAE)を用いた。
  • OpenCVのFarnebäckアルゴリズムを用いて、異なる時間的ストライドで連続フレーム間の密度的光-flowを生成し、複数スケールの運動ダイナミクスを捉えた。

実験結果

リサーチクエスチョン

  • RQ1原始フレームスタックと比較して、密度的光-flow表現は精子の運動性および形態予測をどのように向上させるか?
  • RQ2ドロップアウトを含むマルチレイヤーパーセプトロンを追加することで、小規模な医療動画データセットにおけるモデルの汎化性能と過学習への影響は何か?
  • RQ3入力構成として、原始フレームのみか、原始フレームとマルチスケール光-flowを組み合わせた特徴量のどちらが、精子品質の回帰において優れた性能を示すか?
  • RQ4アーキテクチャの正則化を施した修正版ResNet-34は、この医療動画回帰タスクにおいて標準のResNet-34を上回る性能を示せるか?
  • RQ5精子運動性および形態予測の平均絶対誤差を最小化するための、最適な入力特徴量とモデルアーキテクチャの組み合わせは何か?

主な発見

  • 原始フレームと密度的光-flowの両方を用いた手法(D2入力)と修正ResNet-34モデル(M2)を組み合わせた場合、精子運動性のMAEが8.825、形態のMAEが5.293と、最低水準に達した。
  • ドロップアウト正則化付きMLPを備えたM2モデルは、すべての入力タイプおよびfoldにおいて、ベースラインのM1モデルを一貫して上回り、アーキテクチャの正則化の有効性を示した。
  • D2入力(原始フレームと光-flow特徴の統合)は、D1入力(原始フレームのみスタック)よりも優れた結果を示し、運動情報が予測性能を向上させることを示した。
  • 最良の構成(D2-M2)は、D1入力のベースモデルと比較して、運動性のMAEで10.5%、形態のMAEで5.3%の改善を示した。
  • D2入力とM2アーキテクチャを組み合わせたモデルは、全foldで平均MAEが最低となり、fold別値として運動性でfold1が8.612、fold2が7.873、fold3が9.991を記録した。
  • マルチスケール光-flow(ストライド1およびストライド10)の使用により、補完的な運動の手がかりが得られ、より良い時間的モデリングと一般化性能の向上に寄与した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。