[論文レビュー] Instance Segmentation and Tracking with Cosine Embeddings and Recurrent Hourglass Networks
本稿では、ビデオにおけるインスタンスセグメンテーションおよびトラッキングのための再帰的完全畳み込みネットワークとコサイン埋め込み損失を提案する。スタックド・アワークラス構造にConvGRUを統合し、隣接するインスタンス間でのみ非類似性を強制する新しいコサイン類似度ベースの損失関数で訓練することで、ISBIセルトラッキングチャレンジにおいて最先端の性能を達成し、特に密なセルレイアウトにおいてトラッキングおよびセグメンテーション指標で先行手法を上回った。
Different to semantic segmentation, instance segmentation assigns unique labels to each individual instance of the same class. In this work, we propose a novel recurrent fully convolutional network architecture for tracking such instance segmentations over time. The network architecture incorporates convolutional gated recurrent units (ConvGRU) into a stacked hourglass network to utilize temporal video information. Furthermore, we train the network with a novel embedding loss based on cosine similarities, such that the network predicts unique embeddings for every instance throughout videos. Afterwards, these embeddings are clustered among subsequent video frames to create the final tracked instance segmentations. We evaluate the recurrent hourglass network by segmenting left ventricles in MR videos of the heart, where it outperforms a network that does not incorporate video information. Furthermore, we show applicability of the cosine embedding loss for segmenting leaf instances on still images of plants. Finally, we evaluate the framework for instance segmentation and tracking on six datasets of the ISBI celltracking challenge, where it shows state-of-the-art performance.
研究の動機と目的
- 生体医療画像における個々のインスタンスを複数のビデオフレームにわたって追跡する課題に取り組むこと、特にインスタンスの一貫性が重要なセルトラッキングにおいて。
- 時間経過にわたって一貫したまま、かつフレーム間で強固なクラスタリングを可能にする特徴的な埋め込みを学習することで、インスタンスセグメンテーションを改善すること。
- 既存の埋め込みベース手法の限界を克服するため、隣接するインスタンスのみに注目する新しいコサイン類似度ベースの損失を導入し、最適化と安定性を向上させること。
- ConvGRUを用いて完全畳み込みアーキテクチャに時間的モデリングを統合し、トラッキングのためのスパatiotemporal埋め込みをエンドツーエンドで学習可能にする。
- 医療的MRビデオや植物の静止画像、および挑戦的なセルトラッキングベンチマークを含む多様なデータセットへの汎用性を実証すること。
提案手法
- フレームワークは、収縮パスと拡張パスの間にConvGRUを挿入したスタックド・アワークラスネットワークを用い、時間情報を複数のビデオフレームにわたって伝搬する。
- 各ピクセルにはd次元の埋め込みベクトルが割り当てられ、ネットワークは、インスタンス内では類似性を高め、隣接するインスタンス間でのみ非類似性を強制する新しいコサイン埋め込み損失で訓練される。
- コサイン埋め込み損失は、4色地図定理に基づいて導出されており、必要な非類似性の数を削減し、高インスタンス数の状況における最適化の安定性を向上させる。
- インスタンスセグメンテーションは、k-meansや類似手法を用いて各フレームの予測された埋め込みをクラスタリングすることで達成され、トラッキングは埋め込みの時間的伝搬によって維持される。
- ネットワークは、セグメンテーションのためのバイナリクロスエントロピー損失と、インスタンス識別のためのコサイン埋め込み損失を組み合わせた損失関数でエンドツーエンドに訓練される。
- アーキテクチャは、左心室のMRビデオにおけるセグメンテーション、植物の葉のセグメンテーション、およびISBIセルトラッキングチャレンジを含む複数のデータセットで評価された。
実験結果
リサーチクエスチョン
- RQ1学習された埋め込みを用いて、再帰的完全畳み込みネットワークがビデオフレーム間でインスタンスセグメンテーションを効果的に追跡できるか?
- RQ2隣接するインスタンスのみを考慮するコサインベースの埋め込み損失は、標準的なユークリッド距離ベースの損失と比較して、最適化の安定性と性能を向上させるか?
- RQ3提案手法が、挑戦的な生体医療ビデオデータセットにおけるインスタンスセグメンテーションおよびトラッキングで最先端の性能を達成できるか?
- RQ4スタックド・アワークラスネットワーク内にConvGRUを統合することで、非再帰的または異なる構造の再帰的アーキテクチャと比較して性能にどのような影響を与えるか?
- RQ5非常に小さなインスタンスや密に配置されたインスタンスに適用した場合の手法の限界は何か、そしてそれらをどのように緩和できるか?
主な発見
- ISBIセルトラッキングチャレンジにおいて、6つのデータセットのうち4つでトラッキング指標で1位または2位を獲得し、特に密なFluo-N2DH-S1データセットで最高のパフォーマンスを記録した。
- 密なセルレイアウトを特徴とするDIC-HeLaデータセットでは、トラッキングおよびセグメンテーション指標の両方で他のすべての手法を上回り、トラッキングF1スコア0.983およびセグメンテーションF1スコア0.975を達成した。
- Fluo-GOWT1データセットでは、全体で2位を獲得し、トラッキングF1スコア0.981およびセグメンテーションF1スコア0.983を記錟能した。
- 植物の葉の静止画像においても強力なパフォーマンスを示し、CVPPPチャレンジで最良手法と同等の結果を達成した。テストセットにおける3分割交差検証F1スコアは0.828であった。
- 左心室のMRビデオにおけるセグメンテーションにおいて、非再帰的ベースラインを上回る性能を示し、時間的モデリングの利点を実証した。
- Fluo-HeLaおよびFluo-SIM+では、ダウンサンプリングによりセルのサイズが検出可能な閾値以下に低下したため、性能が劣化した。これは、解像度を保持する処理戦略の必要性を示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。