[論文レビュー] TernausNetV2: Fully Convolutional Network for Instance Segmentation
TernausNetV2 は、接触するオブジェクトの境界を示す二値出力を追加することで、高解像度の衛星画像におけるインスタンスセグメンテーションを実現する完全畳み込みネットワークである。ワイドResNet-38エンコーダーにマルチスペクトル入力拡張を適用し、ウォーターシェッドに基づく後処理ステップを組み合わせることで、アンサンブルやテスト時増強を用いない状態でも、DeepGlobe-CVPR 2018 の建物検出チャレンジで最先端の性能(F1スコア 0.74)を達成した。
The most common approaches to instance segmentation are complex and use two-stage networks with object proposals, conditional random-fields, template matching or recurrent neural networks. In this work we present TernausNetV2 - a simple fully convolutional network that allows extracting objects from a high-resolution satellite imagery on an instance level. The network has popular encoder-decoder type of architecture with skip connections but has a few essential modifications that allows using for semantic as well as for instance segmentation tasks. This approach is universal and allows to extend any network that has been successfully applied for semantic segmentation to perform instance segmentation task. In addition, we generalize network encoder that was pre-trained for RGB images to use additional input channels. It makes possible to use transfer learning from visual to a wider spectral range. For DeepGlobe-CVPR 2018 building detection sub-challenge, based on public leaderboard score, our approach shows superior performance in comparison to other methods. The source code corresponding pre-trained weights are publicly available at https://github.com/ternaus/TernausNetV2
研究の動機と目的
- 高解像度の衛星画像におけるインスタンスセグメンテーションを、完全畳み込みアーキテクチャを用いて実現する手法を開発すること。
- 事前学習されたRGBベースのモデルを、マルチスペクトル入力に拡張して、スペクトル範囲を跨ぐ転移学習を可能にすること。
- 同じクラスに属する密接に配置された、または接触するオブジェクトを、セマンティックセグメンテーション出力から正確に分離できること。
- アンサンブルやテスト時増強を用いない状態でも、DeepGlobe-CVPR 2018 の建物検出チャレンジで最先端の性能を達成すること。
提案手法
- ネットワークは、事前学習済みのワイドResNet-38(インプレイスバッチ正規化を備える)を基盤とした、スキップ接続を有するエンコーダ-デコーダアーキテクチャを採用している。
- 入力のチャンネル数をRGBの3チャンネルから11チャンネルのマルチスペクトルチャンネルに拡張し、RGBから広いスペクトル範囲への転移学習を可能にしている。
- モデルは2つの二値マスクを出力する:1つは建物の敷地を、もう1つは接触または隣接するオブジェクトの境界を表す。
- ハイブリッド損失関数は、バイナリクロスエントロピーと微分可能なソフトJaccard損失(1 - J)を組み合わせており、ピクセル単位の分類とIoUの両方を最適化する。
- ソフトJaccard損失は $ J = \frac{1}{n} \sum_{c=1}^{2} w_c \sum_{i=1}^{n} \left( \frac{y_i^c \hat{y}_i^c}{y_i^c + \hat{y}_i^c - y_i^c \hat{y}_i^c} \right) $ で定義され、$ w_1 = w_2 = 1 $ である。
- 後処理では、二値マスクと境界マスクをシードとして用い、ウォーターシェッド変換を適用して重複するインスタンスを分離する。

実験結果
リサーチクエスチョン
- RQ1セマンティックセグメンテーション用に訓練された完全畳み込みネットワークを、衛星画像におけるインスタンスセグメンテーションに適応可能か?
- RQ2RGBからマルチスペクトル衛星データへの転移学習を効果的に拡張する方法は何か?
- RQ3単純で微分可能な損失関数は、インスタンスセグメンテーションにおけるピクセル単位の精度と交差率(IoU)の両方を向上させられるか?
- RQ4境界予測ヘッドを用いたウォーターシェッド変換に基づく後処理は、インスタンス分離においてエンドツーエンド学習を上回る性能を発揮するか?
主な発見
- モデルは、DeepGlobe-CVPR 2018 の建物検出チャレンジで、公開リーダーボードのF1スコア0.74を達成し、他の手法を上回った。
- ネットワークは、事前学習済みのRGB重みから11チャンネルのマルチスペクトル入力へと効果的に一般化し、スペクトル範囲を跨ぐ転移学習を実現した。
- 接触境界予測ヘッドの追加により、アンサンブルやテスト時増強を用いずに、ウォーターシェッド変換を用いた効果的なインスタンス分離が可能になった。
- 1台のGTX 1080 Tiで1秒間に10サンプルを処理できるため、リアルタイム推論が可能であることが示された。
- ハイブリッド損失関数に $ \alpha = 0.7 $ を設定することで、バイナリクロスエントロピーとソフトJaccard損失をバランスさせ、分類精度とIoU性能の両方を向上させた。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。