Skip to main content
QUICK REVIEW

[論文レビュー] Mix-and-Match Tuning for Self-Supervised Semantic Segmentation

Xiaohang Zhan, Ziwei Liu|arXiv (Cornell University)|Dec 2, 2017
Advanced Neural Network Applications参考文献 35被引用数 6
ひとこと要約

本論文では、ターゲットデータセットからのスパースで混合されたパッチを活用して、三重項ベースのメトリクス学習のためのクラス別に接続されたグラフを構築することで、自己教師ありセマンティックセグメンテーションの性能を向上させる、プラグアンドプレイな方法であるMix-and-Match(M&M)チューニングを提案する。この手法は、PASCAL VOC2012およびCityScapesの両データセットでImageNet教師あり事前学習を上回り、追加のアノテーションなしで最先端の性能を達成した。

ABSTRACT

Deep convolutional networks for semantic image segmentation typically require large-scale labeled data, e.g. ImageNet and MS COCO, for network pre-training. To reduce annotation efforts, self-supervised semantic segmentation is recently proposed to pre-train a network without any human-provided labels. The key of this new form of learning is to design a proxy task (e.g. image colorization), from which a discriminative loss can be formulated on unlabeled data. Many proxy tasks, however, lack the critical supervision signals that could induce discriminative representation for the target image segmentation task. Thus self-supervision's performance is still far from that of supervised pre-training. In this study, we overcome this limitation by incorporating a "mix-and-match" (M&M) tuning stage in the self-supervision pipeline. The proposed approach is readily pluggable to many self-supervision methods and does not use more annotated samples than the original process. Yet, it is capable of boosting the performance of target image segmentation task to surpass fully-supervised pre-trained counterpart. The improvement is made possible by better harnessing the limited pixel-wise annotations in the target dataset. Specifically, we first introduce the "mix" stage, which sparsely samples and mixes patches from the target set to reflect rich and diverse local patch statistics of target images. A "match" stage then forms a class-wise connected graph, which can be used to derive a strong triplet-based discriminative loss for fine-tuning the network. Our paradigm follows the standard practice in existing self-supervised studies and no extra data or label is required. With the proposed M&M approach, for the first time, a self-supervision method can achieve comparable or even better performance compared to its ImageNet pre-trained counterpart on both PASCAL VOC2012 dataset and CityScapes dataset.

研究の動機と目的

  • 自己教師ありと完全教師あり事前学習の間の性能ギャップを是正すること。
  • ターゲットデータセットからの限られたピクセル単位のアノテーションをより効果的に活用することで、自己教師ありモデルの判別的表現学習を向上させること。
  • 追加のラベルやデータを必要とせず、自己教師あり特徴を強化する、プラグアンドプレイなファインチューニング段階を開発すること。
  • 自己教師あり事前学習にM&Mチューニングを組み合わせることで、ImageNet事前学習を上回ることを実証すること。

提案手法

  • 「ミックス」段階では、ターゲットデータセットから局所的な画像パッチをランダムに抽出・結合し、多様なパッチ統計を形成する。
  • 「マッチ」段階では、混合パッチからクラス別に接続されたグラフを構築し、メトリクス学習のためのハード三重項の発見を可能にする。
  • グラフ上で三重項ベースの判別的損失を計算し、ネットワークをファインチューニングすることで、クラス間の特徴分離を向上させる。
  • 自己教師ありプロキシ事前学習の後、標準的なファインチューニングの前に行われる。追加のアノテーションは不要である。
  • さまざまな自己教師ありプロキシタスク(例:カラー化、ジグザック)およびバックボーンネットワーク(例:AlexNet、VGG-16)と互換性がある。
  • グラフサイズは調整可能であり、性能とトレーニング効率の間のトレードオフを可能にする。

実験結果

リサーチクエスチョン

  • RQ1追加のアノテーションなしで、自己教師あり事前学習をImageNet教師あり事前学習と同等の性能にまで引き上げることは可能か?
  • RQ2ターゲットデータセットに限られたピクセル単位のアノテーションがある場合、それを自己教師あり特徴学習を向上させるためにどのようにより効果的に活用できるか?
  • RQ3ミックス&マッチチューニングのようなマルチステージ最適化戦略は、標準的なファインチューニングを上回る特徴の判別性を向上させるか?
  • RQ4カラー化のようなプロキシタスクは、ターゲット固有のグラフベースメトリクス学習を用いることで、教師あり事前学習との性能ギャップを埋めることができるか?
  • RQ5グラフサイズとパッチミキシングの影響は、学習された表現の質にどのように現れるか?

主な発見

  • PASCAL VOC2012では、M&Mチューニングにより、VGG-16を用いてカラー化事前学習のmIoU 38.4%が42.8%に向上し、ランダム初期化の48.0%を上回り、ImageNet事前学習の64.2%に近づいた。
  • CityScapesでは、M&Mチューニングにより、カラー化事前学習のmIoU 57.5%が66.4%に向上し、ImageNet事前学習の67.9%に非常に近づいた。
  • ランダム初期化のネットワークに対しても、M&MチューニングによりCityScapesのmIoUが42.5%から49.1%に向上し、弱い初期化からの顕著な改善を示した。
  • t-SNE可視化により、M&Mチューニングがクラス別特徴クラスタリングを顕著に改善し、意味的に異なるクラス間の分離が明確になったことが確認された。
  • 大きなグラフサイズは性能向上に寄与したが、トレーニング時間が増加したため、正確性と効率性の間の調整可能なトレードオフであることが示された。
  • 本手法は、複数のベンチマークおよびバックボーンで最先端の結果を達成し、さまざまなプロキシタスクやデータセットにわたり有効であることが証明された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。