[論文レビュー] Adaptive Masked Proxies for Few-Shot Segmentation
本論文では、少数ショットセマンティックセグメンテーションのためのサンプル効率の良い手法である適応的マスク付きプロキシ(AMP)を提案する。AMPは、ベースネットワーク特徴量のマルチスケールマスク付き平均プーリングを用いて最終層の重みを構築し、学習済みクラスシグネเจอチャと統合する。AMPはPASCAL-5iで5ショット設定において最先端手法を5.5%上回り、微調整や補助ブランチを必要とせず継続的学習を可能にし、2ストリームのモーション・アピアランスネットワークと動画セグメンテーションにおける自己適応をサポートする。
Deep learning has thrived by training on large-scale datasets. However, in robotics applications sample efficiency is critical. We propose a novel adaptive masked proxies method that constructs the final segmentation layer weights from few labelled samples. It utilizes multi-resolution average pooling on base embeddings masked with the label to act as a positive proxy for the new class, while fusing it with the previously learned class signatures. Our method is evaluated on PASCAL-$5^i$ dataset and outperforms the state-of-the-art in the few-shot semantic segmentation. Unlike previous methods, our approach does not require a second branch to estimate parameters or prototypes, which enables it to be used with 2-stream motion and appearance based segmentation networks. We further propose a novel setup for evaluating continual learning of object segmentation which we name incremental PASCAL (iPASCAL) where our method outperforms the baseline method. Our code is publicly available at https://github.com/MSiam/AdaptiveMaskedProxies.
研究の動機と目的
- 大規模データセットの入手が困難なロボット工学や実世界の応用分野におけるディープラーニングのサンプル非効率性を解消すること。
- 少数ショットセグメンテーションにおいて、プロトタイプ推定のための第二のガイドブランチを不要にすることで、計算負荷とモデルの複雑さを低減すること。
- バックプロパゲーションを伴わずに、新しいプロキシで事前に学習したクラスシグネチャーを適応的に更新することで、セマンティックセグメンテーションにおける継続的学習を可能にすること。
- 追加のパラメータ推定ブランチを必要とせず、2ストリームのモーションおよびアピアランスネットワークを動画オブジェクトセグメンテーションに適用できること。
- 現実のストリーミングデータ条件下で継続的セマンティックセグメンテーションを評価できる新しいベンチマーク、iPASCALを提案すること。
提案手法
- AMPは、事前学習済みバックボーンの特徴マップに対して、正解のセグメンテーションラベルを用いてマスク付き平均プーリング(NMAP)を実行し、クラスプロキシを計算する。
- マルチスケールインプリントを採用し、複数の特徴マップスケールからのプロキシを集約することで、セグメンテーション精度を向上させる。
- 学習可能な適応的重み付け機構を用いて、新しいクラスプロキシと事前に学習済みのクラスシグネチャーを統合し、バックプロパゲーションを伴わずに既存のクラス重みを更新する。
- 適応メカニズムは相関フィルタにインspiredされたランナーアベージ更新ルールを用い、到着するサポートセットからのオンライン学習を可能にする。
- AMPは、モデル自身の予測から得た擬似ラベルを用いてプロキシを無教師的に更新することで、動画セグメンテーションにおける自己適応を実現する。
- 重みインプリントとバックプロパゲーションを交互に実行することで、事前学習済みネットワークとの柔軟な統合を可能にする。
実験結果
リサーチクエスチョン
- RQ1プロトタイプ推定のための第二のガイドブランチを必要としない少数ショットセグメンテーション手法が、最先端性能を達成できるか?
- RQ2低ショット条件下で、マルチスケールプロキシインプリントはセグメンテーション精度の向上にどの程度効果的か?
- RQ3新しいクラスが逐次的に導入される継続的学習のシナリオにおいて、プロキシベース手法を、深刻な忘れなしに拡張可能か?
- RQ4追加のブランチを必要とせず、2ストリームのモーション・アピアランスネットワークにAMPを適用した場合、動画オブジェクトセグメンテーションでどの程度の性能を示すか?
- RQ5iPASCALのような新規ベンチマークは、現実的でストリーミングデータ条件下での継続的セマンティックセグメンテーションを効果的に評価できるか?
主な発見
- AMPは、PASCAL-5iデータセットの5ショット設定において、最先端手法を5.5%上回るmIoUを達成した。
- プロキシ適応なし(α = 0)の場合、1ショット状況でmIoUが28.3%低下し、既存クラスの重み適応が極めて重要であることが示された。
- マルチスケールインプリントは性能向上に顕著な寄与を示しており、これを省略すると1ショット設定で明確なmIoU低下が生じた。
- DAVIS-2016ベンチマークにおいて、CRFの後処理を施したAMPは、最先端の非教師あり動画オブジェクトセグメンテーション手法を上回った。
- iPASCALの継続的学習設定において、AMPは過学習に悩まされるナーブな微調整を上回り、特にハイウェイ分類タスクで顕著な優位性を示した。
- AMPは擬似ラベルを用いた自己適応により、動画セグメンテーションでMotAdaptと同等の性能を達成し、人的アノテーションを回避した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。