[論文レビュー] DetCo: Unsupervised Contrastive Learning for Object Detection
DetCoは、マルチレベルの監視とグローバル・ローカル対照学習を用いて、インスタンスレベルの検出と画像分類の両方の性能を向上させる自己教師あり対照学習フレームワークを提案する。これは、SOTAの転移性能を達成し、COCOでSparse R-CNNを46.5 APまで向上させ、ImageNet分類で先行手法より6.9%高いトップ1精度を達成した。
Unsupervised contrastive learning achieves great success in learning image representations with CNN. Unlike most recent methods that focused on improving accuracy of image classification, we present a novel contrastive learning approach, named DetCo, which fully explores the contrasts between global image and local image patches to learn discriminative representations for object detection. DetCo has several appealing benefits. (1) It is carefully designed by investigating the weaknesses of current self-supervised methods, which discard important representations for object detection. (2) DetCo builds hierarchical intermediate contrastive losses between global image and local patches to improve object detection, while maintaining global representations for image recognition. Theoretical analysis shows that the local patches actually remove the contextual information of an image, improving the lower bound of mutual information for better contrastive learning. (3) Extensive experiments on PASCAL VOC, COCO and Cityscapes demonstrate that DetCo not only outperforms state-of-the-art methods on object detection, but also on segmentation, pose estimation, and 3D shape prediction, while it is still competitive on image classification. For example, on PASCAL VOC, DetCo-100ep achieves 57.4 mAP, which is on par with the result of MoCov2-800ep. Moreover, DetCo consistently outperforms supervised method by 1.6/1.2/1.0 AP on Mask RCNN-C4/FPN/RetinaNet with 1x schedule. Code will be released at \href{https://github.com/xieenze/DetCo}{\color{blue}{ t github.com/xieenze/DetCo}}.
研究の動機と目的
- 自己教師あり表現学習におけるインスタンスレベルの検出と画像分類の両方の性能を同時に向上させるという課題に対処すること。
- 密度の高い予測タスクへの強力な転移を可能にするプレティスクタスクを設計し、画像レベルの分類精度を損なわないようにすること。
- 対照学習を用いて、マルチスケールの特徴ピラミッドにおける特徴の識別性と一貫性を向上させること。
- グローバル画像レベルの表現とローカルパッチレベルの表現のギャップを埋め、検出と分類の両方の性能を向上させること。
- 最近の検出に特化した自己教師あり手法を上回る、シンプルだが効果的な事前学習フレームワークを構築すること。
提案手法
- バックボーンネットワークの各段階からの特徴を最適化することで、特徴ピラミッドの各レベルでの識別性を向上させるマルチレベル監視を導入する。
- グローバルとローカルの対照学習(GLC)を用いて、全体画像とクロップされたローカルパッチ間の表現を一致させ、スケール間の一貫性を促進する。
- 同一画像の増幅画像(ポジティブビュー)間の距離を最小化し、異なる画像(ネガティブビュー)間の距離を最大化するように対照学習を適用する。
- グローバル画像特徴とローカルパッチ特徴の両方に対照損失を適用することで、グローバルおよびローカル表現の共同最適化を可能にする。
- マルチレベル監視とGLCを組み合わせることで、特徴ピラミッドのすべての段階における特徴品質を向上させ、マルチスケール検出を改善する。
- 追加の監視を必要とせず、標準的なデータオーグメンテーション(例:クロップ、カラーのジャマーリング)を用いて対照学習のポジティブビューを生成する。
実験結果
リサーチクエスチョン
- RQ1自己教師あり手法が、物体検出と画像分類の両方で同時にSOTA性能を達成できるか?
- RQ2特徴ピラミッドの各段階におけるマルチレベル監視が、検出と分類の性能に与える影響は何か?
- RQ3グローバル・ローカル対照学習は、表現の一貫性と識別性をどの程度向上させるか?
- RQ4統一されたプレティスクタスクは、インスタンスレベルの検出と画像レベルの分類の両方に効果的に寄与できるか?
- RQ5DetCoは、同時に開発された検出に特化した自己教師あり手法と比較して、転移性能においてどのように差をつけるか?
主な発見
- ImageNet分類では68.6%のトップ1精度を達成し、DenseCL(+6.9%)およびInsLoc(+5.0%)を上回り、強力な画像レベル性能を示した。
- COCO物体検出では、SwAVを用いたMask R-CNN C4を6.9 AP向上させ、Sparse R-CNNの性能を45.0 APから46.5 APまで向上させ、新たなSOTAを樹立した。
- マルチレベル監視とグローバル・ローカル対照学習の組み合わせにより、アブレーションスタディで示されるように、すべてのバックボーン段階で一貫した性能向上が得られた。
- アブレーションスタディにより、マルチレベル監視とグローバル・ローカル対照学習の両方が不可欠であることが確認された。両方の要素を削除すると、顕著な性能低下が生じた。
- セマンティックセグメンテーションおよびDensePoseにおいても、競争力ある性能を維持しており、密度の高い予測タスクへの広範な転送可能性を示した。
- 検出と分類の両方の性能において、DenseCL、InsLoc、PatchReIDといった同時期の検出に特化した手法を上回る、最良のトレードオフを達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。