Skip to main content
QUICK REVIEW

[論文レビュー] Deep Bregman Divergence for Contrastive Learning of Visual Representations

Mina Rezaei, Farzin Soleymani|arXiv (Cornell University)|Sep 15, 2021
Advanced Vision and Imaging被引用数 6
ひとこと要約

本論文は、視覚的表現における分布レベルの差を捉えるために、深層Bregman散発を活用する新しい対照学習フレームワークを提案する。ユークリッド距離を超える特徴品質の向上を実現する。複数の線形サブネットワークを訓練して機能的Bregman散発を計算し、従来の対照学習損失と組み合わせることで、分類およびオブジェクト検出タスクにおける自己教師ありおよび半教師あり学習ベンチマークで最先端の性能を達成する。

ABSTRACT

Deep Bregman divergence measures divergence of data points using neural networks which is beyond Euclidean distance and capable of capturing divergence over distributions. In this paper, we propose deep Bregman divergences for contrastive learning of visual representation where we aim to enhance contrastive loss used in self-supervised learning by training additional networks based on functional Bregman divergence. In contrast to the conventional contrastive learning methods which are solely based on divergences between single points, our framework can capture the divergence between distributions which improves the quality of learned representation. We show the combination of conventional contrastive loss and our proposed divergence loss outperforms baseline and most of the previous methods for self-supervised and semi-supervised learning on multiple classifications and object detection tasks and datasets. Moreover, the learned representations generalize well when transferred to the other datasets and tasks. The source code and our models are available in supplementary and will be released with paper.

研究の動機と目的

  • 点同士の距離を越えた分布レベルの差を捉えることで、自己教師あり視覚的表現学習を改善すること。
  • 機能的Bregman散発を用いて対照学習を拡張し、データ分布全体におけるより洗練されたメトリクス学習を可能にすること。
  • 従来の対照学習損失と新規の散発損失を同時に最適化できるエンドツーエンドで訓練可能なフレームワークの開発。
  • 異なるデータセットおよびタスク間での特徴の一般化および転移性の向上。
  • 自己教師ありおよび半教師ありの状況におけるメトリクス学習におけるBregman散発の有効性の調査。

提案手法

  • フレームワークは、補正画像ペアから埋め込みを生成するためのベースエンコーダーとプロジェクションヘッドを用いる。
  • 複数の深層線形サブネットワークを訓練し、機能的Bregman散発の凸生成関数をパrameter化する。
  • これらのサブネットワークを用いて埋め込み間のBregman散発を計算し、分布レベルの差を捉える。
  • 対照的散発損失を導入し、学習可能なガウスカーネル関数を用いてBregman散発を類似度スコアに変換する。
  • 全体の損失は、標準的なNT-Xent対照学習損失と新規の散発損失を組み合わせており、エンドツーエンドで最適化される。
  • ハイパーパramータ λ と σ はベイズ最適化を用いて、下流タスクのパフォーマンスを最大化するように調整される。

実験結果

リサーチクエスチョン

  • RQ1機能的Bregman散発は、対照学習における点同士の距離を越えた視覚的表現学習を改善できるか?
  • RQ2従来の対照学習損失とBregman散発損失を組み合わせることで、表現品質および下流タスクのパフォーマンスにどのような影響を与えるか?
  • RQ3既存の自己教師ありおよび半教師あり学習アプローチと比較して、本手法はデータセットおよびタスク間でより一般化できるか?
  • RQ4Bregman散発を類似度スコアに変換する関数 ψ の最適な形態は何か?
  • RQ5ハイパーパramータ λ と σ が対照的散発損失のパフォーマンスに与える影響は何か?

主な発見

  • 提案手法は、画像分類およびオブジェクト検出の自己教師ありおよび半教師あり学習ベンチマークにおいて、ベースラインおよび多数の先行手法を上回る性能を達成した。
  • CIFAR-10では、ベイズ最適化により特定された最良のハイパーパramータ λ=5 および σ=1.5 を用いて、トップ1正解率が94.2%に達した。
  • t-SNE可視化では、クラス0、1、8、9についてSimCLRと比較してクラスタの分離が明確に改善されており、特徴の識別性が向上していることが示された。
  • ガウスカーネル(σ=1.5)を変換関数 ψ として用いた場合、全テスト関数の中で最も高いパフォーマンスを発揮した。
  • 従来の対照学習損失と新規の散発損失の組み合わせにより、転移学習のシナリオにおいてよりロバストで一般化可能な表現が得られた。
  • 本手法は強力な転移性を示し、標準ベンチマークおよび最近の臨床データセットの両方で高い性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。