[論文レビュー] Siamese Contrastive Embedding Network for Compositional Zero-Shot Learning
本論文は、構成的ゼロショット学習(CZSL)のためのシアンズ対照的埋め込みネットワーク(SCEN)を提案する。SCENは、それぞれの状態とオブジェクトに対して、別々の埋め込み空間で対照的学習を用いて判別性の高いプロトタイプを学習する。一方、状態遷移モジュール(STM)は、ドメインギャップを低減するための合成トレーニングサンプルを生成する。SCENは、最近のC-GQAデータセットも含む3つのベンチマークデータセットで最先端の性能を達成した。
Compositional Zero-Shot Learning (CZSL) aims to recognize unseen compositions formed from seen state and object during training. Since the same state may be various in the visual appearance while entangled with different objects, CZSL is still a challenging task. Some methods recognize state and object with two trained classifiers, ignoring the impact of the interaction between object and state; the other methods try to learn the joint representation of the state-object compositions, leading to the domain gap between seen and unseen composition sets. In this paper, we propose a novel Siamese Contrastive Embedding Network (SCEN) (Code: https://github.com/XDUxyLi/SCEN-master) for unseen composition recognition. Considering the entanglement between state and object, we embed the visual feature into a Siamese Contrastive Space to capture prototypes of them separately, alleviating the interaction between state and object. In addition, we design a State Transition Module (STM) to increase the diversity of training compositions, improving the robustness of the recognition model. Extensive experiments indicate that our method significantly outperforms the state-of-the-art approaches on three challenging benchmark datasets, including the recent proposed C-QGA dataset.
研究の動機と目的
- 見たことのある状態とオブジェクトから構成される未観測の組み合わせをゼロショット学習で認識するという課題に対処すること。
- 一般化性能を阻害する状態とオブジェクト特徴のエンタングルメントを軽減すること。
- データ拡張を通じて、見たことのある組み合わせと未見の組み合わせの間のドメインギャップを低減すること。
- 状態とオブジェクトのための分離され、判別性の高いプロトタイプを学習することで、モデルのロバストネスと一般化性能を向上させること。
- C-GQAを含む困難なCZSLベンチマークで、既存手法を上回ること。
提案手法
- モデルは、視覚的特徴を状態固有およびオブジェクト固有の対照的空間に投影するための、状態固有エンコーダー $E_s$ とオブジェクト固有エンコーダー $E_o$ の2つの別々のエンコーダーを使用する。
- 同じ状態やオブジェクトのプロトタイプが近づき、関係のないものとは遠ざかるようにするため、状態定数およびオブジェクト定数のデータベースをポジティブサンプルとし、共有の不適切なデータベースをネガティブサンプルとして用いる。
- シアンズ対照的損失 ($\mathcal{L}_{cts}$) を適用して、同じ状態またはオブジェクトのプロトタイプが引き寄せられ、関係のないものとは引き離されるようにする。
- 状態遷移モジュール(STM)は、敵対的損失を用いて、現実的で仮想の組み合わせを生成し、トレーニングデータの多様性を高め、ドメインギャップを低減する。
- STMは、トレーニング中にあり得るが未見の状態-オブジェクトの組み合わせをモデルに晒すことで、一般化性能を向上させる。
- 最終的なモデルは、学習されたプロトタイプ上で線形ソフトマックス分類器を用いて、見られるセットおよび未見のセットからの組み合わせを予測する。
実験結果
リサーチクエスチョン
- RQ1状態とオブジェクトのための分離されたプロトタイプは、構成的学習におけるゼロショット一般化を向上させるか?
- RQ2対照的学習は、エンタングルドな視覚的特徴から状態とオブジェクト表現をどれほど効果的に分離できるか?
- RQ3状態遷移モジュールによる合成データ生成は、見たことのある組み合わせと未見の組み合わせの間のドメインギャップを低減できるか?
- RQ4対照的学習とデータ拡張の組み合わせは、多様なベンチマークで一貫した性能向上をもたらすか?
- RQ5モデルはハイパーパrameterに対してどれほど感度が高く、最適な設定は一般化性能を最良にするか?
主な発見
- SCENは、MIT-States、UT-Zappos、C-GQAの各データセットで最先端の性能を達成し、既存手法を上回った。
- アブレーションスタディの結果、$\mathcal{L}_{cts}$ と $\mathcal{L}_{stm}$ の両方が不可欠であることが確認され、$\mathcal{L}_{cts}$ はプロトタイプ学習を向上させ、$\mathcal{L}_{stm}$ はドメインギャップを低減した。
- C-GQAデータセットでは、最良の調和平均(HM)とAUCスコアを達成し、複雑で現実世界的な組み合わせにおいてもロバストネスを示した。
- 最適なハイパーパrameter設定(C-GQAおよびUT-Zapposでは $\beta = 0.1$、MIT-Statesでは $\beta = 0.5$)が、STM損失の寄与をバランスよく保つために特定された。
- 定性的な結果から、モデルは上位3件の予測内に未見の組み合わせを正しく予測しており、強力な一般化能力を示している。
- ラベルが不完全であっても、年齢やテクスチャなどの部分的属性を正しく捉える能力が向上しており、より良い特徴の分離が実現していると考えられる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。