[論文レビュー] More Photos are All You Need: Semi-Supervised Learning for Fine-Grained Sketch Based Image Retrieval
本論文は、限られたアノテート済みデータの下で検索性能を向上させるために、大規模なラベルなし写真を活用して疑似スケッチ-写真ペアを生成する、画期的な半教師ありフレームワークを提案する。写真からスケッチへの生成器と検索モデルを、識別子誘導型インスタンス重み付けと知識蒸留を併用して共同で訓練することで、QMUL-ShoeV2で教師ありベースライン比でAcc@1を8.0%向上させ、最先端の性能を達成した。
A fundamental challenge faced by existing Fine-Grained Sketch-Based Image Retrieval (FG-SBIR) models is the data scarcity -- model performances are largely bottlenecked by the lack of sketch-photo pairs. Whilst the number of photos can be easily scaled, each corresponding sketch still needs to be individually produced. In this paper, we aim to mitigate such an upper-bound on sketch data, and study whether unlabelled photos alone (of which they are many) can be cultivated for performances gain. In particular, we introduce a novel semi-supervised framework for cross-modal retrieval that can additionally leverage large-scale unlabelled photos to account for data scarcity. At the centre of our semi-supervision design is a sequential photo-to-sketch generation model that aims to generate paired sketches for unlabelled photos. Importantly, we further introduce a discriminator guided mechanism to guide against unfaithful generation, together with a distillation loss based regularizer to provide tolerance against noisy training samples. Last but not least, we treat generation and retrieval as two conjugate problems, where a joint learning procedure is devised for each module to mutually benefit from each other. Extensive experiments show that our semi-supervised model yields significant performance boost over the state-of-the-art supervised alternatives, as well as existing methods that can exploit unlabelled photos for FG-SBIR.
研究の動機と目的
- アノテート済みスケッチ-写真ペアが限られ、収集に費用がかかるFine-grained Sketch-based Image Retrieval (FG-SBIR) における深刻なデータ不足問題に対処する。
- 何百万枚も入手可能な大規模なラベルなし写真が、ペア化されたスケッチが不要な状況でもFG-SBIRの性能向上に寄与できるかを調査する。
- スケッチ生成と検索がフィードバック信号を通じてお互いに利益をもたらすよう、両者を相互に強化する共同学習フレームワークを開発する。
- 不正確なスケッチ生成のノイズや不正確さに対処するため、信頼性スコアとノイズ耐性メカニズムを導入する。
- 生成と検索を統合した微分可能でエンドツーエンドのトレーニングパイプラインを設計し、フィードバックにポリシー勾配強化学習を統合する。
提案手法
- ラベルなし写真から高精細で詳細なスケッチを生成できる、空間的解像度を保持する順次的写真→スケッチ生成器を提案し、クロスモーダル2次元アテンション機構を導入する。
- 生成されたスケッチ-写真ペアの信頼性を評価する識別子(D_C)を導入し、検索学習中のトリプレット損失にインスタンスごとの重み付けに使用される信頼スコアを出力する。
- 相対的ティーチャーステューデントフレームワークに基づく知識蒸留損失を適用し、ノイズの多い合成ペアに対する耐性を高めるために検索モデルを正則化する。
- 検索モデルと識別子からの報酬をポリシー勾配強化学習を用いて生成器に逆伝播させ、検索品質から生成の正確性へのフィードバックを可能にする。
- 生成器と検索モデルを共同で訓練し、検索モデルがフィードバック信号で生成器をガイドし、生成器が拡張された訓練データにより検索性能を向上させる。
- 蒸留による一貫性損失を統合し、ノイズの多い疑似ラベルへの過学習を低減し、学習を安定化させる。

実験結果
リサーチクエスチョン
- RQ1ペア化されたスケッチデータが限られる状況で、ラベルなし写真のみでFG-SBIRの性能を顕著に向上させられるか?
- RQ2性能の低下を防ぐために、トレーニング中に信頼性が低いまたは不正確なスケッチ生成をどのようにフィルタリングできるか?
- RQ3スケッチ生成と検索の共同学習が、逐次的または独立した学習と比較して、両タスクの性能をどの程度向上させられるか?
- RQ4識別子の信頼度に基づくインスタンスごとの重み付けが、検索の耐性をどのように向上させるか?
- RQ5検索から生成へのポリシー勾配フィードバックが、合成スケッチ-写真ペアの品質向上にどの程度効果的か?
主な発見
- 提案された半教師ありフレームワークは、QMUL-ShoeV2データセットでAcc@1が39.1%を達成し、教師ありベースライン比で8.0%の向上を示した。
- 識別子誘導型インスタンス重み付けを除去すると、Acc@1は36.8%に低下し、低品質な合成ペアのフィルタリングにその役割が不可欠であることが確認された。
- 知識蒸留を除去すると、ノイズ感受性が増し、Acc@1が1.8%低下した。相対的蒸留アプローチは絶対的蒸留を0.9%上回った。
- 生成器に組み込まれた2次元アテンション機構はスケッチ品質を向上させ、1次元アテンションに置き換えるとAcc@1が4.2%低下(8.1%に)した。
- ポリシー勾配フィードバックによる共同学習は、検索精度を1.4%向上させ、検索または識別子のフィードバックのみを別個に適用する場合を上回った。
- 本フレームワークは限られた訓練データでも強力な性能を維持し、さまざまなデータサイズにおいて教師ありベースラインを顕著に上回った。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。