Skip to main content
QUICK REVIEW

[論文レビュー] DRPT: Disentangled and Recurrent Prompt Tuning for Compositional Zero-Shot Learning

Xiaocheng Lu, Ziming Liu|arXiv (Cornell University)|May 2, 2023
Domain Adaptation and Few-Shot Learning被引用数 7
ひとこと要約

本稿では、視覚言語モデルにおける状態とオブジェクトのプリミティブ間の勾配の混合を軽減する、分離的かつ再帰的なプロンプトチューニングフレームワークであるDRPTを提案する。再帰的戦略により、オブジェクトと状態のトークンを段階的かつ独立にチューニングすることで、UT-ZapposおよびC-GQAベンチマークにおいて、最先端の手法よりも優れた正確性と効率性を達成し、未学習の組み合わせへの一般化およびゼロショット画像・テキスト検索の両面で最先端の性能を発揮する。

ABSTRACT

Compositional Zero-shot Learning (CZSL) aims to recognize novel concepts composed of known knowledge without training samples. Standard CZSL either identifies visual primitives or enhances unseen composed entities, and as a result, entanglement between state and object primitives cannot be fully utilized. Admittedly, vision-language models (VLMs) could naturally cope with CZSL through tuning prompts, while uneven entanglement leads prompts to be dragged into local optimum. In this paper, we take a further step to introduce a novel Disentangled and Recurrent Prompt Tuning framework termed DRPT to better tap the potential of VLMs in CZSL. Specifically, the state and object primitives are deemed as learnable tokens of vocabulary embedded in prompts and tuned on seen compositions. Instead of jointly tuning state and object, we devise a disentangled and recurrent tuning strategy to suppress the traction force caused by entanglement and gradually optimize the token parameters, leading to a better prompt space. Notably, we develop a progressive fine-tuning procedure that allows for incremental updates to the prompts, optimizing the object first, then the state, and vice versa. Meanwhile, the optimization of state and object is independent, thus clearer features can be learned to further alleviate the issue of entangling misleading optimization. Moreover, we quantify and analyze the entanglement in CZSL and supplement entanglement rebalancing optimization schemes. DRPT surpasses representative state-of-the-art methods on extensive benchmark datasets, demonstrating superiority in both accuracy and efficiency.

研究の動機と目的

  • コンポジショナルゼロショット学習(CZSL)のプロンプトチューニングにおける状態とオブジェクトのプリミティブ間の混合問題に対処すること。これは最適化を妨げ、収束が不十分になる原因となる。
  • トレーニングデータなしで、視覚言語モデル(VLM)の未学習の組み合わせ概念(例:「青いリンゴ」)への一般化を向上させるために、プロンプトチューニングを活用すること。
  • 状態とオブジェクトのトークンを独立して最適化できるように、段階的かつ分離されたチューニング戦略を開発すること。
  • 平均混合率と混合分散という新しい指標を用いて、CZSLにおける混合を定量化・分析し、最適化のバイアスを軽減するためのバランス調整を組み込むこと。
  • DRPTが複数のベンチマークデータセットにおいて、既存の最先端手法を正確性と効率性の両面で上回ることを示すこと。

提案手法

  • DRPTは、訓練中に状態とオブジェクトのトークンを交互に固定・更新することで、混合に起因する勾配干渉を低減する、分離的かつ再帰的なプロンプトチューニング戦略を導入する。
  • オブジェクトプロンプトを最初にチューニングし、次に状態プロンプトをチューニングする段階的ファインチューニングスケジュールを採用し、各プリミティブの独立した最適化を可能にする。
  • 最適なチューニング順序(例:o→a→ao)を探索するためのステータス遷移シーケンス機構を設計し、アブレーションにより、このシーケンスが最良のパフォーマンスを発揮することが示された。
  • 平均混合率と混合分散という指標を用いて混合を定量化し、極端に混合されたプロンプトに起因する最適化バイアスを軽減するためのバランス調整を適用する。
  • DRPTは、状態とオブジェクトのプリミティブをプロンプト内の学習可能なトークンとして扱い、共同でファインチューニングするが、分離的かつ再帰的な方法を用いることで、プロンプト空間の最適化を向上させる。
  • UT-ZapposおよびC-GQAで評価され、標準的なゼロショットリtrievalメトリクス(S、U、HM、AUC)を用いて、学習済みおよび未学習の組み合わせにおけるパフォーマンスを測定する。

実験結果

リサーチクエスチョン

  • RQ1状態とオブジェクトのプリミティブ間の混合は、コンポジショナルゼロショット学習のための視覚言語モデルにおけるプロンプトチューニングにどのように影響を与えるか?
  • RQ2分離的かつ再帰的なチューニング戦略は、不均一な混合の悪影響を軽減し、最適化収束を改善できるか?
  • RQ3CZSLにおけるパフォーマンスを最大化するための、状態とオブジェクトプロンプトの最適なトレーニング順序は何か?
  • RQ4混合はどのように定量的に測定され、バランス調整が施されることでモデルの一般化性能が向上するか?
  • RQ5DRPTは、標準的なCZSLベンチマークにおいて、既存の最先端手法を正確性と効率性の両面で上回るか?

主な発見

  • DRPTはUT-ZapposおよびC-GQAの両方で最高のパフォーマンスを達成し、C-GQAでは平均正確性(HM)が64.5%、AUCが29.2%を記録し、ジョイントチューニングや他のベースラインを上回った。
  • ステータス遷移シーケンス「o→a→ao」が最高のパフォーマンスを発揮し、C-GQAではHMが64.5%、AUCが29.2%を記録した。これは、独立的かつ段階的なチューニングがジョイントチューニングよりも効果的であることを示している。
  • アブレーションスタディにより、分離的チューニングと再帰的最適化の両方が不可欠であることが確認された。両方の要素を欠如させると、C-GQAにおけるHMが2%以上低下した。
  • 提案された混合指標(平均混合率と分散)は、高混合度のプロンプトが更新に抵抗し、最適化を誤導することを示し、バランス調整の必要性を裏付けた。
  • 定性的な結果から、オブジェクトは状態よりも予測可能性が高く、DRPTは学習済みおよび未学習の組み合わせの両方に対して関連画像を正しく検索できた。ただし、「Greed Bush」のような曖昧なケースではわずかな失敗が見られた。
  • DRPTは、ジョイントチューニングと比較して、未学習の組み合わせへの一般化性能をAUCで3.5~5.5パーセンテージポイント向上させ、ゼロショット一般化における有効性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。