[論文レビュー] Improving Zero-Shot Models with Label Distribution Priors
本稿では、ラベルの事前分布を活用することで、ラベル付きデータを一切使用せずにCLIPのようなゼロショット視覚・言語モデルの性能を向上させるCLIPPRという手法を提案する。アダプタネットワークを訓練し、CLIPの元のゼロショット予測を保持するのと、予測されたラベル分布を仮定された事前分布に一致させるのをバランスさせる。UTK年齢回帰では平均絶対誤差が28%低減され、ImageNet分類では2.83%の精度向上を達成した。
Labeling large image datasets with attributes such as facial age or object type is tedious and sometimes infeasible. Supervised machine learning methods provide a highly accurate solution, but require manual labels which are often unavailable. Zero-shot models (e.g., CLIP) do not require manual labels but are not as accurate as supervised ones, particularly when the attribute is numeric. We propose a new approach, CLIPPR (CLIP with Priors), which adapts zero-shot models for regression and classification on unlabelled datasets. Our method does not use any annotated images. Instead, we assume a prior over the label distribution in the dataset. We then train an adapter network on top of CLIP under two competing objectives: i) minimal change of predictions from the original CLIP model ii) minimal distance between predicted and prior distribution of labels. Additionally, we present a novel approach for selecting prompts for Vision & Language models using a distributional prior. Our method is effective and presents a significant improvement over the original model. We demonstrate an improvement of 28% in mean absolute error on the UTK age regression task. We also present promising results for classification benchmarks, improving the classification accuracy on the ImageNet dataset by 2.83%, without using any labels.
研究の動機と目的
- ラベル分布の不一致により性能が低いゼロショットモデル(例:CLIP)が回帰タスクで劣る問題に対処する。
- 特に長尾属性や年齢のような数値属性において、ラベル付きデータが不足する問題を克服する。
- アノテート済みの例が不要な状態で、ラベル分布の事前知識を組み込むことでゼロショット分類および回帰を向上させる。
- ラベル付きデータと分布的事前知識のみを用いて、事前学習済みV&Lモデルを適応する手法を開発する。
- ハイパーパrameterへの依存を最小限に抑えつつ、元のモデル予測の忠実性を保ちながら、多様なデータセットに堅牢に適応可能にする。
提案手法
- CLIPなどの固定された視覚・言語(V&L)モデルエンコーダの上にアダプタモジュールを訓練し、ラベル付きデータを一切使用せず、未ラベル画像とラベル分布の事前分布のみを用いる。
- 2つの競合する目的でアダプタを最適化する:(1) 元のCLIPゼロショット予測からのずれを最小化(ログィットにおけるL2損失により)、(2) 予測されたラベル分布と事前分布との間の分布的距離を最小化(Wasserstein距離により)。
- 2つの目的を重み付き組み合わせで最適化し、ハイパーパrameter α を用いて、元の予測の保持と事前分布への適合のトレードオフを調整する。
- タスク固有のテキストプロンプトを、ラベル事前分布に基づいて選択し、ラベル付きデータなしでプロンプト工学を改善する。
- 多変量回帰拡張にはスライスドWasserstein距離を用いた分布マッチングを適用するが、これは今後の課題として残す。
- 外部情報やドメイン知識(例:人口統計や既知のデータ分布)からラベル事前分布を推定する。
実験結果
リサーチクエスチョン
- RQ1ラベルの事前分布を用いることで、アノテート済みデータが一切ない状況下でゼロショット回帰性能が顕著に向上するか?
- RQ2ラベルにアクセスできない状況下で、視覚・言語モデルを、ターゲットデータセットの真のラベル分布をよりよく反映するように適応できるか?
- RQ3元のゼロショット予測を保持しつつ、ラベル事前分布に一致させる際の、多様なタスクにおけるモデル精度向上の程度はどの程度か?
- RQ4提案手法は、ハイパーパrameterの微調整を最小限に抑えつつ、回帰および分類タスクに一般化可能か?
- RQ5ベースのV&Lモデルのゼロショット予測に誤りがある場合や、ラベル事前分布の推定に誤差がある場合でも、この手法はどれほど頑健か?
主な発見
- UTK年齢回帰ベンチマークにおいて、CLIPPRは平均絶対誤差(MAE)を7.99から5.73に低下させ、CLIPのゼロショット性能比で28%の相対的改善を達成した。
- 本手法は、ラベル付き例を一切使用せず、ImageNetのトップ1分類精度をCLIPのゼロショットベースライン比で2.83%向上させた。
- 複数のデータセットで一貫した改善が得られ、α = 1で最適性能を示し、α値(0.3, 1, 3)の変動に対しても安定性を保った。
- UTKデータセットにおいて、32ショット/クラスの状態のアダプタ(Tip-Adapter)ですら上回る性能を示し、強力なゼロショット一般化能力を示した。
- 本手法は回帰および分類の両タスクで有効であり、モダリティを跨いで分布的事前知識を活用することでゼロショット性能を向上させられることを示した。
- CLIPのゼロショット予測が根本的に誤り(例:ランダムに近い)である場合に、失敗ケースが発生する。これは、本手法がベースモデルの出力を出発点として依存しているためである。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。