[論文レビュー] GRIT: General Robust Image Task Benchmark
GRITは、7つのコアなビジョンおよびビジョン・リンギアタスク(オブジェクト分類、局所化、参照表現、VQA、セマンティックセグメンテーション、キーポイント検出、サーフェスノルム推定)を対象とし、多様なデータソース、コンセプト、画像の摂動に対して、ビジョンモデルの汎用性、耐性、キャリブレーションを評価する統合ベンチマークを導入する。このベンチマークは、2つのトラック(制限付き:ゼロショット転送およびデータ効率性を想定、非制限付き:大規模なフォーデーションモデルを想定)を通じて、モデルの公平な比較を可能にする。主な結果として、分布シフト下での顕著な性能低下と強いキャリブレーションのトレードオフが明らかになった。
Computer vision models excel at making predictions when the test distribution closely resembles the training distribution. Such models have yet to match the ability of biological vision to learn from multiple sources and generalize to new data sources and tasks. To facilitate the development and evaluation of more general vision systems, we introduce the General Robust Image Task (GRIT) benchmark. GRIT evaluates the performance, robustness, and calibration of a vision system across a variety of image prediction tasks, concepts, and data sources. The seven tasks in GRIT are selected to cover a range of visual skills: object categorization, object localization, referring expression grounding, visual question answering, segmentation, human keypoint detection, and surface normal estimation. GRIT is carefully designed to enable the evaluation of robustness under image perturbations, image source distribution shift, and concept distribution shift. By providing a unified platform for thorough assessment of skills and concepts learned by a vision model, we hope GRIT catalyzes the development of performant and robust general purpose vision systems.
研究の動機と目的
- i.i.d.設定を超えたビジョンモデルの評価のための統合ベンチマークの欠如に応えること、特に分布シフトやコンセプト転送の下での評価を目的とする。
- JPEG、ぼかし、敵対的摂動を含む20種類の画像歪みに対するモデルの耐性を評価すること。
- 大規模なフォーデーションモデル(非制限付きトラック)と効率的かつデータ効率的なモデル(制限付きトラック)の両方をサポートし、トレーニングデータへのアクセスを制御すること。
- 信頼度スコアを用いて予測の信頼性と自己認識の度合いを測定することで、モデルのキャリブレーションを評価すること。
- 人間の視覚理解に類似した、タスク、コンセプト、データソースを横断する汎用ビジョンシステムの開発を促進すること。
提案手法
- GRITは、広範な視覚的スキルをカバーする7つのコアタスク(オブジェクト分類、局所化、参照表現のグランドイング、VQA、セマンティックセグメンテーション、人間キーポイント検出、サーフェスノルム推定)を軸に構成されている。
- 評価の一貫性を高め、曖昧さを低減するために、明確で既存のデータセットと標準化されたアノテーションを用いる。
- 評価は3つの主要な軸を含む:(1) 新たなデータソース(分布シフト)、(2) 新たなコンセプト(コンセプトシフト)、(3) 20種類の画像摂動タイプに対する耐性。
- RMSEと自己認識メトリクスを用いたキャリブレーション評価を可能にするために、各予測に対して信頼度スコアを出力することがモデルの要件となる。
- 2つの評価トラックを定義:制限付き(特定の公開データソースに限定)と非制限付き(アブレーション/テストセットを除く任意のデータ)。これにより、計算スケールにかかわらず公平な比較が可能になる。
- サブセット(例:新規ソース、新規コンセプト)ごとに個々のサンプル評価指標を計算し、平均化することで、一般化性と耐性の微細な分析が可能になる。
実験結果
リサーチクエスチョン
- RQ1ビジョンモデルは、トレーニング時に見なかった新しいデータソースやコンセプトに対して、どの程度一般化できるか?
- RQ2JPEG圧縮、ノイズ、敵対的攻撃などの多様な画像摂動下でも、モデルの性能はどの程度維持されるか?
- RQ3異なるタスクや分布シフト下で、モデルの信頼度スコアはどの程度キャリブレーションされているか?
- RQ4限定されたデータソースで学習したモデルでも、新規コンセプトや新規データソースに対して強力なゼロショット転送性能を達成できるか?
- RQ5異なるモデルアーキテクチャーやサイズは、複数のビジョンタスクにおける耐性と一般化性の観点で、どのように比較されるか?
主な発見
- すべてのモデルが画像摂動下で性能低下を示したが、参照表現タスクにおけるゼロショットGPV-1を除き、低ベースライン性能のため例外的だった。
- 制限付きトラックで、GPV-2が全体で最も高い正確度(31.9%)を達成し、Mask R-CNN(20.2%)やBaeら(7.1%)を上回った。
- 新規データソースおよび新規コンセプトでの性能低下が顕著に見られ、ゼロショット一般化の限界が浮き彫りになった。
- キャリブレーション指標から、自己認識を最大化するモデルはしばしばRMSEが悪化しており、信頼性とキャリブレーションのバランスを取る必要があることが示された。
- 制限付きトラックは、計算リソースが限られたモデルの公平な比較を成功裏に可能にした。これは、トレーニングデータを同じ公開ソースに限定することで実現された。
- サーフェスノルム推定および人物キーポイント検出タスクでは、データにコンセプトタグが存在しないため、新規コンセプトのパフォーマンスが報告されなかった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。