Skip to main content
QUICK REVIEW

[論文レビュー] INTERN: A New Learning Paradigm Towards General Vision

Jing Shao, Siyu Chen|arXiv (Cornell University)|Nov 16, 2021
Domain Adaptation and Few-Shot Learning参考文献 43被引用数 10
ひとこと要約

本論文では、一般視覚のための新規マルチステージ学習パラダイムであるINTERNを提案する。このモデルは、複数の監視信号(アマチュア:広範な事前学習、エキスパート:タスク固有のファインチューニング、一般化者:マルチタスク適応)を段階的に活用することで、1つのモデルが多様なコンピュータビジョンタスクに一般化できるように訓練する。このモデルは、CLIPなどの先行手法を著しく上回り、10%のダウンストリーム学習データのみを用いて26のベンチマークでSOTA性能を達成した。

ABSTRACT

Enormous waves of technological innovations over the past several years, marked by the advances in AI technologies, are profoundly reshaping the industry and the society. However, down the road, a key challenge awaits us, that is, our capability of meeting rapidly-growing scenario-specific demands is severely limited by the cost of acquiring a commensurate amount of training data. This difficult situation is in essence due to limitations of the mainstream learning paradigm: we need to train a new model for each new scenario, based on a large quantity of well-annotated data and commonly from scratch. In tackling this fundamental problem, we move beyond and develop a new learning paradigm named INTERN. By learning with supervisory signals from multiple sources in multiple stages, the model being trained will develop strong generalizability. We evaluate our model on 26 well-known datasets that cover four categories of tasks in computer vision. In most cases, our models, adapted with only 10% of the training data in the target domain, outperform the counterparts trained with the full set of data, often by a significant margin. This is an important step towards a promising prospect where such a model with general vision capability can dramatically reduce our reliance on data, thus expediting the adoption of AI technologies. Furthermore, revolving around our new paradigm, we also introduce a new data system, a new architecture, and a new benchmark, which, together, form a general vision ecosystem to support its future development in an open and inclusive manner. See project website at https://opengvlab.shlab.org.cn .

研究の動機と目的

  • 新しい視覚アプリケーション用にタスク固有のモデルを訓練するための高いデータおよび計算コストを低減すること。
  • 単一の監視信号による事前学習の制限を克服し、狭いタスクの範囲に限定されない一般化を実現すること。
  • 1つのモデルが多様で、場合によっては未観測の視覚タスクに対しても効果的に適応できる、スケーラブルで統合されたパイプラインを開発すること。
  • 大規模なアノテート済みデータセットへの依存を減らし、効率的なフェイシング適応を可能にすること。
  • オープンかつ包括的な一般視覚モデル開発を促進するための包括的エコシステム(データ、アーキテクチャ、ベンチマーク)を確立すること。

提案手法

  • INTERNは3段階の事前学習パイプラインを採用する:(I) アップストリーム・アマチュア、(II) アップストリーム・エキスパート、(III) 一般化者。これは人間のインターンの学習プロセスを模倣する。
  • アップストリーム・アマチュア段階では、大規模かつマルチソースの監視信号(画像ラベル、ボクシングボックス、セグメンテーションマスク、自然言語など)を用いて、広範な表現学習を実施する。
  • アップストリーム・エキスパート段階では、分類、検出、セグメンテーションなどの特定タスクに対して、強力な監視信号を用いてファインチューニングを行い、タスク固有の熟練を構築する。
  • 一般化者段階では、これまでの全段階からの知識を統合し、統一的で柔軟な適応ヘッドを介して新規タスクへの高速適応を可能にする。
  • 多様な監視信号をサポートする新しいデータシステムを設計し、キュレートされたラベルシステムと高品質でスケーラブルなデータ収集のためのデータパイプラインを備える。
  • 26の多様な視覚タスクにわたる一般化を評価し、再現可能性を保証するための新しいベンチマーク、General Vision Benchmarkを導入する。

実験結果

リサーチクエスチョン

  • RQ1マルチステージ学習パラダイムを用いることで、1つの視覚モデルが多様で、場合によっては未観測の視覚タスクに対しても強力な一般化を達成できるか?
  • RQ2カテゴリ、ボックス、マスク、言語など、マルチソースの監視信号学習は、単一監視信号による事前学習に比べて、モデルの一般化をどの程度向上させるか?
  • RQ3INTERNで事前学習されたモデルが、ダウンストリームデータの10%のみでファインチューニングされた場合、タスク固有のモデルと同等またはそれ以上の性能を達成できるか?
  • RQ4提案されたパラダイムは、視覚AIにおけるデータ依存性を低減しつつ、広範なタスクにわたり性能を維持または向上させられるか?
  • RQ5将来的に新しいモodalities(例:動画、音声)やタスクの統合を考慮した場合、INTERNフレームワークはどの程度スケーラブルで拡張可能か?

主な発見

  • 最大のINTERNモデル、Up-G MN-B15は、26の評価タスクの多くで、公開済みの最高性能モデル(CLIP-R50×16)を上回った。これは、ダウンストリーム学習データの10%のみを用いても同様に成立する。
  • 平均して、INTERNモデルは分類、検出、セグメンテーション、リtrievalの4つのタスクカテゴリすべてで優れた性能を示し、強力なゼロショットおよびフェイシング一般化を実現した。
  • 10%のダウンストリームデータでの性能が、先行研究で全データセットで学習されたモデルの性能を上回ることが多く、データ効率の劇的向上を示している。
  • マルチステージ事前学習スキームにより、モデルは多様な監視信号を効果的に学習でき、頑健で柔軟な表現を獲得した。
  • 提案されたGeneral Vision Benchmarkは、将来的な一般視覚モデル研究のための標準的で包括的な評価プラットフォームを提供する。
  • データシステム、アーキテクチャ(MetaNetファミリー)、ベンチマークを含むエコシステムにより、一般視覚モデルの再現可能でスケーラブルな開発が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。