Skip to main content
QUICK REVIEW

[論文レビュー] Towards AGI in Computer Vision: Lessons Learned from GPT and Large Language Models

Lingxi Xie, Longhui Wei|arXiv (Cornell University)|Jun 14, 2023
Multimodal Machine Learning Applications被引用数 5
ひとこと要約

本論文は、GPTがNLPで成功を収めたのをヒントに、インタラクティブで世界規模の環境から学習できるエージェントを可能にすることで、コンピュータビジョン分野における人工汎用知能(AGI)の実現に向けて、3段階のパイプラインを提案する。このアプローチでは、まずシミュレートされた環境で将来のフレームを予測するようにエージェントを事前学習させ、次に多様なビジョンタスクを実行できるように指示微調整を行う。視覚的タスクの統合を可能にするプロンプトベースのシステムが、主な貢献である。

ABSTRACT

The AI community has been pursuing algorithms known as artificial general intelligence (AGI) that apply to any kind of real-world problem. Recently, chat systems powered by large language models (LLMs) emerge and rapidly become a promising direction to achieve AGI in natural language processing (NLP), but the path towards AGI in computer vision (CV) remains unclear. One may owe the dilemma to the fact that visual signals are more complex than language signals, yet we are interested in finding concrete reasons, as well as absorbing experiences from GPT and LLMs to solve the problem. In this paper, we start with a conceptual definition of AGI and briefly review how NLP solves a wide range of tasks via a chat system. The analysis inspires us that unification is the next important goal of CV. But, despite various efforts in this direction, CV is still far from a system like GPT that naturally integrates all tasks. We point out that the essential weakness of CV lies in lacking a paradigm to learn from environments, yet NLP has accomplished the task in the text world. We then imagine a pipeline that puts a CV algorithm (i.e., an agent) in world-scale, interactable environments, pre-trains it to predict future frames with respect to its action, and then fine-tunes it with instruction to accomplish various tasks. We expect substantial research and engineering efforts to push the idea forward and scale it up, for which we share our perspectives on future research directions.

研究の動機と目的

  • 基礎モデルの進展にもかかわらず、ビジョンタスクの統合がNLPと比較してなぜ困難であるかを特定すること。
  • GPTおよび大規模言語モデル(LLMs)がテキスト世界におけるインタラクティブな学習を通じて、どのようにタスクを統合しているかを分析すること。
  • LLMsの成功を模倣するように、インタラクティブで世界規模の環境から学習できるエージェントを可能にする、コンピュータビジョンのための新しいパラダイムを提案すること。
  • AGIを実現するための3段階のパイプライン(環境作成、将来フレーム予測の事前学習、指示微調整)を提示すること。
  • 環境の忠実度、事前学習の代理タスク、および指示データのスケールといった、今後の研究における主な課題を特定することで、研究を導くこと。

提案手法

  • ビジョンエージェントのための現実世界のインタラクションを模倣できる、忠実で豊富でインタラクティブな仮想環境を構築すること。
  • 行動に基づいて将来のフレームを自己回帰的に予測するようにエージェントを事前学習させ、LLMsの自己教師あり事前学習を模倣すること。
  • 人間の指示を用いて事前学習済みエージェントを微調整し、多様なビジョンタスクを実行可能にする。これはLLMsにおける指示微調整に類似している。
  • 視覚的表現学習における効率性と一般化性を向上させるために、データ圧縮と多スケール特徴抽出に焦点を当てた代理タスクを設計すること。
  • 統一されたトークン化と再構成損失を用いて、視覚的表現学習の事前学習のパフォーマンス指標として、クロスモodal生成(例:テキストから画像)を統合すること。
  • 複雑なタスクを基本的な行動(例:探索、持ち運び)に分解できる統一されたプロンプトシステムを設計し、合成的タスク実行を可能にすること。

実験結果

リサーチクエスチョン

  • RQ1基礎モデルの進展にもかかわらず、なぜビジョンタスクの統合はNLPと比較して困難のままであるのか?
  • RQ2LLMsがNLPでタスクを統合できるのに対し、コンピュータビジョン分野で欠けている、どのような根本的なパラダイムの転換が必要なのか?
  • RQ3インタラクティブで世界規模の環境が、一般化ビジョンエージェントの事前学習の基盤としてどのように機能できるか?
  • RQ4視覚エージェントがインタラクションから世界モデルを学習できるようにするには、どの代理タスクと事前学習目的が最も効果的か?
  • RQ5指示微調整と統一されたプロンプトシステムを統合することで、1つのエージェントが多様なビジョンタスクに一般化できる仕組みは何か?

主な発見

  • コンピュータビジョン分野における根本的な欠陥は、NLPとは異なり、インタラクティブな環境からの学習のためのパラダイムが欠けていることである。
  • 対照的学習やマスキング画像モデリングといった、現在のビジョン事前学習手法は、世界モデル学習を可能にするには不十分であり、インタラクティブな環境に再考する必要がある。
  • 将来の事前学習では、視覚的データの冗長性をより効果的に処理するため、データ圧縮と多スケール特徴抽出を優先すべきである。
  • 現実世界のビジョンタスクの複雑さを考慮すると、現在のLLMsと比較して、指示微調整に桁違いの規模の指示データが必要になる。
  • 3D世界モデリング、ローカライゼーション、および模倣学習をシーケンス予測フレームワーク(例:ENTLのように)に統合することは、身体的なビジョンタスクの統合に有望である。
  • PaLM-EとENTLは、LLMsとトークン化を用いたビジョンタスクの統合において初期の進展を示しているが、現実世界の複雑さは、はるかに高度なシミュレーションとインタラクションを必要としている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。