[論文レビュー] STEVE-1: A Generative Model for Text-to-Behavior in Minecraft
本論文は、60ドルの計算資源と2,000件の指示ラベル付きトラジェクトリーデータのみを用いて、Minecraftにおけるテキストから行動への制御を可能にする生成モデルSTEVE-1を紹介する。unCLIPにインspiredされ、微調整されたVPTポリシーとCVAE事前分布を組み合わせて、テキストからMineCLIP埋め込みを予測する。これにより、生のピクセル入力と低レベルのコントロールを用いても、13の初期ゲームタスクのうち12つで強力なゼロショット一般化が実現される。
Constructing AI models that respond to text instructions is challenging, especially for sequential decision-making tasks. This work introduces a methodology, inspired by unCLIP, for instruction-tuning generative models of behavior without relying on a large dataset of instruction-labeled trajectories. Using this methodology, we create an instruction-tuned Video Pretraining (VPT) model called STEVE-1, which can follow short-horizon open-ended text and visual instructions in Minecraft. STEVE-1 is trained in two steps: adapting the pretrained VPT model to follow commands in MineCLIP's latent space, then training a prior to predict latent codes from text. This allows us to finetune VPT through self-supervised behavioral cloning and hindsight relabeling, reducing the need for costly human text annotations, and all for only $60 of compute. By leveraging pretrained models like VPT and MineCLIP and employing best practices from text-conditioned image generation, STEVE-1 sets a new bar for open-ended instruction-following in Minecraft with low-level controls (mouse and keyboard) and raw pixel inputs, far outperforming previous baselines and robustly completing 12 of 13 tasks in our early-game evaluation suite. We provide experimental evidence highlighting key factors for downstream performance, including pretraining, classifier-free guidance, and data scaling. All resources, including our model weights, training scripts, and evaluation tools are made available for further research.
研究の動機と目的
- 大規模で高価な指示ラベル付きトラジェクトリーデータセットに依存せずに、Minecraftのような順序付き意思決定環境における指示従いを可能にすること。
- 自己教師付き行動クラーニングと後向き再ラベル付けを用いて、事前学習済みの生成モデル(VPT)を、オープンエンドで短い時間窓のテキストおよび視覚的指示に適応させること。
- unCLIP風のポリシーと事前分布の分離に加え、分類器フリーのガイダンスを組み合わせることで、テキストから行動生成のパフォーマンスが向上するかどうかを検証すること。
- 低コストで高精度な指示チューニングが、低レベルのコントロールを伴う複雑なピクセルベースの環境で可能かどうかを実証すること。
- 研究の促進を目的として、モデル重み、トレーニングスクリプト、評価ツールを公開すること。
提案手法
- 自己教師付き行動クラーニングと後向き再ラベル付けを用いて、テキストのアノテーションにかかるコストを回避しつつ、事前学習済みのMineCLIP埋め込みをゴールの監視として用いて、VPTモデルを視覚的ゴールに従うように微調整する。
- テキストプロンプトからMineCLIP潜在埋め込みにマッピングするための条件付き変分オートエンコーダ(CVAE)事前分布を学習し、テキスト条件付きの行動生成を可能にする。
- 分類器フリーのガイダンスを用いたunCLIP風の推論を適用し、条件付き出力と無条件出力の両方に注目できるようにすることで、生成品質と耐性を向上させる。
- 2段階のトレーニングプロセスを採用する:まず、VPTをMineCLIP空間における視覚的ゴールに適応させる。次に、テキストから視覚的埋め込みペアを用いてCVAE事前分布を学習する。
- VPT(70,000時間のゲームプレイの事前学習)とMineCLIP(テキスト-動画の整合性)の事前学習を活用することで、データと計算リソースの要件を削減する。
- プロンプト工学とプロンプトチェーンを用いて、合成や建造のような長時間窓タスクへの性能を拡張する。
実験結果
リサーチクエスチョン
- RQ1最小限の人為的アノテーション付き指示データを用いて、生成モデルをMinecraftにおけるテキストから行動への制御にチューニング可能か?
- RQ2unCLIPにインspiredされたポリシーと事前分布の分離は、順序付き意思決定におけるゼロショット一般化を向上させるか?
- RQ3事前学習、分類器フリーのガイダンス、データスケーリングは、テキストから行動生成の下流パフォーマンスにどのように影響するか?
- RQ4自己教師付き行動クラーニングに後向き再ラベル付けを組み合わせることで、高価な指示ラベル付きトラジェクトリーデータを効果的に置き換えられるか?
- RQ5プロンプト工学とチェーンは、どの程度長時間窓タスクへの性能を拡張できるか?
主な発見
- STEVE-1は、60ドルの計算資源と2,000件の指示ラベル付きセグメントのみを用いて、初期ゲーム評価スイートの13タスク中12タスクを正常に完了した。
- モデルは、例えば「背の高い草を破壊し、草を破壊し、種を収集する」といったエンジニアリングされたプロンプト変種に対しても、堅牢に一般化した。
- 分類器フリーのガイダンスは、特に複雑または曖昧な指示において、生成品質と成功確率を顕著に向上させた。
- VPTの事前学習とMineCLIPの視覚的埋め込みの組み合わせにより、追加の微調整なしに強力なゼロショット転送が実現された。
- プロンプトチェーンにより、木のピックアックスの合成や塔の建造といった長時間窓タスクが、単純なプロンプトでは到達不可能な領域でも解決可能になった。
- 自己教師付き後向き再ラベル付けによる視覚的埋め込みの再ラベル付けを活用することで、高価な人為的アノテーション付き指示トラジェクトリーデータへの依存度が低下した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。