[論文レビュー] OMNI: Open-endedness via Models of human Notions of Interestingness
OMNIは、基礎モデル(FM)を人間の興味の概念(MoI)のモデルとして用い、学習可能で真に興味深いタスクを優先することで、オープンエンドな学習をガイドする。事前学習されたFMを用いて新規性と価値を評価することで、Crafter や BabyAI といった環境において、均一サンプリングや学習進捗のみを基準とするベースラインを上回り、多様で高影響力のある行動を発見する。
Open-ended algorithms aim to learn new, interesting behaviors forever. That requires a vast environment search space, but there are thus infinitely many possible tasks. Even after filtering for tasks the current agent can learn (i.e., learning progress), countless learnable yet uninteresting tasks remain (e.g., minor variations of previously learned tasks). An Achilles Heel of open-endedness research is the inability to quantify (and thus prioritize) tasks that are not just learnable, but also $ extit{interesting}$ (e.g., worthwhile and novel). We propose solving this problem by $ extit{Open-endedness via Models of human Notions of Interestingness}$ (OMNI). The insight is that we can utilize foundation models (FMs) as a model of interestingness (MoI), because they $ extit{already}$ internalize human concepts of interestingness from training on vast amounts of human-generated data, where humans naturally write about what they find interesting or boring. We show that FM-based MoIs improve open-ended learning by focusing on tasks that are both learnable $ extit{and interesting}$, outperforming baselines based on uniform task sampling or learning progress alone. This approach has the potential to dramatically advance the ability to intelligently select which tasks to focus on next (i.e., auto-curricula), and could be seen as AI selecting its own next task to learn, facilitating self-improving AI and AI-Generating Algorithms. Project website at https://www.jennyzhangzt.com/omni/
研究の動機と目的
- オープンエンドなAI研究における重要なギャップに取り組むこと:学習可能性を超えて真に興味深いタスクを定量化・優先できる仕組みの欠如。
- 手作業で設計された興味の指標の限界を克服すること:これらはしばしば新規性や価値に関する人間の直感を捉えきれない。
- AIエージェントが自律的かつ自己調整的に、学習可能で価値のある多様なタスクのカリキュラムを生成・焦点化できることを可能にすること。
- 基礎モデル(膨大な人間生成データで学習済み)が、AI自己向上の応用において人間と同様の判断を内省・一般化できるかどうかを調査すること。
提案手法
- OMNIは、基礎モデル(FM)を興味のモデル(MoI)として用い、膨大なテキストコーパスから得た人間の概念(新規性、価値、独自性など)の事前学習済み理解を活用する。
- MoIは、少数の例を提示することで推論を誘導するプロンプトを用いて、候補となるタスクが学習可能で興味あるかどうかをFMが評価する。
- FMの出力をもとにタスクをスコアリングし、スコアが高いほど期待される学習進捗と認識される興味の度合いが高くなる。
- エージェントはスコア順に並べたリストからタスクをサンプリングし、既知のタスクの微小な変種ではなく、多様で重複のない行動の探索を保証する。
- タスク選択のための統合スコア関数として、ポリシー性能による学習進捗とFMベースの興味の度合いの両方を統合する。
- OMNIは文レベルモデル(例:GPT-3.5)と文埋め込みモデル(例:BGE)を用いて評価され、アブレーションスタディにより性能を比較する。
実験結果
リサーチクエスチョン
- RQ1基礎モデルは、オープンエンドな学習において、人間の興味の概念の代理として効果的に機能するか?
- RQ2FMベースのタスク選択は、均一サンプリングや学習進捗のみを基準とするベースラインと比較して、多様で高影響力のあるスキル習得を促進するか?
- RQ3FMは、学習可能ではあるが退屈なタスク(例:微小な変化)と、真に新規で価値のあるタスクをどの程度区別できるか?
- RQ4複数の興味の側面(例:新規性、価値、複雑さ)を1つのFMプロンプトに統合することで、興味のモデルを改善できるか?
- RQ5人間と同様の興味の判断に基づき、AIが自律的に次の学習タスクを選択することの安全性にどのような影響があるか?
主な発見
- OMNIは、Crafter環境において、全訓練ステップで均一サンプリングや学習進捗のみを基準とするベースラインを顕著に上回り、平均タスク成功確率が高くなる。
- OMNIは、退屈とされるタスク(例:反復的または複合的タスク)において、OMNI-embed よりも高い成功確率を達成しており、真の興味の度合いの識別能力が優れていることが示された。
- この手法は、重複のない高影響力のタスクを効果的に特定・優先することができ、例えば木と石を別々に習得した後、両方を集めるタスクを学習するのを回避し、複合タスクの過大評価を防いだ。
- OMNI-embed(より単純な文埋め込みベースライン)は一部の設定ではOMNIと同等の性能を示すが、特に複合タスクの文脈では、タスクの新規性における微細な差を区別できない。
- GPT-4は、少数の例を提示することで、新規性・価値・学習可能性といった複数の興味の側面を統合して評価する能力を示しており、スケーラブルで適応可能なMoI設計の可能性を示唆している。
- 結果から、基礎モデルが人間と同様の判断を内省・一般化できることを示唆しており、AIが自律的に学習タスクのカリキュラムをカスタマイズ可能であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。