[論文レビュー] Using Natural Language and Program Abstractions to Instill Human Inductive Biases in Machines
本稿では、自然言語記述とプログラムの抽象化(特に学習されたプリミティブを含むもの)を用いて、共通訓練によるメタ強化学習エージェントを提案する。これにより、人間らしい帰納的バイアスを内蔵する。人間が生成した言語と、ライブラリ学習を用いたプログラム誘導により、人間が得意とするタスクにおける一般化性能が向上する一方で、人間が不得意とするタスクでは性能が低下する。これは、これらの表現における圧縮による抽象化が、より人間らしい行動を生じさせることを示している。
Strong inductive biases give humans the ability to quickly learn to perform a variety of tasks. Although meta-learning is a method to endow neural networks with useful inductive biases, agents trained by meta-learning may sometimes acquire very different strategies from humans. We show that co-training these agents on predicting representations from natural language task descriptions and programs induced to generate such tasks guides them toward more human-like inductive biases. Human-generated language descriptions and program induction models that add new learned primitives both contain abstract concepts that can compress description length. Co-training on these representations result in more human-like behavior in downstream meta-reinforcement learning agents than less abstract controls (synthetic language descriptions, program induction without learned primitives), suggesting that the abstraction supported by these representations is key.
研究の動機と目的
- 自然言語とプログラムの抽象化が、人工エージェントの訓練における人間の帰納的バイアスの蓄積源として機能するかどうかを調査すること。
- これらの表現を用いた共通訓練が、メタ強化学習エージェントにおいてより人間らしい行動を生じさせるかどうかを特定すること。
- 特に言語とプログラム表現における圧縮による抽象化が、一般化性能と人間らしい帰納的バイアスの向上に寄与するかどうかを検討すること。
- 人間が生成した言語と合成された言語、および学習されたプリミティブを含むか否かのプログラム抽象化の有効性を、エージェント行動の形成に与える影響を比較すること。
- より大きな環境向けに、このような表現をアクティブラーニングとデータ拡張を用いてスケーラブルに拡張可能かどうかを検討すること。
提案手法
- 自然言語タスク記述とプログラム抽象化から導出された表現を予測する補助タスクを用いて、メタ強化学習エージェントを共通訓練する。
- 2次元のバイナリグリッド環境において、ドメイン特化言語(DSL)を用いてプログラムを生成する。これには、基本プリミティブに加え、学習されたライブラリ抽象化も含む。
- ライブラリ学習を用いて、記述長を圧縮する高階のプログラミングプリミティブを自動で発見・統合する。
- メタ強化学習の訓練中に、人間が生成した言語記述と、学習されたプリミティブを含むプログラムを補助的監視信号として予測するようにエージェントを訓練する。
- 人間のパフォーマンスをベンチマークとして用い、合成言語、基本DSLプログラム、およびライブラリ拡張済みプログラムの各条件を比較する。
- Kumarら[10]が開発したタスク分布を用い、帰納的バイアスの微細な差を区別できるようにし、エージェント行動の詳細な分析を可能にする。
実験結果
リサーチクエスチョン
- RQ1人間が生成した自然言語記述を用いた共通訓練が、メタ強化学習エージェントの、人間の帰納的バイアスへの適合性を向上させるか?
- RQ2特に記述長を圧縮するような、学習されたプリミティブを含むプログラム抽象化を用いることで、エージェントに人間らしい行動が促進されるか?
- RQ3合成言語と人間が生成した言語、基本DSLとライブラリ拡張済みプログラムといった、異なる表現形態が、人間らしい帰納的バイアスの出現にどのように影響するか?
- RQ4人間の言語記述と、ライブラリ学習を用いて合成されたプログラムとの間に、明確な対応関係が見られるか。これは、共通の認知的圧縮メカニズムを示唆するか?
- RQ5言語とプログラム表現における抽象化レベルが、下流のメタ強化学習タスクにおける一般化性能と人間らしい行動の向上に、どの程度寄与するか?
主な発見
- 人間が生成した言語と、学習されたプリミティブを含むプログラムを共通訓練したエージェントは、合成言語や基本DSLプログラムで訓練したエージェントよりも顕著に人間らしい行動を示した。
- 学習されたプリミティブを含むプログラム抽象化の使用により、人間が不得意とするタスク分布においてパフォーマンスが有意に低下した。これは、エージェントがより人間らしい帰納的バイアスを採用したことを示している。
- 人間が生成した言語記述と、ライブラリ学習を用いて合成されたプログラムとの間に強い対応関係が観察された。両者とも同様の方法で情報の圧縮に高階の抽象化を用いていることを示唆している。
- 特に言語とプログラム抽象化における圧縮による抽象化をサポートする表現を用いた共通訓練が、下流のメタ強化学習エージェントにおける人間らしい行動の発現を牽引する要因であることが判明した。
- 人間の言語とライブラリ拡張済みプログラムを用いて訓練したエージェントは、人間が得意とするタスク分布において、制御条件を上回るパフォーマンスを示した。これは、一般化性能の向上を示している。
- 結果から、自然言語とプログラム表現における圧縮による抽象化が、人工エージェントに人間らしい帰納的バイアスを内蔵させるための重要なメカニズムであると示唆される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。