[論文レビュー] Development of collective behavior in newborn artificial agents
本論文は、深層強化学習と好奇心駆動学習——2つの生物学的にインスパイアされたメカニズム——が、外部報酬なしに自然環境における生の視覚入力から新生人工エージェントが自己学習によってコアな集団行動(自己運動、物体認識、グループ好ましさなど)を発達可能であると提唱している。主な貢献は、これらの一般的な学習メカニズムのみで、自己教師ありの感覚駆動経験から複雑で適応的な集団行動が生成可能であることを示したことにある。
Collective behavior is widespread across the animal kingdom. To date, however, the developmental and mechanistic foundations of collective behavior have not been formally established. What learning mechanisms drive the development of collective behavior in newborn animals? Here, we used deep reinforcement learning and curiosity-driven learning -- two learning mechanisms deeply rooted in psychological and neuroscientific research -- to build newborn artificial agents that develop collective behavior. Like newborn animals, our agents learn collective behavior from raw sensory inputs in naturalistic environments. Our agents also learn collective behavior without external rewards, using only intrinsic motivation (curiosity) to drive learning. Specifically, when we raise our artificial agents in natural visual environments with groupmates, the agents spontaneously develop ego-motion, object recognition, and a preference for groupmates, rapidly learning all of the core skills required for collective behavior. This work bridges the divide between high-dimensional sensory inputs and collective action, resulting in a pixels-to-actions model of collective animal behavior. More generally, we show that two generic learning mechanisms -- deep reinforcement learning and curiosity-driven learning -- are sufficient to learn collective behavior from unsupervised natural experience.
研究の動機と目的
- 新生人工エージェントが事前定義されたルールや外部報酬なしに集団行動を発達できるかを調査すること。
- 生物学的に妥当な学習メカニズム——深層強化学習と好奇心駆動学習——が人工エージェントにおける集団行動の出現を支援できるかを検討すること。
- 高次元の感覚入力と調整の取れた集団行動の間のギャップを埋めるために、'ピクセルから行動へ'の学習プロセスをモデル化すること。
- 集団動物行動の発達的・メカニズム的基盤を研究するための透明で神経的に妥当なフレームワークを提供すること。
提案手法
- エージェントは、視覚的観察における予測誤差を最大化するように、好奇心駆動の内発的報酬信号を伴う深層強化学習で訓練される。
- エージェントは、仲間とのグループを形成する自然的3次元視覚環境に埋め込まれており、生のピクセル入力からの自己教師あり学習が可能である。
- 学習は内発的動機づけ(好奇心)にのみ依存し、外部の形状報酬や明示的な社会的シグナルは使用しない。
- アーキテクチャは畳み込みニューラルネットワークを用いて視覚入力を処理し、ポリシーネットワークが行動を生成する。これにより、エンドツーエンドの'ピクセルから行動へ'のシステムが構築される。
- エージェントは視点の変化にかかわらず仲間を不変に認識できるように学習し、自己教師ありの探索によって距離の近接性に対する好みを発達させる。
- 訓練環境は手続き的に生成されており、多様な視覚的および空間的条件下での一般化を保証する。
実験結果
リサーチクエスチョン
- RQ1人工エージェントは、外部報酬や事前プログラムされたルールなしに、内発的動機づけのみで生の感覚入力から集団行動を発達できるか?
- RQ2どのような学習メカニズムが、人工エージェントにおいて自己運動、物体認識、グループ好ましさの自発的出現を支えるのに十分か?
- RQ3深層強化学習と好奇心駆動学習が、どのように自己教師あり経験から複雑な社会的行動を共同で促進するか?
- RQ4'ピクセルから行動へ'モデルは、新生動物で観察される集団行動の発達的経路をどの程度再現できるか?
主な発見
- 人工エージェントは自発的に自己運動の認識を発達させ、自然環境における視覚的流れを用いて自らの移動を追跡する。
- エージェントは視点の変化や視覚的文脈の変化にかかわらず、明示的な教師なしにグループメンバーを一貫して識別できる不変な物体認識を学習する。
- エージェントはグループメンバーへの距離の近接性に対する強い好みを発達させ、自発的なグループ形成と結束を生じさせる。
- 外部報酬なしに、好奇心駆動の内発的動機づけにのみ依存して、すべての集団行動のコアスキルが出現する。
- エージェントの行動は実際の新生動物の行動と類似しており、生の視覚入力から、自己教師ありの迅速な学習によって複雑な社会的スキルが習得されることを示している。
- モデルは、2つの一般的な学習メカニズム——深層強化学習と好奇心——が、人工エージェントにおける集団行動の生成に十分であることを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。