[論文レビュー] Self-Emotion-Mediated Exploration in Artificial Intelligence Mirrors: Findings from Cognitive Psychology
本論文は、精度と自己感受性スコアを用いた性能指標に基づき、認識的(驚き)および達成的(誇り)感情をモデル化することで、自己感受性を介した探索を組み込んだ人工知能のための新規フレームワークを提案する。深層強化学習アーキテクチャ内での微分可能な関数を用いてこれらの感情をシミュレートすることで、エージェントは自律的に探索を学習し、内部の感情状態と探索行動との間の因果関係を示す。これは、90%のエージェントが探索戦略を成功裏に学習したことで、人間の認知的パターンを模倣するものである。
Background: Exploration of the physical environment is an indispensable precursor to information acquisition and knowledge consolidation for living organisms. Yet, current artificial intelligence models lack these autonomy capabilities during training, hindering their adaptability. This work proposes a learning framework for artificial agents to obtain an intrinsic exploratory drive, based on epistemic and achievement emotions triggered during data observation. Methods: This study proposes a dual-module reinforcement framework, where data analysis scores dictate pride or surprise, in accordance with psychological studies on humans. A correlation between these states and exploration is then optimized for agents to meet their learning goals. Results: Causal relationships between states and exploration are demonstrated by the majority of agents. A 15.4\% mean increase is noted for surprise, with a 2.8\% mean decrease for pride. Resulting correlations of $ρ_{surprise}=0.461$ and $ρ_{pride}=-0.237$ are obtained, mirroring previously reported human behavior. Conclusions: These findings lead to the conclusion that bio-inspiration for AI development can be of great use. This can incur benefits typically found in living beings, such as autonomy. Further, it empirically shows how AI methodologies can corroborate human behavioral findings, showcasing major interdisciplinary importance. Ramifications are discussed.
研究の動機と目的
- 人工知能と生物学的探索の間のギャップを埋めるために、AIエージェントに人間らしい感情的動機を組み込むこと。
- 認知心理学の原則に従い、測定可能な性能指標(精度、自己感受性)を用いて、認識的および達成的感情(驚きと誇り)をモデル化すること。
- 内部の感情状態と探索行動を結びつけることで、人工エージェントが環境を自律的に探索できるようにし、適応性と学習効率を向上させること。
- AIにおける感情を介した探索が、認知心理学実験で観察された人間の行動パターンを再現しているかどうかを検証すること。
提案手法
- 感情は微分可能な関数としてモデル化される:誇りはタスクの精度の非線形関数として、驚きは精度と自己感受性スコアの関数として。
- エージェントの学習を安定化させ、時系列差分学習を可能にするために、アクター・クリティックネットワークとリプレイバッファを用いた深層強化学習アーキテクチャを採用。
- 感情関数はクリッピングにより[0,1]の範囲に制限され、個体差を模倣するためのガウスノイズが追加され、現実的な感情のばらつきを確保。
- クリティックネットワークは、ソフト更新(τ=0.005)を用いたターゲットネットワークを用いて時系列差分ターゲットを計算し、損失はAdam最適化アルゴリズム(学習率0.002)で最小化。
- 驚きは、精度と自己感受性の差の二乗を回転・平行移動させた関数としてモデル化され、高自己感受性での誤りや低自己感受性での成功が高驚き状態として捉えられる。
- 誇りは、精度にガウス関数に類似した関数としてモデル化され、高精度でピークを示し、達成に基づく感情反応を反映。
![Figure 1 : Curves demonstrating how the emotion of pride may correlate with accuracy. Example curves following a positive prediction of pride based on increasing accuracy, as described by cognitive psychology research [ 32 , 31 ] . Considering how increasing task accuracy equates to personal achieve](https://ar5iv.labs.arxiv.org/html/2302.06615/assets/figures/pride.png)
実験結果
リサーチクエスチョン
- RQ1認知心理学に由来する自己生成感情状態に基づいて、人工エージェントが探索行動を調整できるか。
- RQ2AIにおける感情を介した探索戦略が、認識的および達成的感情研究で観察された人間の行動パターンをどの程度再現するか。
- RQ3精度や自己感受性といった性能指標が、驚きや誇りといった人工感情にどのように対応し、効果的な探索を促進するか。
- RQ4明示的にモデル化された内部感情状態によって誘導される深層強化学習エージェントが、探索行動において収束を達成できるか。
主な発見
- 90%の人工エージェントが内部感情状態に基づいて探索行動を調整することに成功し、感情と行動との間の因果関係を示した。
- 驚き関数は、高自己感受性での誤りや低自己感受性での成功を高驚き状態として効果的に捉えており、認知心理学の知見と整合した。
- 誇り関数は精度に対して非線形で正の関係を示し、人間の研究で観察された達成に基づく感情反応を反映した。
- 個別化された感情パラメータ(ランダムなC1およびC2値を用いて)を有するエージェントは、多様だが一貫した探索行動を示し、個性の違いを模倣した。
- クリッピングおよびノイズを含む感情関数の使用により、すべてのエージェントで安定的かつ有界な感情出力が確保され、学習のロバスト性が向上した。
- DDPGベースの強化学習フレームワークに感情関数を統合した結果、100エピソードにわたり一貫した探索行動の収束が達成された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。