Skip to main content
QUICK REVIEW

[論文レビュー] Deep Reinforcement Learning for Control of Probabilistic Boolean Networks

Georgios Papagiannis, Sotiris Moschoyiannis|arXiv (Cornell University)|Sep 7, 2019
Gene Regulatory Network Analysis被引用数 4
ひとこと要約

本論文は、Probabilistic Boolean Networks (PBNs) を、その内部ダイナミクスの知識が不要なモデルフリーな深層強化学習手法として、Double Deep Q-Networks と Prioritized Experience Replay を用いて、望ましい吸引子などの目標状態に制御することを提案する。この手法は、合成的および実際の生物学的PBNにおいて、有限時間ステップ内で効果的な制御戦略を学習し、システム生物学および遺伝子調節ネットワーク干渉への応用の可能性を示している。

ABSTRACT

Probabilistic Boolean Networks (PBNs) were introduced as a computational model for the study of complex dynamical systems, such as Gene Regulatory Networks (GRNs). Controllability in this context is the process of making strategic interventions to the state of a network in order to drive it towards some other state that exhibits favourable biological properties. In this paper we study the ability of a Double Deep Q-Network with Prioritized Experience Replay in learning control strategies within a finite number of time steps that drive a PBN towards a target state, typically an attractor. The control method is model-free and does not require knowledge of the network's underlying dynamics, making it suitable for applications where inference of such dynamics is intractable. We present extensive experiment results on two synthetic PBNs and the PBN model constructed directly from gene-expression data of a study on metastatic-melanoma.

研究の動機と目的

  • PBNの内部ダイナミクスの明示的知識が不要なモデルフリーな制御戦略の開発を目的とする。
  • がんを含む疾患フリーな吸引子を含む、複雑な生物学的ネットワーク(遺伝子調節ネットワーク: GRNs)を、望ましい状態に制御する課題に対処することを目的とする。
  • 深層強化学習が、PBNにおいて有限時間ステップ内で最適な制御方策を学習する有効性を評価することを目的とする。
  • 本手法の有効性を、合成PBNおよび転移性メラノーマの遺伝子発現データから得た実世界のPBNの両方で示すこと

提案手法

  • 本手法は、モデルフリーな方法として、優先順位付き経験再生を用いたDouble Deep Q-Network (DDQN) を用いて最適な制御方策を学習する。
  • エージェントは、状態遷移を引き起こすために、行動(遺伝子干渉)を選択することでPBN環境と相互作用する。
  • 優先順位付き経験再生により、時系列差分誤差の大きい遷移に注目することで、サンプル効率が向上する。
  • Qネットワークは、状態-行動-報酬-次状態のタプルを格納するリプレイバッファを用いて訓練され、ベルマン誤差を最小化するようにQ値関数が更新される。
  • アルゴリズムは有限時間枠内で収束するように設計されており、実用的な生物学的干渉シナリオに適している。
  • PBNの遷移ダイナミクスの明示的モデリングは不要であり、その推定が困難な状況にも応用可能である。

実験結果

リサーチクエスチョン

  • RQ1深層強化学習は、ネットワークダイナミクスの事前知識がなくても、PBNに対して効果的な制御方策を学習できるか?
  • RQ2優先順位付き経験再生を用いたDouble Deep Q-Networkは、有限時間ステップ内でPBNを目標吸引子状態に導く性能がどの程度高いか?
  • RQ3本手法の性能は、合成PBNおよび転移性メラノーマの遺伝子発現データから得た実際の生物学的PBNにおいて、それぞれどのように評価されるか?
  • RQ4複雑な確率的ネットワークにおいて、モデルフリーなアプローチは、従来の制御手法と比較して、サンプル効率および収束性において優れているか?

主な発見

  • 提案手法は、合成PBNに対して、有限時間ステップ内で目標吸引子に到達する制御方策を効果的に学習した。これは、ダイナミクスの事前知識がなくても学習が可能であることを示している。
  • 実際の遺伝子発現データから得た転移性メラノーマPBNモデルにおいて、望ましい吸引子に収束した。これは、治療的干渉の可能性を示している。
  • 優先順位付き経験再生は、均一なリプレイと比較して、学習の安定性とサンプル効率を顕著に向上させた。収束速度の向上が実証された。
  • Double Deep Q-Networkアーキテクチャは、Q値推定における過大評価バイアスを低減し、より信頼性の高い方策学習を可能にした。
  • モデルフリーなアプローチは、高い確率的変動性や複雑な吸引子構造を持つPBNに対しても、強靭に機能した。
  • 中規模のPBNに対してもスケーラビリティを示し、妥当な数の訓練エピソード内で制御が学習された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。