Skip to main content
QUICK REVIEW

[論文レビュー] Efficient nonmyopic active search with applications in drug and materials discovery

Shali Jiang, Gustavo Malkomes|arXiv (Cornell University)|Nov 21, 2018
Machine Learning and Algorithms被引用数 6
ひとこと要約

本稿では、調整パラメータが不要な探索と活用のバランスを図る、薬剤および材料発見における効率的な非一時的(nonmyopic)アクティブサーチ方策を提案する。ベイジアン意思決定枠組みを導入し、理論的難易度および適応性ギャップの境界を証明し、実世界のデータセットにおいて、逐次的およびバッチ設定の両方で一時的(myopic)ベースラインを上回る優れた性能を示している。

ABSTRACT

Active search is a learning paradigm for actively identifying as many members of a given class as possible. A critical target scenario is high-throughput screening for scientific discovery, such as drug or materials discovery. In this paper, we approach this problem in Bayesian decision framework. We first derive the Bayesian optimal policy under a natural utility, and establish a theoretical hardness of active search, proving that the optimal policy can not be approximated for any constant ratio. We also study the batch setting for the first time, where a batch of $b>1$ points can be queried at each iteration. We give an asymptotic lower bound, linear in batch size, on the adaptivity gap: how much we could lose if we query $b$ points at a time for $t$ iterations, instead of one point at a time for $bt$ iterations. We then introduce a novel approach to nonmyopic approximations of the optimal policy that admits efficient computation. Our proposed policy can automatically trade off exploration and exploitation, without relying on any tuning parameters. We also generalize our policy to batch setting, and propose two approaches to tackle the combinatorial search challenge. We evaluate our proposed policies on a large database of drug discovery and materials science. Results demonstrate the superior performance of our proposed policy in both sequential and batch setting; the nonmyopic behavior is also illustrated in various aspects.

研究の動機と目的

  • 科学的発見において、ラベル付け予算が限られた中で希少な陽性アイテム(例:有効な薬剤や材料)を同定する課題に対処すること。
  • 一時的(myopic)な前方探索の制限を避けるために、クエリの長期的影響を考慮する非一時的アクティブサーチ方策の開発。
  • 逐次的およびバッチ設定の両方におけるアクティブサーチの理論的基盤を確立し、近似の難易度および適応性ギャップの境界を含む。
  • 探索と活用を自動的にバランスさせる、効率的かつハイパーパrameterフリーの方策の設計。
  • 非一時的方策をバッチアクティブサーチに一般化し、非一時的行動を維持するとともに計算の実行可能性を保つこと。

提案手法

  • 陽性アイテムの数を数える自然な効用関数を用いて、アクティブサーチをベイジアン意思決定問題として定式化する。
  • この効用関数下でのベイジアン最適方策を導出し、定数因子近似比を達成できる多項式時間方策が存在しないことを証明する。
  • 各候補点が将来のクエリ効用に与える長期的影響を評価する、新しい非一時的近似手法を導入する。
  • 組み合わせ的探索の課題に対処するための2つの効率的近似技術を提案することで、方策をバッチアクティブサーチに一般化する。
  • すべての将来パスを明示的に列挙しないで効率的な計算を可能にするために、期待限界利得に基づく代替効用関数を用いる。
  • 近接する点の確率を低下させることで、バッチ内の多様性を促進するため、シミュレーションに懐疑的オラクルを組み込む。

実験結果

リサーチクエスチョン

  • RQ1アクティブサーチにおいて、強力な理論的保証を維持しながら、非一時的アクティブサーチ方策を効率的に計算可能か?
  • RQ2逐次的およびバッチアクティブサーチ方策の理論的適応性ギャップは何か?また、バッチサイズに伴いどのようにスケーリングされるか?
  • RQ3非一時的行動は、実世界の科学的発見設定において、一時的またはグリーディ方策と比較してどのように性能を向上させるか?
  • RQ4非一時的方策は、ハイパーパrameterの手動チューニングを必要とせずに、探索と活用を自動的にバランスできるか?
  • RQ5モデルの不適合(misspecification)は、実応用における非一時的方策の性能にどの程度影響を与えるか?

主な発見

  • 最適アクティブサーチ方策は計算的に困難であり、定数因子近似比を達成できる多項式時間アルゴリズムが存在しない。
  • 適応性ギャップの漸近的下界を確立した:バッチサイズ b のバッチクエリリングは、逐次的クエリリングの最適性能を Ω(b/log T) 倍以上上回る。
  • 提案された非一時的方策、batch-ens は、実際の薬剤および材料発見データセットにおいて、逐次的およびバッチ設定の両方で一時的ベースラインを著しく上回る。
  • 実証的結果から、batch-ens は時間経過とともに選択確率が増加しており、初期には探索を優先し、後期には活用を優先する非一時的行動が示されている。
  • 懐疑的オラクルは、バッチ内の多様性を促進することで性能を向上させ、クエリのクラスタリングを防ぐ「反発力」を効果的にシミュレートしている。
  • 理論的境界にかかわらず、より大きなバッチサイズ(例:5)の batch-ens は、より小さなバッチサイズ(例:1)よりも性能を発揮することがあり、実際には大きなバッチが探索を強化する可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。