Skip to main content
QUICK REVIEW

[論文レビュー] Actively Learning what makes a Discrete Sequence Valid

David M. Janz, Jos van der Westhuizen|arXiv (Cornell University)|Aug 15, 2017
Machine Learning and Algorithms参考文献 19被引用数 15
ひとこと要約

本論文では、分子やコードなどの有効な離散的オブジェクトをより効率的かつ正確に生成できるように、部分的な離散的シーケンスが有効な完全なシーケンスに至る確率を能動的に学習するベイジアン再帰ニューラルネットワークを提案する。情報性の高いトレーニングシーケンスをサンプリングする能動学習を用いることで、バランスサンプリングと比較して著しくトレーニングコストを削減しつつ、生成されたシーケンスの有効性を高めることができる。

ABSTRACT

Deep learning techniques have been hugely successful for traditional supervised and unsupervised machine learning problems. In large part, these techniques solve continuous optimization problems. Recently however, discrete generative deep learning models have been successfully used to efficiently search high-dimensional discrete spaces. These methods work by representing discrete objects as sequences, for which powerful sequence-based deep models can be employed. Unfortunately, these techniques are significantly hindered by the fact that these generative models often produce invalid sequences. As a step towards solving this problem, we propose to learn a deep recurrent validator model. Given a partial sequence, our model learns the probability of that sequence occurring as the beginning of a full valid sequence. Thus this identifies valid versus invalid sequences and crucially it also provides insight about how individual sequence elements influence the validity of discrete objects. To learn this model we propose an approach inspired by seminal work in Bayesian active learning. On a synthetic dataset, we demonstrate the ability of our model to distinguish valid and invalid sequences. We believe this is a key step toward learning generative models that faithfully produce valid discrete objects.

研究の動機と目的

  • 高次元空間(分子構造やコードなど)における生成モデルで生じる無効なシーケンスの問題に対処すること。
  • 部分的シーケンスが有効な完全なシーケンスに至る確率を予測するモデルを開発し、シーケンス要素の有効性予測と解釈可能性を両立させること。
  • データの不均衡を克服するため、ラベル付けに適した情報を有する部分的シーケンスを能動学習で効率的に選択すること。
  • 自己符号化器やその他の生成モデルのトレーニングをより効果的に行うために、初期段階から有効なシーケンスに向けたガイドラインを提供すること。

提案手法

  • 部分的シーケンス x₁:t が有効な完全なシーケンスに至る確率 P(s(x)=1 | x₁:t) を推定するベイジアン再帰ニューラルネットワーク(RNN)を訓練する。
  • 相互情報量に基づく能動学習戦略を用いて、ラベル付けに最も有益な部分的シーケンスを選択し、必要なラベル付き例の数を削減する。
  • ベイジアンRNNが提供する不確実性推定値を活用し、モデルが最も不確実なシーケンスを優先的に選択することで、サンプル効率を向上させる。
  • 温度制御された探索を伴うボルツマンサンプリングを用いて、多様性と有効性を両立したシーケンスを訓練済みモデルから生成する。
  • 外部のバリデータが有効または無効とラベル付けしたシーケンスに対して、確率的出力を用いた交差エントロピー損失を用いてRNNを訓練する。
  • 訓練済みバリデータを生成モデルのパイプラインに統合し、デコーダーが常に高確率で有効なシーケンスを生成するように導く。

実験結果

リサーチクエスチョン

  • RQ1再帰ニューラルネットワークは、部分的離散シーケンスが有効な完全なシーケンスに至る確率を効果的に予測できるか?
  • RQ2能動学習は、無作為抽出やバランスサンプリングと比較して、有効性予測器のトレーニングにおけるサンプル効率とモデル性能において優れているか?
  • RQ3提案手法は、下流の生成モデルが生成する無効なシーケンスの数を著しく削減できるか?
  • RQ4モデルの不確実性に基づくサンプリング戦略は、収束速度と最終的な性能をどの程度向上させるか?

主な発見

  • 能動学習は、より少ないトレーニングサンプルで、ヴァニラ法およびバランスサンプリング法よりも高い平均AUC(受受応答曲線下積分)を達成した。
  • 能動学習は、特にシーケンス長やアスキーベースのサイズが増加する際、トレーニング時間と計算コストを顕著に削減した。
  • 能動法は、バランスベースラインと同等の多様性レベルで100%の有効性を達成した一方、ヴァニラ法では有効なシーケンスはたったの10%にとどまった。
  • モデルは、シーケンス生成の途中段階でも有効性を正確に予測でき、無効なパスを回避するための早期干渉が可能になった。
  • ベイジアンRNNは信頼性の高い不確実性推定値を提供し、これが効果的な能動学習とサンプル選択に不可欠であった。
  • 本手法はスケーラビリティと効率性を示し、サンプル効率およびウォールクロックタイムの両面でバランスサンプリングを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。