Skip to main content
QUICK REVIEW

[論文レビュー] Neural network gradient-based learning of black-box function interfaces

Alon Jacovi, Guy Hadash|arXiv (Cornell University)|Jan 13, 2019
Advanced Neural Network Applications参考文献 19被引用数 11
ひとこと要約

この論文は、非微分可能ブラックボックス関数と連携するニューラルネットワークのエンドツーエンド学習のための新しい「推定して置換」フレームワークを提案する。最適化中は微分可能なニューラル推定器をブラックボックス関数の模倣に用い、推論時には実際の関数に置き換えることで、中間ラベルを必要とせず勾配ベースの学習を可能にし、強化学習や完全に微分可能なモデルと比較してより優れた一般化性能とサンプル効率を達成する。

ABSTRACT

Deep neural networks work well at approximating complicated functions when provided with data and trained by gradient descent methods. At the same time, there is a vast amount of existing functions that programmatically solve different tasks in a precise manner eliminating the need for training. In many cases, it is possible to decompose a task to a series of functions, of which for some we may prefer to use a neural network to learn the functionality, while for others the preferred method would be to use existing black-box functions. We propose a method for end-to-end training of a base neural network that integrates calls to existing black-box functions. We do so by approximating the black-box functionality with a differentiable neural network in a way that drives the base network to comply with the black-box function interface during the end-to-end optimization process. At inference time, we replace the differentiable estimator with its external black-box non-differentiable counterpart such that the base network output matches the input arguments of the black-box function. Using this "Estimate and Replace" paradigm, we train a neural network, end to end, to compute the input to black-box functionality while eliminating the need for intermediate labels. We show that by leveraging the existing precise black-box function during inference, the integrated model generalizes better than a fully differentiable model, and learns more efficiently compared to RL-based methods.

研究の動機と目的

  • 非微分可能で正確なブラックボックス関数をエンドツーエンドニューラルネットワーク学習に統合する課題に対処すること。
  • 外部の記号的または算術的関数と連携するタスクにおいて、高価な中間ラベルの必要性を排除すること。
  • ブラックボックス関数統合のための強化学習ベースの手法と比較して、訓練の安定性とサンプル効率を向上させること。
  • 推論時にブラックボックス関数の正確な挙動を活用することで、一般化性能の向上を図ること。
  • モジュール型でインターフェース準拠のニューラルアーキテクチャを通じて、モデルの解釈可能性と再利用性を高めること。

提案手法

  • 訓練中に非微分可能なブラックボックス関数の入出力挙動を近似する微分可能なブラックボックス推定器ネットワークを導入する。
  • 主なニューラルネットワークをバックプロパゲーションを用いてエンドツーエンドで訓練し、実際の関数の代わりに推定器を代理として用いる。
  • 同じ入力に対してブラックボックス関数の出力をもとに合成ラベルを生成し、推定器のための監督信号を生成する。
  • 推論時に微分可能な推定器を元の非微分可能なブラックボックス関数に置き換えることで、ネットワークが学習した入力分布を保持する。
  • ブラックボックス関数をオракルとして用い、推定器の訓練を真のインターフェースに一致させる。
  • アーキテクチャをモジュール型に設計し、ネットワークを学習可能なコンponentsと明確に定義された外部関数呼び出しの組み合わせとして解釈可能にする。

実験結果

リサーチクエスチョン

  • RQ1中間ラベルを必要とせずに、非微分可能なブラックボックス関数の入力を生成するニューラルネットワークを訓練できるか?
  • RQ2推論時に微分可能な推定器を実際のブラックボックス関数に置き換えることで、完全にエンドツーエンドのニューラルモデルと比較してモデルの一般化性能が向上するか?
  • RQ3非微分性があるにもかかわらず、ブラックボックス関数を呼び出すモデルに勾配ベース最適化を効果的に適用できるか?
  • RQ4提案手法「推定して置換」は、強化学習ベースの代替手法と比較して、サンプル効率と訓練安定性においてどのように異なるか?
  • RQ5フレームワークのモジュール型設計は、モデルの解釈可能性と再利用性をどの程度向上させるか?

主な発見

  • 「推定して置換」手法は、推論時にブラックボックス関数の正確な挙動を活用するため、完全に微分可能なニューラルネットワークモデルと比較して一般化性能が優れている。
  • ブラックボックス関数統合のためのポリシー勾配ベースの強化学習手法と比較して、より低いサンプル複雑性と高い訓練安定性を達成している。
  • ブラックボックス関数をオーガンとして用い、推定器の訓練信号を生成することで、高価な中間ラベルの必要性が排除された。
  • モジュール型アーキテクチャにより解釈性が向上し、例えばWordNetや算術モジュールなどの外部関数とのモデルの相互作用を確認・説明可能になった。
  • フレームワークは再利用性をサポートしており、明確に定義されたインターフェース準拠のモジュールを、異なるタスクに再利用可能である。
  • 実験的結果により、意味解析および質問応答タスクにおいて、エンドツーエンドのニューラルモデルおよびRLベースのベースラインと比較して、学習効率と最終的なパフォーマンスの両面で優れていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。