Skip to main content
QUICK REVIEW

[論文レビュー] Backpropagation through nonlinear units for all-optical training of neural networks

Xianxin Guo, Thomas D. Barrett|arXiv (Cornell University)|Dec 23, 2019
Neural Networks and Reservoir Computing参考文献 24被引用数 7
ひとこと要約

本論文は、非線形活性化を可能にする飽和吸収を用いて、すべての光デバイスを用いたバックプロパゲーション方式を提案する。ポンプ・プローブ構成により勾配の近似計算が行われる。シミュレーションでは、深層構造ですら、状態の最良性能を示すが、デジタルネットワークと同等の性能を達成しており、受動的光素子と現実的な光深さを用いている。

ABSTRACT

Backpropagation through nonlinear neurons is an outstanding challenge to the field of optical neural networks and the major conceptual barrier to all-optical training schemes. Each neuron is required to exhibit a directionally dependent response to propagating optical signals, with the backwards response conditioned on the forward signal, which is highly non-trivial to implement optically. We propose a practical and surprisingly simple solution that uses saturable absorption to provide the network nonlinearity. We find that the backward propagating gradients required to train the network can be approximated in a pump-probe scheme that requires only passive optical elements. Simulations show that, with readily obtainable optical depths, our approach can achieve equivalent performance to state-of-the-art computational networks on image classification benchmarks, even in deep networks with multiple sequential gradient approximations. This scheme is compatible with leading optical neural network proposals and therefore provides a feasible path towards end-to-end optical training.

研究の動機と目的

  • 全光ニューラルネットワークにおける非線形光ニューロンを通じた勾配のバックプロパゲーションという根本的課題を克服すること。
  • 非線形光素子における方向依存応答の問題を解決し、エンド・ツー・エンドの光学的学習を可能にすること。
  • 既存の光ニューラルネットワークプラットフォームと互換性があり、受動的光素子のみを用いる手法を開発すること。
  • 飽和吸収による勾配の近似が、デジタルバックプロパゲーションと同等の性能を達成できることを示すこと。

提案手法

  • バックプロパゲーションに適した方向的に非対称な応答を自然に提供する飽和吸収を、光的非線形性として用いる。
  • ポンプ・プローブ方式を採用し、後退する勾配を近似する。ここで、プローブ信号の透過率は、前方信号の強度に依存する。
  • 活性化関数の微分を、ランダム関数 f(z) を用いて近似する。真の微分 g'(z) との類似度は再重み付けされたスカラー積で測定する。
  • 近似誤差を制限するためにコーシー=シュワルツの不等式を適用し、微分の不正確さに対しても安定した学習を保証する。
  • ニューロンの入力を学習中に非線形領域における飽和吸収の範囲内でガウス分布を仮定する。
  • バッチ正規化と入力スケーリングを用いた標準的な最適化(Adam)を採用し、光深さに応じて入力範囲を調整することで収束性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1光システムにおける飽和吸収が、非線形ニューロンを通じたバックプロパゲーションに必要な方向的に非対称な応答を提供できるか?
  • RQ2単一の光パス内で、受動的ポンプ・プローブ方式を用いて、活性化関数の真の微分をどの程度正確に近似できるか?
  • RQ3このような近似勾配を用いた全光学的学習が、標準ベンチマークにおいてデジタルバックプロパゲーションと同等の性能を達成できるか?
  • RQ4微分の近似誤差が、深層光ニューラルネットワークにおける収束性と精度に与える影響はどの程度か?

主な発見

  • 畳み込みネットワークを用いたMNISTでは、飽和吸収非線形性を用いて99.5±0.1%のテスト精度を達成し、ReLU活性化関数を用いたデジタルネットワークと同等の性能を示した。
  • 飽和吸収を用いて学習した全結合ネットワークは、MNISTで98.0±0.2%の精度を示し、交差エントロピーおよび平均二乗誤差のベースラインと同等の性能を示した。
  • 深層ネットワークにおける複数の連続的勾配近似に対しても本手法は有効であり、誤差蓄積に対して頑健であることが示された。
  • 重み初期化に敏感であり、特に光深さが低い場合に、収束のための特化した初期化戦略(例:二重ピーク分布)の必要がある。
  • 入力強度をより高い値(0–5 または 0–15)にスケーリングすることで、飽和吸収を用いた深層畳み込みネットワークの収束速度が向上した。
  • コーシー=シュワルツの不等式に基づく類似度測定により、微分近似誤差が制限され、不完全な微分推定に対しても安定した学習が保証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。