[論文レビュー] On Correctness of Automatic Differentiation for Non-Differentiable Functions
この論文は、深層学習で一般的な非微分可能関数に自動微分(autodiff)システムを適用する際の形式的正しさを、PAP(解析的分割における区分的解析性)と呼ばれる広範な関数クラスに対して、内省的微分(intensional derivatives)を導入することで確立する。非微分可能点が存在する関数に対しても、内省的微分が常に存在し、ほとんど至る所で標準的微分と一致することを示し、autodiffシステムが実際にそれらを計算していることから、理論的懸念にもかかわらず広く使用されていることの正当化がなされる。
Differentiation lies at the core of many machine-learning algorithms, and is well-supported by popular autodiff systems, such as TensorFlow and PyTorch. Originally, these systems have been developed to compute derivatives of differentiable functions, but in practice, they are commonly applied to functions with non-differentiabilities. For instance, neural networks using ReLU define non-differentiable functions in general, but the gradients of losses involving those functions are computed using autodiff systems in practice. This status quo raises a natural question: are autodiff systems correct in any formal sense when they are applied to such non-differentiable functions? In this paper, we provide a positive answer to this question. Using counterexamples, we first point out flaws in often-used informal arguments, such as: non-differentiabilities arising in deep learning do not cause any issues because they form a measure-zero set. We then investigate a class of functions, called PAP functions, that includes nearly all (possibly non-differentiable) functions in deep learning nowadays. For these PAP functions, we propose a new type of derivatives, called intensional derivatives, and prove that these derivatives always exist and coincide with standard derivatives for almost all inputs. We also show that these intensional derivatives are what most autodiff systems compute or try to compute essentially. In this way, we formally establish the correctness of autodiff systems applied to non-differentiable functions.
研究の動機と目的
- 非微分可能関数、特に深層学習において顕著な非微分可能性を示す関数にautodiffシステムを適用した際の理論的懸念に対処すること。
- 実際の応用においてよく用いられるが誤りであると判明する、非微分可能点が測度ゼロであるという非形式的根拠(例:非微分可能点がほとんど至る所に存在しない)を検証・是正すること。
- 非微分可能関数を許容するautodiffシステムの形式的正しさ条件を定義すること。ただし、非微分可能性が測度ゼロの集合上に限る。
- 深層学習の多くの関数をカバーする新しい関数クラス(PAP関数)を導入・分析すること。
- PAP関数に対して内省的微分を定義し、それがほとんど至る所で存在すること、および微分の基本的性質(例:合成関数の連鎖律)を満たすことの証明を行うこと。
提案手法
- 区分的解析的で解析的分割を持つ関数であるPAP関数のクラスを導入し、深層学習の多くをカバーする。
- 非微分可能点にも一般化可能な標準的微分の拡張として、内省的微分を定義する。
- すべてのPAP関数に対して内省的微分が存在し、ほとんど至る所で標準的微分と一致することを証明する。
- 非微分可能関数に対しても、内省的微分が一般化された連鎖律を満たすことを示す。
- 既存の大多数のautodiffシステムが内省的微分を計算または近似していることの実証を行い、実用的正しさの根拠とする。
- 測度論的議論と解析関数の性質を用いて、内省的微分の存在性と一貫性を確立する。
実験結果
リサーチクエスチョン
- RQ1ReLU活性化関数を有するような非微分可能関数にautodiffシステムを適用した際、形式的正しさは保証されるか?
- RQ2非微分可能点が測度ゼロを占めるという一般的なヒューリスティック的根拠(例:非微分可能点はまれで無害)は、autodiffの正しさを正当化するのに十分か?
- RQ3非微分可能関数に対して、標準的微分とほとんど至る所で一致するような新しい微分概念を定義できるか?
- RQ4非微分可能関数に対しても、内省的微分は合成関数の連鎖律のような基本的な微分法則を満たすか?
- RQ5既存のautodiffシステムは、これらの内省的微分をどの程度正確に計算または近似しているか?
主な発見
- すべてのPAP関数に対して内省的微分が存在し、ほとんど至る所で標準的微分と一致する。
- 非微分可能関数に対しても、内省的微分は合成関数の連鎖律を満たし、関数合成における一貫性が保証される。
- 既存の大多数のautodiffシステムは内省的微分を実際に計算または近似しており、実用的正しさの根拠が得られる。
- PAP関数のクラスには、ReLUやその他の区分的解析的活性化関数を有する現代の深層学習関数がほぼすべて含まれる。
- 反例により、非微分可能点が稀であるというヒューリスティック的根拠が不十分で誤りであることが示される。
- 非微分可能性が測度ゼロの集合上に限る限り、非微分可能関数を許容するautodiffシステムの形式的正しさ条件を確立した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。