[論文レビュー] Oblique Decision Trees from Derivatives of ReLU Networks
この論文は、ReLUネットワークの局所的定数勾配を活用することで、斜交決定木を暗黙的に表現するニューラルアーキテクチャであるローカル定数ネットワーク(LCNs)を提案する。勾配降下法と冷却(annealing)およびドロップコネクトを用いた訓練により、LCNsは分子性質予測タスクで最先端の性能を達成し、従来の斜交決定木手法および標準的なツリー集成モデルを上回る。
We show how neural models can be used to realize piece-wise constant functions such as decision trees. The proposed architecture, which we call locally constant networks, builds on ReLU networks that are piece-wise linear and hence their associated gradients with respect to the inputs are locally constant. We formally establish the equivalence between the classes of locally constant networks and decision trees. Moreover, we highlight several advantageous properties of locally constant networks, including how they realize decision trees with parameter sharing across branching / leaves. Indeed, only $M$ neurons suffice to implicitly model an oblique decision tree with $2^M$ leaf nodes. The neural representation also enables us to adopt many tools developed for deep networks (e.g., DropConnect (Wan et al., 2013)) while implicitly training decision trees. We demonstrate that our method outperforms alternative techniques for training oblique decision trees in the context of molecular property classification and regression tasks.
研究の動機と目的
- 決定木の解釈可能性とディープラーニングの表現力の両立を図るため、斜交決定木の微分可能でニューラルベースの表現を構築すること。
- 斜交決定木の訓練に内在する微分不能で組合せ最適化の課題を、勾配ベースのニューラルアーキテクチャに再定式化することで克服すること。
- コンactなニューラル表現を通じて分岐ノードとリーフ間でパラメータ共有を可能にし、ツリー構造の明示的複雑性を低減すること。
- ドロップコネクトや勾配ベース最適化といったディープラーニングのツールを活用しながら、暗黙的にツリーモデルを訓練することで一般化性能と性能を向上させること。
- ニューラル表現された決定木が、従来のツリー学習手法および標準的なアンサンブルモデルを上回ることを実証すること。
提案手法
- コアなアイデアは、決定木における区分的定数関数を、ReLUネットワークの局所的定数勾配(区分的線形)によって表現すること。
- ローカル定数ネットワーク(LCN)は、入力に関してReLUネットワークの勾配として定義され、ネットワークの各線形領域内で一定のまま保たれる。
- 著者らは、LCNのクラスが数学的に斜交決定木のクラスと同等であることを証明し、ニューラル勾配と決定木構造との間の正式な対応関係を確立した。
- 勾配ベースの訓練を可能にするために、ReLU活性化関数が滑らかに冷却(例:温度パラメータを用いて)され、最適化中の連続的勾配を保証する。
- 動的計画法を用いて、1回の順方向伝搬で全ニューロンの入力に関する勾配を効率的に計算するアルゴリズムを開発し、主要な計算ボトルネックを克服した。
- 拡張手法として、正則化を目的としたドロップコネクトを組み込んだAlcn、活性化関数を切り替え可能なLln、複数のLCNを組み合わせたElcn(LCNのアンサンブル)を提案し、性能をさらに向上させた。
実験結果
リサーチクエスチョン
- RQ1ReLUネットワークの勾配を用いて斜交決定木を暗黙的に表現可能であり、かつ標準的な決定木定式と同等であるか?
- RQ2微分不能で組合せ最適化の課題を有する斜交決定木の訓練を、微分可能なニューラルアーキテクチャに再定式化することで、どのように緩和できるか?
- RQ3ニューラル表現における分岐ノードおよびリーフ間のパラメータ共有は、明示的なツリー表現と比較して、必要なパラメータ数をどの程度削減できるか?
- RQ4ドロップコネクトのようなディープラーニングの正則化技術を、暗黙的に訓練される決定木に効果的に適用可能か?また、一般化性能の向上に寄与するか?
- RQ5提案された決定木のニューラル表現は、分子性質予測タスクにおいて、既存の斜交ツリー学習手法および標準的なツリーアンサンブルを上回る性能を発揮するか?
主な発見
- 提案されたローカル定数ネットワーク(LCN)は、分子性質分類および回帰タスクで最先端の性能を達成し、CART、Hhcart、Tao、ランダムフォレスト、勾配ブースティングを含むすべてのベースラインを上回った。
- ドロップコネクトを組み込んだ拡張版Alcnは、LCNに比べて一貫して一般化性能が向上し、暗黙的ツリー学習における確率的重みドロップアウトの正則化効果を実証した。
- 複数のLCNを組み合わせたアンサンブル手法Elcnは、ランダムフォレストや勾配ブースティングといった標準的なツリーアンサンブルと競合する性能を示し、特に深さのあるツリーにおいて一般化性能に優れた。
- 実証的アブレーションでは、勾配冷却なしでの直接訓練はLCNの最適化に失敗する一方、冷却とドロップコネクトの組み合わせが、より優れた訓練およびテスト性能をもたらした。
- HIVデータセットでは、LCNは競合他手法に比べて顕著に優れた一般化性能を示し、ツリーの深さが増すに従い性能が向上した—これは、M個のニューロンで最大2^M個の決定ノードを実現できる指数的増加の利点に起因するとされた。
- 訓練済みLCNを再び明示的な斜交決定木に変換可能であり、古典的決定木の透明性を保ちつつディープラーニングレベルの性能を達成できる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。