Skip to main content
QUICK REVIEW

[論文レビュー] Integrating Random Effects in Deep Neural Networks

Giora Simchoni, Saharon Rosset|arXiv (Cornell University)|Jun 7, 2022
Domain Adaptation and Few-Shot Learning被引用数 11
ひとこと要約

本稿では、回帰タスクにおける相関データを扱うために、線形混合モデル(LMMs)のランダム効果を統合した深層ニューラルネットワークフレームワーク、LMMNNを提案する。確率的勾配降下法(SGD)を用いてガウス分布の負対数尤度(NLL)を最小化することで、従来のDNNやベースラインと比較して、表形式および空間的・時間的相関を持つデータセットにおいて予測性能が向上する。

ABSTRACT

Modern approaches to supervised learning like deep neural networks (DNNs) typically implicitly assume that observed responses are statistically independent. In contrast, correlated data are prevalent in real-life large-scale applications, with typical sources of correlation including spatial, temporal and clustering structures. These correlations are either ignored by DNNs, or ad-hoc solutions are developed for specific use cases. We propose to use the mixed models framework to handle correlated data in DNNs. By treating the effects underlying the correlation structure as random effects, mixed models are able to avoid overfitted parameter estimates and ultimately yield better predictive performance. The key to combining mixed models and DNNs is using the Gaussian negative log-likelihood (NLL) as a natural loss function that is minimized with DNN machinery including stochastic gradient descent (SGD). Since NLL does not decompose like standard DNN loss functions, the use of SGD with NLL presents some theoretical and implementation challenges, which we address. Our approach which we call LMMNN is demonstrated to improve performance over natural competitors in various correlation scenarios on diverse simulated and real datasets. Our focus is on a regression setting and tabular datasets, but we also show some results for classification. Our code is available at https://github.com/gsimchoni/lmmnn.

研究の動機と目的

  • 空間的・時間的・クラスタ構造を示す相関データを扱う際の深層ニューラルネットワーク(DNNs)の限界を解決すること。
  • 線形混合モデル(LMMs)のランダム効果をDNNに統合し、過学習を低減し、予測精度を向上させること。
  • 確率的勾配降下法(SGD)を用いた理論的裏付けのある訓練手順を、LMMNNの負対数尤度(NLL)損失に基づいて開発すること。
  • 複雑な相関構造を持つ多様な実世界およびシミュレート済みデータセットにおいて、本手法の有効性を実証すること。
  • 高基数のカテゴリカル特徴にとどまらず、より複雑な混合効果のシナリオを扱えるように、既存のLMMNNの研究を拡張すること。

提案手法

  • ランダム効果を平均がゼロのガウス分布に従う潜在変数としてモデル化し、固定効果とランダム効果の両方を学習する深層ニューラルネットワークを定式化する。
  • ランダム効果が誘発する共分散構造を自然に組み込むため、ガウス分布の負対数尤度(NLL)を損失関数として使用する。
  • NLLの最適化に確率的勾配降下法(SGD)を適用し、Chenら(2020)の理論的根拠に基づいて収束性を裏付ける。
  • 分散成分を用いてランダム効果の共分散行列をパラメータ化することで、クラスタ間の相関度合いをモデルが学習可能にする。
  • 高基数のカテゴリカル特徴に対しては、各カテゴリを共有分散を持つランダム効果として扱い、ワンホットエンコーディングによる過学習を回避する。
  • 標準的なDNNアーキテクチャと互換性のある柔軟なフレームワークとして実装し、エンドツーエンドの訓練を可能にする。

実験結果

リサーチクエスチョン

  • RQ1ランダム効果を深層ニューラルネットワークに統合することで、標準的なDNNと比較して相関のある表形式データにおける予測性能が向上するか?
  • RQ2空間的近接性や縦断的繰り返し測定といった複雑な相関構造を持つデータセットにおいて、LMMNNはどのように性能を発揮するか?
  • RQ3ランダム効果を含む深層学習設定において、NLLを最小化するSGDの収束に必要な理論的条件は何か?
  • RQ4高基数のカテゴリカル特徴において、LMMNNはlme4、ワンホットエンコーディング、埋め込み層といった従来のベースラインを上回るか?
  • RQ5空間的・時間的・多段階のクラスタリングを示す多様な相関パターンを持つ実世界のデータセットにおいて、LMMNNは一般化性能を示せるか?

主な発見

  • LMMNNは、Airbnb や Cars といった空間的データセットにおいて、標準的なDNNやlme4と比較して顕著に予測性能を向上させ、平均二乗誤差を低減した。
  • Airbnbデータセットでは、LMMNNが35エポックでテスト損失8.9分を達成し、次に良い結果を出した手法(Carsで5.5分)を上回り、優れた一般化性能を示した。
  • UKB-SBPのような縦断的データでは、LMMNNはRNNよりも少ないパラメータで時間的相関を効果的にモデル化し、LSTMベースのモデルよりも優れた性能を示した。
  • 高基数のカテゴリカル特徴において、LMMNNはワンホットエンコーディングよりも過学習を低減し、埋め込みベースのモデルと比較しても一般化性能に優れた。
  • NLL損失を用いたSGDでは、Chenら(2020)の理論的根拠に基づき、やや厳しい正則化条件のもとで収束性が安定しており、理論的裏付けを有した。
  • Radiation や AirQuality のような空間的データセットでは、LMMNNが競合手法よりも低いテスト誤差を達成し、それぞれ5.1および1.5の平均二乗誤差を記録した。これにより、スパarsな空間的データでも優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。