[논문 리뷰] Integrating Random Effects in Deep Neural Networks
이 논문은 공간적 또는 시간적 상관관계가 있는 데이터를 다룰 수 있도록 선형 혼합 모델(LMMs)의 랜덤 효과를 통합한 딥 뉴럴 네트워크 프레임워크인 LMMNN을 제안한다. 확률적 경사 하강법(SGD)을 통해 가우시안 음수 로그우도(NLL)를 최소화함으로써, 표준 DNN 및 기준 모델 대비 표본 및 공간/시간적으로 상관관계가 있는 데이터셋에서 예측 성능을 향상시킨다.
Modern approaches to supervised learning like deep neural networks (DNNs) typically implicitly assume that observed responses are statistically independent. In contrast, correlated data are prevalent in real-life large-scale applications, with typical sources of correlation including spatial, temporal and clustering structures. These correlations are either ignored by DNNs, or ad-hoc solutions are developed for specific use cases. We propose to use the mixed models framework to handle correlated data in DNNs. By treating the effects underlying the correlation structure as random effects, mixed models are able to avoid overfitted parameter estimates and ultimately yield better predictive performance. The key to combining mixed models and DNNs is using the Gaussian negative log-likelihood (NLL) as a natural loss function that is minimized with DNN machinery including stochastic gradient descent (SGD). Since NLL does not decompose like standard DNN loss functions, the use of SGD with NLL presents some theoretical and implementation challenges, which we address. Our approach which we call LMMNN is demonstrated to improve performance over natural competitors in various correlation scenarios on diverse simulated and real datasets. Our focus is on a regression setting and tabular datasets, but we also show some results for classification. Our code is available at https://github.com/gsimchoni/lmmnn.
연구 동기 및 목표
- 공간적, 시간적, 또는 군집화된 구조를 포함한 상관관계가 있는 데이터를 다루는 데에 한계가 있는 딥 뉴럴 네트워크(DNNs)의 문제를 해결한다.
- 선형 혼합 모델(LMMs)의 랜덤 효과를 DNNs에 통합하여 과적합을 줄이고 예측 정확도를 향상시킨다.
- LMMNN를 위한 이론적으로 타당한 학습 절차를 개발한다. 이는 음수 로그우도(NLL) 손실을 사용한 확률적 경사 하강법(SGD) 기반이다.
- 복잡한 상관관계를 가진 다양한 실제 및 시뮬레이션 데이터셋에서 이 방법의 효과성을 입증한다.
- 이전의 LMMNN 연구를 확장하여 고카디널리티 분류 특성 외의 더 복잡한 혼합 효과 시나리오를 다룰 수 있도록 한다.
제안 방법
- 랜덤 효과를 평균이 0인 가우시안 분포를 가진 잠재 변수로 모델링하는 딥 뉴럴 네트워크를 제안한다.
- 랜덤 효과에 의해 유도되는 공분산 구조를 자연스럽게 통합하기 위해 가우시안 음수 로그우도(NLL)를 손실 함수로 사용한다.
- NLL 최적화를 위해 확률적 경사 하강법(SGD)을 적용하며, Chen 등(2020)의 이론적 근거에 따라 수렴 조건을 제시한다.
- 분산 성분을 사용해 랜덤 효과의 공분산 행렬을 매개변수화함으로써, 클러스터 간 상관관계 정도를 학습할 수 있도록 한다.
- 고카디널리티 분류 특성을 다룰 땐 각 분류를 공유된 분산을 가진 랜덤 효과로 간주하여 원-핫 인코딩으로 인한 과적합을 방지한다.
- 표준 DNN 아키텍처와 호환되는 유연한 프레임워크로 구현하여 엔드 투 엔드 학습을 가능하게 한다.
실험 결과
연구 질문
- RQ1표준 DNN과 비교해 랜덤 효과를 딥 뉴럴 네트워크에 통합함으로써 상관관계가 있는 표본 데이터에서 예측 성능을 향상시킬 수 있는가?
- RQ2공간적 접근성이나 종단적 반복 측정 등과 같은 복잡한 상관관계를 가진 데이터셋에서 LMMNN의 성능은 어떠한가?
- RQ3랜덤 효과가 포함된 딥 러닝 환경에서 NLL를 최소화할 때 SGD의 수렴 조건은 무엇인가?
- RQ4고카디널리티 분류 특성에서 LMMNN은 lme4, 원-핫 인코딩, 임베딩 레이어와 같은 전통적 기준 모델보다 우수한가?
- RQ5LMMNN는 공간적, 시간적, 다중 수준 군집화 패턴을 가진 다양한 실제 데이터셋에 일반화 가능한가?
주요 결과
- LMMNN는 Airbnb 및 Cars와 같은 공간 데이터셋에서 표준 DNN 및 lme4 대비 예측 성능을 크게 향상시켰으며, 평균 제곱오차를 감소시켰다.
- Airbnb 데이터셋에서 LMMNN는 테스트 손실 8.9분(35에포크)을 기록하여 다음으로 우수한 성능을 보인 모델(5.5분, Cars)을 초월했으며, 강력한 일반화 능력을 보였다.
- UKB-SBP와 같은 종단적 데이터에서는 RNN보다 더 적은 파라미터로 시간적 상관관계를 효과적으로 모델링했으며, LSTM 기반 모델보다 뛰어난 성능을 보였다.
- 고카디널리티 분류 특성에서는 원-핫 인코딩 대비 과적합을 줄였고, 임베딩 기반 모델 대비 일반화 능력에서 뛰어난 성능을 보였다.
- NLL 손실을 사용할 경우 SGD의 수렴이 안정적으로 이루어졌으며, Chen 등(2020)의 이론적 근거에 따라 온건한 정규성 조건 하에서 수렴이 보장되었다.
- Radiation 및 AirQuality와 같은 공간 데이터셋에서는 경쟁 모델 대비 더 낮은 테스트 오차를 기록했으며, 각각 평균 제곱오차 5.1과 1.5를 기록하여 희소 공간 데이터에서도 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.