[논문 리뷰] Towards Understanding the Overfitting Phenomenon of Deep Click-Through Rate Prediction Models
이 논문은 딥 클릭스루레이트(CTR) 예측 모델에서 두 번째 학습 에포크 초반에 과적합으로 인해 성능이 급격히 악화되는 '일회성 에포크 현상'을 조사한다. 산업계 및 공개 데이터셋을 대상으로 한 광범위한 실험을 통해 모델 아키텍처, 빠른 수렴 최적화(예: Adam), 특성 희소성 등이 주요 기여 요인임을 규명하며, 이 역설적인 행동을 설명하는 가설을 제안하고, 현재 산업계에서 단일 에포크 학습이 관행이지만 다중 에포크 학습에 대한 심층적 탐구를 권장한다.
Deep learning techniques have been applied widely in industrial recommendation systems. However, far less attention has been paid to the overfitting problem of models in recommendation systems, which, on the contrary, is recognized as a critical issue for deep neural networks. In the context of Click-Through Rate (CTR) prediction, we observe an interesting one-epoch overfitting problem: the model performance exhibits a dramatic degradation at the beginning of the second epoch. Such a phenomenon has been witnessed widely in real-world applications of CTR models. Thereby, the best performance is usually achieved by training with only one epoch. To understand the underlying factors behind the one-epoch phenomenon, we conduct extensive experiments on the production data set collected from the display advertising system of Alibaba. The results show that the model structure, the optimization algorithm with a fast convergence rate, and the feature sparsity are closely related to the one-epoch phenomenon. We also provide a likely hypothesis for explaining such a phenomenon and conduct a set of proof-of-concept experiments. We hope this work can shed light on future research on training more epochs for better performance.
연구 동기 및 목표
- 일회성 에포크 현상의 근본 원인을 규명하는 것, 즉 딥 CTR 모델이 첫 번째 에포크 동안 향상되다가 두 번째 에포크 초반에 급격히 과적합되는 이유를 분석하는 것.
- 다양한 장점이 있을 수 있음에도 불구하고 산업계 CTR 모델이 일반적으로 단일 에포크 학습만 수행하는 이유를 이해하는 것.
- 모델 아키텍처, 최적화 알고리즘, 특성 희소성이 CTR 예측에서의 과적합 행동에 미치는 영향을 분석하는 것.
- 갑작스러운 성능 저하를 설명할 수 있는 타당한 가설을 제안하고, 통제된 실험을 통해 이를 검증하는 것.
- 향후 딥 추천 시스템에서 효과적인 다중 에포크 학습을 위한 통찰을 제공하는 것.
제안 방법
- 저자들은 알리바바의 디스플레이 광고 시스템에서 확보한 대규모 생산 데이터셋과 함께, 두 개의 공개 데이터셋(아마존 북, 타오바오)을 사용하여 광범위한 실험을 수행한다.
- 표준 딥 CTR 모델을 사용하며, 임bedding과 MLP 아키텍처를 적용하고, 사용자 이력 시퀀스에 대해 평균 풀링을 수행하며, 이진 교차 엔트로피 손실을 사용한다.
- 기본 모델은 3개의 완전 연결 층(200×80×1)을 사용하며, DICE 활성화 함수와 시그모이드 출력을 적용하고, 각 특성 필드의 임베딩 차원은 8로 설정한다.
- 학습은 초기 학습률이 1e-3로 고정된 Adam 옵티마이저를 사용하며, 배치 크기는 생산 환경에서는 1024, 아마존에서는 128, 타오바오에서는 512로 설정한다.
- 모델 구성 요소, 최적화 설정, 데이터 희소성 등을 체계적으로 변화시켜 일회성 에포크 현상에 기여하는 요인을 분리한다.
- 빠른 수렴과 희소한 특성으로 인해 학습 샘플이 조기에 기억되며, 이로 인해 갑작스러운 과적합이 발생한다는 관찰 기반으로 가설을 제안하고, 이를 검증하기 위한 개념 증명 실험을 수행한다.
실험 결과
연구 질문
- RQ1딥 CTR 예측 모델이 첫 번째 에포크 동안 성능 향상을 보이다가 두 번째 에포크 초반에 급격한 성능 저하를 보이는 이유는 무엇인가?
- RQ2모델 아키텍처와 최적화 알고리즘 선택이 일회성 에포크 과적합 현상에 어떤 영향을 미치는가?
- RQ3산업계 추천 시스템에서의 특성 희소성이 일회성 에포크 현상에 어느 정도 기여하는가?
- RQ4일회성 에포크 현상은 다양한 데이터셋과 모델 구성 설정 간에도 일반화 가능한가?
- RQ5갑작스러운 과적합 행동을 설명할 수 있는 타당한 가설이 존재하는가? 그리고 실험적으로 검증될 수 있는가?
주요 결과
- 일회성 에포크 현상—즉, 두 번째 에포크 초반에 성능이 급격히 악화되는 현상—은 알리바바의 생산 데이터, 아마존 북, 타오바오 데이터셋을 포함한 여러 산업계 및 공개 데이터셋에서 일관되게 관찰된다.
- 이 현상은 Adam과 같은 빠른 수렴 최적화 알고리즘 사용과 강하게 연관되어 있으며, 이로 인해 모델이 너무 빨리 학습 샘플을 기억하게 된다.
- 특히 사용자 및 아이템 ID 특성에서의 높은 특성 희소성은 과적합 행동을 악화시키며, 드문 특성이 잘 표현되지 않아 쉽게 과적합되기 때문이다.
- 임베딩 레이어와 MLP의 조합을 포함한 모델 아키텍처는 희소하고 고차원적인 입력에 대해 빠르게 피팅할 수 있도록 하여 이 현상에 기여한다.
- 일반적으로 한 에포크 이상 학습을 수행하더라도, 적절히 캘리브레이션된 하이퍼파라미터를 가진 단일 에포크 모델과 비교했을 때 성능 향상이 거의 관찰되지 않으며, 이는 과적합이 학습 초반에 지배적임을 시사한다.
- 빠른 수렴과 희소한 특성로 인한 조기 기억화가 갑작스러운 과적합을 유도한다는 제안된 가설은 통제된 실험을 통해 검증되었으며, 이 현상은 무작위가 아니라 체계적인 것임을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.