[논문 리뷰] FCN: Fusing Exponential and Linear Cross Network for Click-Through Rate Prediction
본 논문은 DCNv3와 SDCNv3를 소개합니다. 명시적 특성 상호작용 네트워크로, Self-Mask 노이즈 필터링으로 특성 교차 차수를 기하급수적으로 증가시키고, Tri-BCE 감독을 더해 암묵적 상호작용에 대해 DNN에 의존하지 않으면서 여섯 개 CTR 데이터셋에서 최첨단 성능을 달성합니다.
As an important modeling paradigm in click-through rate (CTR) prediction, the Deep & Cross Network (DCN) and its derivative models have gained widespread recognition primarily due to their success in a trade-off between computational cost and performance. This paradigm employs a cross network to explicitly model feature interactions with linear growth, while leveraging deep neural networks (DNN) to implicitly capture higher-order feature interactions. However, these models still face several key limitations: (1) The performance of existing explicit feature interaction methods lags behind that of implicit DNN, resulting in overall model performance being dominated by the DNN; (2) While these models claim to capture high-order feature interactions, they often overlook potential noise within these interactions; (3) The learning process for different interaction network branches lacks appropriate supervision signals; and (4) The high-order feature interactions captured by these models are often implicit and non-interpretable due to their reliance on DNN. To address the identified limitations, this paper proposes a novel model, called Fusing Cross Network (FCN), along with two sub-networks: Linear Cross Network (LCN) and Exponential Cross Network (ECN). FCN explicitly captures feature interactions with both linear and exponential growth, eliminating the need to rely on implicit DNN. Moreover, we introduce the Self-Mask operation to filter noise layer by layer and reduce the number of parameters in the cross network by half. To effectively train these two cross networks, we propose a simple yet effective loss function called Tri-BCE, which provides tailored supervision signals for each network. We evaluate the effectiveness, efficiency, and interpretability of FCN on six benchmark datasets. Furthermore, by integrating LCN and ECN, FCN achieves a new state-of-the-art performance.
연구 동기 및 목표
- 전통적인 DNN 기반의 암묵적 상호작용을 넘는 명시적 특성 상호작용으로 해석 가능한 CTR 모델을 동기 부여한다.
- Genuine deep crossing을 위한 교차 차수를 기하급수적으로 증가시키는 Deep Crossing (DCNv3)을 제안한다.
- 저차원 및 고차원 명시적 상호작용을 융합하기 위한 Shallow & Deep Cross Network v3 (SDCNv3)를 제안한다.
- 교차 네트워크의 노이즈를 필터링하고 파라미터를 줄이기 위한 Self-Mask를 도입한다.
- 서브네트워크에 적응형 감독 신호를 제공하는 Tri-BCE 손실을 개발한다.
제안 방법
- 공유 Cross & Masked 벡터를 위한 청크 방식으로 다중 필드 범주형 입력을 두 가지 뷰로 임베딩하고 재구성한다.
- Cross 벡터와 각 층의 마스킹된 연결을 사용해 교차 차수를 기하급수적으로 증가시키는 Deep Crossing (DCNv3)을 정의한다.
- Self-Mask: Mask(c_l) = c_l ⊙ max(0, LayerNorm(c_l))를 통해 노이즈를 필터링하고 파라미터를 절반으로 줄인다.
- Shallow & Deep Cross Network v3 (SDCNv3)를 도입하여 얕은 및 깊은 명시적 교차를 Self-Mask 및 평행 융합 스킴과 결합한다.
- Tri-BCE 손실: L_Tri = L + w_D L_D + w_S L_S 에 대해 적응 가중치 w_D = max(0, L_D − L) 및 w_S = max(0, L_S − L)로 정의한다.
- 명시적-전용 DCNv3/SDCNv3가 파라미터 및 계산 프로파일 측면에서 우수한 이점을 보인 복잡도 비교를 제공한다.
실험 결과
연구 질문
- RQ1RQ1 DCNv3 및 SDCNv3가 대규모 데이터셋에서 다른 CTR 모델보다 성능이 더 우수한가?
- RQ2RQ2 DCNv3 및 SDCNv3가 경쟁 CTR 모델보다 더 효율적인가?
- RQ3RQ3 SDCNv3가 해석 가능성과 노이즈 필터링 기능을 제공하는가?
- RQ4RQ4 다양한 구성이 모델 성능과 학습에 어떤 영향을 미치는가?
주요 결과
- SDCNv3는 여섯 개 데이터셋 모두에서 최상의 성능을 달성하고 PapersWithCode 벤치마크에서 Criteo, KDD12, KKBox에 대해 1위를 차지한다.
- DCNv3는 강력한 기준선들보다 명시적 상호작용 성능이 우수하며 Avazu 및 Criteo에서 로스(logloss)와 AUC의 측정 가능한 개선을 보인다.
- SDCNv3는 Tri-BCE 감독 하에 명시적 특성 상호작용만으로 최첨단 결과를 제공하여 명시적 교차의 효과를 강조한다.
- Tri-BCE는 서브네트워크에 적응형 감독 신호를 제공하여 학습 다이나믹스와 최종 예측이 향상된다.
- Self-Mask가 파라미터 수를 줄이고 무거운 암묵적-DNN 구성 요소를 회피하면서 모델의 효율-복잡도 균형을 개선한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.