[논문 리뷰] MOI-Mixer: Improving MLP-Mixer with Multi Order Interactions in Sequential Recommendation
이 논문은 다중차수 상호작용(MOI) 레이어를 도입하여 순차적 추천에서 고차수 특징 상호작용을 명시적으로 캡처하는 방식으로 기존 MLP-Mixer를 향상시킨 MOI-Mixer를 제안한다. 표준 MLP 레이어를 고차수 상호작용을 모델링할 수 있는 MOI 레이어로 대체함으로써 선형 복잡도를 유지하면서도, Transformer 기반 모델과 유사한 성능을 달성한다. 특히 장문의 시퀀스 환경에서 이중 계산 비용 없이도 뛰어난 성능을 발휘한다.
Successful sequential recommendation systems rely on accurately capturing the user's short-term and long-term interest. Although Transformer-based models achieved state-of-the-art performance in the sequential recommendation task, they generally require quadratic memory and time complexity to the sequence length, making it difficult to extract the long-term interest of users. On the other hand, Multi-Layer Perceptrons (MLP)-based models, renowned for their linear memory and time complexity, have recently shown competitive results compared to Transformer in various tasks. Given the availability of a massive amount of the user's behavior history, the linear memory and time complexity of MLP-based models make them a promising alternative to explore in the sequential recommendation task. To this end, we adopted MLP-based models in sequential recommendation but consistently observed that MLP-based methods obtain lower performance than those of Transformer despite their computational benefits. From experiments, we observed that introducing explicit high-order interactions to MLP layers mitigates such performance gap. In response, we propose the Multi-Order Interaction (MOI) layer, which is capable of expressing an arbitrary order of interactions within the inputs while maintaining the memory and time complexity of the MLP layer. By replacing the MLP layer with the MOI layer, our model was able to achieve comparable performance with Transformer-based models while retaining the MLP-based models' computational benefits.
연구 동기 및 목표
- MLP 기반 모델의 계산적 이점에도 불구하고 순차적 추천에서 MLP 기반 모델과 Transformer 기반 모델 간의 성능 격차를 해소하기 위해.
- 명시적인 고차수 특징 상호작용이 순차적 추천에서 성능 격차를 줄일 수 있는지 조사하기 위해.
- 임의의 순서의 상호작용을 캡처하면서도 선형 메모리 및 시간 복잡도를 유지하는 새로운 레이어를 설계하기 위해.
- 장문의 시퀀스 모델링에 있어 채널 믹싱 연산에서의 고차수 상호작용의 효과를 평가하기 위해.
제안 방법
- PARAFAC에 영감을 받은 텐서 분해 기반 방법을 사용하여 입력 특징 간의 임의의 순서의 상호작용을 모델링하는 다중차수 상호작용(MOI) 레이어를 제안한다.
- 표준 MLP 레이어를 토큰 믹싱 및 채널 믹싱 구성 요소 모두에서 대체하는 방식으로 MOI 레이어를 MLP-Mixer 아키텍처에 통합한다.
- 상호작용 순서를 하이퍼파라미터 k로 제어할 수 있는 파라미터 효율적인 설계를 적용하여 특징 상호작용의 모델링 유연성을 확보한다.
- 학습 중 기울기 흐름과 안정성을 유지하기 위해 히드라드 곱과 잔차 연결을 사용한다.
- MOI 레이어에서 히드라드 곱 이후에 LayerNorm을 적용하며, 이는 아블레이션 결과에서 다른 정규화 배치 방식보다 성능이 뛰어나다는 것을 확인한 바 있다.
- 위치 임베딩을 적응시켰지만, MOI 레이어의 고유한 순서 민감성으로 인해 효과가 없음을 발견했다.
실험 결과
연구 질문
- RQ1명시적인 고차수 특징 상호작용이 순차적 추천에서 MLP 기반 모델과 Transformer 기반 모델 간의 성능 격차를 메울 수 있는가?
- RQ2채널 믹싱 레이어에서 고차수 상호작용을 모델링하면 추천 정확도가 향상되는가?
- RQ3자기주의 어텐션과 유사한 복잡한 상호작용을 캡처하면서도 선형 계산 복잡도를 유지할 수 있는가?
- RQ4상호작용 순서(k)가 아키텍처의 다양한 구성 요소에서 모델 성능에 미치는 영향은 어떠한가?
- RQ5순서에 민감한 MOI 레이어를 갖는 MLP 기반 모델에서 위치 임베딩이 필수적인가?
주요 결과
- ML-1m 데이터셋에서 MOI-Mixer는 NDCG@10이 0.4873을 기록하여 기준선인 MLP-Mixer를 초월하고, 최신 기술 기반의 Transformer 모델과 동등한 성능을 달성한다.
- 채널 믹싱 레이어에서의 이차 상호작용(k=2)이 가장 우수한 성능을 보였으며, 순서를 더 높이면 성능이 저하되는 경향을 보였다.
- 토큰 믹서에서 표준 MLP 레이어를 단일 선형 레이어로 대체하면 NDCG@10에서 성능이 0.3% 뿐 감소하지만, 이는 이중 계산 복잡도를 유발하여 확장성에 제약을 끼친다.
- BERT4Rec와 gMLP와 달리, MOI-Mixer는 시퀀스 길이가 1000에 이르는 경우에도 선형 FLOPs 및 VRAM 사용량을 유지한다.
- MOI 레이어에서 히드라드 곱 이후에 정규화를 적용할 경우 성능이 가장 뛰어나며, Layer Scale 및 L2 정규화는 효과가 없거나 성능 저하를 초래한다.
- 위치 임베딩은 성능 향상에 기여하지 않았다. MOI 레이어가 이미 상호작용 메커니즘을 통해 순서를 적절히 캡처하고 있기 때문이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.