[논문 리뷰] MET: Masked Encoding for Tabular Data
MET는 데이터 증강을 필요로 하지 않고 좌표별 표현과 적대적 복원 손실을 사용하는 마스킹 인코딩을 도입함으로써, 표본 데이터에 대한 새로운 복원 기반 자기 지도 학습 방법을 제안한다. 이는 다섯 개인 다양한 표본 데이터셋에서 이전 방법 대비 최대 9% 향상된 분류 정확도를 달성하여 최신 기술 수준(SOTA)을 확립한다.
We consider the task of self-supervised representation learning (SSL) for tabular data: tabular-SSL. Typical contrastive learning based SSL methods require instance-wise data augmentations which are difficult to design for unstructured tabular data. Existing tabular-SSL methods design such augmentations in a relatively ad-hoc fashion and can fail to capture the underlying data manifold. Instead of augmentations based approaches for tabular-SSL, we propose a new reconstruction based method, called Masked Encoding for Tabular Data (MET), that does not require augmentations. MET is based on the popular MAE approach for vision-SSL [He et al., 2021] and uses two key ideas: (i) since each coordinate in a tabular dataset has a distinct meaning, we need to use separate representations for all coordinates, and (ii) using an adversarial reconstruction loss in addition to the standard one. Empirical results on five diverse tabular datasets show that MET achieves a new state of the art (SOTA) on all of these datasets and improves up to 9% over current SOTA methods. We shed more light on the working of MET via experiments on carefully designed simple datasets.
연구 동기 및 목표
- 자연스럽게 구조화되지 않은 표본 데이터에서 자기 지도 학습을 위한 효과적인 데이터 증강 기법을 설계하는 데 도전한다.
- 대체로 임의로 선택되거나 도메인에 특화된 증강 기법에 의존하지 않는 복원 기반의 대체 기법을 제안하여 표본 데이터용 SSL에 활용한다.
- 좌표별 임베딩과 적대적 훈련을 활용해 표본 데이터의 표현 학습을 향상시킨다.
- 모든 토큰 표현을 풀링하는 대신 연결함으로써 표본 SSL에서 더 나은 최종 성능을 달성할 수 있음을 입증한다.
- 복원 기반 방법이 비선형 데이터 분포에서도 선형으로 분리 가능한 표현을 학습할 수 있는지 조사한다.
제안 방법
- MET는 표본 데이터의 마스킹된 특징을 복원하기 위해 트랜스포머 기반의 인코더-디코더 아키텍처를 사용한다.
- 특정 비율의 특징에 대해 마스킹을 적용하고, 모든 마스킹된 좌표에 대해 학습 가능한 마스크 토큰을 사용하며, 각 특징에 대해 위치 인코딩을 적용한다.
- 평균 풀링 대신, 모든 특징의 표현을 연결하여 최종 테스트를 위한 미세조정에 활용함으로써 좌표별 정보를 유지한다.
- 입력 공간에서 기울기 상승을 수행하여 변형을 생성함으로써 적대적 복원 손실을 도입한다.
- 표준 마스킹 복원 손실과 적대적 복원 손실을 조합하여 엔드 투 엔드로 모델을 훈련시킨다.
- 모델은 인스턴스 수준의 데이터 증강을 피하고, 복원과 적대적 정규화에만 의존한다.
실험 결과
연구 질문
- RQ1복원 기반 접근 방식이 표본 자기 지도 표현 학습에서 대비 학습 방법보다 우수한 성능을 낼 수 있는가?
- RQ2풀링 대신 모든 토큰 표현을 연결함으로써 표본 SSL에서 더 나은 최종 성능을 달성할 수 있는가?
- RQ3복원 손실에 대해 입력 공간에서 기울기 상승을 통한 적대적 훈련이 표본 데이터에서 모델 일반화를 향상시킬 수 있는가?
- RQ4왜 복원 기반 방법은 비선형 데이터 분포에서도 선형으로 분리 가능한 표현을 학습하는가?
- RQ5다양한 표본 벤치마크에서 기존 최신 기술 수준 방법들인 DACL, SubTab, VIME와 비교해 MET는 어떻게 성능을 내는가?
주요 결과
- MET는 다섯 개인 표준 표본 데이터셋에서 새로운 최신 기술 수준 성능을 달성하여 이전 최신 기술 수준 방법 대비 평균 정확도를 3.2% 향상시켰다.
- FMNIST 및 CovType 데이터셋에서 MET는 각각 90.94%와 74.12%의 최종 정확도를 기록하여 기준 방법들을 능가했다.
- MET는 레이블된 데이터의 20%만으로도 일부 데이터셋에서 전체 레이블 세트를 사용한 지도 학습의 성능을 따라잡을 수 있었다.
- 각 특징에 별도의 마스크 토큰을 사용하는 것이 CovType과 같이 이질적인 데이터셋에서 성능을 향상시켰다(공유 토큰 대비 75.40% 대비 74.12%), 비록 메모리 비용이 더 높아지긴 하지만.
- 마스크 토큰을 인코더를 통과시키면 성능이 떨어지고 계산 비용이 증가하므로, 디코더에 직접 입력하는 것이 더 바람직하다는 것이 확인되었다.
- 단순한 합성 데이터셋에 대한 실험 결과, MET의 표현은 비선형으로 분리 가능한 데이터를 선형으로 분리 가능하게 만들었으며, 이는 더 나은 분리성과 일반화 능력을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.