[논문 리뷰] Semi-supervised Learning with Missing Values Imputation
이 논문은 레이블 정보를 활용하여 결손치 추정과 분류 정확도를 향상시키는 연합적 보정 및 분류 프레임워크인 준감독형 조건부 정규화 플로우(이하 SSCFlow)를 제안한다. 부분적으로 손상된 인스턴스의 조건부 분포를 준감독형 정규화 플로우로 모델링하고, 노이즈 제거 오토인코더를 통해 손상된 보정치를 반복적으로 개선함으로써, 결손치가 있는 다수의 실세계 데이터셋에서 최신 기술 수준의 성능을 달성한다.
Incomplete instances with various missing attributes in many real-world applications have brought challenges to the classification tasks. Missing values imputation methods are often employed to replace the missing values with substitute values. However, this process often separates the imputation and classification, which may lead to inferior performance since label information are often ignored during imputation. Moreover, traditional methods may rely on improper assumptions to initialize the missing values, whereas the unreliability of such initialization might lead to inferior performance. To address these problems, a novel semi-supervised conditional normalizing flow (SSCFlow) is proposed in this paper. SSCFlow explicitly utilizes the label information to facilitate the imputation and classification simultaneously by estimating the conditional distribution of incomplete instances with a novel semi-supervised normalizing flow. Moreover, SSCFlow treats the initialized missing values as corrupted initial imputation and iteratively reconstructs their latent representations with an overcomplete denoising autoencoder to approximate their true conditional distribution. Experiments on real-world datasets demonstrate the robustness and effectiveness of the proposed algorithm.
연구 동기 및 목표
- 보정 단계에서 레이블 정보를 忽시하는 전통적인 두 단계 보정-분류 파ip라인의 한계를 해결한다.
- 기존 방법에서 결손치 초기화가 신뢰할 수 없어 발생하는 낮은 성능을 극복한다.
- 조건부 분포 추정을 공동 최적화하여 보정과 분류를 동시에 향상시킨다.
- 생성 과정에 레이블 사전 지식을 통합하여, 레이블이 있는 데이터와 없는 데이터를 모두 효과적으로 학습할 수 있도록 한다.
- 결손치를 손상된 특성으로 간주하고 준감독형 잠재 공간 모델링을 통해 복원하는 강력한 프레임워크를 개발한다.
제안 방법
- 부분적으로 손상된 인스턴스의 조건부 분포를 레이블에 기반해 추정하는 준감독형 조건부 정규화 플로우(이하 SSCFlow)를 제안한다.
- 정규화 플로우에 관측된 레이블을 추가 특성로 통합하여 보정과 분류를 공동으로 이끈다.
- 미관측 레이블을 결손치로 간주하고, 엔드 투 엔드 학습 과정에서 이를 복원한다.
- 과잉 구성된 노이즈 제거 오토인코더를 사용하여 손상된 전체 특성을 반복적으로 복원하고, 결손치의 진짜 조건부 분포를 근사한다.
- 정규화 플로우에서 역행성 변환을 활용하여 정확한 우도 추정과 조건부 분포에서의 효율적 샘플링을 가능하게 한다.
- 보정 헤드와 분류 헤드 간에 파라미터와 특징을 공유함으로써 일반화 및 일관성을 향상시킨다.

실험 결과
연구 질문
- RQ1조건부 분포 추정을 통한 연합적 보정 및 분류가 보정-분류를 분리한 전통적인 두 단계 접근 방식을 능가할 수 있는가?
- RQ2보정 단계에서 레이블 정보를 통합할 경우 결손치 추정 품질과 후속 분류 정확도에 어떤 영향을 미치는가?
- RQ3단일 단계 보정에 비해 손상된 보정치를 반복적으로 복원하는 방식이 성능 향상에 얼마나 기여하는가?
- RQ4준감독형 조건부 정규화 플로우의 사용이 잠재 공간에서의 결정 경계 분리도와 해석 가능성에 어떤 영향을 미치는가?
- RQ5SSCFlow의 다양한 구성 요소(예: IDM, IT, LS)가 전체 성능에 기여하는 정도는 어떠한가? 특히 어떤 요소가 가장 핵심적인가?
주요 결과
- SSCFlow는 MCFlow 및 기타 최신 기술 수준의 방법에 비해 모든 테스트 데이터셋에서 가장 높은 분류 정확도(ACC)를 달성했으며, HTRU2 데이터셋에서 특히 두드러진 향상(0.9686 ± 0.5218 대비 0.9602 ± 0.0020)을 보였다.
- 유방암 데이터셋에서는 98.37% ± 0.0082의 정확도를 기록하여 두 번째로 높은 성능을 보인 방법(93.85% ± 0.0135)을 크게 앞서갔다.
- MDS를 통해 시각화한 결과, SSCFlow가 생성한 잠재 공간 표현은 더 명확한 클래스 분리도와 더 자연스러운 군집 경계를 보여, 더 나은 해석 가능성의 잠재력을 입증했다.
- 제거 분석 결과, SSCFlow의 모든 구성 요소(IDM, IT, LS)가 성능 향상에 기여하며, 특히 SSCFlow-LS가 보정에서 가장 열악한 성능을 보여, 레이블 영향력이 손실에만 국한되지 않고 생성 과정 자체에 영향을 주어야 한다는 점을 확인했다.
- 결손치를 보정하지 않고 직접 불완전한 데이터를 분류하는 XGBoost는 대부분의 데이터셋에서 가장 낮은 성능을 보였으며, 이는 결손치 분포를 忽시할 경우 성능이 악화된다는 주장을 뒷받침한다.
- 은행 지폐, 센서리스, 와이파이 위치 기반 등 다양한 실세계 데이터셋에서 모델의 강건성이 입증되었으며, 보정 및 분류 모두에서 일관된 향상이 관찰되었다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.