Skip to main content
QUICK REVIEW

[논문 리뷰] FedCVT: Semi-supervised Vertical Federated Learning with Cross-view Training

Yan Kang, Yang Liu|arXiv (Cornell University)|2020. 08. 25.
Privacy-Preserving Technologies in Data참고 문헌 24인용 수 13
한 줄 요약

FedCVT는 정렬된 샘플이 제한된 상황에서 누락된 특징을 추정하고, 비정규화된 데이터에 대해 가짜 레이블을 생성하며, 서로 다른 시각에서 세 개의 분류기를 공동으로 훈련함으로써 모델 성능을 향상시키는 반감독형 수직联邦학습 프레임워크를 제안한다. 이는 원래의 VFL보다 뛰어나며, CIFAR10에서 정렬된 샘플이 500개 뿐이어도 최대 22.7% 높은 정확도를 달성하면서도, 중간 표현을 안전하게 교환함으로써 데이터 기밀성을 유지한다.

ABSTRACT

Federated learning allows multiple parties to build machine learning models collaboratively without exposing data. In particular, vertical federated learning (VFL) enables participating parties to build a joint machine learning model based on distributed features of aligned samples. However, VFL requires all parties to share a sufficient amount of aligned samples. In reality, the set of aligned samples may be small, leaving the majority of the non-aligned data unused. In this article, we propose Federated Cross-view Training (FedCVT), a semi-supervised learning approach that improves the performance of the VFL model with limited aligned samples. More specifically, FedCVT estimates representations for missing features, predicts pseudo-labels for unlabeled samples to expand the training set, and trains three classifiers jointly based on different views of the expanded training set to improve the VFL model's performance. FedCVT does not require parties to share their original data and model parameters, thus preserving data privacy. We conduct experiments on NUS-WIDE, Vehicle, and CIFAR10 datasets. The experimental results demonstrate that FedCVT significantly outperforms vanilla VFL that only utilizes aligned samples. Finally, we perform ablation studies to investigate the contribution of each component of FedCVT to the performance of FedCVT. Code is available at https://github.com/yankang18/FedCVT

연구 동기 및 목표

  • 파트너 간에 정렬된 샘플이 매우 적을 경우 발생하는 수직 연합학습(VFL)의 성능 저하 문제를 해결하기 위해.
  • 원시 데이터나 모델 파라미터를 공유하지 않고도 비정규화된, 정렬되지 않은 데이터를 효과적으로 활용할 수 있도록 하기 위해.
  • 다양한 데이터 시각 간의 교차 시각 훈련을 통해 VFL에서의 표현 학습과 일반화 능력을 향상시키기 위해.
  • 원시 데이터나 완전한 모델 가중치를 공유하지 않고 중간 표현과 기울기만을 교환함으로써 데이터 기밀성을 유지하기 위해.
  • 제한된 레이블 데이터를 가진 다양한 데이터 유형과 실제 세계 시나리오에서 FedCVT의 효과성을 검증하기 위해.

제안 방법

  • 정렬된 데이터에서 학습된 공유 및 고유 표현을 사용하여 비정규화된 샘플의 누락된 특징을 추정한다.
  • 확장된 데이터셋에 대해 훈련된 학생 모델을 사용하여 비정규화된 샘플의 가짜 레이블을 예측한다.
  • 세 가지 별도의 데이터 시각을 구성한다: 원본 특징에서의 시각, 추정된 특징에서의 시각, 가짜 레이블이 부여된 샘플에서의 시각.
  • 세 가지 시각을 사용하여 수직 연합학습을 통해 세 분류기를 공동으로 훈련시켜 표현 학습을 향상시킨다.
  • 원시 데이터나 전체 모델 가중치를 공유하지 않고 중간 표현과 기울기만을 교환하는 기밀성 보장 프레임워크를 구현한다.
  • 전방 및 후방 전파 과정을 보호하기 위해 하이브리드 암호화 기법을 사용한다.

실험 결과

연구 질문

  • RQ1정렬된 샘플이 매우 적을 경우 반감독 학습 기법이 수직 연합학습 성능을 향상시킬 수 있는가?
  • RQ2연합 환경에서 비정규화된 샘플의 누락된 특징을 복구하기 위해 표현 추정 기법이 얼마나 효과적인가?
  • RQ3가짜 레이블링과 교차 시각 훈련이 레이블 데이터가 제한된 VFL에서 모델 일반화 능력을 얼마나 향상시키는가?
  • RQ4FedCVT는 낮은 데이터 환경에서 기존 VFL을 크게 능가하면서도 기밀성을 유지하는가?
  • RQ5표현 추정, 가짜 레이블링, 또는 교차 시각 훈련 중 어떤 구성 요소가 성능 향상에 가장 기여하는가?

주요 결과

  • CIFAR10에서 정렬된 샘플이 500개 뿐이어도 FedCVT는 기존 VFL 대비 정확도를 22.66% 향상시켜 40.02%에서 62.68%로 상승시켰다.
  • 10,000개의 정렬된 샘플이 있을 경우에도 FedCVT는 25,000개 샘플로 훈련된 로컬 모델보다 성능이 뛰어나 72.06%의 정확도를 기록했고, 로컬 모델의 67.74%보다 높았다.
  • 표현 추정만으로도 기존 VFL 대비 정확도를 11% 향상시켜 가장 큰 성능 향상을 기록했다.
  • 표현 추정과 결합했을 때 교차 시각 훈련이 추가로 성능을 0.6% 향상시켰으며, 이는 4,000개 샘플에서의 결과였다.
  • 제거 실험 결과, 표현 추정, 가짜 레이블링, 교차 시각 훈련 모두가 최종 성능 향상에 누적적으로 기여하는 것으로 확인되었다.
  • FedCVT는 NUS-WIDE, Vehicle, CIFAR10 등 테스트된 모든 데이터셋에서 기존 VFL을 능가했으며, 레이블 데이터가 극히 적은 상황에서도 뛰어난 성능을 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.