Skip to main content
QUICK REVIEW

[논문 리뷰] Exploiting Unlabeled Data in Smart Cities using Federated Learning

Abdullatif Albaseer, Bekir Sait Çiftler|arXiv (Cornell University)|2020. 01. 10.
Privacy-Preserving Technologies in Data참고 문헌 21인용 수 13
한 줄 요약

이 논문은 스마트 시티에서 사용 가능한 비라벨 데이터를 활용하여 모델 정확도를 향상시키면서도 사용자 프라이버시를 보존하는 반독립적 에지 학습 프레임워크인 FedSem을 제안한다. 먼저 라벨이 부여된 데이터로 전역 모델을 훈련한 후 두 번째 단계에서 가짜 라벨이 부여된 비라벨 데이터를 통합함으로써 FedSem은 라벨이 부여된 데이터만을 사용할 경우보다 최대 8% 높은 정확도를 달성하여, 라벨이 부족한 상황에서도 뚜렷한 성능 향상을 입증한다.

ABSTRACT

Privacy concerns are considered one of the main challenges in smart cities as sharing sensitive data brings threatening problems to people's lives. Federated learning has emerged as an effective technique to avoid privacy infringement as well as increase the utilization of the data. However, there is a scarcity in the amount of labeled data and an abundance of unlabeled data collected in smart cities, hence there is a need to use semi-supervised learning. We propose a semi-supervised federated learning method called FedSem that exploits unlabeled data. The algorithm is divided into two phases where the first phase trains a global model based on the labeled data. In the second phase, we use semi-supervised learning based on the pseudo labeling technique to improve the model. We conducted several experiments using traffic signs dataset to show that FedSem can improve accuracy up to 8% by utilizing the unlabeled data in the learning process.

연구 동기 및 목표

  • 스마트 시티 응용 분야에서 라벨이 부여된 데이터의 부족과 비라벨 데이터의 풍부함을 해결하기 위해.
  • 중앙 집중식 데이터 수집을 피하는 방식으로 엣지 네트워크에서 프라이버시를 보존하는 모델 훈련을 가능하게 하기 위해.
  • 반독립적 학습 프레임워크를 개발하여 반감독 기법을 통해 비라벨 데이터를 효과적으로 활용하기 위해.
  • 다양한 데이터 이질성과 라벨 비율 조건 하에서 제안된 방법의 성능을 평가하기 위해.

제안 방법

  • FedSem 프레임워크는 두 단계로 구성된다: 첫 번째 단계에서는 반독립 학습을 통해 라벨이 부여된 데이터만을 사용하여 전역 모델을 훈련시킨다.
  • 두 번째 단계에서는 가짜 라벨 기법을 활용해 비라벨 데이터를 통합한다. 이때 첫 번째 단계의 모델이 비라벨 샘플에 대해 예측을 수행한다.
  • 가짜 라벨가 부여된 샘플은 이후 전역 모델의 미세조정에 사용되어 일반화 능력과 성능을 향상시킨다.
  • 이 방법은 분류 작업을 위해 세 개의 컨볼루션 레이어와 하나의 완전 연결 레이어를 포함한 표준 딥 러닝 아키텍처를 사용한다.
  • 클라이언트는 라운드 로빈 방식으로 참여하며, 모델 업데이트는 중앙 집중적으로 집계되어 전역 모델을 형성한다.
  • 시스템은 고정된 학습률과 배치 크기를 사용하며, 수렴성과 정확도를 평가하기 위해 다수의 라운드와 에포크 동안 하이퍼파ram터를 조정한다.

실험 결과

연구 질문

  • RQ1반독립 학습이 엣지 네트워크에서 비라벨 데이터가 풍부한 반감독 설정으로 효과적으로 확장될 수 있는가?
  • RQ2가짜 라벨가 부여된 데이터의 통합이 프라이버시를 보존하는 반독립 학습 환경에서 모델 정확도에 어떤 영향을 미치는가?
  • RQ3스마트 시티 응용 분야에서 성능을 최대화하기 위해 라벨이 부여된 데이터 비율과 비라벨 데이터 활용 간의 최적 균형은 무엇인가?
  • RQ4데이터 이질성이 엣지 환경에서 반감독 반독립 학습의 성능에 어떤 영향을 미치는가?

주요 결과

  • FedSem은 비라벨 데이터를 훈련 과정에 통합함으로써 최대 8%의 정확도 향상을 달성한다.
  • 라벨이 부여된 데이터가 오직 10%일 경우에도, 비라벨 데이터를 통합한 후 7%의 정확도 향상을 기록한다.
  • 로컬 에포크 수를 늘릴수록 테스트 정확도가 향상되며, 이는 하이퍼파ram터 튜닝이 수렴에 있어 매우 중요하다는 것을 시사한다.
  • 훈련 과정에서 정확도 향상과 손실 변동성 감소를 통해 학습이 안정화되고 모델의 강건성이 향상됨을 확인할 수 있다.
  • 다양한 라벨 데이터 비율(20%, 30%, 50%)에서 일관된 성능 향상이 관찰되어, 이 방법의 확장성과 타당성을 입증한다.
  • 가짜 라벨링 기법의 사용이 성능 향상에 크게 기여하며, 특히 라벨이 부족한 상황에서 비라벨 데이터의 가치가 뚜렷하게 드러남을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.