[논문 리뷰] Data Selection for Federated Learning with Relevant and Irrelevant Data at Clients
이 논문은 각 클라이언트에서 관련 데이터 샘플만 식별하고 사용하는 분산 데이터 선택 방법을 제안한다. 이 방법은 작업에 특화된 벤치마크 모델을 활용하여 관련성을 평가한다. 관련성이 없는 데이터를 필터링함으로써, 전체 클라이언트 데이터로 학습하는 것에 비해 모델 정확도를 최대 25% 향상시킨다.
Federated learning is an effective way of training a machine learning model from data collected by client devices. A challenge is that among the large variety of data collected at each client, it is likely that only a subset is relevant for a learning task while the rest of data has a negative impact on model training. Therefore, before starting the learning process, it is important to select the subset of data that is relevant to the given federated learning task. In this paper, we propose a method for distributedly selecting relevant data, where we use a benchmark model trained on a small benchmark dataset that is task-specific, to evaluate the relevance of individual data samples at each client and select the data with sufficiently high relevance. Then, each client only uses the selected subset of its data in the federated learning process. The effectiveness of our proposed approach is evaluated on multiple real-world datasets in a simulated system with a large number of clients, showing up to $25\%$ improvement in model accuracy compared to training with all data.
연구 동기 및 목표
- 비관련 데이터가 분산 학습 성능에 악영향을 미치는 문제를 해결하기 위해.
- 클라이언트가 특정 학습 작업에 관련된 데이터만 식별하고 유지할 수 있도록 하기 위해.
- 중앙 집중식 데이터 수집 없이도 많은 클라이언트에 걸쳐 확장 가능한 분산 데이터 선택 메커니즘을 개발하기 위해.
- 분산 학습 중에 낮은 관련성의 데이터 샘플을 제외시킴으로써 모델 정확도를 향상시키기 위해.
제안 방법
- 각 클라이언트는 소규모 작업 특화 데이터셋으로 미리 학습된 벤치마크 모델을 사용하여 로컬 데이터 샘플의 관련성을 평가한다.
- 관련성은 각 데이터 샘플과 벤치마크 모델의 예측 간 유사성 또는 일치도를 측정하여 정량화한다.
- 관련성 점수가 사전 정의된 임계값을 초과하는 데이터 샘플은 분산 학습에 대상으로 선정된다.
- 클라이언트는 선정된 고관련성 데이터의 부분집합만을 사용하여 분산 학습을 수행한다.
- 이 방법은 분산 방식으로 작동하여 원시 클라이언트 데이터를 공유하지 않아 데이터 프라이버시를 보장한다.
실험 결과
연구 질문
- RQ1벤치마크 모델이 분산 학습 환경에서 개별 클라이언트의 관련 데이터 샘플을 효과적으로 식별할 수 있는가?
- RQ2비관련 데이터를 제외함으로써 분산 학습에서 최종 모델 정확도에 어떤 영향을 미치는가?
- RQ3대규모 클라이언트 환경에서 데이터 선택은 수렴 속도와 모델 일반화에 어떤 영향을 미치는가?
- RQ4제안된 방법이 원시 클라이언트 데이터를 공유하지 않으면서도 상당한 정확도 향상을 달성할 수 있는가?
주요 결과
- 제안된 방법은 전체 클라이언트 데이터로 학습하는 것에 비해 모델 정확도를 최대 25% 향상시킨다.
- 모델 정확도 향상은 시뮬레이션된 분산 시스템에서 여러 실세계 데이터셋에 걸쳐 일관되게 관찰된다.
- 비관련 데이터를 제거함으로써 분산 학습에서 수렴 속도 향상과 더 나은 일반화가 이루어진다.
- 벤치마크 모델 기반의 관련성 평가가 전역 데이터에 접근하지 않고도 유용한 샘플을 효과적으로 식별한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.