Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Federated Training via Collaborative Machine Teaching using Trusted Instances

Yufei Han, Xiangliang Zhang|arXiv (Cornell University)|2019. 05. 08.
Privacy-Preserving Technologies in Data참고 문헌 18인용 수 7
한 줄 요약

이 논문은 공동 학습 기반의 기계 학습 프레임워크인 CoMT를 제안한다. CoMT는 분산된 에이전트들 간의 소규모 신뢰할 수 있는 데이터 인스턴스를 활용하여 체계적으로 손상된 학습 데이터를 식별하고 수정함으로써联邦 학습의 강건성을 향상시킨다. 기밀성을 유지하는 방식으로 데이터 선택과 모델 학습을 동시에 최적화함으로써 CoMT는 합성 및 실제 데이터셋에서 최신 기술 수준의 성능을 달성하며, 이전 방법 대비 학습 시간을 75% 이상 단축시키면서도 모델 정확도를 향상시킨다.

ABSTRACT

Federated learning performs distributed model training using local data hosted by agents. It shares only model parameter updates for iterative aggregation at the server. Although it is privacy-preserving by design, federated learning is vulnerable to noise corruption of local agents, as demonstrated in the previous study on adversarial data poisoning threat against federated learning systems. Even a single noise-corrupted agent can bias the model training. In our work, we propose a collaborative and privacy-preserving machine teaching paradigm with multiple distributed teachers, to improve robustness of the federated training process against local data corruption. We assume that each local agent (teacher) have the resources to verify a small portions of trusted instances, which may not by itself be adequate for learning. In the proposed collaborative machine teaching method, these trusted instances guide the distributed agents to jointly select a compact while informative training subset from data hosted by their own. Simultaneously, the agents learn to add changes of limited magnitudes into the selected data instances, in order to improve the testing performances of the federally trained model despite of the training data corruption. Experiments on toy and real data demonstrate that our approach can identify training set bugs effectively and suggest appropriate changes to the labels. Our algorithm is a step toward trustworthy machine learning.

연구 동기 및 목표

  • 체계적인 데이터 손상으로 인해 자기 일관성이 유지되어 감지하기 어려운 연합 학습의 취약성을 해결한다.
  • 원시 데이터를 공유하지 않으면서도 분산 에이전트들이 기밀성을 유지한 채 공동으로 모델의 강건성을 향상시킬 수 있는 방법을 개발한다.
  • 손상된 학습 데이터가 존재하는 상황에서도 학습 성능을 향상시키기 위해 데이터 튜닝과 모델 학습을 통합 최적화 과정으로 통합한다.
  • 기존 기계 학습 방법에서 흔히 발생하는 계산 비용과 확장성 제약을 최소화한다.
  • 제한된 전문가 레이블이 부여된 신뢰할 수 있는 데이터를 갖는 실제 연합 환경에서 강건한 기계 학습의 실용적 구현을 가능하게 한다.

제안 방법

  • 로컬 에이전트들이 분산된 강사 역할을 하며 중앙 서버가 학습자 역할을 하는 공동 기계 학습 프레임워크를 도입하여, 작고 정보성 높은 학습 서브셋을 공동으로 선택한다.
  • 소규모 전문가 검증을 거친 신뢰할 수 있는 인스턴스를 앵커로 활용하여, 다양한 에이전트 간의 학습 데이터 선택 및 수정을 유도함으로써 진정한 데이터 분포와의 일치를 확보한다.
  • 학습 인스턴스 선택과 제한된 변형을 통해 레이블를 수정하는 것을 동시에 최적화하는 연속 최적화 문제를 수립한다. 이는 모델 일반화 능력을 향상시킨다.
  • 공동 최적화를 활용하여 분산된 에이전트들이 데이터 튜닝과 모델 학습을 명시적인 데이터 전송 없이 공동으로 수행함으로써 기밀성을 유지한다.
  • 모델 학습과 데이터 수정을 통합된 목표 함수에 통합하여, 최적화 전반에 걸쳐 신뢰할 수 있는 인스턴스와의 일관성을 강제한다.
  • 적응형 학습률(예: 네스테로프 가속 경사)을 활용한 점진적 업데이트를 적용하여 수렴 속도와 안정성을 향상시킨다.

실험 결과

연구 질문

  • RQ1신뢰할 수 있는 인스턴스를 활용한 공동 기계 학습이 연합 학습 환경에서 체계적으로 손상된 학습 데이터를 효과적으로 탐지하고 수정할 수 있는가?
  • RQ2데이터 선택과 모델 학습을 동시에 최적화하는 방식이 비공동 또는 고립된 데이터 수정 방법에 비해 강건성 향상에 얼마나 기여하는가?
  • RQ3제안된 방법은 손상된 데이터셋에서 성능을 유지하거나 향상시키면서도 계산 비용을 얼마나 줄일 수 있는가?
  • RQ4원시 데이터 전송 없이도 효과적인 공동 작업을 가능하게 하면서 기밀성을 유지하는가?
  • RQ5공동 학습을 통해 선택된 학습 서브셋의 최적 크기와 구성은 무엇이며, 이는 모델 일반화에 어떤 영향을 미치는가?

주요 결과

  • CPUSMALL 회귀 데이터셋에서 CoMT는 학습 데이터의 55%만 사용하여 R-제곱 점수 0.71을 달성했으며, 이는 TI-단독(0.38), DUTI(0.56), rLR(0.58)보다 뚜렷이 뛰어난 성능이다.
  • IJCNN 이진 분류 데이터셋에서 CoMT는 레이블 뒤집기 노이즈 조건 하에 AUC 점수 0.73을 기록했으며, 모든 기준 모델(≤0.70)을 초월했고, 선택된 데이터의 55%만으로도 높은 성능를 유지했다.
  • CoMT는 평균적으로 회귀 문제의 경우 1500회 반복, 분류 문제의 경우 2000회 반복 내에 수렴했으며, 이는 이전 연구 결과와 일관된 수렴 행동을 보여, 적응형 학습률을 활용할 경우 더 빠른 수렴 가능성을 시사한다.
  • 메모리 크기에 비례해 거의 선형적으로 확장되는 것으로 나타났다: 50만 개 인스턴스에서 회귀 문제의 경우 384.32초, 분류 문제의 경우 684.33초가 소요되어 강력한 계산 확장성을 입증했다.
  • 모든 실험에서 CoMT는 DUTI 대비 실행 시간을 25% 미만으로 줄여, 대규모 환경에서의 효율성 우수성을 확인했다.
  • 선택된 데이터가 많아질수록 성능이 단순히 증가하지 않는다는 점은 최적의 작고 효율적인 학습 서브셋 존재를 확인하며, 공동 학습의 核심 원리가 검증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.