[논문 리뷰] A Systematic Literature Review on Federated Machine Learning: From A Software Engineering Perspective
체계적 문헌 고찰로서 소프트웨어 엔지니어링 관점에서 연합 학습을 분석하고, 연합 학습 생애주기(배경, 요구사항, 아키텍처, 구현, 평가) 전반에 걸쳐 231개의 1차 연구를 종합하며 경향과 과제를 식별합니다.
Federated learning is an emerging machine learning paradigm where clients train models locally and formulate a global model based on the local model updates. To identify the state-of-the-art in federated learning and explore how to develop federated learning systems, we perform a systematic literature review from a software engineering perspective, based on 231 primary studies. Our data synthesis covers the lifecycle of federated learning system development that includes background understanding, requirement analysis, architecture design, implementation, and evaluation. We highlight and summarise the findings from the results, and identify future trends to encourage researchers to advance their current work.
연구 동기 및 목표
- 소프트웨어 엔지니어링 관점에서 연합 학습 시스템 개발에 대한 총체적 개요를 제공한다.
- 연합 학습의 연구 활동, 주제 및 전문가를 식별한다.
- SDLC 단계 전반에 걸쳐 연합 학습 요구사항, 아키텍처 설계, 구현 및 평가를 분석한다.
- 실무자와 연구자들을 위한 도전과제와 향후 흐름을 강조한다.
- 도입 및 시스템 개발 의사결정을 위한 데이터 기반 합성을 제공한다.
제안 방법
- Kitchenham의 가이드라인(2007)에 따른 체계적 문헌 고찰.
- ACM DL, IEEE Xplore, ScienceDirect, Springer, ArXiv, Google Scholar(2016-2020)에서 소스 선정.
- 네 가지 품질 기준(인용률, 방법론, 발견, 향후 작업)에 따른 포함/배제 기준과 품질 평가.
- 두 연구자가 교차 확인한 231개 1차 연구의 데이터 추출.
- 초기 세트를 보강하기 위한 순방향 및 역방향 스노볼링.
- 배포 생태계의 소프트웨어 생애주기(배경, 요구사항, 아키텍처, 구현, 평가) 따라 연구를 분류.
실험 결과
연구 질문
- RQ1RQ1: 연합 학습이 무엇인가?
- RQ2RQ1.1: 왜 연합 학습이 채택되는가?
- RQ3RQ1.2: 연합 학습의 응용 분야는 무엇인가?
- RQ4RQ1.3: 연합 학습 응용이 다루는 데이터는 어떤 것인가?
- RQ5RQ1.4: 연합 학습 응용의 클라이언트 데이터 분포는 어떠한가?
주요 결과
- 연합 학습은 로컬 데이터가 기기가 떠나지 않는 분산/중앙 조정식 또는 분산형 학습 접근 방식으로, 업데이트나 그래디언트가 공유되어 글로벌 모델을 형성합니다.
- 채택 동기는 개인 정보 보호 및 통신 효율성에 중점을 두고 확장성 이점이 있으며, 비 IID 데이터 하에서의 모델 성능은 여전히 과제입니다.
- 응용 및 데이터 유형에서 이미지 데이터, 구조화된 데이터, 텍스트가 가장 흔하며, MNIST는 자주 사용되는 데이터셋입니다; 많은 연구가 프로토타입 또는 시뮬레이션으로 생산 시스템이 아닙니다.
- 클라이언트 데이터 분포는 비IID, IID 또는 명시되지 않는 경우가 많으며, 비IID 분포는 모델 성능에 상당한 영향을 미치고 FedAvg 확장의 초점이 됩니다.
- 통신 효율성, 이질성(통계적 및 시스템적), 데이터 보안, 클라이언트 보안에 대한 연구 활동이 특히 2019년경 급증했습니다; 도전과제로는 드롭아웃 처리, 비 IID에 대한 강건성, 확장성이 있습니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.