Skip to main content
QUICK REVIEW

[논문 리뷰] Vertical Federated Learning: A Structured Literature Review

Afsana Khan, Marijn ten Thij|arXiv (Cornell University)|2022. 12. 01.
Privacy-Preserving Technologies in Data인용 수 9
한 줄 요약

이 구조적 문헌 고찰은 수직 분할된 데이터에서 공동으로 모델을 훈련하는 조직 간의 협업을 가능하게 하는 프라이버시 보장 기반 기계학습 패러다임인 수직 연합 학습(VFL)에 대한 종합적인 분석을 제공한다. 이 논문은 통신, 학습, 프라이버시, 비즈니스 가치 분야에서의 핵심 과제를 규명하고, 최신 기술적 해결책과 8개의 향후 연구 방향(예: 프라이버시 보장 기반 특징 선택, 공정성, 인cent리브 메커니즘, 해석 가능성)을 제시한다.

ABSTRACT

Federated Learning (FL) has emerged as a promising distributed learning paradigm with an added advantage of data privacy. With the growing interest in having collaboration among data owners, FL has gained significant attention of organizations. The idea of FL is to enable collaborating participants train machine learning (ML) models on decentralized data without breaching privacy. In simpler words, federated learning is the approach of ``bringing the model to the data, instead of bringing the data to the mode''. Federated learning, when applied to data which is partitioned vertically across participants, is able to build a complete ML model by combining local models trained only using the data with distinct features at the local sites. This architecture of FL is referred to as vertical federated learning (VFL), which differs from the conventional FL on horizontally partitioned data. As VFL is different from conventional FL, it comes with its own issues and challenges. In this paper, we present a structured literature review discussing the state-of-the-art approaches in VFL. Additionally, the literature review highlights the existing solutions to challenges in VFL and provides potential research directions in this domain.

연구 동기 및 목표

  • 연구자들을 대상으로 수직 연합 학습(VFL) 분야의 현재 최신 기술 동태를 체계적으로 개관하기 위해.
  • 통신, 학습, 프라이버시 및 보안, 비즈니스 가치 차원에서 VFL 분야의 핵심 과제를 식별하고 분류하기 위해.
  • 이러한 과제를 해결하기 위한 기존의 해결책과 방법론을 VFL 시스템에서 분석하기 위해.
  • 개방된 연구 문제를 부각시키고, 프라이버시 보장 기반 특징 선택, 공정성, 인센티브 메커니즘, 해석 가능성 등을 포함한 8개의 향후 연구 방향을 제안하기 위해.
  • 의료, 금융 및 기타 데이터 민감도가 높은 분야에서의 실생활 응용을 위한 안전하고 공정하며 확장 가능한 VFL 시스템 개발을 지원하기 위해.

제안 방법

  • 기술적, 프라이버시적, 비즈니스적 측면에 중점을 두고, VFL에 관한 동료 심사 및 프리프린트 논문을 대상으로 구조적 문헌 고찰을 수행하였다.
  • 통신 효율성, 모델 수렴, 암호 보안, 데이터 프라이버시 처리 방식에 따라 기존 VFL 기법을 분류하였다.
  • 통신, 학습, 프라이버시 및 보안, 비즈니스 가치의 네 가지 핵심 범주에서 과제에 대응하는 해결책을 매핑하였다.
  • VFL 프레임워크에서 모델 업데이트 및 특징 표현을 보호하기 위해 사용되는 암호 기법(예: 안전한 집계, 히든 암호화, 비밀 공유)의 활용을 평가하였다.
  • VFL 인센티브 메커니즘에서 클라이언트 기여도를 측정하기 위해 공동 게임 이론, 특히 케일리 값(Shapley values)의 적용을 분석하였다.
  • 의사결정 해석 가능성과 편향 완화를 위해 설명 가능성 AI(XAI) 및 공정성 인식 학습 기법의 적용 동향을 탐색하였다.

실험 결과

연구 질문

  • RQ1수직 연합 학습(VFL)에서의 핵심 기술적, 프라이버시적, 비즈니스 과제는 무엇인가?
  • RQ2기존의 해결책은 VFL에서 통신 효율성, 모델 수렴, 데이터 프라이버시를 어떻게 해결하는가?
  • RQ3VFL에서 안전한 협업을 가능하게 하는 주요 암호 기법과 기계학습 기법은 무엇인가?
  • RQ4비동일한, 수직으로 분할된 데이터 소스에서 훈련된 VFL 모델에서 공정성과 편향을 어떻게 완화할 수 있는가?
  • RQ5프라이버시 보장과 악성 행동 탐지 조건을 유지하면서 데이터 기여자를 공정하게 보상할 수 있는 인센티브 메커니즘은 무엇인가?

주요 결과

  • VFL은 동일한 샘플에 대해 서로 다른 특징을 보유한 조직 간에 원시 데이터를 공유하지 않으면서도 협업 기반의 모델 훈련을 가능하게 하여 프라이버시를 보장한다.
  • 통신 오버헤드는 여전히 VFL의 주요 과제이며, 특히 클라이언트와 중앙 서버 간의 빈번한 모델 파rameter 교환으로 인해 발생한다.
  • 안전한 집계 및 히든 암호화와 같은 암호 기법이 VFL 훈련 중 모델 업데이트 및 특징 표현을 보호하는 데 널리 사용된다.
  • 다른 기술적 진전에도 불구하고, VFL에서의 프라이버시 보장 기반 특징 선택은 여전히 탐색이 부족한 영역이며, 중대한 개방형 연구 과제로 남아 있다.
  • 데이터 이질성과 비동기 업데이트로 인해 VFL에서의 공정성 확보가 어렵고, 이러한 환경에서 편향 없는 모델 훈련을 보장하는 방법이 거의 존재하지 않는다.
  • 셰플리 값(Shapley values) 기반 인센티브 메커니즘이 일반적이지만 계산 비용이 높으며, 향후에는 보다 적합한 공동 게임 이론 개념과 참가자 선별 전략이 유망한 연구 방향으로 제시된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.