Skip to main content
QUICK REVIEW

[論文レビュー] FedCVT: Semi-supervised Vertical Federated Learning with Cross-view Training

Yan Kang, Yang Liu|arXiv (Cornell University)|Aug 25, 2020
Privacy-Preserving Technologies in Data参考文献 24被引用数 13
ひとこと要約

FedCVTは、限られた一致サンプルを用いてモデル性能を向上させる半教師付きの垂直フェデレーテッドラーニングフレームワークを提案する。本手法は、欠損特徴の推定、未ラベルデータに対する仮ラベルの生成、および異なるビュー間で3つの分類器を共同で訓練することで、データの機微性を保ちながら性能を大幅に向上させる。CIFAR10でわずか500個の一致サンプルでの学習において、ヴァナイルVFLを大きく上回り、最大22.7%高い精度を達成する。

ABSTRACT

Federated learning allows multiple parties to build machine learning models collaboratively without exposing data. In particular, vertical federated learning (VFL) enables participating parties to build a joint machine learning model based on distributed features of aligned samples. However, VFL requires all parties to share a sufficient amount of aligned samples. In reality, the set of aligned samples may be small, leaving the majority of the non-aligned data unused. In this article, we propose Federated Cross-view Training (FedCVT), a semi-supervised learning approach that improves the performance of the VFL model with limited aligned samples. More specifically, FedCVT estimates representations for missing features, predicts pseudo-labels for unlabeled samples to expand the training set, and trains three classifiers jointly based on different views of the expanded training set to improve the VFL model's performance. FedCVT does not require parties to share their original data and model parameters, thus preserving data privacy. We conduct experiments on NUS-WIDE, Vehicle, and CIFAR10 datasets. The experimental results demonstrate that FedCVT significantly outperforms vanilla VFL that only utilizes aligned samples. Finally, we perform ablation studies to investigate the contribution of each component of FedCVT to the performance of FedCVT. Code is available at https://github.com/yankang18/FedCVT

研究の動機と目的

  • 参加者間で利用可能な一致サンプルが僅かである場合に生じる垂直フェデレーテッドラーニング(VFL)の性能低下を是正すること。
  • 生データやモデルパラメータを共有せずに、未ラベルで一致しないデータを有効に活用できること。
  • 複数のデータビューにわたるクロスビュー学習を通じて、VFLにおける表現学習と一般化性能の向上を図ること。
  • 生データや完全なモデル重みではなく、中間表現と勾配のみを交換することで、データプライバシーを保護すること。
  • 限られたラベル付きデータを前提とした、多様なデータタイプと実世界のシナリオにおいてFedCVTの有効性を検証すること。

提案手法

  • 一致データから学習された共有表現と固有表現を用いて、未ラベルサンプルの欠損特徴を推定する。
  • 拡張されたデータセット上で訓練された学生モデルを用いて、未ラベルサンプルの仮ラベルを予測する。
  • 3つの異なるデータビューを構築する:元の特徴からなるビュー、推定された特徴からなるビュー、および仮ラベル付きサンプルからなるビュー。
  • 3つのビューを用いて垂直フェデレーテッドラーニングにより3つの分類器を共同で訓練することで、表現学習を強化する。
  • 生データや完全なモデルパラメータではなく、中間表現と勾配のみを交換するプライバシー保護フレームワークを採用する。
  • 前方伝搬と逆伝搬を保護するハイブリッド暗号方式を用いる。

実験結果

リサーチクエスチョン

  • RQ1限られた一致サンプルしか利用できない状況において、半教師付き学習技術が垂直フェデレーテッドラーニングの性能を向上させられるか?
  • RQ2フェデレーテッド環境において、表現推定は未ラベルサンプルの欠損特徴をどれほど効果的に回復できるか?
  • RQ3仮ラベル付けとクロスビュー学習は、ラベル付きデータが限られたVFL環境で、モデルの一般化性能をどの程度向上させるか?
  • RQ4FedCVTは、低データ環境においてヴァナイルVFLを著しく上回る性能を発揮する一方で、プライバシーを保持できるか?
  • RQ5表現推定、仮ラベル付け、クロスビュー学習のうち、どのコンポonentが性能向上に最も寄与しているか?

主な発見

  • CIFAR10において、500個の一致サンプルでの学習で、ヴァナイルVFLに比べ22.66%の精度向上を達成し、40.02%から62.68%に向上した。
  • 10,000個の一致サンプルを用いた場合でも、FedCVTは25,000個のサンプルで学習したローカルモデル(67.74%)を上回り、72.06%の精度を達成した。
  • 表現推定は単体で最大の性能向上をもたらし、500個の一致サンプルでヴァナイルVFLに比べ11%の精度向上を実現した。
  • 表現推定と組み合わせたクロスビュー学習は、4,000個のサンプルでさらに0.6%の精度向上をもたらした。
  • アブレーションスタディの結果、表現推定、仮ラベル付け、クロスビュー学習のすべてのコンポーネントが、最終的な性能向上に加法的に寄与していることが確認された。
  • FedCVTは、NUS-WIDE、Vehicle、CIFAR10の全テストデータセットでヴァナイルVFLを上回り、ラベル付きデータが極めて少ない状況でも高い性能を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。