Skip to main content
QUICK REVIEW

[논문 리뷰] Unimodal Training-Multimodal Prediction: Cross-modal Federated Learning with Hierarchical Aggregation

Rongyu Zhang, Xiaowei Chi|arXiv (Cornell University)|2023. 03. 27.
Traffic Prediction and Management Techniques인용 수 5
한 줄 요약

이 논문은 교차 모달 연합 학습을 위한 계층적 집계 프레임워크인 HA-Fedformer를 제안하며, 훈련 클라이언트에서 단모달 데이터만을 사용하여 다모달 예측을 가능하게 한다. 불확실성 인식 인코더 집계와 교차 모달 디코더 정렬을 결합함으로써, CMU-MOSI 및 CMU-MOSEI 벤치마크에서 최신 기술(SOTA) 방법보다 15–20% 성능 향상을 달성한다.

ABSTRACT

Multimodal learning has seen great success mining data features from multiple modalities with remarkable model performance improvement. Meanwhile, federated learning (FL) addresses the data sharing problem, enabling privacy-preserved collaborative training to provide sufficient precious data. Great potential, therefore, arises with the confluence of them, known as multimodal federated learning. However, limitation lies in the predominant approaches as they often assume that each local dataset records samples from all modalities. In this paper, we aim to bridge this gap by proposing an Unimodal Training - Multimodal Prediction (UTMP) framework under the context of multimodal federated learning. We design HA-Fedformer, a novel transformer-based model that empowers unimodal training with only a unimodal dataset at the client and multimodal testing by aggregating multiple clients' knowledge for better accuracy. The key advantages are twofold. Firstly, to alleviate the impact of data non-IID, we develop an uncertainty-aware aggregation method for the local encoders with layer-wise Markov Chain Monte Carlo sampling. Secondly, to overcome the challenge of unaligned language sequence, we implement a cross-modal decoder aggregation to capture the hidden signal correlation between decoders trained by data from different modalities. Our experiments on popular sentiment analysis benchmarks, CMU-MOSI and CMU-MOSEI, demonstrate that HA-Fedformer significantly outperforms state-of-the-art multimodal models under the UTMP federated learning frameworks, with 15%-20% improvement on most attributes.

연구 동기 및 목표

  • 기존의 다모달 연합 학습 방법이 모든 클라이언트가 다수의 모달리티에 접근해야 하는 제한점을 해결하기 위해.
  • 클라이언트가 단모달 데이터(예: 텍스트, 오디오, 영상)만을 보유하고 있을 때에도 효과적인 다모달 모델 학습을 가능하게 하여 데이터 프라이버시를 유지하기 위해.
  • 단모달 학습 설정에서 데이터의 비독립(identically distributed, non-IID) 분포와 모달리티 순서가 일치하지 않는 문제를 해결하기 위해.
  • 직접적인 데이터 공유 없이 단모달 모델들로부터의 지식을 융합하는 새로운 집계 전략을 개발하기 위해.

제안 방법

  • 클라이언트가 단모달 데이터로 학습하지만 글로벌 모델이 다모달 추론을 가능하게 하는 '단모달 학습 - 다모달 예측(UTMP)' 프레임워크를 제안한다.
  • 모달리티별 인코더와 공유되는 교차 모달 디코더를 갖춘 트랜스포머 기반 모델인 HA-Fedformer를 도입한다.
  • 계층별 마르코프 체인 몬테카를로 샘플링을 사용하여 불확실성 추정 및 데이터 non-IID 영향 완화를 위한 후행 기반 인코더 집계(PbEA)를 적용한다.
  • 모델 가중치 내 숨겨진 신호 상관관계를 캡처하여 서로 다른 모달리티에서 학습된 디코더를 정렬하기 위해 교차 모달 디코더 집계(CmDA)를 설계한다.
  • 계층적 집계를 적용: 인코더에는 PbEA, 디코더에는 CmDA를 사용하여 단모달 클라이언트 간에 강력한 지식 전이가 가능하도록 한다.
  • 수렴 상태 모니터링과 통계적 유의성 검증(윌콕슨 부호 순위 검정)을 위해 검증 손실 기반 접근법을 사용하여 복잡한 환경에서의 안정성 평가를 수행한다.

실험 결과

연구 질문

  • RQ1클라이언트가 기여하는 데이터가 단모달일 때, 연합 학습 환경에서 다모달 모델을 효과적으로 학습할 수 있는가?
  • RQ2간단한 표현 방식(예: 텍스트)을 갖는 단모달 데이터로 학습할 경우, 데이터 non-IID 문제를 어떻게 완화할 수 있는가?
  • RQ3다른 모달리티에서 학습된 디코더 간의 숨겨진 신호 상관관계를 활용하여 특징 수준의 정렬 없이도 일치하지 않는 순서를 정렬할 수 있는가?
  • RQ4UTMP 환경에서 기존의 연합 평균 기반 방법과 비교해 계층적 집계(인코더 및 디코더 집계)가 성능 향상에 뚜렷한 기여를 하는가?

주요 결과

  • HA-Fedformer는 CMU-MOSEI에서 상관관계 점수(Corr) 0.625, CMU-MOSI에서 0.54를 기록하여 기준 방법 대비 15–20% 향상된 성능을 달성한다.
  • FedMSplit 및 기타 SOTA 기준 방법보다 유의미하게 뛰어나며, 모든 지표에서 일측 위험 수준 0.01 이하의 p-값을 기록한다.
  • 절단 실험 결과, 어떤 모달리티도 제거할 경우 성능 저하가 발생하며, 특히 텍스트(L)가 가장 큰 영향을 미치지만, 이중 모달 학습조차도 대부분의 기준 방법을 능가한다.
  • 계층적 집계(PbEA + CmDA)는 Acc7 및 Corr 지표에서 뚜렷한 성능 향상을 이끌어내어 non-IID 및 일치하지 않는 데이터에 대한 효과성을 입증한다.
  • PbEA에서 최적의 샘플 크기 S = 5 또는 7일 때 성능이 가장 우수하며, S = 10일 경우 과적합 현상이 발생함을 확인하여 수렴 속도와 일반화 능력 사이의 상충 관계를 확인한다.
  • 모달리티 누락 시나리오(MR = 0.3에서 0.7)에서도 HA-Fedformer는 강력한 내구성을 유지하며, 70% 모달리티 누락 비율에서도 FedMSplit를 능가한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.