[논문 리뷰] Balanced Multimodal Learning via On-the-fly Gradient Modulation
이 논문은 일반화 향상 기반의 실시간 기울기 조절(OGM-GE)을 제안한다. 이 방법은 다중모odal 모델 최적화를 동적으로 조절하기 위해 모odal 기여도 차이를 기반으로 기울기를 조절하며, 일반화 능력을 유지하기 위해 적응형 가우시안 노이즈를 주입한다. 다양한 다중모달 벤치마크에서 일관된 성능 향상을 이끌어내며, 특히 아키텍처 변경 없이도 최적화가 부족한 모달의 표현을 향상시킨다.
Multimodal learning helps to comprehensively understand the world, by integrating different senses. Accordingly, multiple input modalities are expected to boost model performance, but we actually find that they are not fully exploited even when the multimodal model outperforms its uni-modal counterpart. Specifically, in this paper we point out that existing multimodal discriminative models, in which uniform objective is designed for all modalities, could remain under-optimized uni-modal representations, caused by another dominated modality in some scenarios, e.g., sound in blowing wind event, vision in drawing picture event, etc. To alleviate this optimization imbalance, we propose on-the-fly gradient modulation to adaptively control the optimization of each modality, via monitoring the discrepancy of their contribution towards the learning objective. Further, an extra Gaussian noise that changes dynamically is introduced to avoid possible generalization drop caused by gradient modulation. As a result, we achieve considerable improvement over common fusion methods on different multimodal tasks, and this simple strategy can also boost existing multimodal methods, which illustrates its efficacy and versatility. The source code is available at \url{https://github.com/GeWu-Lab/OGM-GE_CVPR2022}.
연구 동기 및 목표
- 다중모달 학습에서 한 모달이 학습을 지배하고 다른 모달이 최적화가 부족해지는 최적화 불균형 문제를 해결하기 위해.
- 다중모달 모델이 단모달 기준선보다 우수한 성능을 내더라도, 양방향 모달 인코더의 표현 품질을 향상시키기 위해.
- 아키텍처나 학습 오버헤드 없이 기존 융합 방법을 향상시키는 플러그인 전략을 개발하기 위해.
- 기울기 조절 중 일반화 능력을 유지하기 위해 적응형 노이즈를 도입하기 위해.
제안 방법
- 실시간 기울기 조절(OGM)은 학습 도중 각 모달의 공동 손실에 기여하는 정도의 차이를 동적으로 모니터링한다.
- 기울기 조절은 이러한 차이에 기반해 각 모달의 최적화 강도를 조절하며, 최적화가 부족한 모달에게 더 많은 업데이트를 제공한다.
- 일반화 향상(GE)은 조절으로 인해 감소하는 확률적 기울기 노이즈를 상쇄하기 위해 동적으로 변화하는 가우시안 노이즈를 주입한다.
- 이 방법은 SGD 및 Adam과 같은 표준 최적화기와 호환되며, 일반적인 초기 융합 및 고급 융합 아키텍처 모두에 적용 가능하다.
- 학습률과 배치 크기에 기반해 노이즈 강도를 조절하여 일반화 성능과 양의 상관관계를 유지한다.
- 추가 분류기나 사전 학습 없이도 종단 간 학습 중에 전체적으로 적용된다.
실험 결과
연구 질문
- RQ1다중모달 모델에서 공동 모델이 단모달 기준선을 초월하더라도, 왜 단모달 표현이 여전히 최적화가 부족한가?
- RQ2다중모달 학습 환경에서 기울기 흐름을 어떻게 적응적으로 조절하여 모달 간 최적화 균형을 맞출 수 있는가?
- RQ3기울기 조절이 모델 일반화에 어떤 영향을 미치며, 이를 어떻게 완화할 수 있는가?
- RQ4제안된 방법은 다양한 최적화기, 융합 전략, 데이터셋에 일반적으로 적용 가능한가?
주요 결과
- VGGSound에서 OGM-GE는 SGD를 사용할 때 시각 모달 성능을 49.1%에서 50.6%로, 청각 모달을 49.1%에서 50.6%로 향상시켜 양쪽 모달에 대해 일관된 성능 향상을 보였다.
- CREMA-D에서 OGM-GE는 SGD를 사용할 때 성능을 51.7%에서 61.9%로, Adam을 사용할 때는 49.7%에서 54.6%로 향상시켜 다양한 최적화기에서의 효과를 입증했다.
- 동일한 학습 설정에서 노이즈를 추가했을 때 OGM-GE는 VGGSound에서 48.3%에서 50.3%로, CREMA-D에서 50.4%에서 60.2%로 성능 향상을 보였다.
- 작은 배치 크기와 큰 학습률이 더 좋은 성능을 내어, 노이즈 강도와 일반화 성능 간 이론적 연관성을 검증했다.
- 기본 및 고급 융합 방법을 모두 사용할 때, OGM-GE는 Kinetics-Sounds 및 VGGSound를 포함한 네 개의 다중모달 데이터셋에서 일관된 향상을 이뤘다.
- SGD와 Adam 최적화기 모두와 함께 효과적으로 작동하여 광범위한 호환성과 플러그인 유용성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.