Skip to main content
QUICK REVIEW

[논문 리뷰] Revisiting Pre-training in Audio-Visual Learning

Ruoxuan Feng, Wenke Xia|arXiv (Cornell University)|2023. 02. 07.
Speech and Audio Processing인용 수 5
한 줄 요약

이 논문은 음성-시각 학습에서 사전 훈련 모델의 활용도가 낮은 이유로 비정상적인 배치 정규화(BatchNorm) 파라미터와 단모달 인코더 간의 부정적 간섭을 규명한다. 이를 해결하기 위해 사전 훈련된 모델의 사전 훈련 지식를 복원하고 모델 용량을 회복하기 위한 적응형 배치 정규화 재초기화(ABRi)와 양단계로 구성된 융합 튜닝 전략을 제안한다. 이는 Kinetics-Sounds, AVE, UCF-101 등의 데이터셋에서 일관된 성능 향상을 이끌어낸다.

ABSTRACT

Pre-training technique has gained tremendous success in enhancing model performance on various tasks, but found to perform worse than training from scratch in some uni-modal situations. This inspires us to think: are the pre-trained models always effective in the more complex multi-modal scenario, especially for the heterogeneous modalities such as audio and visual ones? We find that the answer is No. Specifically, we explore the effects of pre-trained models on two audio-visual learning scenarios: cross-modal initialization and multi-modal joint learning. When cross-modal initialization is applied, the phenomena of "dead channel" caused by abnormal Batchnorm parameters hinders the utilization of model capacity. Thus, we propose Adaptive Batchnorm Re-initialization (ABRi) to better exploit the capacity of pre-trained models for target tasks. In multi-modal joint learning, we find a strong pre-trained uni-modal encoder would bring negative effects on the encoder of another modality. To alleviate such problem, we introduce a two-stage Fusion Tuning strategy, taking better advantage of the pre-trained knowledge while making the uni-modal encoders cooperate with an adaptive masking method. The experiment results show that our methods could further exploit pre-trained models' potential and boost performance in audio-visual learning.

연구 동기 및 목표

  • 사전 훈련 모델이 이질적인 모달 간의 복잡한 음성-시각 다모달 학습에서 효과적으로 유지되는지 여부를 조사한다.
  • 사전 훈련 모델이 다모달 공동 학습 및 교차 모달 초기화 상황에서 성능이 떨어지는 원인을 진단한다.
  • 사전 훈련 모델 활용도 저하의 근본 원인인 비정상적인 배치 정규화 파라미터와 단모달 인코더 간의 부정적 간섭을 해결한다.
  • 사전 훈련된 모델의 사전 훈련 지식를 복원하고 표현 품질을 유지하면서 인코더 간 협업을 향상시키기 위해 ABRi와 이중 단계 융합 튜닝 전략을 제안한다.
  • 제안된 방법의 효과성과 일반화 능력을 다양한 음성-시각 벤치마크와 모달 간에서 검증한다.

제안 방법

  • 교차 모달 초기화에서 사전 훈련 모델의 사전 훈련 지식를 복원하고 모델 용량을 회복하기 위해 비정상적인 배치 정규화 파라미터를 수정하기 위한 적응형 배치 정규화 재초기화(ABRi)를 제안한다.
  • ABRi 는 학습된 파라미터를 기반으로 배치 정규화 레이어를 적응적으로 재초기화하여 모델 용량을 복원하고 수렴 속도를 향상시킨다.
  • 이중 단계 융합 튜닝 전략을 도입한다: 첫 번째 단계에서는 각 단모달 인코더를 개별적으로 미세조정하여 사전 훈련 지식를 해금하고, 두 번째 단계에서는 샘플별 적응형 마스킹을 사용해 양쪽 인코더를 함께 미세조정한다.
  • 적응형 마스킹 메커니즘은 공동 훈련 중에 정보량이 적은 모달리티 특징을 동적으로 억제하여 학습 균형을 유지하고 간섭을 줄인다.
  • ABRi 와 융합 튜닝을 동시에 적용하여 다모달 모델에서 용량과 지식 활용도 문제를 동시에 해결한다.
  • 이 방법을 UCF-101에서 RGB와 옵티컬 플로우 등의 다른 모달리티와 AVE에서 AGVA 및 PSP 등의 복잡한 상호작용 모듈에 적용하여 일반화 능력을 입증한다.

실험 결과

연구 질문

  • RQ1사전 훈련 모델이 단모달 작업에서는 성공을 거두었음에도 불구하고 음성-시각 학습에서 성능이 떨어지는 이유는 무엇인가?
  • RQ2특히 음성 사전 훈련 모델을 시각 작업에 적용할 때 교차 모달 초기화에서 사전 훈련 모델이 실패하는 원인은 무엇인가?
  • RQ3강력한 사전 훈련 인코더가 존재할 경우 다모달 공동 학습에서 다른 모달리티의 표현 품질에 어떤 영향을 미치는가?
  • RQ4배치 정규화 레이어의 적응형 재초기화가 사전 훈련된 음성-시각 모델의 수렴과 성능 향상에 기여할 수 있는가?
  • RQ5적응형 마스킹을 포함한 이중 단계 튜닝 전략은 단모달 인코더 간 협업을 향상시키면서도 사전 훈련 지식를 유지할 수 있는가?

주요 결과

  • ABRi 는 CIFAR-100에서 성능 향상을 크게 이끌어내었으며, VGGSound 사전 훈련 모델이 ABRi 를 사용해 78.1%의 정확도를 달성하여 랜덤 초기화 훈련보다 뛰어난 성능을 보였다.
  • Kinetics-Sounds에서 ABRi 와 함께 이중 단계 융합 튜닝 전략을 적용하면 정확도가 74.13% (VGGSound 사전 훈련)와 71.89% (ImageNet 사전 훈련)로 상승하여 기준 공동 훈련 성능을 초월했다.
  • Kinetics-Sounds에서 음성 및 시각 인코더 양쪽에 ABRi 를 적용한 결과 성능 저하가 발생했으며, 이는 주로 음성 모달리티를 과도하게 최적화함으로써 시각 학습에 악영향을 미친다는 것을 시사한다.
  • AVE 데이터셋에서 융합 튜닝 전략은 정확도에서 2.1%p 향상(74.13% 대비 72.64%)을 기록했고, mAP에서도 2.1%p 향상(89.00 대비 86.49)을 달성하여 공동 훈련 대비 우수한 성능을 보였다.
  • UCF-101에서 이중 단계 융합 튜닝과 ABRi 를 적용한 결과 정확도가 83.62%를 기록하여 의사결정 융합 대비 2.13%p 향상되고 공동 훈련 대비 4.69%p 향상되어 비음성-시각 모달리티로의 일반화 능력을 입증했다.
  • 제거 분석 결과, Kinetics-Sounds에서 모델 지식 활용도 저하가 주요 장애물임을 확인하였으며, ABRi 만으로는 성능 향상이 미미함을 보여, 사전 훈련 지식 활용 문제의 근본 원인이 사전 훈련 지식 활용 부족임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.