Skip to main content
QUICK REVIEW

[논문 리뷰] AudioCLIP: Extending CLIP to Image, Text and Audio

Andrey Guzhov, Federico Raue|arXiv (Cornell University)|2021. 06. 24.
Music and Audio Processing인용 수 4
한 줄 요약

이 논문은 CLIP 모델의 삼중모달 확장판인 AudioCLIP을 제안하며, ESResNeXt 기반 오디오 인코더를 CLIP의 시각-텍스트 대비 학습 프레임워크와 통합함으로써 제로샷 오디오 분류 및 교차모달 쿼리 기능을 가능하게 한다. 모델은 UrbanSound8K에서 90.07%의 최고 성능을 기록하고 ESC-50에서는 97.15%의 최고 성능을 달성하였으며, 각각 제로샷 기준선으로서 68.78%와 69.40%의 새로운 기록을 수립하였다.

ABSTRACT

In the past, the rapidly evolving field of sound classification greatly benefited from the application of methods from other domains. Today, we observe the trend to fuse domain-specific tasks and approaches together, which provides the community with new outstanding models. In this work, we present an extension of the CLIP model that handles audio in addition to text and images. Our proposed model incorporates the ESResNeXt audio-model into the CLIP framework using the AudioSet dataset. Such a combination enables the proposed model to perform bimodal and unimodal classification and querying, while keeping CLIP's ability to generalize to unseen datasets in a zero-shot inference fashion. AudioCLIP achieves new state-of-the-art results in the Environmental Sound Classification (ESC) task, out-performing other approaches by reaching accuracies of 90.07% on the UrbanSound8K and 97.15% on the ESC-50 datasets. Further it sets new baselines in the zero-shot ESC-task on the same datasets (68.78% and 69.40%, respectively). Finally, we also assess the cross-modal querying performance of the proposed model as well as the influence of full and partial training on the results. For the sake of reproducibility, our code is published.

연구 동기 및 목표

  • 오디오를 세 번째 모달리티로 포함시켜 시각-텍스트 대비 학습 프레임워크인 CLIP 프레임워크를 확장함으로써, 텍스트, 이미지, 오디오의 공동 표현 학습을 가능하게 하기.
  • AudioSet 데이터셋에서의 대비 학습을 활용하여 오디오 분류의 제로샷 일반화를 가능하게 하기.
  • 제로샷 및 피넷팅된 설정에서 텍스트, 이미지, 오디오 간의 교차모달 쿼리 기능을 평가하기.
  • 모델 성능에 미치는 전체 학습과 부분 학습의 영향을 조사하기.
  • 환경 음향 분류 분야에서 새로운 최고 성능 기록을 수립하고, 재현 가능하며 오픈소스로 구현된 모델을 제공하기.

제안 방법

  • 오디오 입력을 위해 원래의 시각 인코더를 대체하는 ESResNeXt 오디오 모델을 CLIP 프레임워크에 오디오 인코더로 통합한다.
  • AudioSet 데이터셋에서 대비 학습을 통해 오디오 임베딩을 해당 텍스트 및 이미지 임베딩과 정렬한다.
  • 이중 단계 학습 전략을 적용한다: 첫 번째로, 고정된 텍스트 및 이미지 인코더를 사용하여 오디오 헤드를 대비 손실 함수를 기반으로 사전 학습하고, 두 번째로 전체 엔드 투 엔드 피넷팅을 수행한다.
  • 일치하는 텍스트-오디오, 이미지-오디오, 텍스트-이미지 쌍 간의 유사도를 극대화하고, 일치하지 않는 쌍 간의 유사도를 최소화하기 위해 이중지점 대비 손실을 사용한다.
  • 쿼리 임베딩(텍스트, 이미지 또는 오디오)과 클래스별 임베딩 벡터 간의 코사인 유사도를 계산하여 제로샷 추론을 지원한다.
  • ImageNet, AudioSet, UrbanSound8K, ESC-50 등의 여러 데이터셋을 활용하여 P@1, R@1, mAP 등의 지표로 교차모달 검색 성능을 평가한다.

실험 결과

연구 질문

  • RQ1CLIP와 같은 대비 학습 프레임워크가 시각 및 언어 성능에 영향을 주지 않으면서도 오디오를 세 번째 모달리티로 성공적으로 확장할 수 있는가?
  • RQ2오디오, 텍스트, 이미지 인코더의 공동 학습이 환경 음향 분류에서 제로샷 일반화 능력을 얼마나 향상시키는가?
  • RQ3오디오 헤드만을 부분적으로 학습하는 것과 전체 엔드 투 엔드 피넷팅을 비교했을 때, 분류 및 교차모달 쿼리 성능에 어떤 영향을 미치는가?
  • RQ4AudioSet 데이터셋이 모델의 도메인 간 일반화 능력, 특히 UrbanSound8K 및 ESC-50와 같은 후행 오디오 벤치마크로의 일반화 능력에 어떤 영향을 미치는가?
  • RQ5AudioCLIP은 제로샷 및 피넷팅된 설정 모두에서 텍스트, 이미지, 오디오 간 효과적인 교차모달 쿼리 기능을 수행할 수 있는가?

주요 결과

  • 전체 학습 조건에서 AudioCLIP은 UrbanSound8K에서 90.07%의 새로운 최고 성능을 기록하였고, ESC-50에서는 97.15%의 최고 성능을 달성하였다.
  • 모델은 UrbanSound8K에서 68.78%의 새로운 제로샷 분류 기준선을 설정하였고, ESC-50에서는 69.40%를 기록하여 이전 방법들을 크게 앞서갔다.
  • 오디오 헤드만을 부분적으로 학습하는 것만으로도 UrbanSound8K에서 89.95%의 정확도와 ESC-50에서는 96.65%의 정확도를 기록하여 강력한 제로샷 일반화 능력을 입증하였다.
  • 전체 학습은 AudioSet, UrbanSound8K, ESC-50에서의 교차모달 쿼리 성능을 향상시켰으며, 특히 오디오-기반 텍스트 쿼리 및 이미지-기반 오디오 쿼리에서 mAP 향상에 기여하였다.
  • 전체 학습 후 ImageNet 검색 작업에서 성능이 약간 저하되었으며, 이는 ImageNet과 AudioSet 간의 도메인 차이가 존재할 수 있음을 시사한다.
  • 제안된 모델은 모든 텍스트-이미지-오디오 조합에서 효과적인 교차모달 검색을 가능하게 하였으며, 전체 학습 후 ESC-50에서 오디오-기반 텍스트 쿼리 및 텍스트-기반 오디오 쿼리의 mAP 점수가 70%를 초과하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.