Skip to main content
QUICK REVIEW

[논문 리뷰] Talk, Don't Write: A Study of Direct Speech-Based Image Retrieval

Ramon Sanabria, Austin Waters|arXiv (Cornell University)|2021. 04. 05.
Multimodal Machine Learning Applications참고 문헌 36인용 수 6
한 줄 요약

이 논문은 자기지도 학습된 음성 표현을 사용하는 이중 인코더 아키텍처를 활용한 직접 음성 기반 이미지 검색 방법을 제안하며, Flickr Audio (+11.4% R@1) 및 Places Audio (+25.8% R@1)에서 최신 기준 성능을 달성한다. 종합적으로, 음성 인코딩을 종단 간(end-to-end)으로 수행할 경우, 특히 외래 발음이나 즉흥적인 말하기의 경우, 음성 인식(ASR) 기반 텍스트 인코딩보다 우수한 성능을 보이며, 번역 오류를 제거하고 합성 음성 데이터에 대한 강력한 사전 훈련을 활용함으로써 성능 향상을 이룬다.

ABSTRACT

Speech-based image retrieval has been studied as a proxy for joint representation learning, usually without emphasis on retrieval itself. As such, it is unclear how well speech-based retrieval can work in practice -- both in an absolute sense and versus alternative strategies that combine automatic speech recognition (ASR) with strong text encoders. In this work, we extensively study and expand choices of encoder architectures, training methodology (including unimodal and multimodal pretraining), and other factors. Our experiments cover different types of speech in three datasets: Flickr Audio, Places Audio, and Localized Narratives. Our best model configuration achieves large gains over state of the art, e.g., pushing recall-at-one from 21.8% to 33.2% for Flickr Audio and 27.6% to 53.4% for Places Audio. We also show our best speech-based models can match or exceed cascaded ASR-to-text encoding when speech is spontaneous, accented, or otherwise hard to automatically transcribe.

연구 동기 및 목표

  • 직접 음성 기반 이미지 검색 전략이 ASR 기반 텍스트 검색 전략에 비해 실용적으로 얼마나 효과적인지 평가하는 것.
  • 다양한 음성 및 이미지 인코더 아키텍처, 사전 훈련 방법, 음성 표현 방식이 검색 성능에 미치는 영향을 조사하는 것.
  • 특히 저자원 또는 잡음이 많은 음성 환경에서 종단 간 음성 인코딩이 계단식 ASR + 텍스트 인코딩을 능가할 수 있는지 확인하는 것.
  • 이전에 결과가 없었던 Localized Narratives 데이터셋에 대해 음성-이미지 검색을 위한 강력한 베이스라인을 설정하는 것.
  • 재현성과 다중모odal 표현 학습 분야에서의 재사용을 위해 모델(Milan)을 오픈소스로 제공하는 것.

제안 방법

  • 음성 및 이미지 모odal에 대해 별도로 훈련 가능한 인코더를 갖춘 이중 인코더 아키텍처를 사용하며, 각 모달은 고정 길이의 벡터로 임베딩된다.
  • ASR 전사에 의존하지 않기 위해 음성 인코더의 입력으로 자기지도 학습된 음성 표현(예: CPC-8k, wav2vec)을 사용한다.
  • 실제 데이터셋에 대한 미세조정 이전에 음성과 이미지 표현을 정렬하기 위해 합성된 말하기 캡션(Conceptual Spoken Captions)을 기반으로 다중모달 사전 훈련을 수행한다.
  • 일반화 성능 향상을 위해 이미지 타워에는 ImageNet, 텍스트 타워에는 Conceptual Captions를 각각 기반으로 강력한 사전 훈련을 수행한다.
  • 긍정적인 이미지-음성 쌍은 가까이, 부정적인 쌍은 멀리 오도록 하는 대비 손실 함수를 사용하여 대비 학습을 통해 모델을 훈련시킨다.
  • 세 가지 데이터셋(다양한 음성 특성 포함)에서 표준 검색 메트릭, 특히 R@1을 사용해 성능을 평가한다.

실험 결과

연구 질문

  • RQ1저품질 또는 외래 발음의 음성에서 직접 음성 인코딩이 계단식 ASR + 텍스트 인코딩보다 우수한가?
  • RQ2다양한 음성 도메인에서 다양한 음성 표현 방법(예: MFCC, wav2vec, CPC)이 검색 성능에 어떤 영향을 미치는가?
  • RQ3합성 음성(예: 미국 영어 TTS)에 대해 사전 훈련한 후, 다른 발음(예: 인도 영어)을 가진 실세계 데이터셋에 대해 미세조정할 경우 성능이 떨어지는가?
  • RQ4모델 용량, 배치 크기, 사전 훈련 전략이 다양한 크기와 음성 품질을 가진 데이터셋에서 검색 성능에 어떤 영향을 미치는가?
  • RQ5통합된 종단 간 음성 인코더가 이전에 보고되지 않은 벤치마크인 Localized Narratives에서 최신 기준 성능을 달성할 수 있는가?

주요 결과

  • 최적의 모델 설정에서 Flickr Audio에서 R@1이 33.2%를 기록하며, 이는 이전 최신 기준(21.8%) 대비 11.4%포인트 향상된 성과이다.
  • Places Audio에서는 R@1이 53.4%에 도달하여 이전 최신 기준(27.6%) 대비 25.8%포인트 향상되었다.
  • Localized Narratives 데이터셋에서는 음성-이미지 검색 분야에서 처음으로 보고된 결과를 기록했으며, Places Audio에서 R@1이 53.4%, Flickr Audio에서 33.2%를 기록했다.
  • LocNarr(인도 영어, 낮은 ASR 품질)에서 직접 음성 인코딩이 ASR + 텍스트 인코딩을 능가하여, 발음과 불순한 말하기에 대한 강건성을 입증했다.
  • PlacesAudio(미국 영어, 높은 품질의 ASR)에서는 ASR 기반 성능과 유사하게 유지되었지만, LocNarr에서는 ASR 기반 성능을 초월했다.
  • 합성된 미국 영어 음성에 대해 사전 훈련한 결과, 인도 영어 음성(LocNarr)에서는 성능 저하가 발생하여 합성 데이터의 도메인 이탈 문제를 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.