Skip to main content
QUICK REVIEW

[논문 리뷰] An Encoder-Decoder Based Audio Captioning System With Transfer and Reinforcement Learning

Xinhao Mei, Qiushi Huang|arXiv (Cornell University)|2021. 08. 05.
Music and Audio Processing참고 문헌 21인용 수 20
한 줄 요약

이 논문은 사전 훈련된 오디오 모델(PANNs)에서의 전이 학습과 AudioCaps에서의 도메인 내 미세조정을 활용한 CNN-Transformer 오디오 캡셔닝 시스템을 제안한다. 이 시스템은 CIDEr 점수를 최적화하기 위해 강화 학습을 통합하였으며, DCASE 2021 Task 6에서 3위를 기록했다. 이는 대부분의 지표에서 최신 기술의 앙상블 모델을 능가했지만, 강화 학습으로 인해 "배경에서"와 같은 반복적인 표현이 캡처에 포함되는 문제가 있었다.

ABSTRACT

Automated audio captioning aims to use natural language to describe the content of audio data. This paper presents an audio captioning system with an encoder-decoder architecture, where the decoder predicts words based on audio features extracted by the encoder. To improve the proposed system, transfer learning from either an upstream audio-related task or a large in-domain dataset is introduced to mitigate the problem induced by data scarcity. Besides, evaluation metrics are incorporated into the optimization of the model with reinforcement learning, which helps address the problem of ``exposure bias'' induced by ``teacher forcing'' training strategy and the mismatch between the evaluation metrics and the loss function. The resulting system was ranked 3rd in DCASE 2021 Task 6. Ablation studies are carried out to investigate how much each element in the proposed system can contribute to final performance. The results show that the proposed techniques significantly improve the scores of the evaluation metrics, however, reinforcement learning may impact adversely on the quality of the generated captions.

연구 동기 및 목표

  • 오디오 캡셔닝에서 데이터 부족 문제를 해결하기 위해 상游 오디오 작업과 도메인 내 데이터셋에서의 전이 학습을 적용한다.
  • 훈련 손실과 평가 지표 간의 괴리를 줄이기 위해 CIDEr를 강화 학습을 통해 모델 최적화에 통합한다.
  • 평가 지표 점수를 넘어서 캡처 품질에 미치는 강화 학습의 영향을 조사한다.
  • 단일 모odal 사전 훈련과 다중 모odal 전이 학습(오디오 및 언어)의 효과성을 평가한다.
  • 자동 평가 지표와 인간 평가 간의 괴이성을 분석한다.

제안 방법

  • 시스템은 오디오 입력에서 로그 멜 스펙트로그램 특징을 추출하기 위해 10층의 CNN 인코더(기본은 PANNs)를 사용한다.
  • Transformer 디코더는 인코더 특징과 이전에 생성된 토큰에 조건을 두고 자동적으로 캡처를 생성한다.
  • 전이 학습은 사전 훈련된 PANNs 인코더를 사용하고 AudioCaps 데이터셋에서 미세조정하여 오디오 및 언어 표현 학습을 향상시킨다.
  • 강화 학습은 CIDEr를 보상 신호로 사용하여 훈련을 평가 지표와 직접적으로 일치시킨다.
  • 정책 기반 강화 학습 방법을 사용하여 생성된 캡처의 CIDEr 점수에 기반해 디코더 파라미터를 업데이트한다.
  • 제거 실험은 전이 학습 및 강화 학습이 없는 모델과의 비교를 통해 각 구성 요소의 기여도를 분리한다.

실험 결과

연구 질문

  • RQ1PANNs와 AudioCaps에서의 사전 훈련이 랜덤 초기화로 훈련하는 것과 비교해 오디오 캡셔닝 성능에 어떤 영향을 미치는가?
  • RQ2강화 학습이 CIDEr 및 SPICE와 같은 자동 평가 지표에 얼마나 기여하는가?
  • RQ3지표 향상에도 불구하고 강화 학습이 생성된 캡처의 유창성과 의미적 품질을 떨어뜨리는가?
  • RQ4오디오 전용 vs. 오디오+언어 전이 학습 전략 간의 성능 및 내성성은 어떻게 비교되는가?
  • RQ5왜 강화 학습은 "배경에서"와 같은 표현의 과다 사용을 유도하는가?

주요 결과

  • 제안된 시스템은 DCASE 2021 Task 6에서 3위를 기록했으며, BLEU-1를 제외한 모든 지표에서 최신 기술의 앙상블 모델을 능가했다.
  • PANNs에서의 사전 훈련은 모든 평가 지표를 크게 향상시켜 강력한 오디오 특징 추출의 중요성을 입증했다.
  • AudioCaps에서의 미세조정은 성능을 추가로 향상시켰으며, 단일 모odal 사전 훈련보다 오디오-언어 통합 전이 학습이 더 효과적임을 확인했다.
  • 강화 학습은 CIDEr, SPICE, CIDEr-D를 포함한 모든 평가 지표를 향상시켰지만, 문법 오류와 반복어가 발생했다.
  • RL 이후 생성된 캡처 중 765개가 "배경에서"를 포함했으며, 이는 RL 없을 경우의 5배에 달했다. 실제 레퍼런스 캡처 중 이 표현을 포함한 것은 302개 뿐이었고, 이는 지표 중심의 과적합을 시사한다.
  • 결과적으로 현재의 자동 평가 지표, 예를 들어 CIDEr는 인간 평가와 완전히 일치하지 않으며, 점수 향상과 함께 캡처 품질이 악화된 점이 드러났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.