[논문 리뷰] Can Audio Captions Be Evaluated with Image Caption Metrics?
이 논문은 문장-BERT를 통한 의미 유사도 측정과 사용자 정의된 오류 검출기(문장의 자연스러움 문제를 보상)를 조합한 새로운 오디오 캡션 평가 지표인 FENSE를 제안한다. 인간이 애너테이션한 두 가지 새로운 벤치마크인 AudioCaps-Eval과 Clotho-Eval에서 평가한 결과, FENSE는 기존 지표보다 쌍대 비교 정확도에서 14–25% 높은 성능을 보이며, 이미지 캡션 지표가 오디오 캡션에 적합하지 않은 것으로 입증되었다. 이는 어조 특화된 오류와 의미 일치 문제로 인해 발생하는 도메인 특화 결함 때문이며, 이미지 캡션 지표는 오디오 캡션 평가에 부적합하다.
Automated audio captioning aims at generating textual descriptions for an audio clip. To evaluate the quality of generated audio captions, previous works directly adopt image captioning metrics like SPICE and CIDEr, without justifying their suitability in this new domain, which may mislead the development of advanced models. This problem is still unstudied due to the lack of human judgment datasets on caption quality. Therefore, we firstly construct two evaluation benchmarks, AudioCaps-Eval and Clotho-Eval. They are established with pairwise comparison instead of absolute rating to achieve better inter-annotator agreement. Current metrics are found in poor correlation with human annotations on these datasets. To overcome their limitations, we propose a metric named FENSE, where we combine the strength of Sentence-BERT in capturing similarity, and a novel Error Detector to penalize erroneous sentences for robustness. On the newly established benchmarks, FENSE outperforms current metrics by 14-25% accuracy. Code, data and web demo available at: https://github.com/blmoistawinde/fense
연구 동기 및 목표
- SPICE 및 CIDEr와 같은 이미지 캡션 지표가 오디오 캡션 평가에 적합한지 조사하기 위해.
- 오디오 캡션 품질 평가에 대한 인간 애너테이션 기반 벤치마크의 부족으로 인해 공정한 지표 평가가 어려운 문제를 해결하기 위해.
- 오디오 캡션의 의미 유사도와 자연스러움 문제를 고려한 더 견고한 평가 지표를 개발하기 위해.
- 쌍대 비교를 통해 고도의 일치도를 확보한 새로운 벤치마크인 AudioCaps-Eval과 Clotho-Eval을 구축하기 위해.
- 현재 사용 중인 지표, 특히 SPICE와 같은 이미지 전용 지표가 오디오 도메인에서 인간 평가와 상관관계를 가지지 못함을 입증하기 위해.
제안 방법
- 쌍대 비교를 통해 절대 평가 대비 높은 일관성 확보를 위해, 인간이 애너테이션한 새로운 평가 벤치마크인 AudioCaps-Eval과 Clotho-Eval을 구축하였다.
- BLEU, ROUGE, METEOR, CIDEr, SPICE, BERTScore, BLEURT와 같은 기존 지표들을 새로운 벤치마크에서 평가하여 인간 평가와의 상관관계를 분석하였다.
- 생성된 캡션과 기준 캡션 간의 의미 유사도를 측정하기 위해 문장 임베딩을 계산함으로써 문장-BERT를 캡션 평가에 재사용하였다.
- 사용자 정의된 BERT 기반 모델을 미세조정하여 자연스럽지 않은 문장, 불완전하거나 일관성 없는 문장과 같은 자연스러움 문제를 식별하는 새로운 오류 검출기(Error Detector)를 설계하였다.
- 문장-BERT와 오류 검출기를 통합하여 자연스러움 오류가 보상되는 통합 지표인 FENSE를 개발하였다.
- 두 데이터셋에서 추론 실험과 정량적 비교를 통해 FENSE의 각 구성 요소 기여도를 검증하였다.

실험 결과
연구 질문
- RQ1SPICE 및 CIDEr와 같은 이미지 캡션 지표를 신뢰성 있게 오디오 캡션 평가에 사용할 수 있는가?
- RQ2기존의 자동 지표들이 오디오 캡션 품질 평가에서 인간 평가와 얼마나 상관관계가 있는가?
- RQ3생성된 캡션의 자연스러움 문제는 표준 평가 지표의 성능에 어느 정도 영향을 미치는가?
- RQ4Sentence-BERT와 같은 사전 학습된 문장 임베딩 모델이 오디오 캡션 평가 정확도를 향상시킬 수 있는가?
- RQ5자연스러움 인식 오류 검출 메커니즘을 통합하면 오디오 캡션 평가 지표의 견고성과 정확도가 상당히 향상되는가?
주요 결과
- FENSE는 AudioCaps-Eval과 Clotho-Eval 양 벤치마크에서 모든 기존 지표를 앞서며, 다음으로 좋은 지표보다 쌍대 비교 정확도에서 14–25% 높은 성능을 기록하였다.
- 이미지 캡션 전용 지표인 SPICE는 어려운 인간 평가 쌍에서 50% 이하의 정확도를 기록하여 오디오 캡션 평가에 부적합함을 확인하였다.
- N-그램 기반 지표인 BLEU 1과 BLEU 4는 어려운 쌍(HC 및 MM)에서 랜덤 추측 수준 이하의 성능을 보이며, 의미적 뉘앙스를 포착하지 못함을 입증하였다.
- 문장-BERT만으로도 뛰어난 성능을 보였지만, 오류 검출기와 조합할 경우 추가로 성능 향상을 보이며, 자연스러움 문제의 영향이 지표 신뢰성에 심각하게 작용함을 입증하였다.
- 보류된 테스트 세트(723개 캡션)에서 오류 검출기는 F1 스코어 85.4를 기록하여 높은 정밀도(96.8%)와 수용 가능한 재현율(76.4%)을 보이며 자연스러움 오류 식별 능력을 입증하였다.
- 인간 평가와 FENSE는 캡션 시스템 순위 매기기에 강력한 일치를 보였지만, SPICE는 인간 선호도와 일치하지 않으며, 특히 가장 가까운 이웃 기반 베이스라인을 최악의 순위로 평가하는 데 실패하였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.