Skip to main content
QUICK REVIEW

[論文レビュー] Can Audio Captions Be Evaluated with Image Caption Metrics?

Zelin Zhou, Zhiling Zhang|arXiv (Cornell University)|Oct 10, 2021
Natural Language Processing Techniques被引用数 7
ひとこと要約

本稿では、意味的類似度を測るためのSentence-BERTと、文の流れの問題をペナルティ化する独自のエラー検出器を組み合わせた、音声キャプション評価用の新規メトリクスFENSEを提案する。2つの新しい人間アノテート済みベンチマーク、AudioCaps-EvalおよびClotho-Evalを用いた評価において、FENSEは既存のメトリクスよりも14–25%高いペairwise比較精度を達成した。これは、画像キャプション評価メトリクスが、文の流れや意味的整合性に関するドメイン特有の欠陥を有するため、音声キャプション評価には不適切であることを示している。

ABSTRACT

Automated audio captioning aims at generating textual descriptions for an audio clip. To evaluate the quality of generated audio captions, previous works directly adopt image captioning metrics like SPICE and CIDEr, without justifying their suitability in this new domain, which may mislead the development of advanced models. This problem is still unstudied due to the lack of human judgment datasets on caption quality. Therefore, we firstly construct two evaluation benchmarks, AudioCaps-Eval and Clotho-Eval. They are established with pairwise comparison instead of absolute rating to achieve better inter-annotator agreement. Current metrics are found in poor correlation with human annotations on these datasets. To overcome their limitations, we propose a metric named FENSE, where we combine the strength of Sentence-BERT in capturing similarity, and a novel Error Detector to penalize erroneous sentences for robustness. On the newly established benchmarks, FENSE outperforms current metrics by 14-25% accuracy. Code, data and web demo available at: https://github.com/blmoistawinde/fense

研究の動機と目的

  • 画像キャプション評価メトリクス(例:SPICE や CIDEr)が音声キャプションの評価に適しているかどうかを調査すること。
  • 音声キャプション品質のための人的アノテーション済みベンチマークの不足が、公平なメトリクス評価を妨げているという問題に対処すること。
  • 意味的類似度と文の流れの問題を考慮した、より頑健な評価メトリクスの開発。
  • ペアワイズ比較を用いて高相互アノテーター整合性を確保するため、AudioCaps-EvalおよびClotho-Evalという新しいベンチマークを確立すること。
  • 現在のメトリクス、特に画像固有のもの(例:SPICE)が音声ドメインにおいて人間の判断と相関しないことを実証すること。

提案手法

  • ペアワイズ比較を用いて、相互アノテーター整合性を向上させるために、2つの新しい人間アノテート済み評価ベンチマーク、AudioCaps-EvalおよびClotho-Evalを構築した。
  • BLEU、ROUGE、METEOR、CIDEr、SPICE、BERTScore、BLEURTといった既存のメトリクスを、新しいベンチマーク上で評価し、人間の判断との相関を測定した。
  • 生成キャプションとリファレンスキャプション間の意味的類似度を測るために、文の埋め込みを計算することで、Sentence-BERTをキャプション評価に再利用した。
  • 微調整されたBERTベースのモデルを用いて、文の途中で途切れている、または一貫性のない文などの文の流れの問題を特定する、新しいエラー検出器を設計した。
  • Sentence-BERTとエラー検出器を統合し、文の流れのエラーをペナルティ化することで、より頑健なメトリクスFENSEを構築した。
  • 2つのデータセットにおけるアブレーションスタディと定量的比較を通じて、FENSEの各コンポonentの貢献を検証した。
Fig. 1 : Column A, B and C shows the corresponding scores of Caption A, B and C given by different metrics. One cell is colored if the caption is favoured by a certain metric of this row.
Fig. 1 : Column A, B and C shows the corresponding scores of Caption A, B and C given by different metrics. One cell is colored if the caption is favoured by a certain metric of this row.

実験結果

リサーチクエスチョン

  • RQ1SPICE や CIDEr といった画像キャプション評価メトリクスを、音声キャプションの評価に信頼性を持って使用できるか?
  • RQ2既存の自動メトリクスは、音声キャプション品質の評価において、人間の判断とどの程度相関しているか?
  • RQ3生成キャプションに含まれる文の流れの問題が、標準的な評価メトリクスの性能にどの程度影響を与えるか?
  • RQ4Sentence-BERT などの事前学習済み文の埋め込みモデルは、音声キャプションの評価精度を向上させることができるか?
  • RQ5文の流れに配慮したエラー検出メカニズムを統合することで、音声キャプション評価メトリクスの頑健性と正確性が顕著に向上するか?

主な発見

  • FENSEは、AudioCaps-EvalおよびClotho-Evalの両方で、すべての既存メトリクスを上回り、次に良いメトリクスよりも14–25%高いペアワイズ比較精度を達成した。
  • 画像キャプション特有のメトリクス(例:SPICE)は性能が低く、困難な人間判断ペアでは50%未満の正確性を示し、音声キャプション評価には不適切であることが確認された。
  • n-gramベースのメトリクス(例:BLEU 1 と BLEU 4)は、難易度の高いペア(HC と MM)ではランダムな推測と同等の性能にとどまり、意味のニュアンスを捉える能力に欠けていることが示された。
  • Sentence-BERT単体でも高い性能を示したが、エラー検出器を組み合わせることでさらなる向上が得られた。これは、文の流れの問題がメトリクスの信頼性に顕著に影響を与えることを裏付けた。
  • ホールドアウトテストセット(723件のキャプション)において、エラー検出器は85.4のF1スコアを達成し、正確性(96.8%)は高く、適切な再現率(76.4%)を示した。
  • 人間の判断とFENSEは、キャプションシステムの順位付けにおいて強い一致を示したが、SPICEは人間の好みと一致せず、特に最近傍のベースラインを最悪の順位に評価した。
Fig. 2 : Illustration of judgments made by humans, FENSE and SPICE on Clotho-Eval. y-axis shows the win fractions of 4 audio captioning systems.
Fig. 2 : Illustration of judgments made by humans, FENSE and SPICE on Clotho-Eval. y-axis shows the win fractions of 4 audio captioning systems.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。