Skip to main content
QUICK REVIEW

[論文レビュー] Soundscape Captioning using Sound Affective Quality Network and Large Language Model

Yuanbo Hou, Qiaoqiao Ren|arXiv (Cornell University)|Jun 9, 2024
Noise Effects and Management被引用数 4
ひとこと要約

本稿では、音響的シーン/イベント認識と受動的感情的質感を統合することで文脈に配慮した音響シーンの記述を自動生成する、自動化されたタスク「サウンドスケープキャプション(SoundSCap)」を紹介する。提案されたSoundSCaperモデルは、マルチスケール音響モデル(SoundAQnet)と大規模言語モデル(LLM)を組み合わせ、専門家水準の品質に匹敵するキャプションを生成する。人間評価においても、5点満点中平均差が0.21~0.25の統計的有意差は認められない。

ABSTRACT

We live in a rich and varied acoustic world, which is experienced by individuals or communities as a soundscape. Computational auditory scene analysis, disentangling acoustic scenes by detecting and classifying events, focuses on objective attributes of sounds, such as their category and temporal characteristics, ignoring their effects on people, such as the emotions they evoke within a context. To fill this gap, we propose the affective soundscape captioning (ASSC) task, which enables automated soundscape analysis, thus avoiding labour-intensive subjective ratings and surveys in conventional methods. With soundscape captioning, context-aware descriptions are generated for soundscape by capturing the acoustic scenes (ASs), audio events (AEs) information, and the corresponding human affective qualities (AQs). To this end, we propose an automatic soundscape captioner (SoundSCaper) system composed of an acoustic model, i.e. SoundAQnet, and a large language model (LLM). SoundAQnet simultaneously models multi-scale information about ASs, AEs, and perceived AQs, while the LLM describes the soundscape with captions by parsing the information captured with SoundAQnet. SoundSCaper is assessed by two juries of 32 people. In expert evaluation, the average score of SoundSCaper-generated captions is slightly lower than that of two soundscape experts on the evaluation set D1 and the external mixed dataset D2, but not statistically significant. In layperson evaluation, SoundSCaper outperforms soundscape experts in several metrics. In addition to human evaluation, compared to other automated audio captioning systems with and without LLM, SoundSCaper performs better on the ASSC task in several NLP-based metrics. Overall, SoundSCaper performs well in human subjective evaluation and various objective captioning metrics, and the generated captions are comparable to those annotated by soundscape experts.

研究の動機と目的

  • 従来、アンケートや専門家評価に依存していた主観的音響スケープ評価の人的負担を軽減するための自動化。
  • 音響環境における客観的音声イベント検出と主観的ヒューマン感情反応のギャップを埋める。
  • 自然言語キャプションのための、音響シーン、イベント、および受動的感情的質感(PAQ)を統合した統一フレームワークの構築。
  • 16名の音響スケープ専門家からなるジャッジによる人間評価を用いて、自動キャプションシステムの性能を専門家と比較評価する。
  • ディープラーニングとLLMを活用し、スケーラブルで文脈に配慮し、感情を反映した複雑な音響環境の記述を可能にする。

提案手法

  • 生の音声から音響シーン(AS)、音声イベント(AE)、受動的感情的質感(PAQ)を同時にモデル化できる、軽量でマルチスケールの深層ニューラルネットワーク「SoundAQnet」を提案。
  • 8Dの音響スケープ円周モデル(SCM)を用いて、快適さ、活発さ、落ち着きといった知覚的属性を、参加者の評価付き大規模データセットで学習。
  • 短時間の顕著なイベント(例:サイレン)と長時間の環境的文脈(例:都市部対森林)の両方を捉えるためにマルチスケール表現を活用。
  • SoundAQnetの出力を一般用途の大規模言語モデル(LLM)と統合し、AS、AE、PAQの3つの視点から自然言語キャプションを生成。
  • ゼロショットまたはフェイントショットのプロンプティング戦略を用いて、モデルの潜在表現から一貫性があり文脈に配慮した記述をLLMが合成できるように誘導。
  • ホールドアウトテストデータおよび多様な音声長さと音響特性を有する外部混合データセットを用いたジャッジベースの人間評価により、システムの妥当性を検証。

実験結果

リサーチクエスチョン

  • RQ1自動化されたシステムは、専門家がアノテートした記述と同等の品質を持つ文脈に配慮した音響スケープキャプションを生成できるか?
  • RQ2音響シーン/イベント認識と受動的感情的質感(PAQ)を統合することで、従来のAS/AE分類と比較して、キャプション生成の性能がどの程度向上するか?
  • RQ3長さや音響特性が異なる多様な音声クリップに対して、モデルはどの程度一般化できるか?
  • RQ4SoundAQnetの感情的質感予測は、個々の専門家の認識と比較して、主観性と一貫性の面でどう異なるか?
  • RQ5SoundSCaperが生成したキャプションと専門家がアノテートしたキャプションとの間の性能差は、統計的に有意か?

主な発見

  • テストセットにおいて、SoundSCaperが生成したキャプションの平均人間評価得点は5点満点中4.29であり、専門家がアノテートしたキャプションの4.50点と比較して0.21ポイントの差であった。
  • 5つのモデルが未知のデータセットを含む外部混合データセットにおいて、SoundSCaperの平均得点は4.25点であったのに対し、専門家がアノテートしたキャプションは4.50点で、差は0.25ポイントであった。
  • SoundSCaperと専門家がアノテートしたキャプションとの間の性能差は統計的に有意ではなく、人間の知覚において同等の品質であると示された。
  • SoundSCaperは、支配的である音声イベントや一般的な音響シーンの特徴を捉える点で優れているが、空間的・時間的詳細(例:車両の進行方向、短時間のサイレンの有無)は不足している。
  • SoundAQnetの感情的質感予測は、個々の専門家の反応よりもやや穏やかで一般的であるため、個人のバイアスを軽減するが、繊細な感情表現を失う可能性がある。
  • 長さや音響特性が異なる多様な音声クリップに対して、モデルは強く一般化しており、実世界の状況でも頑健であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。