[論文レビュー] Dialog+ in Broadcasting: First Field Tests Using Deep-Learning-Based Dialogue Enhancement
本論文では、オブジェクトベースのオーディオワークフローを必要とせず、従来のミキシングされたオーディオトラックに対してユーザーが調整可能な会話レベルを提供するディープラーニングベースのシステム、Dialog+ を提案する。2,000人以上の参加者を対象とした現地テストでは、60歳以上の視聴者の90%が会話の明瞭さにしばしばまたは非常にしばしば困難を抱えていることが判明し、83%の参加者がDialog+の強化を好んだ。これは、一般視聴者におけるアクセシビリティ向上の有効性を裏付けている。
Difficulties in following speech due to loud background sounds are common in broadcasting. Object-based audio, e.g., MPEG-H Audio solves this problem by providing a user-adjustable speech level. While object-based audio is gaining momentum, transitioning to it requires time and effort. Also, lots of content exists, produced and archived outside the object-based workflows. To address this, Fraunhofer IIS has developed a deep-learning solution called Dialog+, capable of enabling speech level personalization also for content with only the final audio tracks available. This paper reports on public field tests evaluating Dialog+, conducted together with Westdeutscher Rundfunk (WDR) and Bayerischer Rundfunk (BR), starting from September 2020. To our knowledge, these are the first large-scale tests of this kind. As part of one of these, a survey with more than 2,000 participants showed that 90% of the people above 60 years old have problems in understanding speech in TV "often" or "very often". Overall, 83% of the participants liked the possibility to switch to Dialog+, including those who do not normally struggle with speech intelligibility. Dialog+ introduces a clear benefit for the audience, filling the gap between object-based broadcasting and traditionally produced material.
研究の動機と目的
- 高齢者や聴覚に障害を有する視聴者に対して特に顕著な、背景音がうるさいために生じる放送テレビにおける会話の明瞭性の問題を解決すること。
- オブジェクトベースのオーディオメタデータやワークフローを備えていないレガシーオーディオコンテンツに対して、個別に調整可能な会話レベルの調整を可能にすること。
- 現代のオブジェクトベースのオーディオシステムと、従来の放送制作手法で制作された素材との間のギャップを埋めること。
- 実際の放送環境において、ディープラーニングベースの会話強化ソリューションの有効性とユーザー受容性を大規模な現地テストで評価すること。
提案手法
- 時間変動する会話レベルを推定し、聴取者の好みに応じて調整可能な、時間変動する会話レベル推定モデルを用いた、ディープニューラルネットワークを、混合ステレオまたはモノオーディオトラックからの会話成分の分離と強化に訓練する。
- 会話の明瞭性に関する知覚的モデルに基づき、聴取者ごとに調整可能な時間変動する会話レベルを推定する。
- 再エンコーディングやメタデータの変更なしに、既存の放送オーディオストリームにリアルタイムで強化を適用する。
- 公共放送局 WDR および BR でのライブ放送ワークフローに統合し、現地テストを実施する。
- 多様な年齢層を含む実際の視聴者を対象にした大規模なアンケートを通じて、ユーザーの好みと使いやすさを評価する。
- 既存の配信インfraに互換性を持たせ、標準オーディオフォーマットとの後方互換性を確保するように設計されている。
実験結果
リサーチクエスチョン
- RQ1オブジェクトベースのオーディオワークフローを必要とせず、標準的な放送オーディオで会話の明瞭性を効果的に強化できるディープラーニングベースのシステムは実現可能か?
- RQ2特に高齢者を含む視聴者は、実際の放送環境下で調整可能な会話レベルをどのように感じ、反応するか?
- RQ3標準オーディオと比較して、Dialog+ は聴覚に障害を有する視聴者の会話理解をどの程度向上させるか?
- RQ4会話の明瞭性に問題を抱えない通常の視聴者層を含めた、多様なデモグラフィックグループにおける Dialog+ のユーザー受容率はどの程度か?
- RQ5後処理で行い、侵襲的でない強化システムは、ネイティブのオブジェクトベースのオーディオソリューションと同等の知覚的利点を達成できるか?
主な発見
- 60歳以上の参加者の90%が、テレビ放送での会話の理解にしばしばまたは非常にしばしば困難を抱えていると報告した。
- 会話の明瞭性に問題を抱えない通常の視聴者を含む、アンケート参加者の83%が Dialog+ の強化を好んだ。
- 本現地テストは、ライブ公共放送環境において、ディープラーニングベースの会話強化システムを大規模に実地評価した初の事例である。
- Dialog+ は、オブジェクトベースのオーディオワークフローとは異なる方法で制作されたコンテンツに対しても、ユーザーが調整可能な会話レベルを提供することに成功した。
- 本システムは顕著な知覚的利点と高いユーザー受容性を示し、将来のオブジェクトベースのオーディオエコシステムへの橋渡しとしての実用性を証明した。
- 本研究の結果は、ディープラーニングベースの強化が、一般視聴者向けの放送コンテンツにおけるアクセシビリティとユーザーエクスペリエンスを顕著に向上させられることを確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。