Skip to main content
QUICK REVIEW

[논문 리뷰] MPEG-H Audio for Improving Accessibility in Broadcasting and Streaming

Christian Simon, Matteo Torcoli|arXiv (Cornell University)|2019. 09. 25.
Subtitles and Audiovisual Media참고 문헌 14인용 수 5
한 줄 요약

이 논문은 방송 및 스트리밍에서 접근성을 향상시키기 위해 MPEG-H 오디오의 오브젝트 기반 오디오(OBA) 기술을 활용하여 대화 강화 및 오디오 설명과 같은 동적이고 사용자 제어 오디오 조정을 가능하게 한다. 오디오 요소를 수준과 위치를 조정할 수 있는 독립된 오브젝트로 간주함으로써 MPEG-H는 기존 워크플로우에 최소한의 변경으로도 개인화된 청취 경험을 가능하게 하여 听력 장애가 있는 사람, 노인, 비모국어 사용자에게서 말의 명료도와 접근성을 크게 향상시킨다.

ABSTRACT

Broadcasting and streaming services still suffer from various levels of accessibility barriers for a significant portion of the population, limiting the access to information and culture, and in the most severe cases limiting the empowerment of people. This paper provides a brief overview of some of the most common accessibility barriers encountered. It then gives a short introduction to object-based audio (OBA) production and transport, focusing on the aspects relevant for lowering accessibility barriers. MPEG-H Audio is used as a concrete example of an OBA system already deployed. Two example cases (dialog enhancement and audio description) are used to demonstrate in detail the simplicity of producing MPEG-H Audio content providing improved accessibility. Several other possibilities are outlined briefly. We show that using OBA for broadcasting and streaming content allows offering several accessibility features in a flexible manner, requiring only small changes to the existing production workflow, assuming the receiver supports the functionality.

연구 동기 및 목표

  • 청각, 인지, 언어 관련 곤란을 겪는 사람들을 위한 방송 및 스트리밍에서 지속적인 접근성 장벽을 해결하기 위해.
  • MPEG-H 오디오와 같은 오브젝트 기반 오디오(OBA) 시스템이 기존 제작 워크플로우를 대대적으로 재구성하지 않고도 맞춤형 오디오 경험을 제공할 수 있음을 입증하기 위해.
  • MPEG-H 오디오 메타데이터와 프리셋을 사용한 대화 강화 및 오디오 설명의 실용적 구현 사례를 시연하기 위해.
  • 사용자 상호작용과 메타데이터 기반 렌더링이 포괄적인 오디오 제공을 가능하게 하는 역할을 부각하기 위해.
  • OBA의 실현 가능성과 접근성 기능을 위한 낮은 통합 비용을 입증함으로써 미디어 제작 분야에서의 OBA 도입을 촉진하기 위해.

제안 방법

  • 오디오 요소(예: 대화, 음악, 효과)를 개별 오디오 오브젝트로 분리하고 관련 메타데이터를 포함하는 MPEG-H 오디오의 오브젝트 기반 오디오(OBA) 프레임워크를 사용한다.
  • 오디오 오브젝트의 상대적 음량을 제어하기 위해 동적 게인 메타데이터를 적용한다. 예를 들어, 말의 명료도 향상을 위해 'Dialog+' 프리셋에서 대화 수준을 +6 dB로 증가시킨다.
  • 사용자 상호작용을 가능하게 하기 위해 조절 가능한 게인 범위(예: 대화에 대해 ±9 dB, 오디오 설명에 대해 ±6 dB)와 공간적 위치 조정(예: 수평 기준 ±180°, 수직 기준 0–30°)을 정의한다.
  • 작성 도구를 사용해 오디오 장면을 모니터링하고, 다운믹스를 테스트하며, 인코딩 전 렌더링 동작을 검증한다.
  • 방송 및 스트리밍 파이프라인에 통합하기 위해 ADM 또는 MPF 형식으로 오디오 및 메타데이터를 내보낸다.
  • 기존 혼합 콘텐츠에서 별도의 트랙이 확보되지 않은 경우, 소스 분리 기법(예: [28]에서 제시된 바와 유사)을 활용해 대화 및 배경 트랙을 추출한다.

실험 결과

연구 질문

  • RQ1오브젝트 기반 오디오는 청각 장애가 있는 사람들을 위한 방송 및 스트리밍에서 접근성 장벽을 어떻게 줄일 수 있는가?
  • RQ2MPEG-H 오디오의 동적 메타데이터와 상호작용은 소음이 많거나 복잡한 오디오 환경에서 말의 명료도를 얼마나 향상시킬 수 있는가?
  • RQ3최소한의 변경으로도 기존 제작 워크플로우에 오디오 설명 및 대화 강화를 통합하는 데 실현 가능성은 어느 정도인가?
  • RQ4사용자가 조절할 수 있는 오디오 조정(예: 음량 및 위치 조절)이 인식된 접근성과 사용자 경험에 어떤 영향을 미치는가?
  • RQ5OBA 기반 시스템, 예를 들어 MPEG-H 오디오는 다국어 및 간소 언어 콘텐츠 제공을 효과적으로 지원할 수 있는가?

주요 결과

  • MPEG-H 오디오는 'Dialog+' 프리셋을 통해 +6 dB의 정적 게인 오프셋을 적용함으로써 대화 강화를 가능하게 하여 청각 장애가 있는 사용자에게 말의 명료도를 크게 향상시킨다.
  • 게인(예: ±9 dB)과 공간적 위치 조정(예: 수평 기준 ±180°, 수직 기준 0–30°)에 대한 사용자 상호작용을 통해 콘텐츠를 재인코딩하지 않고도 개인화된 오디오 경험을 제공할 수 있다.
  • 오디오 설명은 주 혼합을 동적으로 감쇄시키는 전용 프리셋을 통해 구현될 수 있으며, 이는 내보낸 DAW 오토메이션을 동적 게인 메타데이터로 활용한다.
  • 기존 콘텐츠가 소스 분리 기법을 통해 대화 및 배경 구성 요소를 추출함으로써 후행 호환성을 지원한다.
  • 메타데이터 기반 렌더링을 활용해 기존 생산 파이프라인에 최소한의 변경으로도 접근성 기능을 확장할 수 있으며, 재생 시점에서 메타데이터 기반의 렌더링을 통해 이를 실현한다.
  • MPEG-H 오디오용 사용자 인터페이스는 오디오 오브젝트의 두드러짐과 위치를 직관적으로 제어할 수 있게 하여 최종 사용자가 오디오 장면을 개인의 필요에 맞게 맞춤화할 수 있도록 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.