Skip to main content
QUICK REVIEW

[논문 리뷰] Detection of Audio-Video Synchronization Errors Via Event Detection

Joshua P. Ebenezer, Yongjun Wu|arXiv (Cornell University)|2021. 04. 20.
Video Analysis and Summarization참고 문헌 21인용 수 5
한 줄 요약

이 논문은 테니스 영상에서 공 충격의 음성 및 시각적 서명을 탐지함으로써 영상-음성 동기화 오류를 검출하기 위한 이단계적 딥러닝 방법을 제안한다. 504,300 프레임으로 구성된 대규모 데이터셋을 사용하여, 미세한 A/V 동기화 오류 검출에서 81.25% 정밀도와 83.87% 재현율을 달성하였으며, 인간의 인지 임계 이하의 오차에 대해서도 이전의 엔드 투 엔드 접근 방식을 능가한다.

ABSTRACT

We present a new method and a large-scale database to detect audio-video synchronization(A/V sync) errors in tennis videos. A deep network is trained to detect the visual signature of the tennis ball being hit by the racquet in the video stream. Another deep network is trained to detect the auditory signature of the same event in the audio stream. During evaluation, the audio stream is searched by the audio network for the audio event of the ball being hit. If the event is found in audio, the neighboring interval in video is searched for the corresponding visual signature. If the event is not found in the video stream but is found in the audio stream, A/V sync error is flagged. We developed a large-scaled database of 504,300 frames from 6 hours of videos of tennis events, simulated A/V sync errors, and found our method achieves high accuracy on the task.

연구 동기 및 목표

  • 영상 스트림에서 인간의 인지 임계 이하인 작은 영상-음성 동기화 오류를 탐지하는 데 도전하는 것.
  • 초기 동기화 오차에 취약하고 해석이 어려운 엔드 투 엔드 모델의 한계를 극복하는 것.
  • 동영상 온디맨드 및 라이브 스트리밍 서비스에서 자동으로 A/V 동기화 오류를 탐지할 수 있는 확장 가능하고 해석 가능한 방법을 개발하는 것.
  • 공 충격, 타격 후 튀김, 비플레이 상태를 레이블링한 대규모 프레임 정밀도 데이터셋을 구축하는 것.

제안 방법

  • 160ms 길이의 음성 세그먼트를 사용하여 영상 프레임 중심에 위치한 테니스 공 타격의 청각적 서명을 식별하도록 딥 오디오 이벤트 탐지기(AED)를 훈련시킨다.
  • 3프레임 그룹(80ms)을 입력으로 사용하여 공 타격의 시각적 서명을 탐지하도록 딥 비디오 이벤트 탐지기(VED)를 훈련시킨다. 레이블은 프레임 수준의 애너테이션에서 유래한다.
  • 추론 과정에서 AED는 음성 스트림을 스캔하여 타격을 탐지한다. 만약 타격이 발견되면, VED는 해당 음성 타격의 시간적 이웃 영역(최대 240ms 이전부터 80ms 이후까지)의 영상 프레임을 검사하여 대응하는 시각적 이벤트가 존재하는지 확인한다.
  • 음성 타격의 시간적 이웃 영역에서 시각적 타격이 탐지되지 않으면, A/V 동기화 오류로 간주한다.
  • 이벤트 탐지에서 발생할 수 있는 시간적 이탈을 보완하기 위해 이웃 영역 검색 전략을 사용함으로써, 미세한 시간 오차에 대한 강인성을 향상시킨다.
  • 오차 탐지 성능 평가를 위해, 영상 및 음성 세그먼트를 무작위로 ±15프레임(−3에서 +6 프레임 제외)만큼 오프셋하여 A/V 동기화 오류를 시뮬레이션한다.

실험 결과

연구 질문

  • RQ1이중단계 이벤트 탐지 접근 방식이, 특히 미세한 오프셋에 대해 엔드 투 엔드 모델보다 더 높은 정확도로 A/V 동기화 오류를 탐지할 수 있는가?
  • RQ2시간적 이웃 분석을 통한 음성 및 영상 이벤트 탐지의 조합이 A/V 동기화 오류 탐지에 얼마나 효과적인가?
  • RQ3대규모 프레임 애너테이션 데이터셋이 A/V 동기화 오류의 고정밀도 탐지에 기여할 수 있는가?
  • RQ4음성 및 영상 이벤트 간의 이격이 100ms 미만일 경우, 이 방법의 강인성은 어느 정도 유지되는가?

주요 결과

  • 이웃한 잘못된 양성 및 음성 결과를 보정하기 위해 VED의 이웃 영역 검색 전략을 적용한 후, 오디오 이벤트 탐지기는 90.2% 정밀도와 72.76% 재현율을 기록하였다.
  • 조기 정지 기법을 통해 비디오 이벤트 탐지기는 높은 재현율을 확보하여, 빠른 타격을 놓치는 것을 최소화하였으며, 이는 잘못된 동기화 오류 경고를 방지하는 데 핵심적이다.
  • 최종 A/V 동기화 오류 탐지 시스템은 시뮬레이션된 동기화 오류에서 81.25% 정밀도와 83.87% 재현율을 달성하였으며, 이는 이전 방법들보다 미세한 오프셋에서 뛰어난 성능을 보였다.
  • 이 방법은 일반적으로 인간이 인지하지 못하는 50ms 이하의 크기의 A/V 동기화 오류도 성공적으로 탐지하였다. 이러한 오류는 영상 품질에 악영향을 미칠 수 있다.
  • 6시간 분량의 테니스 영상에서 유래한 504,300프레임의 대규모 데이터셋(2,443건의 타격 레이블 포함)은 시스템의 강력한 훈련과 평가를 가능하게 하였다.
  • 오디오 이벤트 지속 시간이 여러 세그먼트에 걸쳐 있을 경우에도 시스템의 성능이 강인하다. 이는 VED가 이웃 프레임을 검사하여 모호함을 해소하기 때문이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.