Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Video Summarization Framework using EEG and Eye-tracking Signals

Sai Sukruth Bezugam, Swatilekha Majumdar|arXiv (Cornell University)|2021. 01. 27.
Video Analysis and Summarization참고 문헌 42인용 수 6
한 줄 요약

이 논문은 뇌파(EEG)와 시선 추적 신호를 활용하여 인지적으로 주목할 만한 프레임을 식별하는 인간 중심의 비디오 요약 프레임워크를 제안한다. 이는 96.5%의 비디오 압축률을 달성하며 정밀도 0.98, 재현율 0.97를 기록하여 최신 기술을 능가하면서도 생물학적으로 유용한 설명 가능한 특징 추출을 통해 계산 비용을 줄인다.

ABSTRACT

This paper proposes an efficient video summarization framework that will give a gist of the entire video in a few key-frames or video skims. Existing video summarization frameworks are based on algorithms that utilize computer vision low-level feature extraction or high-level domain level extraction. However, being the ultimate user of the summarized video, humans remain the most neglected aspect. Therefore, the proposed paper considers human's role in summarization and introduces human visual attention-based summarization techniques. To understand human attention behavior, we have designed and performed experiments with human participants using electroencephalogram (EEG) and eye-tracking technology. The EEG and eye-tracking data obtained from the experimentation are processed simultaneously and used to segment frames containing useful information from a considerable video volume. Thus, the frame segmentation primarily relies on the cognitive judgments of human beings. Using our approach, a video is summarized by 96.5% while maintaining higher precision and high recall factors. The comparison with the state-of-the-art techniques demonstrates that the proposed approach yields ceiling-level performance with reduced computational cost in summarising the videos.

연구 동기 및 목표

  • 기존 비디오 요약 기법들이 인간의 인지적 및 주의 행동을 핵심 입력으로 간주하지 않는 격차를 보완하기 위해.
  • 인간 인지 신호에 기반한 계산 효율적이고 설명 가능한 비디오 요약 프레임워크를 개발하기 위해.
  • 비디오의 핵심을 대표하는 关건 프레임을 식별하기 위해 EEG와 시선 추적 데이터를 융합하는 효과를 평가하기 위해.
  • 압축률, 정밀도, 재현율 측면에서 제안된 방법을 최신 기술과 비교 평가하기 위해.
  • 신경생리학적 및 행동 신호를 통합함으로써 인간-기계 협업 기반의 비디오 요약 기반을 마련하기 위해.

제안 방법

  • 비디오 시청 중 뇌파 및 시각적 주의 반응을 측정하기 위해 EEG 및 시선 추적 장치를 사용하여 인간 참가자를 대상으로 통제된 실험을 수행하였다.
  • 뇌파 및 시선 추적 신호를 동시에 처리하여 인지적 및 시각적 주의 사건을 탐지하고, 인지적으로 주목할 만한 프레임을 식별하였다.
  • 인간의 관련성 판단에 기반하여 인간의 주의 신호를 융합하여 장시간 비디오 시퀀스에서 관건 프레임을 추출하고 분할하였다.
  • 강한 EEG 및 시선 추적 반응을 보이는 세그먼트를 우선순위로 삼아 정보량이 높은 프레임을 선택하는 메커니즘을 적용하였다.
  • 딥러닝 아키텍처를 회피함으로써 최소한의 계산 오버헤드로 높은 압축률을 달성하기 위해 요약 파이프라인을 최적화하였다.
  • 기준 참조(annotation)를 사용하여 방법을 검증하고 기존의 전통적 및 딥러닝 기반 요약 기준과 성능을 비교하였다.

실험 결과

연구 질문

  • RQ1EEG와 시선 추적 신호는 비디오 요약을 위한 인지적으로 관련성이 높은 프레임을 얼마나 효과적으로 식별할 수 있는가?
  • RQ2EEG와 시선 추적 신호를 융합한 경우, 단독으로 하나의 모odal을 사용하는 것에 비해 성능 향상은 어느 정도인가?
  • RQ3딥러닝 기반 아키텍처를 사용하지 않는 인간 중심의 프레임워크는 최신 기술 대비 낮은 계산 비용으로 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ4제안된 프레임워크는 높은 비디오 압축률을 달성하면서도 정밀도와 재현율을 얼마나 잘 유지하는가?
  • RQ5인간의 인지적 신호 통합은 비디오 요약 시스템의 설명 가능성과 해석 가능성에 어떤 영향을 미치는가?

주요 결과

  • 제안된 프레임워크는 비디오 압축 비율이 96.5%에 이르며, 원본 비디오 길이의 3.5%만 요약으로 유지된다.
  • 이 방법은 정밀도 약 0.98을 기록하여 추출된 관건 프레임의 98%가 비디오 콘텐츠와 관련이 있음을 나타낸다.
  • 재현율 값 약 0.97은 시스템이 비디오에서 실제로 관련성이 높은 프레임의 97%를 성공적으로 복원했음을 의미한다.
  • EEG와 시선 추적 신호의 융합은 98.15%의 탐지 비율을 기록하여 EEG 전용(68.7%) 및 시선 추적 전용(15.27%) 접근 방식보다 유의미하게 뛰어난 성능을 보였다.
  • 제안된 방법의 F-스코어는 가장 높았으며, 이는 존재하는 프레임워크 대비 관건 프레임 추출의 전체 정확도가 뛰어나다는 것을 확인한다.
  • 딥러닝 기반 방법에 비해 더 적은 파rameter를 요구하면서도 정밀도와 재현율 모두에서 뛰어난 성능을 보였으며, 더 높은 설명 가능성도 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.