[논문 리뷰] Fusing Audio, Textual and Visual Features for Sentiment Analysis of News Videos
이 논문은 뉴스 영상의 긴장 수준(낮음/높음)을 분류하기 위해 청각, 텍스트, 시각적 특징을 융합하는 다중모odal 접근법을 제안한다. 이는 얼굴 감정 강도, 음성 기본 주파수, 음성 발생 확률, 소리의 세기, 그리고 닫힌 자막에서 추출한 정서 점수 등을 포함한다. 520개의 브라질 및 미국 뉴스 영상에서 평가된 결과, 이 방법은 84%의 정확도를 달성하여 미디어 및 저널리즘 분석 분야에 강력한 잠재력을 보여주었다.
This paper presents a novel approach to perform sentiment analysis of news videos, based on the fusion of audio, textual and visual clues extracted from their contents. The proposed approach aims at contributing to the semiodiscoursive study regarding the construction of the ethos (identity) of this media universe, which has become a central part of the modern-day lives of millions of people. To achieve this goal, we apply state-of-the-art computational methods for (1) automatic emotion recognition from facial expressions, (2) extraction of modulations in the participants' speeches and (3) sentiment analysis from the closed caption associated to the videos of interest. More specifically, we compute features, such as, visual intensities of recognized emotions, field sizes of participants, voicing probability, sound loudness, speech fundamental frequencies and the sentiment scores (polarities) from text sentences in the closed caption. Experimental results with a dataset containing 520 annotated news videos from three Brazilian and one American popular TV newscasts show that our approach achieves an accuracy of up to 84% in the sentiments (tension levels) classification task, thus demonstrating its high potential to be used by media analysts in several applications, especially, in the journalistic domain.
연구 동기 및 목표
- 구어 및 비구어적 신호를 통합함으로써 뉴스 영상의 시미오디스커서 분석을 지원하는 계산적 접근법을 개발하는 것.
- 기존 연구의 격차를 보완하기 위해 청각, 텍스트, 시각적 모odal을 융합하여 뉴스 방송에서 정서적 긴장도를 유추하는 것.
- 단일 모달 정서 분석을 초월하여 뉴스 영상의 긴장 수준 분류 정확도를 향상시키는 것.
- 미디어 분석가와 저널리스트가 요약, 조직화, 청중 참여를 위해 정서적으로 강한 콘텐츠를 식별하는 데 도움을 주는 것.
- 닫힌 자막에서 추출한 정서 점수가 높은 긴장도를 가진 뉴스 영상 세그먼트를 탐지하는 데 핵심 신호로 기능하는지 검증하는 것.
제안 방법
- 영상 프레임 전반에 걸쳐 얼굴 표정 인식을 통해 정서 강도(예: 기쁨, 분노, 슬픔)를 정량화하는 시각적 특징을 추출한다.
- 긴장도를 나타내는 음성 조절을 탐지하기 위해 음성 기본 주파수, 음성 발생 확률, 소리의 세기 등의 청각적 특징을 분석한다.
- 최신 기술 기반의 정서 분석을 사용하여 닫힌 자막의 텍스트 콘텐츠를 처리하여 극성 점수(긍정/부정 정서)를 추출한다.
- 기여도에 따라 가중치를 적용하여 기능 수준과 의사결정 수준에서 다중모달 특징을 융합한다.
- 영상 전체 기간 동안의 모든 다중모달 특징의 합산 및 가중치 적용된 값을 기반으로 각 뉴스 영상을 낮은 긴장 또는 높은 긴장으로 분류한다.
- 4명의 인간 평가자가 일치하는 결과를 기반으로 기준 진술 긴장 수준을 정의하기 위해 투표 기반 메커니즘을 사용하며, 전체 및 100% 일치 서브셋에서 결과를 평가한다.
실험 결과
연구 질문
- RQ1청각, 텍스트, 시각적 특징의 융합이 단일 모달 접근법에 비해 뉴스 영상의 긴장 수준 분류 정확도를 향상시키는가?
- RQ2닫힌 자막에서 추출한 정서 점수가 시각적 및 청각적 신호에 비해 높은 긴장도를 가진 뉴스 세그먼트를 식별하는 데 얼마나 효과적인가?
- RQ3제안된 다중모달 융합 방법이 낮은 긴장도 뉴스 영상 분류에서 개별 특징 세트를 초월하는가?
- RQ4얼굴 표정과 음성 조절이 저널리즘 방송에서 인식된 정서적 긴장도와 어느 정도 상관이 있는가?
- RQ5자동 긴장도 탐지 기술이 뉴스 요약 및 미디어 분 析에서의 콘텐츠 우선순위 정하기와 같은 실용적 응용 분야를 지원할 수 있는가?
주요 결과
- 제안된 다중모달 융합 방법은 520개의 뉴스 영상로 구성된 데이터셋에서 긴장 수준(낮음 또는 높음) 분류에 대해 84%의 정확도를 달성하였다.
- 인간 평가자가 100% 일치한 영상로 제한된 경우, 방법의 정확도는 85%로 상승하여 일관된 평가에 대한 강건성을 확인하였다.
- 닫힌 자막에서 추출한 정서 점수가 높은 긴장도 뉴스 세그먼트 식별에 가장 효과적인 단일 특징으로 나타났으며, 100% 일치 서브셋에서 83%의 정확도를 기록하였다.
- 감정 점수만으로도 낮은 긴장도 뉴스를 분류할 때 성능이 열 劣화되는 것에 비해, 제안된 방법은 낮은 긴장도 뉴스 분류에서 개별 특징(예: 필드 크기, 정서 점수)을 초월하였다.
- 다중모달 특징 융합은 단모달 접근법에 비해 성능 향상이著격하게 했으며, 95% 신뢰수준에서 통계적 유의성을 확인한 대응 t-검정을 통과하였다.
- 본 연구는 닫힌 자막의 정서 분석이 다중모달 뉴스 영상 분석에서 가치 있고 아직 활용되지 않은 신호임을 입증하였으며, 특히 정서적으로 강한 콘텐츠를 탐지하는 데 유용하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.