[논문 리뷰] Visual and Textual Sentiment Analysis Using Deep Fusion Convolutional Neural Networks
이 논문은 풀링 레이어에서 특징을 융합함으로써 시각적 및 텍스처적 감성 표현을 동시에 학습하는 엔드 투 엔드 딥 퓨전 컨volution 신경망을 제안한다. 감성 분류 정확도를 크게 향상시킨다. VSO 데이터셋에서 84.7%의 정확도를 기록하며, 최신 기술 대비 1.3% 향상되어 다중모달 융합의 효과성을 입증한다.
Sentiment analysis is attracting more and more attentions and has become a very hot research topic due to its potential applications in personalized recommendation, opinion mining, etc. Most of the existing methods are based on either textual or visual data and can not achieve satisfactory results, as it is very hard to extract sufficient information from only one single modality data. Inspired by the observation that there exists strong semantic correlation between visual and textual data in social medias, we propose an end-to-end deep fusion convolutional neural network to jointly learn textual and visual sentiment representations from training examples. The two modality information are fused together in a pooling layer and fed into fully-connected layers to predict the sentiment polarity. We evaluate the proposed approach on two widely used data sets. Results show that our method achieves promising result compared with the state-of-the-art methods which clearly demonstrate its competency.
연구 동기 및 목표
- 소셜 미디어에서 시각적 및 텍스처적 모odal 간 상호보완적 정보를 활용하여 단모달 감성 분석의 한계를 해결한다.
- 저수준의 이미지 특징과 고수준의 감성 의미 간의 정서적 갭을 극복하기 위해 깊이 있는 계층적 특징 학습을 통해 감성 의미를 학습한다.
- 다중모달 데이터에서 이미지와 짧은 텍스트 간의 의미적 상관관계를 모델링하여 감성 예측 성능을 향상시킨다.
- 전역 이미지 컨텍스트를 유지하면서 국소적 텍스트 특징을 포착하기 위해 후기 단계에서 시각적 및 텍스처적 표현을 융합하는 엔드 투 엔드 프레임워크를 개발한다.
- 기본 데이터셋에서 이른 융합/늦은 융합 및 모달 전용 기준 모델 대비 딥 퓨전의 우수성을 입증한다.
제안 방법
- 텍스트 기술을 분산 벡터 표현으로 매핑하기 위해 사전 학습된 Word2Vec(200D)를 사용하며, OOV 단어는 무작위로 초기화한다.
- 3, 4, 5 크기의 필터를 가진 다층 컨volution 신경망을 사용하여 임bedded 텍스트 시퀀스에서 국소 n-gram 특징을 추출한다.
- 입력 이미지를 AlexNet의 첫 다섯 레이어와 동일한 다섯 레이어의 컨볼루션 아키텍처로 처리하며, 입력을 224×224로 리사이징한다.
- 풀링 레이어에서 시각적 및 텍스처적 특징을 융합하기 위해 풀링된 표현을 연결한 후, 완전 연결 레이어에 입력한다.
- 모달 전용 특징을 독립적으로 학습하고 표현 수준에서 융합하는 후기 융합 전략을 적용하여 전역 이미지 컨텍스트를 유지한다.
- 초기 학습률 0.0001로 100개의 미니배치를 사용하여 엔드 투 엔드 모델을 훈련하며, 3000 스텝마다 기저가 0.96인 지수 감소를 적용한다.
실험 결과
연구 질문
- RQ1시각적 및 텍스처적 특징의 공동 학습이 단모달 접근 방식을 초월하여 감성 분류 성능을 향상시킬 수 있는가?
- RQ2다중모달 감성 분석에서 깊이 있는 시각적 및 텍스처적 표현의 후기 융합 전략이 이른 융합 또는 늦은 융합 전략과 비교해 어떻게 성능을 냅니다?
- RQ3전역 이미지 컨텍스트를 유지하면서 국소적 텍스트 특징과 융합했을 때 감성 예측 성능 향상 정도는 어느 정도인가?
- RQ4제안된 딥 퓨전 모델이 VSO 및 MVSO-EN과 같은 기준 데이터셋에서 기존 최신 기술 대비 우수한 성능을 내는가?
- RQ5실제 소셜 미디어 데이터셋에서 노이즈가 많고 약한 레이블이 부여된 데이터에 대해 모델의 강인성은 어느 정도인가?
주요 결과
- 제안된 딥 퓨전 모델은 VSO 데이터셋에서 84.7%의 정확도를 기록하며, 이전 최신 기술 대비 1.3%p 향상되었다.
- VSO 데이터셋에서 단모달 기준 모델(SV: 63.1% 정확도, ST: 69.5% 정확도)을 뚜렷이 앞서며, 다중모달 융합의 가치를 입증한다.
- PCNN(78.1% 정확도), You의 CCR 방법(67.2% 정확도), T-LSTM(83.3% 정확도)을 모두 능가하여 VSO에서 최고의 성능을 기록한다.
- 더 노이즈가 많은 MVSO-EN 데이터셋에서 73.7%의 정확도를 기록하며, 증가한 데이터 노이즈에도 불구하고 강인함을 보였다.
- 성능 향상의 원인은 전역 이미지 특징과 국소 텍스트 특징의 효과적 융합에 기인하며, 더 나은 의미 표현 학습이 가능해졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.