[논문 리뷰] NITS-VC System for VATEX Video Captioning Challenge 2020
이 논문은 VATEX 2020 영상 설명 챌린지에 대비해 NITS-VC 시스템을 제시한다. 이 시스템은 C3D 기반의 시각적 특징 인코딩을 사용하는 이중-LSTM 인코더-디코더 아키텍처를 적용한다. 모델은 요소별 곱셈을 통해 시각적 특징과 텍스처적 특징을 융합하며, 공개 테스트 세트에서 BLEU-4 점수 0.20, 비공개 테스트 세트에서 0.22를 기록하여 개방형 영어 영상 설명 분야에서 뛰어난 성능을 보였다.
Video captioning is process of summarising the content, event and action of the video into a short textual form which can be helpful in many research areas such as video guided machine translation, video sentiment analysis and providing aid to needy individual. In this paper, a system description of the framework used for VATEX-2020 video captioning challenge is presented. We employ an encoder-decoder based approach in which the visual features of the video are encoded using 3D convolutional neural network (C3D) and in the decoding phase two Long Short Term Memory (LSTM) recurrent networks are used in which visual features and input captions are fused separately and final output is generated by performing element-wise product between the output of both LSTMs. Our model is able to achieve BLEU scores of 0.20 and 0.22 on public and private test data sets respectively.
연구 동기 및 목표
- VATEX 2020 다국어 영상 설명 챌린지에 대비한 강력한 영상 설명 시스템을 개발하기 위해.
- 개방형 영상 설명 과제를 해결하기 위해 일관되고 맥락적으로 관련된 영어 설명을 생성하기 위해.
- 이중-LSTM 아키텍처와 요소별 곱셈을 통해 시각적 특징과 텍스트 특징을 융합하여 설명 품질을 향상시키기 위해.
- BLEU, CIDEr, METEOR, ROUGE-L와 같은 표준 지표를 사용하여 공개 및 비공개 테스트 세트에서 시스템을 평가하기 위해.
- 주의 없는 이중 LSTM 디코딩과 결합된 C3D 특징의 효과성을 입증하기 위해.
제안 방법
- 영상 클립을 등간격으로 분할한 후, 사전 훈련된 3D 합성곱 신경망(C3D)을 사용하여 시각적 특징을 추출한다. 각 클립은 16프레임으로 구성된다.
- C3D 출력은 필터 크기가 5인 평균 풀링을 통해 차원을 감소시키고 중복 정보를 제거한다.
- 각 세그먼트에서 추출된 풀링된 특징은 시간적 관계를 유지하기 위해 연결되어 시각적 표현의 시퀀스를 형성한다.
- 디코더에서는 두 개의 별도된 장기 단기 기억(LSTM) 네트워크를 사용한다: 하나는 시각적 특징에 조건화되고, 다른 하나는 입력 설명에 조건화되며, 특징 융합은 요소별 곱셈을 통해 수행된다.
- 캡션 생성 과정은 <BOS> 토큰으로 시작하고 <EOS> 토큰으로 종료되며, 단어 단위 예측을 위해 탐욕적 디코딩을 사용한다.
- 모델은 Adam 옵timizer를 사용하여 교차 엔트로피 손실로 훈련되며, 드롭아웃 비율은 0.5, 두 LSTMs의 은닉 크기는 512이며, 배치 크기는 64와 256로 설정하고 50 에포크 동안 훈련한다.
실험 결과
연구 질문
- RQ1표준 단일-LSTM 디코더와 비교해 볼 때, 요소별 특징 융합을 적용한 이중-LSTM 디코더는 정확한 영상 설명 생성에 얼마나 효과적인가?
- RQ2C3D 기반의 시각적 특징 추출과 평균 풀링을 조합함으로써 영상 프레임 간의 중복성을 줄여 설명 성능을 향상시킬 수 있는가?
- RQ3배치 크기가 VATEX 데이터셋을 사용한 영상 설명 작업에서 모델의 일반화 능력과 성능에 어떤 영향을 미치는가?
- RQ4제안된 시스템은 BLEU, CIDEr, METEOR, ROUGE-L와 같은 표준 평가 지표에서 최신 기술 모델과 비교해 어떻게 성능을 내는가?
- RQ5요소별 곱셈을 통한 시각적 특징과 텍스트 특징 융합은 설명의 일관성과 관련성 향상에 어느 정도 기여하는가?
주요 결과
- 공개 테스트 세트에서 BLEU-4 점수는 0.20, 비공개 테스트 세트에서는 0.22를 기록하여 개방형 영상 설명 분야에서 뛰어난 성능을 보였다.
- 비공개 테스트 세트에서 CIDEr 점수는 0.27이었으며, n-그램 겹침과 의미적 관련성 측면에서 기준 설명과 양호한 일치를 보였다.
- 비공개 테스트 세트에서 BLEU-1 점수는 0.65를 기록하여 생성된 설명과 기준 설명 간의 높은 유니그램 겹침을 나타냈다.
- METEOR 점수는 두 테스트 세트에서 모두 0.18로 안정되어 있었으며, 생성된 설명의 단어 정밀도와 재현율이 높고 문장 분할이 적은 것을 반영했다.
- 비공개 테스트 세트에서 ROUGE-L 점수는 0.43이었으며, 생성된 설명과 기준 설명 간의 문장 수준의 일관성과 가장 긴 공통 부분 수열의 재현도가 양호함을 나타냈다.
- 더 작은 배치 크기(64)가 더 큰 크기(256)보다 더 높은 성능을 보였으며, 일반화 능력 향상과 과적합 감소를 시사했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.