Skip to main content
QUICK REVIEW

[논문 리뷰] MART: Memory-Augmented Recurrent Transformer for Coherent Video Paragraph Captioning

Jie Lei, Liwei Wang|arXiv (Cornell University)|2020. 05. 11.
Multimodal Machine Learning Applications참고 문헌 36인용 수 12
한 줄 요약

이 논문은 일관성 있는 비디오 문단 요약을 위한 메모리 보강형 순환 트랜스포머인 MART를 제안한다. 이는 트랜스포머 디코더에 비디오 세그먼트와 이전 문장 기록의 요약을 저장하는 메모리 모듈을 통합하여 문장 간 일관성을 향상시키고 반복을 줄인다. ActivityNet Captions와 YouCookII에서의 실험 결과, MART는 일관성과 유창성 면에서 LSTM 기반 및 기존 트랜스포머 베이스라인을 모두 능가하며, 시각적 관련성도 유지한다.

ABSTRACT

Generating multi-sentence descriptions for videos is one of the most challenging captioning tasks due to its high requirements for not only visual relevance but also discourse-based coherence across the sentences in the paragraph. Towards this goal, we propose a new approach called Memory-Augmented Recurrent Transformer (MART), which uses a memory module to augment the transformer architecture. The memory module generates a highly summarized memory state from the video segments and the sentence history so as to help better prediction of the next sentence (w.r.t. coreference and repetition aspects), thus encouraging coherent paragraph generation. Extensive experiments, human evaluations, and qualitative analyses on two popular datasets ActivityNet Captions and YouCookII show that MART generates more coherent and less repetitive paragraph captions than baseline methods, while maintaining relevance to the input video events. All code is available open-source at: https://github.com/jayleicn/recurrent-transformer

연구 동기 및 목표

  • 일관되고 반복적이지 않은 다중 문장 비디오 설명을 생성하는 데 도전하는 것.
  • 표준 트랜스포머가 이전 컨텍스트를 고려하지 않고 문장을 독립적으로 디코딩함으로써 발생하는 컨텍스트 분할 문제를 해결하는 것.
  • 비디오 세그먼트와 생성된 문장 간 장거리 의존성을 모델링할 수 있는 순환 트랜스포머 아키텍처를 설계하는 것.
  • 이전 기록을 요약하는 메모리 모듈을 통해 논의 수준의 일관성을 향상시키고 다음 문장 생성을 안내하는 것.
  • 문단 수준의 비디오 요약에서 LSTM 기반 및 표준 트랜스포머 모델보다 더 나은 성능을 달성하는 것.

제안 방법

  • 과도한 피팅과 메모리 사용을 줄이기 위해 공유된 레이어를 가진 통합 인코더-디코더 트랜스포머 아키텍처를 사용한다.
  • 비디오 세그먼트와 이전에 생성된 문장의 매우 요약된 상태를 저장하고 업데이트하는 메모리 모듈을 도입한다.
  • 각 디코딩 단계에서 이전 메모리 상태와의 크로스 어텐션을 통해 현재 비디오 표현을 강화함으로써 컨텍스트 인식 생성을 가능하게 한다.
  • 현재 입력과 이전 메모리를 모두 사용하여 메모리 상태를 업데이트함으로써 문장 간 재귀성을 구현한다.
  • 자기회귀적 다음 토큰 예측을 위한 교차 엔트로피 손실을 사용하여 엔드 투 엔드로 모델을 훈련시킨다.
  • 비교를 위해 강력한 베이스라인으로서 비디오 요약에 적합한 Transformer-XL의 변종을 적응시켰다.

실험 결과

연구 질문

  • RQ1메모리 보강형 순환 트랜스포머 아키텍처가 비디오 문단 요약의 논의 수준 일관성에 기여하는가?
  • RQ2외부 메모리 모듈을 통해 요약된 기록을 통합함으로써 표준 트랜스포머보다 문장 수준의 반복을 줄일 수 있는가?
  • RQ3MART는 일관성과 관련성 측면에서 LSTM 기반 및 표준 트랜스포머 모델과 비교해 어떻게 성능을 냈는가?
  • RQ4메모리 모듈을 사용해 의미적으로 유사한 비디오 세그먼트를 검색할 수 있는가? 이는 의미 있는 표현을 포착하고 있음을 시사한다.
  • RQ5MART의 재귀 메커니즘은 다수의 비디오 세그먼트와 문장 간 장거리 의존성을 효과적으로 모델링하는가?

주요 결과

  • MART는 ActivityNet Captions 검증 세트에서 기존 트랜스포머 모델보다 유사성과 일관성 면에서 뚜렷이 뛰어나며, C 지표에서 각각 22.87%와 24.33%의 점수를 기록했다.
  • 인간 평가 결과, 54명의 평가자가 참여한 페어와이즈 비교에서 MART는 기존 트랜스포머보다 일관성과 관련성 면에서 유의미하게 더 선호되었다.
  • Transformer-XL과 비교했을 때, MART는 관련성 성능는 유사하게 유지했지만 일관성 면에서 뚜렷이 뛰어나, C 지표에서 R@4 점수 5.18%로 반복을 줄였음을 시사한다.
  • 제거 실험 결과 재귀 메커니즘이 필수적임을 확인했다: 이를 제거하면 C 점수는 23.42에서 22.78로 감소하여 일관성 향상에 기여하는 역할을 확인했다.
  • 메모리 상태 검색 실험 결과, 메모리 모듈이 의미적으로 유의미한 표현을 포착하고 있음을 보여주었으며, 메모리 공간에서의 가장 가까운 이웃은 일반적으로 쿼리 비디오와 의미적으로 관련이 있었다.
  • 2개의 히든 레이어와 메모리 길이 1을 가진 모델이 성능과 계산 비용의 최적 균형을 이뤘으며, 검증 세트에서 C 점수 23.42를 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.