Skip to main content
QUICK REVIEW

[논문 리뷰] Storytelling of Photo Stream with Bidirectional Multi-thread Recurrent Neural Network

Yu Liu, Jianlong Fu|arXiv (Cornell University)|2016. 06. 02.
Multimodal Machine Learning Applications참고 문헌 22인용 수 7
한 줄 요약

이 논문은 시각적 스토리텔링에서 장거리 종속성과 비연속 프레임 간의 크로스 스킵 구조를 해결하기 위해 새로운 스킵 게이팅 순환 단위(sGRU)를 갖춘 이방향 다중 스레드 순환 신경망(BMRNN)을 제안한다. 모델은 장면 전환 시 스킵 정보를 유지함으로써 서사 일관성을 향상시키며, NYC, 디즈니랜드, SIND 데이터셋에서 각각 22.8%, 15.6%, 15.7% 높은 recall@1 성능을 기록하여 최신 기술(SOTA)을 초월한다.

ABSTRACT

Visual storytelling aims to generate human-level narrative language (i.e., a natural paragraph with multiple sentences) from a photo streams. A typical photo story consists of a global timeline with multi-thread local storylines, where each storyline occurs in one different scene. Such complex structure leads to large content gaps at scene transitions between consecutive photos. Most existing image/video captioning methods can only achieve limited performance, because the units in traditional recurrent neural networks (RNN) tend to "forget" the previous state when the visual sequence is inconsistent. In this paper, we propose a novel visual storytelling approach with Bidirectional Multi-thread Recurrent Neural Network (BMRNN). First, based on the mined local storylines, a skip gated recurrent unit (sGRU) with delay control is proposed to maintain longer range visual information. Second, by using sGRU as basic units, the BMRNN is trained to align the local storylines into the global sequential timeline. Third, a new training scheme with a storyline-constrained objective function is proposed by jointly considering both global and local matches. Experiments on three standard storytelling datasets show that the BMRNN model outperforms the state-of-the-art methods.

연구 동기 및 목표

  • 사진 스트림의 크로스 스킵 구조로 인한 장거리 종속성과 콘텐츠 간극 문제를 해결하기 위해.
  • 불일치하는 장면 전환 동안 장거리 시각 정보를 유지할 수 있는 순환 신경망 아키텍처를 개발하기 위해.
  • 새로운 훈련 목표를 통해 전반적인 시간선 일관성과 국소적 스토리라인 정렬을 동시에 최적화하기 위해.
  • 내용적으로 일관되고 의미적으로 정확한 인간 수준의 서사 기술을 생성하기 위해.

제안 방법

  • 지연 제어 기능과 보존 방식을 갖춘 스킵 게이팅 순환 단위(sGRU)를 도입하여 스킵된 프레임 간에도 장거리 시각 정보를 유지한다.
  • sGRU를 핵심 단위로 사용하여 전반적인 시간선과 다수의 국소적 스토리라인을 동시에 모델링하는 이방향 다중 스레드 RNN(BMRNN)을 설계한다.
  • 전체 시퀀스 정렬과 국소적 스토리라인 일관성 양측을 동시에 최적화하는 스토리라인 제약 훈련 목표 함수를 구현한다.
  • 입력 이미지의 시각적 표현으로 VGGNet fc7 특징을 사용하여 강력하고 이식 가능한 특징 추출을 보장한다.
  • 교차 엔트로피 손실과 검색 기반 목표 함수를 조합하여 사용하여 서사 품질을 향상시키고, BMRNN 모델을 엔드 투 엔드로 훈련한다.
  • 추론 과정에서 K-최근접 이웃 검색을 적용하여 후보 문장 생성을 정밀하게 조정하고 검색 지표를 향상시킨다.

실험 결과

연구 질문

  • RQ1어떻게 순환 신경망이 비연속적 프레임 간의 장거리 종속성이 있는 크로스 스킵 구조를 갖는 시각적 스토리를 효과적으로 모델링할 수 있는가?
  • RQ2사진 스트림에서 장면 전환 시 장거리 시각적 맥락을 유지하기 위해 어떤 아키텍처 수정이 필요한가?
  • RQ3전체 시간선과 국소적 스토리라인을 동시에 최적화하는 것이 시각적 스토리텔링의 서사 일관성과 생성 품질을 향상시킬 수 있는가?
  • RQ4제안된 sGRU 단위가 표준 GRU 및 LSTM 단위에 비해 스킵 구조 종속성을 얼마나 잘 포착하는가?
  • RQ5BMRNN 모델은 자동 평가와 인간 선호도 측정 모두에서 기존 최신 기술 방법을 얼마나 뛰어넘는가?

주요 결과

  • BMRNN 모델은 최신 기술 방법 대비 NYC 데이터셋에서 recall@1이 22.8% 높게 기록했다.
  • 디즈니랜드 데이터셋에서 모델은 최고의 베이스라인 대비 recall@1을 15.6% 향상시켰다.
  • SIND 데이터셋에서 BMRNN 모델은 recall@1에서 15.7% 향상되어 벤치마크 전반에서 일관된 성과를 보였다.
  • 사용자 연구에서 BMRNN이 생성한 스토리는 CRCN이 생성한 스토리보다 68.0%의 경우에서 선호되었으며, 평균 주관적 점수는 5.19로 CRCN의 3.77보다 높았다.
  • 사용자 연구 결과, BMRNN이 생성한 스토리는 SIND에서 중앙 순위(Medr)를 8로, 디즈니랜드에서는 5로 낮추어 검색 성능 향상과 더 나은 문장 생성 품질을 나타냈다.
  • 사용자 연구에서 BMRNN이 생성한 스토리는 실제 정답에 더 가까운 경우가 7.0%였고, CRCN은 단지 2.0%에 그쳐 더 뛰어난 서사 품질을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.