Skip to main content
QUICK REVIEW

[논문 리뷰] Text with Knowledge Graph Augmented Transformer for Video Captioning

Xin Gu, Guang Chen|arXiv (Cornell University)|2023. 03. 22.
Multimodal Machine Learning Applications인용 수 6
한 줄 요약

이 논문은 외부 지식 그래프에서 사전에 구축된 지식을 다중모달 비디오 특징(시각적, 음성, 텍스트적)과 통합하여 장꼬리 단어 문제를 해결하기 위해 TextKG를 제안한다. 이는 두 스트림 트랜스포머로 구성되며, 외부 스트림(지식 인식)과 내부 스트림(다중모달 특징 추출기) 간의 상호작용을 통해 성능을 향상시킨다. YouCookII에서 최신 기술 대비 CIDEr 점수를 18.7%p 향상시켰다.

ABSTRACT

Video captioning aims to describe the content of videos using natural language. Although significant progress has been made, there is still much room to improve the performance for real-world applications, mainly due to the long-tail words challenge. In this paper, we propose a text with knowledge graph augmented transformer (TextKG) for video captioning. Notably, TextKG is a two-stream transformer, formed by the external stream and internal stream. The external stream is designed to absorb additional knowledge, which models the interactions between the additional knowledge, e.g., pre-built knowledge graph, and the built-in information of videos, e.g., the salient object regions, speech transcripts, and video captions, to mitigate the long-tail words challenge. Meanwhile, the internal stream is designed to exploit the multi-modality information in videos (e.g., the appearance of video frames, speech transcripts, and video captions) to ensure the quality of caption results. In addition, the cross attention mechanism is also used in between the two streams for sharing information. In this way, the two streams can help each other for more accurate results. Extensive experiments conducted on four challenging video captioning datasets, i.e., YouCookII, ActivityNet Captions, MSRVTT, and MSVD, demonstrate that the proposed method performs favorably against the state-of-the-art methods. Specifically, the proposed TextKG method outperforms the best published results by improving 18.7% absolute CIDEr scores on the YouCookII dataset.

연구 동기 및 목표

  • 희귀하거나 미리보지 않은 물체, 성질, 동작에 대해 예측이 부족한 비디오 자동번역의 장꼬리 단어 문제를 해결하기 위해.
  • 비디오 자동번역 과정에 사전에 구축된 지식 그래프에서 외부 지식을 통합하여 자동번역 품질을 향상시키기 위해.
  • 다중모달 비디오 특징과 지식 그래프 정보를 유기적으로 융합하는 이중 스트림 트랜스포머 아키텍처를 설계하기 위해.
  • 다양하고 도전적인 비디오 자동번역 벤치마크에서 성능을 평가하여 강건성과 최신 기술 수준의 성능을 입증하기 위해.

제안 방법

  • TextKG는 두 스트림 트랜스포머를 사용한다: 내부 스트림은 다중모달 입력(비디오 프레임, 음성 텍스트, 자동번역문)을 처리하고, 외부 스트림은 감지된 주요 물체와 지식 그래프 엔티티 간의 상호작용을 모델링한다.
  • 비디오 프레임에서 감지된 주요 물체를 바탕으로 지식 그래프 엔티티를 검색하고, 그 특징을 시각적, 음성, 자동번역 특징과 융합하여 외부 스트림에 활용한다.
  • 내부 스트림과 외부 스트림 간의 교차 어텐션 메커니즘을 적용하여 이중 방향 정보 공유를 가능하게 하고 특징 표현을 향상시킨다.
  • 지식 선택 메커니즘을 통해 잡음이 있거나 관련성이 없는 지식을 걸러내어 모델의 강건성과 성능을 향상시킨다.
  • 표준 자동번역 손실 함수를 사용하여 YouCookII, ActivityNet Captions, MSR-VTT, MSVD의 네 가지 벤치마크 데이터셋에서 엔드 투 엔드로 모델을 훈련시킨다.
  • 일반 지식 그래프와 특정 지식 그래프를 모두 사용한다. 일반 그래프는 광범위한 의미 관계를 제공하고, 특정 그래프는 엔티티별 세부 사실을 제공한다.

실험 결과

연구 질문

  • RQ1지식 그래프에서 외부 지식을 통합하면 비디오 자동번역에서 장꼬리 단어 문제를 크게 줄일 수 있는가?
  • RQ2다중모달 비디오 특징(시각적, 음성, 텍스트적)과 지식 그래프 정보의 융합이 자동번역 품질을 어떻게 향상시키는가?
  • RQ3희귀하거나 미리보지 않은 어휘를 예측할 때 음성 텍스트와 지식 그래프 정보 중 어느 것이 더 중요한가?
  • RQ4음성 텍스트의 품질이 지식 증강 비디오 자동번역 모델의 성능에 어떻게 영향을 미치는가?
  • RQ5지식 선택 메커니즘이 노이즈가 있거나 관련성이 없는 지식을 걸러내어 모델의 강건성을 향상시키는가?

주요 결과

  • Paragraph-level 평가에서 YouCookII 데이터셋에서 최고의 공개 결과 대비 CIDEr 점수를 18.7%p 향상시켰다.
  • 지식 그래프 정보의 포함으로 영상 및 영역 특징과 결합했을 때 CIDEr 점수가 4.6점 향상되어 71.3에서 75.9로 상승했다.
  • 음성 텍스트가 없더라도 지식 그래프 통합으로 성능이 3.9 CIDEr 점수 향상(45.9에서 49.8로)되어 장꼬리 문제 완화에 핵심적인 역할을 함을 보여주었다.
  • 지식 선택 메커니즘이 필수적이다. 이를 제거하면 CIDEr 점수가 3.9p 하락하여 노이즈가 있는 지식이 성능에 악영향을 준다는 것을 시사한다.
  • 일반 및 특정 지식 그래프를 모두 사용한 방법은 모든 음성 텍스트 품질 수준에서 베이스라인을 초월했으며, 일반 그래프가 음성 텍스트 노이즈에 더 강건함을 보였다.
  • 정성적 결과에서는 TextKG가 표준 모델이 간과하는 장꼬리 어휘인 'sesame oil'과 'black pepper'를 지식 그래프 관계를 활용해 성공적으로 생성하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.