Skip to main content
QUICK REVIEW

[논문 리뷰] TPsgtR: Neural-Symbolic Tensor Product Scene-Graph-Triplet Representation for Image Captioning

Chiranjib Sur|arXiv (Cornell University)|2019. 11. 22.
Multimodal Machine Learning Applications참고 문헌 15인용 수 10
한 줄 요약

이 논문은 이미지 캡션 생성을 향상시키기 위해 위치 및 관계 구조를 포함한 시나리오 그래프 트리플릿(주어-서술어-목적어)을 인코딩하는 새로운 신경-기호 텐서 곱 표현인 TPsgtR을 제안한다. 텐서 곱을 통한 문맥 벡터와 역할 벡터의 직교 조합을 활용하여, 더 구조적이고 해석 가능하며 맥락적으로 정확한 캡션을 생성하며, MS COCO에서 자동 평가 지표와 정성적 다양성 측면에서 이전 모델들을 능가한다.

ABSTRACT

Image captioning can be improved if the structure of the graphical representations can be formulated with conceptual positional binding. In this work, we have introduced a novel technique for caption generation using the neural-symbolic encoding of the scene-graphs, derived from regional visual information of the images and we call it Tensor Product Scene-Graph-Triplet Representation (TP$_{sgt}$R). While, most of the previous works concentrated on identification of the object features in images, we introduce a neuro-symbolic embedding that can embed identified relationships among different regions of the image into concrete forms, instead of relying on the model to compose for any/all combinations. These neural symbolic representation helps in better definition of the neural symbolic space for neuro-symbolic attention and can be transformed to better captions. With this approach, we introduced two novel architectures (TP$_{sgt}$R-TDBU and TP$_{sgt}$R-sTDBU) for comparison and experiment result demonstrates that our approaches outperformed the other models, and generated captions are more comprehensive and natural.

연구 동기 및 목표

  • 객체 관계와 공간 위치의 구조적 뉴런-기호 표현을 통합하여 이미지 캡션 생성을 향상시키기 위해.
  • 공생 통계에 의존하고 명시적 구조적 추론이 부족한 엔드 투 엔드 학습 모델의 한계를 극복하기 위해.
  • 의미적 내용과 관계 구조(예: 공간 역할을 포함한 주어-서술어-목적어)를 미분 가능하고 조합적인 방식으로 인코딩할 수 있는 표현을 개발하기 위해.
  • 구조적이고 기호 인식 기반 표현이 더 기술적이고 문법적으로 올바르며 다양한 캡션을 생성함으로써 더 나은 결과를 이끌어내는지 확인하기 위해.
  • 텐서 곱 표현이 시각적 캡션 생성을 위한 관계 및 위치 정보를 모델링하는 데 효과적인지 검증하기 위해.

제안 방법

  • 이 방법은 객체 특징(문맥)과 공간/관계적 역할(역할 벡터)을 텐서 곱 연산을 통해 조합하는 텐서 곱 시나리오 그래프 트리플릿 표현(TPsgtR)을 도입한다.
  • TPsgtR은 직교 조합을 사용하여 주어-서술어-목적어 트리플릿을 위치 기반으로 통합하여 연속적인 벡터 공간에서 구조적 관계를 유지한다.
  • 두 가지 아키텍처가 제안된다: TPsgtR-TDBU(상향-하향) 및 TPsgtR-sTDBU(세미틱 상향-하향), 이는 TPsgtR을 어텐션 메커니즘을 갖춘 트랜스포머 유사 디코더에 통합한다.
  • 모델은 사전 훈련된 시나리오 그래프 생성기(예: [14]에서 유래)를 활용하여 SPO 트리플릿을 추출하지만, 원시 특징에 대한 모델 학습 어텐션에 의존하지 않고 직접적으로 텐서 곱을 통해 조합한다.
  • 텐서 곱 연산은 표현이 순열에 대해 불변이며, 알려지지 않은 관계에 대한 조합 일반화를 지원한다.
  • 최종 캡션 생성은 뉴런-기호 어텐션을 갖춘 순환 디코더를 사용하여 수행되며, TPsgtR 벡터가 맥락 인식 기반 단어 예측을 이끈다.

실험 결과

연구 질문

  • RQ1뉴런-기호 텐서 곱 표현이 이미지 시나리오 그래프의 관계 및 위치 구조를 효과적으로 인코딩하여 캡션 향상에 기여할 수 있는가?
  • RQ2텐서 곱을 통한 명시적 구조적 조합이 엔드 투 엔드로 학습된 어텐션 메커니즘과 비교해 더 나은 일반화 및 성능을 보일 수 있는가?
  • RQ3TPsgtR 표현은 전통적인 시각적 특징 융합 방법과 비교해 캡션 품질과 다양성 측면에서 어떻게 다른가?
  • RQ4주어, 목적어 등의 의미 역할 정보의 포함이 캡션의 통일성과 문법적 정확도를 얼마나 향상시키는가?
  • RQ5시나리오 그래프 생성기가 다른 데이터 분포에서 훈련된 경우에도 TPsgtR은 데이터셋 간 일반화가 가능한가?

주요 결과

  • TPsgtR-sTDBU 아키텍처는 MS COCO 테스트 세트에서 BLEU-4 점수 34.9%를 기록하여, [4]에서 사용한 36개의 평균 영역 제안 수에 비해 더 적은 영역 제안 수(평균 8~9개)를 사용함에도 불구하고 여러 최첨단 모델을 능가했다.
  • TPsgtR-sTDBU 모델은 CIDEr-D 점수 0.554를 기록하여 인간 애너테이션 캡션과의 의미적 내용 및 다양성 일치도가 높다는 것을 나타냈다.
  • 그림 4의 정성적 분석 결과, TPsgtR-sTDBU는 베이스라인 모델 대비 더 기술적이고 문법적으로 올바르며 맥락이 풍부한 캡션을 생성하는 것으로 나타났다.
  • 모델는 TPsgtR-TDBU보다 성능 향상을 보였으며, 이는 의미 인식 기반 상향-하향 어텐션의 효과가 캡션 품질 향상에 기여함을 확인했다.
  • 시나리오 그래프 생성기가 MSCOCO 외부 데이터에서 훈련된(감지 정확도 28%) 경우에도 경쟁 가능한 성능을 기록하여, 특징 소스의 분포 이동에 대해 강건함을 보였다.
  • 결과적으로, TPsgtR와 같은 구조적이고 기호 인식 기반 표현은 순수하게 엔드 투 엔드로 학습된 표현보다 장거리 의존성과 관계 추론을 더 잘 포착할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.