Skip to main content
QUICK REVIEW

[논문 리뷰] A Data Augmentation Approach for Sign-Language-To-Text Translation In-The-Wild

Xiujun Li, Xi Yin|arXiv (Cornell University)|2020. 04. 13.
Multimodal Machine Learning Applications참고 문헌 48인용 수 134
한 줄 요약

이 논문은 시각-언어 사전 훈련 방법인 Oscar를 제안하며, 이미지에서 검출된 객체 태그를 의미적 기준점으로 사용하여 다중모달 간 정렬을 향상시킵니다. 통합된 트랜스포머 프레임워크에서 영역 특징과 텍스트 임베딩에 객체 태그를 통합함으로써, VQA, 이미지 캡션, NLVR2를 포함한 여섯 가지 시각-언어 과제에서 최신 기준 성능을 달성하며 기존 방법보다 뚜렷한 성능 향상을 보입니다.

ABSTRACT

In this paper, we describe the current main approaches to sign language translation which use deep neural networks with videos as input and text as output. We highlight that, under our point of view, their main weakness is the lack of generalization in daily life contexts. Our goal is to build a state-of-the-art system for the automatic interpretation of sign language in unpredictable video framing conditions. Our main contribution is the shift from image features to landmark positions in order to diminish the size of the input data and facilitate the combination of data augmentation techniques for landmarks. We describe the set of hypotheses to build such a system and the list of experiments that will lead us to their verification.

연구 동기 및 목표

  • 이미지 영역과 텍스트 토큰 간에 명시적인 기반 없이 약한 감독을 받는 다중모달 정렬 문제를 해결한다.
  • 현대 객체 검출기의 높은 정확도를 활용하여 주목할 만하고 의미적으로 유의미한 객체를 정렬을 위한 앵커 포인트로 식별한다.
  • 객체 태그를 통해 명시적이고 기반된 지도 학습을 제공함으로써 이미지-텍스트 의미 정렬 학습의 효율성과 효과를 향상시킨다.
  • 개선된 사전 훈련을 통해 다양한 시각-언어 이해 및 생성 과제에서 최신 기준 성능을 달성한다.
  • 대표적 표현 학습에서 객체 태그가 직접적인 시각적 특징보다 정렬 앵커로 더 효과적임을 분석을 통해 입증한다.

제안 방법

  • 각 이미지-텍스트 쌍을 단어 토큰, 객체 태그(객체 검출기를 통해 검출된 것), 이미지 영역 특징의 삼중조로 표현한다.
  • 텍스트와 객체 태그 모두에 사전 훈련된 단어 임베딩을 사용하며, 사전 매핑을 통해 공통 의미 공간에 정렬한다.
  • 모델을 두 가지 목적으로 사전 훈련한다: 단어와 태그에 대한 마스킹 토큰 예측, 객체 태그와 해당 이미지 영역 간의 대비 손실.
  • 객체 태그를 앵커 포인트로 사용하여 트랜스포머 인코더의 자기주의 기반 메커니즘을 이끌어내어 시각적 영역과 언어 단위 간의 정렬을 향상시킨다.
  • 언어적 의미 공간(예: BERT 임베딩)을 활용하여 객체 태그의 표현 품질을 향상시켜 원시 영역 특징보다 더 구분력 있는 특징으로 만든다.
  • 표준 피니튜닝 프rotocol를 사용하여 VQA, 이미지 캡션, 이미지-텍스트 검색과 같은 최종 과제에서 사전 훈련된 Oscar 모델을 피니튜닝한다.

실험 결과

연구 질문

  • RQ1이미지에서 검출된 객체 태그가 시각-언어 사전 훈련에서 다중모달 정렬을 향상시키는 데 효과적인 앵커 포인트로 기능할 수 있는가?
  • RQ2직접적인 자기주의 기반의 원시 영역 특징과 텍스트 토큰에 의존하는 것과 비교해 객체 태그를 의미적 앵커로 사용할 경우 어떤 차이가 있는가?
  • RQ3객체 태그를 사용한 사전 훈련이 시각-언어 이해 및 생성 과제 양쪽에서 성능 향상에 기여하는가?
  • RQ4다양한 객체 태그 소스(예: Visual Genome 대비 Open Images)가 최종 성능에 어떤 영향을 미치는가?
  • RQ5새로운 객체 캡션과 같은 제로샷 또는 피처샷 설정에서 객체 태그가 일반화 성능을 향상시킬 수 있는가?

주요 결과

  • Oscar는 VQA, 이미지 캡션, NLVR2를 포함한 여섯 가지 기존의 시각-언어 벤치마크에서 새로운 최신 기준 성능을 달성한다.
  • VQA 개발 세트에서 Oscar는 객체 태그 없이 기반 모델 대비 정확도를 71.70으로 향상시켰으며, 이는 상대적 향상 1.1%에 해당한다.
  • 이미지 캡션 과제에서 Oscar는 BLEU-4 점수 36.4, ROUGE-L 점수 30.3, CIDEr 점수 123.4를 기록하며, 기반 모델 대비 각각 1.9, 1.2, 7.8점 향상되었다.
  • 동일한 영역 특징을 사용하더라도 객체 태그를 앵커 포인트로 사용하는 것이 기반 모델보다 성능 향상에 뚜렷한 영향을 미친다.
  • Visual Genome(VG) 객체 태그로 사전 훈련한 모델가 Open Images(OI) 태그를 사용한 모델보다 성능이 뛰어나며, 이는 VG 데이터셋의 더 높은 객체 다양성 때문일 것이다.
  • 절단 실험 결과, 객체 태그가 직접적인 시각적 특징으로 사용되는 것보다 정렬 앵커로 사용될 때 가장 효과적임을 확인하였으며, 이는 특징의 중복을 증가시키지 않으면서도 정렬을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.