Skip to main content
QUICK REVIEW

[논문 리뷰] Grounding Object Detections With Transcriptions

Yasufumi Moriya, Ramon Sanabria|arXiv (Cornell University)|2019. 06. 13.
Multimodal Machine Learning Applications참고 문헌 32인용 수 5
한 줄 요약

이 논문은 지침 영상에서 음성 번역문과 영상 프레임을 시간에 맞춰 정렬함으로써 객체 검출 및 시각적 기반 주석을 자동으로 생성하는 방법을 제안한다. 시간에 맞춰 정렬된 음성 번역문을 사용해 실체를 식별하며, How2 및 Flickr30k 데이터셋에서 경쟁적인 성능을 달성한다. 이는 인간이 주석을 달지 않은 박스나 레이블로 훈련된 약한 지도 학습 모델이 인간의 시각-언어 관계를 의미 있게 학습할 수 있음을 보여준다.

ABSTRACT

A vast amount of audio-visual data is available on the Internet thanks to video streaming services, to which users upload their content. However, there are difficulties in exploiting available data for supervised statistical models due to the lack of labels. Unfortunately, generating labels for such amount of data through human annotation can be expensive, time-consuming and prone to annotation errors. In this paper, we propose a method to automatically extract entity-video frame pairs from a collection of instruction videos by using speech transcriptions and videos. We conduct experiments on image recognition and visual grounding tasks on the automatically constructed entity-video frame dataset of How2. The models will be evaluated on new manually annotated portion of How2 dev5 and val set and on the Flickr30k dataset. This work constitutes a first step towards meta-algorithms capable of automatically construct task-specific training sets.

연구 동기 및 목표

  • 실세계 영상 응용 분야에서 지도 학습을 위한 제한된 레이블이 부여된 시각 데이터 문제를 해결하기 위해.
  • 비용이 많이 들고 오류가 발생하기 쉬운 인간 주석에 의존하는 것을 줄이기 위해, 음성 번역문에서 자동으로 객체-영상 프레임 쌍을 생성하기 위해.
  • 비스시프트, 지침 영상에서 음성 번역문이 시각적 실체에 효과적으로 기반을 두는지 탐색하기 위해.
  • 자동으로 구성된 데이터셋으로 훈련된 객체 인식 및 시각적 기반 모델의 성능을 평가하기 위해.
  • 원시 오디오-비디오 데이터에서 작업별 훈련 세트를 자동으로 구축할 수 있는 메타 알고리즘의 기반을 마련하기 위해.

제안 방법

  • 지침 영상에서 시간에 맞춰 정렬된 자동 음성 인식(ASR) 번역문을 활용해 명사 실체와 그에 해당하는 타임스탬프를 식별한다.
  • 각 명사 실체가 나타나는 시간에 해당하는 영상 프레임을 추출하고, 해당 실체와 쌍을 이루어 훈련 데이터를 구성한다.
  • 객체 인식을 위해 VGG-16 네트워크를 사용하며, 자동으로 생성된 데이터셋으로 미세조정하고, 일대일(소프트맥스) 및 다대다(시그모이드) 훈련 전략을 모두 적용한다.
  • 다중 예제 학습(MIL) 및 복원 기반 접근법을 사용해 약한 지도 학습 기반의 시각적 기반을 수행하며, ResNet-152의 영역 제안 및 특징 임베딩을 활용한다.
  • 분류 작업에는 교차 엔트로피 손실, 기반 작업에는 순서 정렬 손실을 사용하며, 딥 네URAL 네트워크에서 유도된 특징 표현을 활용한다.
  • How2 dev5/val의 수동 주석이 달린 부분과 Flickr30k 데이터셋에서 모델의 일반화 능력과 성능을 평가하기 위해 평가를 수행한다.

실험 결과

연구 질문

  • RQ1인간 주석 없이도 음성 번역문을 신뢰성 있게 사용해 정확한 객체 검출 및 시각적 기반 주석을 생성할 수 있는가?
  • RQ2오디오-비디오 데이터에서 자동으로 생성된 레이블로 훈련된 약한 지도 학습 모델이 객체 인식 및 기반 작업에서 얼마나 효과적인가?
  • RQ3약한 레이블 데이터에서 일대다 훈련 전략(시그모이드 활성화)이 일대일 훈련 전략(소프트맥스)보다 성능이 뛰어나게 되는가?
  • RQ4자동으로 생성된 레이블로 훈련했을 때, 다중 예제 학습(MIL) 기반 모델이 복원 기반 방법보다 성능이 뛰어나게 되는가?
  • RQ5자동으로 구성된 데이터셋으로 훈련된 모델가 다른 벤치마크, 예를 들어 Flickr30k에 대해 얼마나 잘 일반화되는가?

주요 결과

  • How2 데이터셋에서 일대다 훈련 전략(시그모이드 활성화 및 이진 교차 엔트로피 손실)은 일대일 접근 방식보다 더 높은 평균 정밀도 평균(마프) 성능을 달성했으며, 검증 세트에서 마프@20가 9.54에 도달했다.
  • Flickr30k 데이터셋에서 다중 레이블 시스템은 검증 세트에서 마프@20가 44.34를 기록했으며, 단일 레이블 시스템보다 뚜렷이 뛰어나, 다객체 이미지에서의 일반화 능력 향상을 입증했다.
  • How2 dev5 세트에서 MIL 기반 시각적 기반 모델은 최고의 IoU@0.5 점수 9.3%를 기록했으며, 무작위 기반(7.6%) 및 복원 방법(7.9%)을 모두 앞서며, 약한 지도 학습에서 효과적인 국소화를 가능하게 했다.
  • Flickr30k에서 MIL 모델은 테스트 세트에서 IoU@0.5 점수 19.6%를 기록했으며, 기반 모델 대비 일관된 성능 향상을 보이며, 이 방법이 다른 데이터셋으로의 이식 가능성도 입증했다.
  • How2 및 Flickr30k 양쪽 데이터셋에서의 상한선 IoU 점수는 현재 모델과 최적 성능 사이에 여전히 큰 격차가 있음을 시사하며, 기반 알고리즘의 향상 여지가 크다는 것을 보여준다.
  • 최신 기술 수준에 못 미치는 방법을 사용했음에도 불구하고, 자동으로 생성된 레이블로 훈련된 모델들이 의미 있는 성능을 달성했으며, 실세계 영상에서 자동 데이터 구축의 가능성은 입증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.