Skip to main content
QUICK REVIEW

[논문 리뷰] Collecting Image Description Datasets using Crowdsourcing

Ramakrishna Vedantam, C. Lawrence Zitnick|arXiv (Cornell University)|2014. 11. 12.
Multimodal Machine Learning Applications참고 문헌 12인용 수 4
한 줄 요약

이 논문은 아마존 메카니컬 트루크를 통해 수집한 각 이미지당 50건의 인간 작성 캡션을 포함하는 두 가지 새로운 이미지 설명 데이터셋—ABSTRACT-50S와 PASCAL-50S—을 소개한다. 작업자들에게 자유로운 서술 대신 주요 시점 요소를 '기록'하도록 지시하여, 기존의 이미지당 5개의 캡션만을 포함하는 데이터셋에 비해 훨씬 더 높은 품질과 객관성, 더 높은 서술 다양성을 확보하였다.

ABSTRACT

We describe our two new datasets with images described by humans. Both the datasets were collected using Amazon Mechanical Turk, a crowdsourcing platform. The two datasets contain significantly more descriptions per image than other existing datasets. One is based on a popular image description dataset called the UIUC Pascal Sentence Dataset, whereas the other is based on the Abstract Scenes dataset con- taining images made from clipart objects. In this paper we describe our interfaces, analyze some properties of and show example descriptions from our two datasets.

연구 동기 및 목표

  • 이미지당 다수의 캡션을 포함하는 고품질이고 다양한 이미지 설명 데이터셋의 부족을 해결하기 위해.
  • 사람들이 이미지를 어떻게 다르게 묘사하는지 반영하기 위해, 각 이미지당 대량의 인간 작성 객관적 서술을 수집하기 위해.
  • 자유로운 서술 프롬프트 대신 '기록' 지시어를 사용하여, 이미지 설명의 품질과 관련성 향상시키기 위해.
  • 특히 제로샷 학습 및 이미지 캡션 생성에 적합한 골드 표준 데이터셋을 만들기 위해.
  • 실제 세계의 이미지(PASCAL-50S)와 추상적, 만화 같은 이미지(ABSTRACT-50S)를 모두 기반으로 하여 더 넓은 연구 응용을 가능하게 하기 위해.

제안 방법

  • 각 이미지당 50개의 캡션을 별개의 자격을 갖춘 작업자로부터 아마존 메카니컬 트루크를 통해 수집하였다.
  • 작업자의 품질을 확보하기 위해 미국 거주자이며, HIT 승인률 95% 이상, 승인 건수 500건 이상인 자격을 요구하였다.
  • 자신의 상상력이나 주관적 해석을 줄이기 위해, 자유로운 서술 대신 시점의 주요 요소를 '기록'하도록 지시하였다.
  • 유사한 이미지들 간에서 서술의 객관성, 명확성, 식별 가능성을 강조하는 인터페이스를 설계하였다.
  • 대화문, 지나치게 기술적인 서술, 문법 오류가 있는 문장은 거절 기준을 적용하여 걸러내었다.
  • 두 가지 데이터셋을 생성하였다: UIUC PASCAL Sentence Dataset의 실제 이미지에서 유래한 PASCAL-50S와, 합성된 추상적 이미지에서 유래한 ABSTRACT-50S.

실험 결과

연구 질문

  • RQ1자유로운 서술 지시어 대신 '기록' 지시어를 사용할 경우, 이미지 캡션의 품질과 객관성에 어떤 영향을 미치는가?
  • RQ2이미지당 50개의 캡션을 수집함으로써, 이미지 서술의 다양성과 대표성에 어떤 영향을 미치는가?
  • RQ3실제 이미지(PASCAL-50S)와 추상적 이미지(ABSTRACT-50S) 간의 캡션 길이와 언어 스타일은 어떻게 다를까?
  • RQ4수집된 캡션들이 이미지 내에서 물체의 세부 중요도와 의미적 차이를 얼마나 잘 반영하고 있는가?
  • RQ5이러한 데이터셋은 제로샷 학습 및 이미지 캡션 생성과 같은 시각-언어 작업에서 성능 향상에 기여할 수 있는가?

주요 결과

  • PASCAL-50S 데이터셋은 1,000개의 이미지와 각각 50개의 인간 작성 캡션을 포함하여 총 50,000개의 서술을 포함한다.
  • ABSTRACT-50S 데이터셋은 500개의 추상적 이미지와 각각 50개의 캡션을 포함하여 총 25,000개의 서술을 포함한다.
  • PASCAL-50S의 평균 캡션 길이는 8.8개의 단어이며, ABSTRACT-50S는 10.59개의 단어로, 추상적 이미지에 대해 더 구체적인 서술이 이루어졌음을 시사한다.
  • '기록' 지시어를 사용함으로써, 자유로운 서술 작업에 비해 수집된 서술의 객관성과 이미지 관련성이 뚜렷이 향상되었다.
  • 서술 스타일과 어휘 표현에 다양한 변동성이 존재하여, 동일한 이미지를 서로 다른 방식으로 인식하는 인간의 다양성을 반영하고 있다.
  • 이 데이터셋들은 시각-언어 이해, 제로샷 학습, 이미지 캡션 생성 등 다양한 모델의 훈련 및 평가에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.