Skip to main content
QUICK REVIEW

[논문 리뷰] COCO-CN for Cross-Lingual Image Tagging, Captioning and Retrieval

Xirong Li, Chaoxi Xu|arXiv (Cornell University)|2018. 05. 22.
Multimodal Machine Learning Applications참고 문헌 45인용 수 14
한 줄 요약

이 논문은 MS-COCO를 확장하여 27,218개의 수작업 중국어 이미지 설명문과 70,993개의 태그를 포함한 대규모 다국어 데이터셋인 COCO-CN을 소개한다. 이는 다국어 이미지 태깅, 설명문 생성 및 검색을 가능하게 하며, 품질 향상과 효율성 향상을 위한 추천 기반 어노테이션 시스템을 제안하고, 계단식 MLP와 개선된 W2VV 모델을 사용하여 강력한 베이스라인을 수립한다. 이는 다국어 및 상용 방법보다 다국어 작업에서 뛰어난 성능을 보인다.

ABSTRACT

This paper contributes to cross-lingual image annotation and retrieval in terms of data and baseline methods. We propose COCO-CN, a novel dataset enriching MS-COCO with manually written Chinese sentences and tags. For more effective annotation acquisition, we develop a recommendation-assisted collective annotation system, automatically providing an annotator with several tags and sentences deemed to be relevant with respect to the pictorial content. Having 20,342 images annotated with 27,218 Chinese sentences and 70,993 tags, COCO-CN is currently the largest Chinese-English dataset that provides a unified and challenging platform for cross-lingual image tagging, captioning and retrieval. We develop conceptually simple yet effective methods per task for learning from cross-lingual resources. Extensive experiments on the three tasks justify the viability of the proposed dataset and methods. Data and code are publicly available at https://github.com/li-xirong/coco-cn

연구 동기 및 목표

  • 비영어권 언어, 특히 중국어를 위한 고품질 대규모 다국어 이미지 데이터셋의 부족을 해결하기 위해.
  • 추천 기반 공동 어노테이션 시스템을 개발하여 이미지 어노테이션의 품질과 효율성을 향상시키기 위해.
  • 이중어 자원을 활용하여 이미지 태깅, 설명문 생성 및 검색을 위한 효과적인 다국어 모델을 수립하기 위해.
  • 다양한 작업을 아우르는 다국어 멀티미디어 이해 평가를 위한 통합 벤치마크를 제공하기 위해.

제안 방법

  • 이미지 콘텐츠를 기반으로 관련 태그와 문장을 추천하는 추천 기반 공동 어노테이션 시스템을 개발하여 어노테이터의 작업 부담을 줄이고 일관성을 향상시켰다.
  • 20,342개의 이미지에서 27,218개의 중국어 설명문과 70,993개의 태그를 수집하여, 다양한 고품질 이중어 어노테이션으로 MS-COCO를 크게 확장했다.
  • 단일어 및 이중어 데이터를 활용하여 다국어 이미지 태깅 성능을 향상시키는 계단식 MLP 모델을 제안했다.
  • 다국어 이미지 검색을 위한 개선된 W2VV 모델을 도입하여 언어 간 시각적 및 텍스트적 특징을 통합했다.
  • 백오프-오브-워드 특징 융합을 통해 태그를 추가 입력으로 통합하여 이미지 설명문 생성 품질을 향상시켰다.
  • 표준 평가 지표를 사용하여 세 가지 작업에서 모델을 평가했다: 이미지 태깅(정밀도, 재현율, F1), 설명문 생성(BLEU-4, METEOR, ROUGE-L, CIDEr), 검색(CL, CM, CLM).

실험 결과

연구 질문

  • RQ1추천 기반 어노테이션 시스템이 다국어 이미지 어노테이션 수집의 품질과 효율성을 크게 향상시킬 수 있는가?
  • RQ2이중어 태그와 문장의 포함 여부가 다국어 이미지 태깅 및 설명문 생성 성능에 어떤 영향을 미치는가?
  • RQ3단일어 및 이중어 데이터로부터 순차적으로 학습하는 것이 다국어 이미지 태깅에서 종단 간 학습보다 우수한가?
  • RQ4태그를 보조 입력으로 통합하면 다국어 환경에서 이미지 설명문 생성 성능이 향상되는가?
  • RQ5개선된 W2VV 모델은 기존 방법과 비교해 다국어 이미지 검색에서 어떤 성능을 보이는가?

주요 결과

  • 추천 기반 시스템은 제안된 태그의 54%를 수락하여 어노테이터의 작업 부담을 크게 줄였고, 고품질 어노테이션을 유지했다.
  • 계단식 MLP는 다국어 이미지 태깅에서 단일어 및 다중작업 모델을 모두 압도하여, 다국어 데이터로부터 순차적 학습의 효과성을 입증했다.
  • 태그 특징을 활용한 이미지 설명문 생성은 CIDEr 점수 90.0을 기록하여 베이스라인(84.6) 대비 5.4점 향상되어 태그가 설명문 품질을 향상시킨다는 것을 입증했다.
  • 개선된 W2VV 모델은 다국어 이미지 검색에서 최고 성능을 기록하여 단일어 및 상용 베이스라인을 모두 능가했다.
  • COCO-CN은 MS-COCO보다 585개의 새로운 개념을 포함하고 있으며, 기계 번역 대비 문장당 45.3% 더 많은 키워드를 포함하여 풍부한 언어 다양성을 보였다.
  • ResNeXt-101 특징는 모든 세 가지 작업에서 최고의 성능을 보였으며, 다국어 표현 학습에서의 우수성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.