Skip to main content
QUICK REVIEW

[論文レビュー] COCO-CN for Cross-Lingual Image Tagging, Captioning and Retrieval

Xirong Li, Chaoxi Xu|arXiv (Cornell University)|May 22, 2018
Multimodal Machine Learning Applications参考文献 45被引用数 14
ひとこと要約

本稿では、MS-COCOに27,218件の手作業による中国語画像キャプションと70,993件のタグを追加した大規模な多言語データセットCOCO-CNを紹介する。これにより、多言語間画像タグ付け、キャプション作成、リtrievalが可能になる。推薦支援型アノテーションシステムを提案し、品質と効率を向上させた。また、段階的MLPと強化されたW2VVモデルを用いた強力なベースラインを確立し、多言語間タスクにおいて単言語および商業的手法を上回った。

ABSTRACT

This paper contributes to cross-lingual image annotation and retrieval in terms of data and baseline methods. We propose COCO-CN, a novel dataset enriching MS-COCO with manually written Chinese sentences and tags. For more effective annotation acquisition, we develop a recommendation-assisted collective annotation system, automatically providing an annotator with several tags and sentences deemed to be relevant with respect to the pictorial content. Having 20,342 images annotated with 27,218 Chinese sentences and 70,993 tags, COCO-CN is currently the largest Chinese-English dataset that provides a unified and challenging platform for cross-lingual image tagging, captioning and retrieval. We develop conceptually simple yet effective methods per task for learning from cross-lingual resources. Extensive experiments on the three tasks justify the viability of the proposed dataset and methods. Data and code are publicly available at https://github.com/li-xirong/coco-cn

研究の動機と目的

  • 英語以外の言語、特に中国語における高品質で大規模な多言語画像データセットの不足に対処すること。
  • 推薦支援型共同アノテーションシステムの開発により、画像アノテーションの品質と効率を向上させること。
  • 二か国語リソースを活用して、画像タグ付け、キャプション作成、リtrievalのための効果的な多言語モデルを確立すること。
  • 複数のタスクにわたる多言語マルチメディア理解の評価のための統一ベンチマークを提供すること。

提案手法

  • 画像の内容に基づいて関連するタグや文をアノテーターに提案する推薦支援型共同アノテーションシステムを開発し、作業負荷を軽減するとともに一貫性を向上させた。
  • 20,342枚の画像を収集し、27,218件の中国語キャプションと70,993件のタグを追加。多様で高品質な二か国語アノテーションにより、MS-COCOを大幅に拡張した。
  • 単語語彙と二か国語データを活用して多言語間画像タグ付け性能を向上させる段階的MLPモデルを提案した。
  • 視覚的および言語的特徴を複数言語で統合する多言語間画像リtrievalのための強化されたW2VVモデルを導入した。
  • Bag-of-Words特徴統合を用いてタグを追加入力として統合し、画像キャプション生成の品質を向上させた。
  • 標準指標を用いて3つのタスクでモデルを評価した:画像タグ付け(精度、再現率、F1)、キャプション作成(BLEU-4、METEOR、ROUGE-L、CIDEr)、リtrieval(CL、CM、CLM)。

実験結果

リサーチクエスチョン

  • RQ1推薦支援型アノテーションシステムは、多言語画像アノテーションの収集における品質と効率を顕著に向上させることができるか?
  • RQ2二か国語のタグや文の追加は、多言語間画像タグ付けおよびキャプション作成の性能にどのような影響を与えるか?
  • RQ3単語語彙と二か国語データからの段階的学習は、単語語彙データでのエンドツーエンド学習を上回る性能を示せるか?
  • RQ4タグを補助入力として組み込むことで、多言語環境下での画像キャプション生成性能が向上するか?
  • RQ5強化されたW2VVモデルは、既存の手法と比較して多言語間画像リtrievalで優れた性能を示すか?

主な発見

  • 推薦支援システムでは、提案されたタグの受容率が54%に達し、アノテーターの作業負荷を顕著に軽減しながらも高品質なアノテーションを維持した。
  • 段階的MLPは、単語語彙モデルおよびマルチタスクモデルを上回り、多言語データからの段階的学習の有効性を示した。
  • タグ特徴を組み込んだ画像キャプション生成では、CIDErスコアが90.0に達し、ベースライン(84.6)から5.4ポイント向上した。これは、タグがキャプション品質を向上させることを証明している。
  • 強化されたW2VVモデルは、多言語間画像リtrievalで最先端の性能を達成し、単語語彙および商業的ベースラインを上回った。
  • COCO-CNにはMS-COCOにない585の新規概念が含まれており、機械翻訳と比較して1文あたり45.3%も多くのキーワードを含むことから、豊富な言語的多様性が示された。
  • ResNeXt-101特徴量は、すべての3つのタスクで最高の性能を示し、多言語表現学習における優位性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。