Skip to main content
QUICK REVIEW

[論文レビュー] Face2Text: Collecting an Annotated Image Description Corpus for the Generation of Rich Face Descriptions

Albert Gatt, Marc Tanti|arXiv (Cornell University)|Mar 10, 2018
Multimodal Machine Learning Applications参考文献 26被引用数 17
ひとこと要約

本稿では、現実世界の状況で収集された顔画像のための豊富で人間がアノテートしたテキスト記述を含む大規模なクラウドソーシング型コーパス、Face2Textを提示する。研究では、記述が一般的に物理的・感情的・推論的属性を混合していることが明らかになった。これは、現実の視覚的特徴に焦点を当てた現在の画像からテキストへのモデルとは対照的であり、微細な文脈に配慮した顔認識記述生成分野における最先端の技術を前進させるものである。

ABSTRACT

The past few years have witnessed renewed interest in NLP tasks at the interface between vision and language. One intensively-studied problem is that of automatically generating text from images. In this paper, we extend this problem to the more specific domain of face description. Unlike scene descriptions, face descriptions are more fine-grained and rely on attributes extracted from the image, rather than objects and relations. Given that no data exists for this task, we present an ongoing crowdsourcing study to collect a corpus of descriptions of face images taken `in the wild'. To gain a better understanding of the variation we find in face description and the possible issues that this may raise, we also conducted an annotation study on a subset of the corpus. Primarily, we found descriptions to refer to a mixture of attributes, not only physical, but also emotional and inferential, which is bound to create further challenges for current image-to-text methods.

研究の動機と目的

  • 現実世界の状況(「イン・ザ・ワイルド」)で収集された顔画像のための、大規模かつ多様な人間によるテキスト記述のコーパスを構築すること。
  • 特に物理的・感情的・推論的属性の混合を含む、人間の顔の記述の意味的・文法的複雑さを調査すること。
  • 推論や感情といった曖昧な属性を定義する際の課題を特定するため、記述カテゴリにおけるアノテーター間整合性を評価すること。
  • 将来的な自動顔記述生成研究を支援するため、高度なNLGモデルのトレーニングおよび評価に使用可能なデータ基盤を提供すること。
  • データ拡張技術および微細な意味的アノテーションの検討を通じて、顔記述タスクにおけるモデルの解釈可能性とパフォーマンスを向上させること。

提案手法

  • 非専門のアノテーターから現実世界の顔画像の自由記述を収集するためのクラウドソーシング研究を実施した。
  • 記述の意味的コンテンツを分類するための五段階のアノテーションスキーム(物理的、感情的、推論的、社会的、その他)を設計した。
  • 特に曖昧なクラス(例:「推論」)における信頼性を評価するため、Fleissのカッパを用いたアノテーター間整合性の検証を実施した。
  • 背景が記述の顕著さやスタイルに与える影響を調査するため、アノテーターから人口統計的および文脈的メタデータを収集した。
  • Web検索を用いて類似画像を特定し、周囲のコンテンツから一致するテキスト記述を抽出することで、半自動的なデータ拡張を検討した。
  • 将来の微細なアノテーション計画として、具体的な属性(例:髪の色、感情、人種)をタグ付けすることで、モデルのトレーニングおよび評価を向上させることを想定している。

実験結果

リサーチクエスチョン

  • RQ1自然な状況下で人間は、顔画像の記述において、物理的・感情的・推論的属性のどのタイプを一般的に含むか?
  • RQ2特に曖昧なカテゴリ(例:「推論」)において、人間のアノテーターが顔の記述の意味的カテゴリを分類する際の信頼性はどの程度か?
  • RQ3年齢・性別・文化的背景などの人口統計的要因が、顔の記述における属性の顕著さや種別にどの程度影響を及えるか?
  • RQ4Webベースの画像検索および周囲のテキストマイニングを用いて、既存の画像-記述ペairをどのようにデータセット拡張に活用できるか?
  • RQ5記述に視覚的でない推論的または感情的コンテンツが含まれる場合、自動顔記述システムのトレーニングにおける主な課題は何か?

主な発見

  • コーパス内の記述は物理的属性を主に含むが、感情的および推論的要素も顕著な割合で含まれており、意味的複雑性が非常に高いことが示された。
  • 物理的および感情的カテゴリではアノテーター間整合性が中程度から高く、一方「推論」カテゴリでは低く、明確な定義とトレーニングの必要性が示された。
  • カテゴリ全体における平均Fleissのカッパは0.45であり、範囲は-0.19から0.88までであった。1つの外れ値を除外した後、平均は0.60に上昇し、精錬後の信頼性が妥当であることが示された。
  • コーパスは、単純なオブジェクトラベリングをはるかに超える、現実世界の人間の記述行動を反映した多様な文法的・意味的変異を捉えている。
  • 「真剣な」や「後悔している」、あるいは「自分を守っている」のような感情的および推論的属性が頻繁に言及されており、記述における感情的および文脈的解釈の重要性が浮き彫りになった。
  • 半自動的なWebマイニングを用いたデータ拡張により、コーパスのスケールと多様性が拡大されており、今後は微細な意味的タグ付けを適用して、より正確な評価およびモデルトレーニングを可能にする計画である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。