Skip to main content
QUICK REVIEW

[論文レビュー] Do Androids Laugh at Electric Sheep? Humor "Understanding" Benchmarks from The New Yorker Caption Contest

Jack Hessel, Ana Marasović|arXiv (Cornell University)|Sep 13, 2022
Multimodal Machine Learning Applications被引用数 5
ひとこと要約

本論文は『ニューヨーカー』カートゥンキャプションコンテストを用いてマルチモーダルなユーモア理解のベンチマークを導入し、3つのタスク—カートゥンにキャプションを一致させる、キャプションの質をランク付けする、およびなぜそのキャプションが面白いのかを説明する—を提案する。最新のマルチモーダルおよび言語モデルを用いても、人間の性能に比べて著しく劣る結果となった:キャプション一致タスクでは最高で62%の正答率(人間は94%)にとどまり、GPT-4による説明は66%以上のケースで人間が書いた説明よりも好まれたが、依然としてAIのユーモア理解における重要なギャップが浮き彫りになった。

ABSTRACT

Large neural networks can now generate jokes, but do they really "understand" humor? We challenge AI models with three tasks derived from the New Yorker Cartoon Caption Contest: matching a joke to a cartoon, identifying a winning caption, and explaining why a winning caption is funny. These tasks encapsulate progressively more sophisticated aspects of "understanding" a cartoon; key elements are the complex, often surprising relationships between images and captions and the frequent inclusion of indirect and playful allusions to human experience and culture. We investigate both multimodal and language-only models: the former are challenged with the cartoon images directly, while the latter are given multifaceted descriptions of the visual scene to simulate human-level visual understanding. We find that both types of models struggle at all three tasks. For example, our best multimodal models fall 30 accuracy points behind human performance on the matching task, and, even when provided ground-truth visual scene descriptors, human-authored explanations are preferred head-to-head over the best machine-authored ones (few-shot GPT-4) in more than 2/3 of cases. We release models, code, leaderboard, and corpus, which includes newly-gathered annotations describing the image's locations/entities, what's unusual in the scene, and an explanation of the joke.

研究の動機と目的

  • 大規模なAIモデルが本当にユーモアを『理解している』かどうかを、文化的に繊細な現実世界のカートゥンキャプションでテストすること。
  • ニューヨーカー・カートゥン・キャプション・コンテストに基づいた、複雑さを反映する挑戦的で多面的なベンチマークを開発すること。
  • マルチモーダルおよび言語モデルの、ユーモラスな画像・キャプションペアの認識、ランク付け、説明における限界を調査すること。
  • 今後の研究を支援するため、視覚的記述、異常な状況要因、ジョークの説明を含む豊富にアノテートされたコーパスを公開すること。
  • AIが創造的協働、たとえばブレインストーミングやユーモラスなキャプションの生成において果たせる可能性を検討すること。

提案手法

  • 段階的に複雑さが増す3つのタスクを定式化:(1) 誤り候補から最終選考キャプションをそのカートゥンに一致させる、(2) 同じカートゥンに対して最終選考キャプションを非最終選考キャプションよりも高くランク付ける、(3) 優勝キャプションがなぜ面白いのかを自由記述形式で説明する。
  • 2つの評価設定を用いる:'ピixeLから'(モデルが生のカートゥン画像を処理する)と'記述から'(モデルが人間がアノテートした視覚的記述を受け取る、人間レベルの視覚を模倣する)。
  • シーンの記述、異常な要素、ジョークの説明を含む、豊富にアノテートされた新しいデータセットを収集し、1,000枚以上のカートゥンをアノテート。
  • 最新のモデル—マルチモーダルタスクに微調整されたCLIP(ViT-L/14)と、few-shot GPT-4による説明生成—をベンチマークで評価。
  • 創造的協働を可能にするための、提示を最適化したプロンプトを設計し、コーパスを再形式化してAI支援のブレインストーミングおよびキャプション生成を支援する。
  • 人間による評価を実施し、モデルが生成した説明と人間が書いた説明を、ペairワイズの好み比較によって比較。

実験結果

リサーチクエスチョン

  • RQ1マルチモーダルモデルは、優勝キャプションをその対応するカートゥン画像に正確に一致させることができるか?
  • RQ2同じカートゥンに対して、高品質なキャプションと低品質なキャプションを、両方が画像と一致する状況でも区別できるか?
  • RQ3言語モデルは、人間が書いた説明よりも好まれるような、ユーモアの説明を生成できるか?
  • RQ4人間レベルの視覚的記述へのアクセスが、ユーモア理解タスクにおけるモデル性能にどのように影響するか?
  • RQ5AIモデルは、ユーモラスなカートゥンキャプションを生成する創造的プロセスをどの程度支援できるか?

主な発見

  • 'ピクセルから'設定では、最高のマルチモーダルモデル(微調整済みCLIP ViT-L/14)がキャプション一致タスクで62%の正答率を達成したが、人間は94%であった。
  • 真値の視覚的記述が提供されても、最高の言語モデル(5ショットGPT-4)が生成する説明は、1/3未満のケースで人間の説明よりも好まれるにとどまり、説明品質における顕著なギャップを示している。
  • ペアワイズ比較において、人間の説明が機械生成のものよりも66%以上で好まれ、現在のモデルが人間レベルのユーモア理解を再現できていないことを実証している。
  • 性能のギャップは、3つのタスクすべてにわたって継続しており、ニューヨーカー風ユーモアの背後にある繊細で間接的で文化的に埋め込まれた関係性をAIモデルが理解できないことが示唆されている。
  • 本研究の提出以降の言語モデルの進歩にもかかわらず、性能のギャップは依然として顕著であり、現在のモデルがまだユーモアの深いメカニズムを理解していないことを示している。
  • アノテーション、モデル、コード、およびcapcon.devのリーダーボードを含む公開されたベンチマークは、AIにおけるユーモア理解の発展に貴重なリソースを提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。