[論文レビュー] Breaking Common Sense: WHOOPS! A Vision-and-Language Benchmark of Synthetic and Compositional Images
本論文は、Midjourney などのテキスト対画像モデルを用いて生成された 500 枚の合成的で常識に反する画像を特徴とする、視覚・言語ベンチマーク WHOOPS! を紹介する。4 つのタスク(説明生成を含む)において最先端モデルを評価した結果、人間の正確性(95%)と BLIP2-XXL(27%)や GPT-3(33%)のモデル間で顕著な性能格差が明らかとなり、AI の視覚的常識的推論能力の向上が求められることを示している。
Weird, unusual, and uncanny images pique the curiosity of observers because they challenge commonsense. For example, an image released during the 2022 world cup depicts the famous soccer stars Lionel Messi and Cristiano Ronaldo playing chess, which playfully violates our expectation that their competition should occur on the football field. Humans can easily recognize and interpret these unconventional images, but can AI models do the same? We introduce WHOOPS!, a new dataset and benchmark for visual commonsense. The dataset is comprised of purposefully commonsense-defying images created by designers using publicly-available image generation tools like Midjourney. We consider several tasks posed over the dataset. In addition to image captioning, cross-modal matching, and visual question answering, we introduce a difficult explanation generation task, where models must identify and explain why a given image is unusual. Our results show that state-of-the-art models such as GPT3 and BLIP2 still lag behind human performance on WHOOPS!. We hope our dataset will inspire the development of AI models with stronger visual commonsense reasoning abilities. Data, models and code are available at the project website: whoops-benchmark.github.io
研究の動機と目的
- オブジェクト認識を超えた視覚的常識的推論を試すベンチマークの開発。
- 物理的・時間的・生物学的・文化的な常識に反する多様な合成データセットの作成。
- 特に説明生成を含む新しいタスクにおいて、最先端の視覚・言語モデルを評価し、現在の限界を明らかにすること。
- 公開可能なデータセット、コード、リーダーボードを提供し、視覚的常識的推論分野における体系的評価と進展を支援すること。
提案手法
- デザイナーと協力し、テキスト対画像モデル(例:Midjourney、DALL-E、Stable Diffusion)を用いて、現実的と思われるシーンを変更することで、500 枚の不審な画像を生成。
- 各画像に、なぜ不審であるかの詳細な説明、記述的キャプション、不十分なキャプション、視覚的質疑応答ペアをアノテート。
- 4 つのベンチマークタスクを定式化:(1) 説明生成、(2) 画像キャプション作成、(3) 詳細なキャプションと不十分なキャプションの間のクロスマodalマッチング、(4) 視覚的質疑応答。
- 人間の評価と整合する GPT-4 を用いた自動評価メトリクスを提案し、説明生成の評価に活用(81% の正確性)。
- BLIP2-XXL、OFA、CoCa、GPT-3 パイプラインなどのモデルに対して、ゼロショットおよび教師あり評価を実施。合成画像と自然画像の比較を用いた。
- 「不審さ」の影響を合成画像生成とは分離するため、(自然、通常、不審) の画像トリオからなる対照セットを収集。
実験結果
リサーチクエスチョン
- RQ1最先端の視覚・言語モデルは、画像が常識に反する理由を妥当な説明として生成できるか?
- RQ2不審な常識違反画像において、モデルの説明生成パフォーマンスは人間のパフォーマンスと比べてどの程度か?
- RQ3WHOOPS! の難易度は、画像生成技術に起因するのか、それとも画像自体の不審さや構成的不整合に起因するのか?
- RQ4時間的・生物学的・物理的など、どの種類の常識違反が現在のモデルにとって最も困難か?
- RQ5説明生成の自動評価メトリクスは、人間の判断を信頼性高く反映できるか?
主な発見
- 説明生成における人間のパフォーマンスは 95% に達したが、最良のモデル(微調整済み BLIP2-XXL)はわずか 27% の受容性にとどまり、視覚的常識的推論における顕著な格差が明らかになった。
- GPT-4 を用いた自動評価メトリクスは、人間の評価と 81% の正確性で一致し、信頼性の高い自動ベンチマーク評価を可能にした。
- 正解の画像記述(オラクル入力)が与えられた場合でも、モデルのパフォーマンスは 68% にとどまり、課題の本質は記述ではなく推論にあることが証明された。
- モデルのパフォーマンスは常識のカテゴリによって顕著に変動した:BLIP2-XXL や GPT-3 パイプラインは、時間的不整合と芸術的知識違反に対して特に苦戦した。
- 画像キャプション作成の正確性は、自然画像・通常画像では 89% であったが、不審な画像では 49% に低下し、困難さの主な要因は「不審さ」そのものであることが確認された。
- GPT-3 を用いたパイプラインアプローチ(予測キャプションを入力として使用)は、46% の常識カテゴリでエンドツーエンドの BLIP2-XXL を上回り、大規模言語モデルが中間出力に導かれた場合に、視覚的不整合をよりよく推論できることを示唆した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。