Skip to main content
QUICK REVIEW

[论文解读] Attentive Explanations: Justifying Decisions and Pointing to the Evidence (Extended Abstract)

Dong Huk Park, Lisa Anne Hendricks|arXiv (Cornell University)|Nov 17, 2017
Multimodal Machine Learning Applications参考文献 8被引用 4
一句话总结

本文提出了 VQA-X 和 ACT-X 兩個大型數據集,包含人類標註的文本解釋與視覺定位,適用於視覺問題回覆與活動識別任務。提出了一種多模態模型(PJ-X),透過雙注意力機制聯合學習預測決策、生成自然語言解釋,並關注視覺證據,顯著提升了解釋品質與與人類標註證據的一致性。

ABSTRACT

Deep models are the defacto standard in visual decision problems due to their impressive performance on a wide array of visual tasks. On the other hand, their opaqueness has led to a surge of interest in explainable systems. In this work, we emphasize the importance of model explanation in various forms such as visual pointing and textual justification. The lack of data with justification annotations is one of the bottlenecks of generating multimodal explanations. Thus, we propose two large-scale datasets with annotations that visually and textually justify a classification decision for various activities, i.e. ACT-X, and for question answering, i.e. VQA-X. We also introduce a multimodal methodology for generating visual and textual explanations simultaneously. We quantitatively show that training with the textual explanations not only yields better textual justification models, but also models that better localize the evidence that support their decision.

研究动机与目标

  • 解決視覺決策任務中缺乏人類標註的文本與視覺解釋之數據集的問題。
  • 開發一種多模態模型,能夠生成與人類推理一致的文本解釋與視覺注意力地圖。
  • 研究在參考解釋上進行訓練是否能提升模型的定位與解釋品質。
  • 評估為解釋訓練的注意力機制是否能提升與人類標註視覺證據的一致性。
  • 證明將解釋條件化於模型決策(例如答案或分類標籤)能產生更高品質的解釋。

提出的方法

  • 提出兩個大型數據集:VQA-X(30,000 個用於 VQA 的解釋句子)與 ACT-X(54,000 個用於活動識別的句子),均包含人類標註的文本解釋與視覺定位。
  • 收集視覺定位標註,其中標註者標記出能支持答案的區域,提供模型注意力評估的真實標籤。
  • 設計一種「定位與解釋」(PJ-X)模型,包含兩種獨立的注意力機制:一種用於決策預測(ans-att),另一種用於解釋生成(exp-att)。
  • 僅使用圖像、問題、答案與文本解釋的監督信號,端到端訓練模型,無需明確提供解釋區域的邊界框。
  • 利用雙注意力機制,使模型能在預測與解釋生成過程中自我檢視關注點,實現聯合優化。
  • 使用地球移動距離(EMD)與與人類標註定位的等級相關性,評估視覺注意力地圖,驗證其與人類推理的一致性。

实验结果

研究问题

  • RQ1在人類標註的文本解釋上進行訓練,是否能提升視覺問題回覆與活動識別中生成解釋的品質?
  • RQ2模型在解釋生成過程中的注意力與人類標註的視覺證據一致程度如何?
  • RQ3將解釋生成條件化於模型預測(例如答案或類別標籤)是否比僅使用圖像特徵更有效?
  • RQ4在解釋生成中引入注意力機制,是否能同時提升文本解釋與視覺定位的品質?
  • RQ5能否僅透過模型決策、解釋生成與視覺注意力的聯合優化,而不需對注意力區域提供明確監督,實現三者同步優化?

主要发现

  • PJ-X 模型在自動評估與人工評估指標上,均顯著優於基線模型,文本解釋品質獲得提升,ACT-X 上人工評估得分为 26.4,VQA-X 上為 33.6。
  • 在真實解釋(VQA-X 與 ACT-X)上進行訓練,相比僅在圖像描述上訓練的模型,人工評估分數提升 10.4 分。
  • 將解釋生成條件化於模型預測(例如答案或類別標籤),相比僅使用圖像特徵的影像描述模型,人工評估分數在 ACT-X 上提升 7.2 分,在 VQA-X 上提升 14.4 分。
  • 解釋注意力地圖(exp-att)在與人類視覺定位的一致性上優於預測注意力地圖(ans-att),在 ACT-X 上等級相關性達 0.3744,在 VQA-X 上為 0.3132。
  • exp-att 地圖的地球移動距離(EMD)在 VQA-X 上為 4.31,在 ACT-X 上為 3.8,顯著低於基線模型,顯示與人類標註視覺證據的對齊更佳。
  • 消融實驗確認,解釋用的注意力機制與參考解釋的監督皆至關重要:若移除任一項,解釋品質均出現顯著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。