Skip to main content
QUICK REVIEW

[論文レビュー] How model accuracy and explanation fidelity influence user trust

Andrea Papenmeier, Gwenn Englebienne|arXiv (Cornell University)|Jul 26, 2019
Explainable Artificial Intelligence (XAI)参考文献 21被引用数 62
ひとこと要約

本研究は、モデルの精度が説明の忠実度よりもユーザーの信頼をより強く左右することを示し、説明が高精度モデルと整合しない、または意味不明である場合には信頼を損ねる可能性があることを示唆する。観測された信頼は自己申告の信頼と乖離することがある。

ABSTRACT

Machine learning systems have become popular in fields such as marketing, financing, or data mining. While they are highly accurate, complex machine learning systems pose challenges for engineers and users. Their inherent complexity makes it impossible to easily judge their fairness and the correctness of statistically learned relations between variables and classes. Explainable AI aims to solve this challenge by modelling explanations alongside with the classifiers, potentially improving user trust and acceptance. However, users should not be fooled by persuasive, yet untruthful explanations. We therefore conduct a user study in which we investigate the effects of model accuracy and explanation fidelity, i.e. how truthfully the explanation represents the underlying model, on user trust. Our findings show that accuracy is more important for user trust than explainability. Adding an explanation for a classification result can potentially harm trust, e.g. when adding nonsensical explanations. We also found that users cannot be tricked by high-fidelity explanations into having trust for a bad classifier. Furthermore, we found a mismatch between observed (implicit) and self-reported (explicit) trust.

研究の動機と目的

  • 自動意思決定システムの精度がユーザーの信頼に与える影響を調べる。
  • 説明の有無と忠実度がユーザーの信頼に与える影響を調査する。
  • 精度と説明忠実度の信頼への相互作用を評価する。
  • 高忠実度と低忠実度を用いた最小限の説明アプローチを検証する。
  • 信頼ダイナミクスに関する説明可能なAIの実務家への実証的洞察を提供する。

提案手法

  • 3つの精度レベル(高・中・低)と3つの説明忠実度(高・低・なし)を組み合わせた9つの分類器—説明条件を開発する。
  • ツイートを不適切か否かに分類するソーシャルメディアモデレーションのシナリオを使用する。
  • 3つの分類器を訓練する:高精度(CNNベース)、中精度(ロジスティック回帰)、低精度(逆ラベルCNN)。
  • 説明を生成する:高忠実度はCNN上のL2Xで高精度モデルと逆ラベルモデルに対して、中は高忠実度の係数、低忠実度の説明はランダムな語の選択で作成。
  • 選択特徴へのテキストの縮小によって忠実度を検証し、予測が正解と一致するかを確認する。
  • 被験者間デザインのユーザースタディを327名(有効286名)実施し、自己申告信頼と行動による観測信頼を測定する。
  • 事前調査の手動ラベリング課題に続き、15ツイートのシステム支援ラベリングを行い、Körber (2018) 質問票を用いて理解と信頼を測定する。
  • 信頼データをマン-Whitney U検定と多重比較のボンフェローニ補正で分析する。

実験結果

リサーチクエスチョン

  • RQ1RQ1: 自動意思決定システムの精度はユーザー信頼にどのような影響を与えるか?
  • RQ2RQ2: 説明の有無と忠実度の水準はユーザーの信頼にどのような影響を与えるか?
  • RQ3RQ3: 精度と説明忠実度は知覚理解と信頼の動態をどのように相互作用させるか?
  • RQ4RQ4: 観測された(行動的)信頼指標は自己申告信頼質問票と一致するか?
  • RQ5RQ5: 高忠実度の説明は、性能の悪い分類器についてユーザーを誤解させることができるか?

主な発見

  • Accuracyはユーザー信頼に最も強い影響を与えた。高い精度は一般に信頼と予測可能性の評価を高めた。
  • いかなる条件でも説明の有無は自己申告信頼を正の方向には影響しなかった。高忠実度の説明は中精度で信頼を維持できたが、低忠実度の説明は信頼を低下させた。
  • 高精度システムでは、説明の有無を問わず、いかなる説明(高・低忠実度)も説明なしと比べて信頼を低下させる傾向があった。
  • 中精度では高忠実度の説明は信頼を害さなかったが、低忠実度の説明は害した。
  • 高精度・高忠実度の説明では、説明なしより観測信頼(行動)が高かったことを示し、観測信頼と自己申告信頼の乖離を示唆している。
  • 悪い分類器でも説明と組み合わせてもユーザーを惑わせることはないという証拠がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。