[論文レビュー] Towards a Rigorous Evaluation of Explainability for Multivariate Time Series
本稿では、多変量時系列予測におけるモデルに依存しない説明可能技術としてのLIMEとSHAPを提案および評価し、人間評価を通じて、両手法が一般ユーザーのモデル予測理解を顕著に向上させることを示した。研究ではLIMEがSHAPよりもわずかに好まれたが、説明は信頼性と解釈可能性を向上させ、実世界の販売予測ユースケースにおいて有効であった。
Machine learning-based systems are rapidly gaining popularity and in-line with that there has been a huge research surge in the field of explainability to ensure that machine learning models are reliable, fair, and can be held liable for their decision-making process. Explainable Artificial Intelligence (XAI) methods are typically deployed to debug black-box machine learning models but in comparison to tabular, text, and image data, explainability in time series is still relatively unexplored. The aim of this study was to achieve and evaluate model agnostic explainability in a time series forecasting problem. This work focused on proving a solution for a digital consultancy company aiming to find a data-driven approach in order to understand the effect of their sales related activities on the sales deals closed. The solution involved framing the problem as a time series forecasting problem to predict the sales deals and the explainability was achieved using two novel model agnostic explainability techniques, Local explainable model-agnostic explanations (LIME) and Shapley additive explanations (SHAP) which were evaluated using human evaluation of explainability. The results clearly indicate that the explanations produced by LIME and SHAP greatly helped lay humans in understanding the predictions made by the machine learning model. The presented work can easily be extended to any time
研究の動機と目的
- 多変量時系列予測、特に予測シナリオにおける説明可能性のための厳密な評価手法の不足に対処すること。
- 実世界のデジタルコンサルティング会社の販売予測問題に、モデルに依存しない説明可能技術(LIMEとSHAP)を適用すること。
- 一般参加者を対象とした人間評価を通じて、解釈可能性と信頼性に焦点を当て、説明の質を評価すること。
- LIMEとSHAPの両者が、非専門家が時系列文脈におけるモデル予測を理解するのをどの程度効果的に支援するかを比較すること。
- 他の予測や分類タスクに一般化可能な、時系列における説明可能性の評価フレームワークを確立すること。
提案手法
- 歴史的販売データおよび活動データを用いて、販売予測問題を多変量時系列回帰タスクとして定式化した。
- 局所的解釈可能なモデルに依存しない説明(LIME)を用い、個々の予測における特徴の重要性を局所的に説明した。
- シャープリー加法的説明(SHAP)を用いて、ゲーム理論的原則に基づく特徴の寄与度を計算し、局所的解釈性を実現した。
- 60名の一般参加者(各ケース20名)を対象とした人間評価研究を設計し、検証タスクを通じて説明の質を評価した。
- ユーザーの理解度、信頼性、好みに基づいて説明を評価し、定量的指標に加えて定性的フィードバックも収集した。
- 認知的負荷を管理し、明確性を確保するため、説明の複雑さを上位5つの最重要特徴に制限した。

実験結果
リサーチクエスチョン
- RQ1LIMEとSHAPは、時系列予測モデルが生成する予測の理解を、一般ユーザーがどの程度向上させることができるか?
- RQ2LIMEとSHAPのうち、どちらの説明手法が非専門家ユーザーの理解度と信頼性をより高めるか?
- RQ3説明の複雑さ(例:特徴数)は、人間の理解度と評価にどのように影響するか?
- RQ4人間による説明可能性の評価は、時系列予測における説明の質を信頼できる代理指標として機能するか?
- RQ5提案されたフレームワークは、他の時系列予測や分類タスクにどの程度一般化可能か?
主な発見
- LIMEとSHAPの両方が、一般ユーザーが時系列予測モデルの予測を理解し、信頼する能力を顕著に向上させた。
- 参加者らは、説明のおかげで、予測された取引完了件数に最も影響を与えた販売活動を特定できたと報告した。
- 人間評価においてLIMEがSHAPよりもわずかに好まれたが、サンプルサイズが小さいため、差は微小であり統計的有意ではなかった。
- 人間評価の結果、説明がユーザーのモデル出力に対する自信を高めたことが判明し、実世界の意思決定におけるXAIの活用を支持するものとなった。
- 本研究では、モデルに依存しない説明可能技術が、テーブルデータや画像データにとどまらず、多変量時系列予測にも効果的かつ適用可能であることが示された。
- 本フレームワークは、ELI5 や CIU などの他のXAI手法へも拡張可能であり、分類タスクやドメイン専門家を対象とした応用ベースの評価に適応可能である。
![Figure 2: Average perspiration in a country against year [ 2 ] .](https://ar5iv.labs.arxiv.org/html/2104.04075/assets/figures/univariate.png)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。