Skip to main content
QUICK REVIEW

[論文レビュー] Shifts 2.0: Extending The Dataset of Real Distributional Shifts

Andrey Malinin, Ανδρέας Αθανασόπουλος|arXiv (Cornell University)|Jun 30, 2022
Advanced Glycation End Products researchBiochemistry, Genetics and Molecular Biology被引用数 18
ひとこと要約

本論文は、複数 sclerosis の 3D MRI 損傷部位セグメンテーションと海洋船舶の電力消費量推定という2つの産業スケールのベンチマークを追加し、現実世界の分布シフトを特徴とする Shifts データセットを拡張した。著者らは、データ収集、前処理、ベースライン結果を詳細に提供しており、現実的で高リスクな分布シフト下におけるモデルの汎化性能と不確実性推定の堅牢な評価を可能にしている。

ABSTRACT

Distributional shift, or the mismatch between training and deployment data, is a significant obstacle to the usage of machine learning in high-stakes industrial applications, such as autonomous driving and medicine. This creates a need to be able to assess how robustly ML models generalize as well as the quality of their uncertainty estimates. Standard ML baseline datasets do not allow these properties to be assessed, as the training, validation and test data are often identically distributed. Recently, a range of dedicated benchmarks have appeared, featuring both distributionally matched and shifted data. Among these benchmarks, the Shifts dataset stands out in terms of the diversity of tasks as well as the data modalities it features. While most of the benchmarks are heavily dominated by 2D image classification tasks, Shifts contains tabular weather forecasting, machine translation, and vehicle motion prediction tasks. This enables the robustness properties of models to be assessed on a diverse set of industrial-scale tasks and either universal or directly applicable task-specific conclusions to be reached. In this paper, we extend the Shifts Dataset with two datasets sourced from industrial, high-risk applications of high societal importance. Specifically, we consider the tasks of segmentation of white matter Multiple Sclerosis lesions in 3D magnetic resonance brain images and the estimation of power consumption in marine cargo vessels. Both tasks feature ubiquitous distributional shifts and a strict safety requirement due to the high cost of errors. These new datasets will allow researchers to further explore robust generalization and uncertainty estimation in new situations. In this work, we provide a description of the dataset and baseline results for both tasks.

研究の動機と目的

  • 高リスク分野で一般的に見られる現実世界の分布シフトを反映しない機械学習ベンチマークの重大なギャップを是正すること。
  • 医療画像とエネルギーシステムにおいて、モデルの失敗が深刻な結果をもたらす現実的な分布シフトを有する産業スケールのデータセットを提供すること。
  • 合成的または選別されたシフトではなく、実際の展開時のシフト下におけるモデルの頑健性と不確実性推定の体系的評価を可能にすること。
  • 3D マイエリン線維損傷部位セグメンテーションと貨物船の電力消費量予測という2つの新しい高インパactsなタスクを、Shifts ベンチマークに追加すること。
  • 分布シフト下での不確実性と汎化性能の現実的評価を通じて、より安全で信頼性の高い ML システムの開発を支援すること。

提案手法

  • 臨床的ソースから得た多様なスキャナープロトコルと取得パラメータを有する、複数 sclerosis 損傷部位の新しい 3D MRI データセットを収集・整備し、現実の分布シフトを誘発する。
  • 貨物船の運用テレメトリから得た海洋船舶の電力消費量データセットを構築し、天候、積載量、航行経路の変化に起因するシフトを捉える。
  • 既知の分布シフト下での評価を可能にするために、両データセットに対して標準的な訓練/検証/テスト分割を設計し、インドメインおよびアウトオブドメインの分割を含む。
  • 標準的なディープラーニングモデル(例:U-Net、MLP、ResNet)と不確実性推定技術(MCドロップアウト、変分推論、ディープアンサンブル)をベースラインとして適用。
  • 標準指標(R-AUC、F1-AUC、F1@95%、リテンション曲線)を用いて性能を評価し、シフト下での不確実性キャリブレーションを評価。
  • 再現性とベンチマーク評価における統計的厳密性を確保するため、シングルシードごとの標準偏差を報告。

実験結果

リサーチクエスチョン

  • RQ1最先端のディープラーニングモデルは、3D 医療画像と海洋エネルギー分野における現実世界の分布シフト下で、どのように性能を示すか?
  • RQ2高リスク分野に展開された際、不確実性推定手法(例:MCドロップアウト、ディープアンサンブル)は、シフトしたデータに対してどれほど信頼性を保てるか?
  • RQ3実際の産業データセットにおいて、インドメインからアウトオブドメインへのシフトが生じた場合、モデルの性能と不確実性キャリブレーションはどの程度劣化するか?
  • RQ4新規ベンチマークは、安全を要する環境下で、頑健に汎化し、適切にキャリブレートされた不確実性推定を行うモデルの開発を支援できるか?
  • RQ5既存の ML ベンチマークを、複雑で i.i.d. でないデータシフトを示す現実世界の高リスク産業応用に適用する際の主な課題は何か?

主な発見

  • 3D MRI 損傷部位セグメンテーションタスクでは、分布シフト下で顕著な性能低下が観察され、MCドロップアウトとディープアンサンブルを用いた場合、F1-AUC がインドメイン時(0.618)からアウトオブドメイン時(0.536)に低下した。
  • 海洋船舶の電力消費量予測では、最良のモデル(シンボリック+アンサンブル)が評価セットで R-AUC 17.51×10⁵ を達成し、DNN や単一モデルベースラインを著しく上回った。
  • 不確実性キャリブレーション(R-AUC およびリテンション曲線で測定)は、アウトオブドメインデータで著しく劣化し、VI および MCドロップアウトはインドメインと比較して、シフトしたデータで低い R-AUC を示した。
  • アンサンブル学習を用いたシンボリックモデルが、評価セットで最高の F1@95%(0.509)を達成し、シフト下での不確実性の不適切なキャリブレーションに対してより高い頑健性を示した。
  • ベースラインモデルはシフト下で劣った汎化性能を示し、アウトオブドメイン分割で F1-AUC が最大20%低下した。これは、より優れた頑健性と不確実性推定の必要性を示唆している。
  • 新規データセットは、標準的なモデルと不確実性手法が現実世界の環境では信頼性なく汎化できることを明らかにした。これにより、シフトに配慮した学習と評価の必要性が強調された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。