[論文レビュー] Oral cancer detection and interpretation: Deep multiple instance learning versus conventional deep single instance learning
本研究では、患者レベルのラベルのみを用いて、口腔がん検出における深層多重インスタンス学習(MIL)と従来の単一インスタンス学習(SIL)を比較した。合成データ(PAP-QMNIST)および実際の細胞診データの両方において、SILは分類精度およびキーディスプレーシス・悪性細胞の同定においてMILを上回った。特に、異形成および悪性細胞の同定において顕著な優位性を示し、弱教師付き口腔がん診断においてSILがより効果的かつ効率的であると考えられる。
The current medical standard for setting an oral cancer (OC) diagnosis is histological examination of a tissue sample from the oral cavity. This process is time consuming and more invasive than an alternative approach of acquiring a brush sample followed by cytological analysis. Skilled cytotechnologists are able to detect changes due to malignancy, however, to introduce this approach into clinical routine is associated with challenges such as a lack of experts and labour-intensive work. To design a trustworthy OC detection system that would assist cytotechnologists, we are interested in AI-based methods that reliably can detect cancer given only per-patient labels (minimizing annotation bias), and also provide information on which cells are most relevant for the diagnosis (enabling supervision and understanding). We, therefore, perform a comparison of a conventional single instance learning (SIL) approach and a modern multiple instance learning (MIL) method suitable for OC detection and interpretation, utilizing three different neural network architectures. To facilitate systematic evaluation of the considered approaches, we introduce a synthetic PAP-QMNIST dataset, that serves as a model of OC data, while offering access to per-instance ground truth. Our study indicates that on PAP-QMNIST, the SIL performs better, on average, than the MIL approach. Performance at the bag level on real-world cytological data is similar for both methods, yet the single instance approach performs better on average. Visual examination by cytotechnologist indicates that the methods manage to identify cells which deviate from normality, including malignant cells as well as those suspicious for dysplasia. We share the code as open source at https://github.com/MIDA-group/OralCancerMILvsSIL
研究の動機と目的
- 患者レベルのラベルのみを用いた弱教師付き口腔がん検出における多重インスタンス学習(MIL)と単一インスタンス学習(SIL)の性能を評価すること。
- 診断に最も関連する細胞を同定することで、両手法の解釈可能性を評価し、臨床的信頼性および監視の可能性を高めること。
- 実際の口腔細胞診データを模倣するが、インスタンスレベルの真値ラベルを提供することができる合成データセット(PAP-QMNIST)の開発および検証。
- LeNet、ResNet18、SqueezeNetといった異なるニューラルネットワークアーキテクチャを用いて、合成データおよび実世界データにおいてMILとSILの耐性および信頼性を比較すること。
- MILが弱教師付き学習において理論的に有する利点が、細胞診における口腔がん検出の実用的利点にどのように反映されるかを特定すること。
提案手法
- 患者レベルのラベルのみで学習可能な、制御されたインスタンスレベルラベルを備えた合成PAP-QMNISTデータセットを提案し、インスタンスレベルの性能評価を可能にした。
- ABMIL(アテンションベースMIL)を用い、バッグ内サンプリングおよびミニバッグ戦略を適用し、患者レベルでのラベルのみから学習した。
- 従来のSILを採用し、各細胞にその患者のラベルを割り当てることで、標準的なディープラーニングフレームワークを用いたエンドツーエンド学習を可能にした。
- LeNet、ResNet18、SqueezeNetの3つのニューラルネットワークアーキテクチャを、MILおよびSILの両フレームワークで評価し、アーキテクチャの整合性を確保した。
- ABMILではアテンション機構、SILでは予測スコアを用いて、キーディスプレーシス細胞や悪性細胞などの重要なインスタンスを同定し、解釈可能性を向上させた。
- 細胞診技師による可視化による妥当性評価を実施し、予測されたキーディスプレーシスインスタンスが臨床的に関連する正常からの逸脱と一致するかを検証した。
実験結果
リサーチクエスチョン
- RQ1患者レベルのラベルのみが利用可能な状況下で、MILはSILを上回る性能を示すか?
- RQ2限られたインスタンスレベルのアノテーションがある中で、MILおよびSILの両手法が生物学的に関連する細胞(例:悪性または異形成細胞)を信頼性を持って同定できるか?
- RQ3PAP-QMNIST合成データにおいて、陽性バッグに含まれるキーディスプレーシスインスタンスの割合がABMILの性能に与える影響は?
- RQ4MILおよびSIL手法が、合成データにおいて生物学的に無関係な特徴(例:色、方向)に過剰に注目する程度は?
- RQ5実際の細胞診データにおいて、MILの複雑さが、SILに比べて診断性能および解釈可能性の向上に見合うものか?
主な発見
- PAP-QMNIST合成データセットにおいて、SILはバッグレベルの精度およびインスタンスレベルのAUCの両面でABMILを上回った。特にキーディスプレーシスインスタンスの割合が低い(例:5%)状況で顕著な優位性を示した。
- ABMILは、バッグを正確に分類し、高いAUCを達成するためには、陽性バッグに少なくとも10%のキーディスプレーシスインスタンスを含む必要があった。これは、MIL理論が捉えていない閾値効果を示しており、実用的制限を示唆している。
- ABMILはPAP-QMNISTにおいて、色や方向といった非関連特徴に注目する傾向を示した。これは、誤った注目パターンが発生する可能性を示唆している。
- 実世界の細胞診データにおいて、SILは3つのアーキテクチャすべてでバッグレベルの精度が0.9以上を達成したが、ABMILは平均して0.85未満にとどまった。
- 細胞診技師による妥当性評価では、ABMILの上位36インスタンスに含まれなかった高リスク異形成細胞が、SILによって正しく同定された。これは、本ケースにおいてSILの感受性が優れていることを示している。
- 理論的な利点があるにもかかわらず、MILはSILに比べて一貫した性能向上を示さず、実際にはより単純なSILアプローチが信頼性が高く、メモリ効率に優れていた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。