[論文レビュー] VisualCheXbert: Addressing the Discrepancy Between Radiology Report Labels and Image Labels
本稿では、レントゲン画像の診断と一致するように、生物学的に微調整されたBERTモデルを用いてレントゲンレポートを直接画像ラベルにマッピングする手法であるVisualCheXbertを提案する。この手法により、レポートから得られるラベルと画像から得られるラベルの乖離が軽減され、レントゲンレポートをラベル付けする放射線科医のF1スコアより0.12–0.21高く、CheXpertのレポートラベルラーのF1スコアより0.14高い結果が得られた。
Automatic extraction of medical conditions from free-text radiology reports is critical for supervising computer vision models to interpret medical images. In this work, we show that radiologists labeling reports significantly disagree with radiologists labeling corresponding chest X-ray images, which reduces the quality of report labels as proxies for image labels. We develop and evaluate methods to produce labels from radiology reports that have better agreement with radiologists labeling images. Our best performing method, called VisualCheXbert, uses a biomedically-pretrained BERT model to directly map from a radiology report to the image labels, with a supervisory signal determined by a computer vision model trained to detect medical conditions from chest X-ray images. We find that VisualCheXbert outperforms an approach using an existing radiology report labeler by an average F1 score of 0.14 (95% CI 0.12, 0.17). We also find that VisualCheXbert better agrees with radiologists labeling chest X-ray images than do radiologists labeling the corresponding radiology reports by an average F1 score across several medical conditions of between 0.12 (95% CI 0.09, 0.15) and 0.21 (95% CI 0.18, 0.24).
研究の動機と目的
- 放射線科医がレントゲンレポートをラベル付けする際と、それに対応するチストレントゲン画像をラベル付けする際の乖離を調査すること。
- レポートベースと画像ベースのラベル付けの間の合意不一致の主な原因を特定すること。これには、ラベルの階層構造、臨床歴へのアクセス、レポートのセクションの使用方法が含まれる。
- 放射線科医がラベル付けした画像ラベルと高い一致度を示すように、レポートテキストを直接画像ラベルにマッピングする手法を開発すること。
- レポートベースのラベルからのノイズを低減することで、医療画像認識モデルの弱い教師信号の質を向上させること。
提案手法
- VisualCheXbertは、生物学的に事前学習されたBERTモデルを用いて、レントゲンレポートのテキストを直接画像ベースのラベルにマッピングする。
- モデルは、14の疾患をチストレントゲン画像から検出するように事前学習されたコンピュータビジョンモデルからの監視信号で訓練される。
- 訓練の目的関数は、モデルの予測ラベルとCVモデルの予測との差を最小化することで、レポート解釈を画像ベースの診断と一致させる。
- 本手法は、臨床的に関連性の高い要約であるレポートの「印象」セクションを入力として使用する。
- モデルの性能は、CheXpertテストセット上で放射線科医がラベル付けした画像ラベルとのF1スコアを用いて評価される。
- 本手法は、レポートをラベル付けする人間の放射線科医と、既存のCheXpertルールベースのラベルラーの両方を上回る性能を示した。

実験結果
リサーチクエスチョン
- RQ1放射線科医がレポートをラベル付けする際と、対応するチストレントゲン画像をラベル付けする際の合意度はどの程度か?
- RQ2放射線科医によるレポートベースと画像ベースのラベル付けの間で、合意不一致が生じる主な要因は何か?
- RQ3レポートからラベル付けされた疾患と、画像に実際に存在する疾患との間に、統計的に有意な関係があるか?
- RQ4深層学習モデルを用いて、人間のレポートラベル付けよりも高い一致度で、レポートを直接画像ラベルにマッピングすることができるか?
主な発見
- レポートをラベル付けする放射線科医と、画像をラベル付けする放射線科医との間では、疾患ごとに平均Kappa係数が0.312から0.430の間で低く、合意度が低いことが判明した。
- VisualCheXbertは、レポートをラベル付けする放射線科医の平均F1スコアより0.12–0.21高く、95%信頼区間はそれぞれ(0.09, 0.15)および(0.18, 0.24)であった。
- 同じ評価セットにおいて、VisualCheXbertはCheXpertルールベースのレポートラベルラーと比較してF1スコアを0.14(95%信頼区間:0.12, 0.17)向上させた。
- 子疾患のレポートラベルは、その親疾患が画像に存在する確率を有意に高めることが示され、ラベルの階層構造が臨床的に意味を持つことがわかった。
- 一部の曖昧なレポートラベル(不確実なラベル)も、画像上の疾患が存在する確率を高める傾向があり、曖昧なレポート言語に微妙な診断的シグナルが含まれている可能性を示唆した。
- アテレクトーシスの陽性レポートラベルは、画像上の支援装置の存在確率を0.28倍に低下させ、補償的または交絡的関係がある可能性を示唆した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。