Skip to main content
QUICK REVIEW

[論文レビュー] AfriMed-QA: A Pan-African, Multi-Specialty, Medical Question-Answering Benchmark Dataset

Tobi Olatunji, Charles Nimo|arXiv (Cornell University)|Nov 23, 2024
Topic Modeling被引用数 4
ひとこと要約

AfriMed-QA は、16か国から32の専門分野にわたり、15,275問の質問を含む大規模でパンアフリカ圏にまたがる多専門分野の医療QAベンチマークを提供する。複数選択、短回答、一般消費者向けの質問を含む。30種類のLLMの評価により、専門分野や地理的要因による顕著なパフォーマンスのばらつきが明らかになった。生物学的医療モデルは一般モデルに比べて成績が低く、一部のケースでは幻覚や欠落があるにもかかわらず、消費者はLLMの説明を臨床医の回答よりも好む傾向が見られた。

ABSTRACT

Recent advancements in large language model(LLM) performance on medical multiple choice question (MCQ) benchmarks have stimulated interest from healthcare providers and patients globally. Particularly in low-and middle-income countries (LMICs) facing acute physician shortages and lack of specialists, LLMs offer a potentially scalable pathway to enhance healthcare access and reduce costs. However, their effectiveness in the Global South, especially across the African continent, remains to be established. In this work, we introduce AfriMed-QA, the first large scale Pan-African English multi-specialty medical Question-Answering (QA) dataset, 15,000 questions (open and closed-ended) sourced from over 60 medical schools across 16 countries, covering 32 medical specialties. We further evaluate 30 LLMs across multiple axes including correctness and demographic bias. Our findings show significant performance variation across specialties and geographies, MCQ performance clearly lags USMLE (MedQA). We find that biomedical LLMs underperform general models and smaller edge-friendly LLMs struggle to achieve a passing score. Interestingly, human evaluations show a consistent consumer preference for LLM answers and explanations when compared with clinician answers.

研究の動機と目的

  • 低・中所得国(LMICs)、特にアフリカにおける代表的な医療LLMベンチマークの不足を是正すること。
  • 地域医療知識、言語的多様性、アフリカ大陸全体の臨床的文脈を反映する多様で大規模な医療QAデータセットの構築。
  • 正しさ、人種的バイアス、人間の好みの複数の軸から、30種類のLLMのパフォーマンスと公平性を評価すること。
  • LLMが、特に代表が不足している地域において、臨床医レベルの推論を模倣または上回ることができるかを評価すること。
  • 医師不足の状況にある地域で、公平で地域に適合したAIツールの開発の基盤を築くこと。

提案手法

  • 16か国の60校以上の医学部から、32の専門分野にわたる15,275件の医療質問を収集。
  • 質問を3種類に分類:複数選択問題(MCQ)、短回答問題(SAQ)、一般消費者向け質問(CQ)、それぞれに専門家がアノテートした回答と根拠を付与。
  • 1,430件のMCQに対して、臨床医が盲検評価を実施し、正しさ、幻覚、欠落、有害性検出の観点から30種類のLLMを評価。
  • 臨床医による人間評価を実施し、モデルの回答が正しさ、幻覚、欠落、有害性の観点でどの程度であったかを評価。
  • 専門分野、地理的地域、モデルタイプ(生物学的特化型対一般用途型、オープンソース対クローズドソース)の多軸評価フレームワークを用いて、パフォーマンスのばらつきを分析。
  • 統計的分析を用いて、モデル間および専門分野間でのバイアス、正しさ、好みのパターンを特定。

実験結果

リサーチクエスチョン

  • RQ1LLMは、MedQA や USMLE といった既存ベンチマークと比較して、パンアフリカ圏の多専門分野医療QAベンチマークでどの程度のパフォーマンスを示すか?
  • RQ2アフリカの医療専門分野および地理的地域ごとのパフォーマンスのばらつきはどの程度か?
  • RQ3生物学的特化型LLMは、アフリカの医療文脈における臨床的推論タスクで一般用途LLMを上回る性能を示すか?
  • RQ4臨床医の回答と比較して、LLMが生成する回答にはどの程度の幻覚、欠落、有害な内容が含まれるか?
  • RQ5誤りが存在するにもかかわらず、消費者は臨床医の回答よりもLLMの説明を好む傾向があるか?

主な発見

  • LLMのパフォーマンスは専門分野によって顕著に異なる。最も低い成績は産科婦人科(平均正答率4.62/5)で、最高は医学遺伝学(5.00/5)。
  • Med-PaLM2 や MedLM といった生物学的特化型LLMは、GPT-4 や Llama3-70B といった一般用途LLMに比べて成績が低く、正答率は高く、幻覚率も低い。
  • Phi-3-mini や Mistral-7B といった小規模でエッジに適したLLMは、MCQで及第点に達しないことが判明し、リソースが限られた環境での推論能力の限界を示している。
  • より高い誤り率であったにもかかわらず、人間の評価者たちは、一貫してLLMの説明を臨床医の回答よりも好んだ。特に明確さと包括性の点で優れていた。
  • 臨床医による評価では、眼科分野でLLMの回答の11.36%、呼吸器内科学で10.64%が関連情報の欠落を含んでおり、それぞれ幻覚を含む割合は8.70%と7.59%であった。
  • Mixtral-8x7B-Instruct-v0.1 は、アフリカ現地の専門知識分野で最も高い欠落率(11.11%)を示した。一方、Llama3-OpenBioLLM-70B は、この分野で最も高い有害性率(28.57%)を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。