[논문 리뷰] Clinical knowledge in LLMs does not translate to human interactions
LLMs 단독은 의료 과제에서 성과가 좋지만, 실제 사용자와 함께 사용할 때는 개선되지 않으며 전통적 방법에 비해 종종 실적이 떨어진다; 벤치마크 및 시뮬레이션 상호작용 테스트는 실제 세계의 실패를 예측하지 못한다.
Global healthcare providers are exploring use of large language models (LLMs) to provide medical advice to the public. LLMs now achieve nearly perfect scores on medical licensing exams, but this does not necessarily translate to accurate performance in real-world settings. We tested if LLMs can assist members of the public in identifying underlying conditions and choosing a course of action (disposition) in ten medical scenarios in a controlled study with 1,298 participants. Participants were randomly assigned to receive assistance from an LLM (GPT-4o, Llama 3, Command R+) or a source of their choice (control). Tested alone, LLMs complete the scenarios accurately, correctly identifying conditions in 94.9% of cases and disposition in 56.3% on average. However, participants using the same LLMs identified relevant conditions in less than 34.5% of cases and disposition in less than 44.2%, both no better than the control group. We identify user interactions as a challenge to the deployment of LLMs for medical advice. Standard benchmarks for medical knowledge and simulated patient interactions do not predict the failures we find with human participants. Moving forward, we recommend systematic human user testing to evaluate interactive capabilities prior to public deployments in healthcare.
연구 동기 및 목표
- 일반 대중이 현실적인 시나리오에서 잠재적 의학 상태와 성향을 식별하는 데 LLM이 도움을 줄 수 있는지 평가한다.
- 대규모 무작위 시험에서 세 가지 LLM(GPT-4o, Llama 3, Command R+)과 대조 조건을 비교한다.
- 인간-LLM 상호작용이 진단 및 성향 정확도에 어떤 영향을 미치는지 분석한다.
- 표준의료 벤치마크와 시뮬레이션 상호작용이 실제 성능을 예측하는지 평가한다.
제안 방법
- 10개의 의료 시나리오에 대해 1,298명의 영국 참가자를 네 가지 군으로 무작위 배정하는 무작위 대조 시험을 실시했다.
- 세 가지 치료군은 조건 식별 및 성향 파악을 돕기 위해 LLM(GPT-4o, Llama 3, Command R+)를 사용했고, 대조군은 참가자들의 기존 방법을 사용했다.
- 시나리오는 의사들이 합의된 성향과 금-표준 조건 목록을 추가 의사들이 작성하는 방식으로 초안을 작성했다.
- 참가자들은 다섯점 척도로 성향을 제시하고 관련 조건을 나열했으며, 모델 프롬프트 및 인간 상호작용을 분석해 전파 실패를 식별했다.
실험 결과
연구 질문
- RQ1LLM의 도움을 받아 일반 대중이 관련 의학적 상태 및 성향 결정을 정확하게 식별할 수 있는가?
- RQ2LLMs가 전통적인 가정용 자원과 비교하여 성향 정확도나 상태 식별을 개선하는가?
- RQ3표준 의학 지식 벤치마크가 대화형, 실제 세계의 설정에서 성능을 예측하는가?
- RQ4시뮬레이션된 환자 상호작용이 인간-LLM 성능을 반영하고 확장 가능한 벤치마킹을 제공하는가?
주요 결과
- LLMs 단독으로는 GPT-4o에서 94.9%, Llama 3에서 99.2%, Command R+에서 90.8%의 사례에서 관련 조건을 식별했고, 성향 정확도는 각각 64.7%, 48.8%, 55.5%였다.
- 참가자들이 어떤 LLM을 사용해도 관련 조건을 최대 34.5%의 사례에서, 성향은 최대 44.2%에서 식별했고, 대조군보다 나아지지 않았다.
- 사용자와 LLM 간의 상호작용에서 전파 실패가 나타났다: LLM이 대화의 65.7%–73.2%에서 관련 조건을 제시했지만, 사용자는 정보를 누락했거나 이를 실행하지 않았다.
- 벤치마크(MedQA)는 대화형 성능을 과대평가하는 경우가 많으며, 30건 중 26건에서 QA에서의 모델 정확도가 인간-LLM 상호작용 정확도보다 높았고, 시뮬레이션 참가자는 인간의 변동성을 잘 반영하지 못했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.