Skip to main content
QUICK REVIEW

[논문 리뷰] Health Disparities through Generative AI Models: A Comparison Study Using A Domain Specific large language model

Yohn Jairo Parra Bautista, Vinicious Lima|arXiv (Cornell University)|2023. 10. 23.
Topic Modeling인용 수 4
한 줄 요약

이 연구는 코사인 유사도를 사용하여 도메인 특화 SciBERT와 일반 목적 BERT 모델을 비교하여 텍스트 쿼리에서 건강 격차를 탐지하는 데 초점을 맞춘다. 비록 SciBERT가 생물의학 분야에서 훈련되었음에도 불구하고, BERT는 맥락적으로 민감한 건강 격차 용어를 구분하는 데 더 뛰어나며, 도메인 특화 모델이 윤리적 및 사회적 맥락 인식에 잠재적인 격차를 가질 수 있음을 드러낸다.

ABSTRACT

Health disparities are differences in health outcomes and access to healthcare between different groups, including racial and ethnic minorities, low-income people, and rural residents. An artificial intelligence (AI) program called large language models (LLMs) can understand and generate human language, improving health communication and reducing health disparities. There are many challenges in using LLMs in human-doctor interaction, including the need for diverse and representative data, privacy concerns, and collaboration between healthcare providers and technology experts. We introduce the comparative investigation of domain-specific large language models such as SciBERT with a multi-purpose LLMs BERT. We used cosine similarity to analyze text queries about health disparities in exam rooms when factors such as race are used alone. Using text queries, SciBERT fails when it doesn't differentiate between queries text: "race" alone and "perpetuates health disparities." We believe clinicians can use generative AI to create a draft response when communicating asynchronously with patients. However, careful attention must be paid to ensure they are developed and implemented ethically and equitably.

연구 동기 및 목표

  • 도메인 특화 대규모 언어 모델(예: SciBERT)이 임상 텍스트 쿼리에서 건강 격차를 얼마나 잘 탐지하는지 평가하는 것.
  • 건강 격차 관련 용어에서 맥락적으로 민감한 표현을 식별하는 데 있어 SciBERT와 일반 목적 BERT의 성능을 비교하는 것.
  • 도메인 특화 모델(예: SciBERT)이 임bedding에서 건강 격차의 사회적 및 윤리적 차원을 충분히 반영하고 있는지 평가하는 것.
  • 현재의 대규모 언어 모델이 임상 커뮤니케이션에서 건강 격차를 유지하거나 은폐할 수 있는 한계를 규명하는 것.
  • 사회적 결정 요인을 고려한 생성형 AI의 윤리적이고 공정한 설계를 위해, 모델이 건강 격차의 사회적 결정 요인에 얼마나 민감한지 평가하는 것.

제안 방법

  • 건강 격차와 관련된 텍스트 쿼리의 의미 임베딩을 비교하기 위해 코사인 유사도를 사용하였다.
  • 인종, 민족 및 건강 격차를 포함한 중립적 및 맥락적으로 민감한 변형을 포함한 텍스트 쿼리를 구성하였다.
  • 질의의 조밀한 벡터 표현을 생성하기 위해 도메인 특화 모델인 SciBERT와 일반 목적 모델인 BERT를 훈련 및 적용하였다.
  • 질의 쌍 간의 코사인 유사도를 계산하여 의미 유사도를 측정하였으며, '인종'만 존재할 경우와 '인종이 건강 격차를 악화시킨다'는 문맥에서의 차이가 있어야 할 경우에 집중하였다.
  • 임베딩이 건강 격차 논의에서 '인종'의 맥락적으로 다른 사용을 구분하는지 여부에 따라 모델 성능을 평가하였다.
  • SciBERT 임베딩의 토큰 및 서브워드 분포를 분석하여 데이터 표현 편향을 평가하였다.
Figure 1: Flowchart Comparative Study with Health Disparities prompts
Figure 1: Flowchart Comparative Study with Health Disparities prompts

실험 결과

연구 질문

  • RQ1도메인 특화 언어 모델인 SciBERT가 건강 격차 논의에서 '인종'의 중립적 사용과 맥락적으로 민감한 사용을 효과적으로 구분할 수 있는가?
  • RQ2SciBERT의 성능는 일반 목적 BERT와 비교하여 건강 격차 관련 쿼리의 의미적 차이를 탐지하는 데 어떻게 다른가?
  • RQ3SciBERT와 같은 도메인 특화 대규모 언어 모델이 학습된 임베딩에서 건강 격차의 사회적 결정 요인(예: 인종, 민족)을 어느 정도 반영하는가?
  • RQ4SciBERT의 훈련 데이터에 인식되지 않은 표현 격차가 있어 윤리적 및 사회적 맥락을 건강 격차 용어에서 잘못 처리할 수 있는가?
  • RQ5코사인 유사도는 대규모 언어 모델이 건강 형평성 관련 언어에 대해 의미적 민감도를 효과적으로 측정할 수 있는가?

주요 결과

  • BERT는 '인종'만 존재하는 것과 '인종이 건강 격차를 악화시킨다'는 맥락에서의 차이가 있는 텍스트 쿼리 간의 구분에서 SciBERT를 앞섰다.
  • 생물의학 분야에서 훈련되었음에도 불구하고, SciBERT는 건강 격차를 포함한 의미적으로 다른 쿼리 간의 차이를 구분하지 못했으며, 맥락 민감도가 부족함을 시사한다.
  • SciBERT의 임베딩은 더 높은 토큰 다양성을 보였으며, 더 많은 서브워드, 숫자, 특수 문자(예: '%')를 포함하고 있어 기술적 언어에 더 초점이 맞춰져 있음을 나타낸다.
  • 결과는 SciBERT의 훈련 데이터가 윤리적 및 사회적 차원을 충분히 반영하지 못해 임상 AI 응용에서 잠재적 편향을 초래할 수 있음을 시사한다.
  • 사회적 맥락과 건강 격차의 권력 관계를 고려하지 않는 한, 도메인 특화 모델이 NLP 응용에서 공정성이나 형평성을 자연스럽게 향상시키지 못할 수 있음을 시사한다.
  • 이 연구는 전문적인 대규모 언어 모델이라도 맥락적 및 윤리적 민감도를 철저히 평가하지 않으면 건강 격차를 계속해서 악화시킬 수 있음을 경고한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.