[논문 리뷰] Med-MMHL: A Multi-Modal Dataset for Detecting Human- and LLM-Generated Misinformation in the Medical Domain
Med-MMHL은 의학의 다중 모달 허위 정보 데이터세트로, 여러 질병에 걸친 인간 및 LLM이 생성한 가짜 콘텐츠를 포함하고 문장, 문서 및 다중 모달 수준의 벤치마크를 제공합니다.
The pervasive influence of misinformation has far-reaching and detrimental effects on both individuals and society. The COVID-19 pandemic has witnessed an alarming surge in the dissemination of medical misinformation. However, existing datasets pertaining to misinformation predominantly focus on textual information, neglecting the inclusion of visual elements, and tend to center solely on COVID-19-related misinformation, overlooking misinformation surrounding other diseases. Furthermore, the potential of Large Language Models (LLMs), such as the ChatGPT developed in late 2022, in generating misinformation has been overlooked in previous works. To overcome these limitations, we present Med-MMHL, a novel multi-modal misinformation detection dataset in a general medical domain encompassing multiple diseases. Med-MMHL not only incorporates human-generated misinformation but also includes misinformation generated by LLMs like ChatGPT. Our dataset aims to facilitate comprehensive research and development of methodologies for detecting misinformation across diverse diseases and various scenarios, including human and LLM-generated misinformation detection at the sentence, document, and multi-modal levels. To access our dataset and code, visit our GitHub repository: \url{https://github.com/styxsys0927/Med-MMHL}.
연구 동기 및 목표
- prior medical misinformation 데이터세트의 한계를 COVID-19를 넘는 다중 질병 포함으로 극복한다.
- 시각 데이터를 포함하여 다중 모달 허위 정보 탐지를 가능하게 한다.
- 사람이 생성한 콘텐츠와 함께 LLM 생성 허위 정보도 포함한다.
- 문장-, 문서-, 다중 모달 수준의 허위 정보 탐지에 대한 벤치마크를 제공한다.
- 뉴스, 트윗 및 이미지를 크롤링하여 일반화 가능성을 높인 다양한 데이터세트를 만든다.
제안 방법
- 권위 있는 출처 및 팩트체크 사이트에서 실제 및 가짜 의학 뉴스를 수집하여 관련 이미지와 함께 실제 텍스트, 인간 생성 가짜 텍스트, LLM 생성 가짜 텍스트를 구축한다.
- 실제 기사에 ChatGPT-3.5 스타일의 반대 문장을 도입하고 언어를 다듬어 LLM 생성 허위 정보를 시뮬레이션한다.
- 실제 및 가짜 뉴스에 해당하는 linked 트윗을 수집하여 트윗 기반 과제를 형성한다.
- 가짜 뉴스 및 가짜 주장에 대해 텍스트와 관련 이미지를 정렬하여 다중 모달 하위 집합을 만든다.
- 문장, 문서 및 다중 모달 데이터를 망라하는 다섯 가지 벤치마크 과제(가짜 뉴스, LLM-가짜 문장, 다중 모달 가짜 뉴스, 가짜 트윗, 다중 모달 트윗)를 정의한다.
실험 결과
연구 질문
- RQ1다양한 질병에서 실제 의학 뉴스를 인간 및 LLM 생성 허위 정보와 구분하는 모델의 능력은 어떠한가?
- RQ2의료 분야에서 다중 모달 정보(이미지)가 허위 정보 탐지에 미치는 영향은 무엇인가?
- RQ3이 도메인에서 LLM 생성 가짜 문장이 LLM 생성 가짜 뉴스만큼 탐지될 수 있는가?
- RQ4의료 코퍼스 내 COVID-19를 넘어 다른 질병으로 허위 정보 탐지 능력이 일반화될 수 있는가?
- RQ5Med-MMHL의 문장-, 문서-, 다중 모달 수준의 허위 정보 과제에서 다양한 베이스라인의 성능은 어떠한가?
주요 결과
- 트랜스포머 기반 베이스라인이 가짜 뉴스 탐지에서 비트랜스포머 방법보다 우수하지만 클래스 불균형으로 인해 정밀도는 높고 재현율은 낮다.
- FN-BERT가 평가된 베이스라인 중에서 문서 수준의 가짜 뉴스 및 트윗 탐지에서 최고를 달성한다.
- LLM 생성 가짜 문장이 LLM 생성 가짜 뉴스를 탐지하기 더 어렵다는 점은 문장 수준 탐지 접근법 개선의 필요성을 시사한다.
- 다중 모달 모델(CLIP, VisualBERT)은 다중 모달 가짜 뉴스 탐지 과제에서 강력한 성능을 보이나 텍스트에서 실제 대 가짜인 경우에는 한계가 있다.
- 데이터세트에는 3,455개의 실제 뉴스 기사, 469개의 인간 생성 가짜 뉴스 항목, 2,095개의 LLM 생성 가짜 뉴스 항목, 2,283개의 실제 주장 및 3,567개의 가짜 주장 등이 포함되며, 표 2에 자세한 트윗 및 다중 모달 페어가 제시되어 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.