[논문 리뷰] CARE-MI: Chinese Benchmark for Misinformation Evaluation in Maternity and Infant Care
CARE-MI는 민감한 산후 및 영유아 보호 분야에서 장문 생성의 가짜 정보를 평가하기 위한 중국어 벤치마크를 소개한다. 이 벤치마크는 전문가가 검증한 1,612개의 질문과 인간이 선택한 참고 자료를 포함한다. 연구 결과 현재 중국어 LLM에서 심각한 사실 오류가 존재하는 것으로 드러났으며, 인간 평가에 의존하는 것을 줄이기 위해 자동 평가 모델을 제안한다. 이는 자원이 적고 지식 집약적인 분야에 적용 가능한 이식 가능한 프레임워크를 제공한다.
The recent advances in natural language processing (NLP), have led to a new trend of applying large language models (LLMs) to real-world scenarios. While the latest LLMs are astonishingly fluent when interacting with humans, they suffer from the misinformation problem by unintentionally generating factually false statements. This can lead to harmful consequences, especially when produced within sensitive contexts, such as healthcare. Yet few previous works have focused on evaluating misinformation in the long-form (LF) generation of LLMs, especially for knowledge-intensive topics. Moreover, although LLMs have been shown to perform well in different languages, misinformation evaluation has been mostly conducted in English. To this end, we present a benchmark, CARE-MI, for evaluating LLM misinformation in: 1) a sensitive topic, specifically the maternity and infant care domain; and 2) a language other than English, namely Chinese. Most importantly, we provide an innovative paradigm for building LF generation evaluation benchmarks that can be transferred to other knowledge-intensive domains and low-resourced languages. Our proposed benchmark fills the gap between the extensive usage of LLMs and the lack of datasets for assessing the misinformation generated by these models. It contains 1,612 expert-checked questions, accompanied with human-selected references. Using our benchmark, we conduct extensive experiments and found that current Chinese LLMs are far from perfect in the topic of maternity and infant care. In an effort to minimize the reliance on human resources for performance evaluation, we offer off-the-shelf judgment models for automatically assessing the LF output of LLMs given benchmark questions. Moreover, we compare potential solutions for LF generation evaluation and provide insights for building better automated metrics.
연구 동기 및 목표
- 지식 집약적이고 민감한 분야인 산후 및 영유아 보호 분야에서 장문 생성의 가짜 정보 평가 벤치마크 부족 문제를 해결하기 위해.
- 다른 언어에 비해 자원이 적은 언어, 특히 중국어에 대해 대부분의 이전 연구가 영어에 집중한 점을 메우기 위해.
- 인간이 주석을 달지 않은 자료에 의존하는 것을 줄이면서도 높은 신뢰성을 유지하는 자동화되고 확장 가능한 평가 체계를 개발하기 위해.
- 다른 지식 집약적 분야와 자원이 적은 언어에 적용 가능한 이식 가능한 벤치마크 프레임워크를 제공하기 위해.
제안 방법
- 산후 및 영유아 보호 분야에서 전문가가 검증한 1,612개의 질문을 수집하였으며, 각 질문은 최소 세 개의 권위 있는 지식 자료로 뒷받침된다.
- 장문 생성에 대한 사실적 정확성과 맥락적 관련성을 확보하기 위해 인간이 선택한 기준 답변을 확보하였다.
- GPT-3.5-turbo를 사용해 부정형 및 진술형 진술을 생성하는 제로샷 프롬프팅 전략을 개발하여 데이터 증강 및 모델 校정을 수행하였다.
- 구조화된 프롬프트 템플릿을 기반으로 작은 LLM(GPT-3-350M, GPT-3-6.7B, LLaMA-13B-T)을 미세조정하여 사실 정확성 평가를 위한 자동 평가 모델을 구축하였다.
- 다양한 LLM(MOSS, ChatGLM, GPT-4, LLaMA)을 벤치마크에서 평가하여 출력 길이, 사실 일관성, 참고 자료 일치도를 측정하였다.
- 자동 평가 지표(ROUGE, BLEU)와 인간 평가를 비교하여 장문 출력에서의 가짜 정보 탐지 능력에 대한 신뢰성을 평가하였다.
실험 결과
연구 질문
- RQ1민감한 산후 및 영유아 보호 분야에서 중국어 LLM의 장문 생성에서 사실 오류는 얼마나 퍼져 있는가?
- RQ2인간이 주석을 달지 않은 자료 없이 자동 평가 모델이 LLM 생성 응답의 사실 정확성을 얼마나 정확하게 평가할 수 있는가?
- RQ3다양한 LLM은 전문가가 검증한 질문과 참고 자료를 갖춘 벤치마크에서 지식 집약적인 장문 응답을 얼마나 잘 생성하는가?
- RQ4제안된 벤치마크 프레임워크는 다른 지식 집약적 분야와 자원이 적은 언어로 일반화될 수 있는가?
- RQ5표준 자동 평가 지표(예: ROUGE, BLEU)는 장문 텍스트 생성에서 환각 현상을 탐지하는 데 어떤 한계를 지니는가?
주요 결과
- 현재 중국어 LLM은 평균적으로 123.1토큰과 4.6개 문장을 생성하지만, 산후 및 영유아 보호 분야에서 심각한 사실 오류를 보인다.
- GPT-4와 GPT-3.5-turbo는 각각 ROUGE-L 평균 점수 4.779와 4.562를 기록했지만, 높은 유창성에도 불구하고 환각되거나 오해의 소지가 있는 진술을 생성하였다.
- 벤치마크에 기반해 미세조정된 자동 평가 모델은 인간 평가와 강한 상관관계를 보였으며, LLM 출력의 스케일러블하고 저비용 평가를 가능하게 하였다.
- ROUGE와 BLEU와 같은 표준 자동 평가 지표는 사실 정확성과 관련성이 낮게 나타나, 장문 생성에서의 신뢰할 수 있는 가짜 정보 탐지에 부적합함을 시사한다.
- 벤치마크는 심지어 최신 기술의 LLM인 GPT-4조차도 복잡한 의학적 개념에 대해 추론할 때 설득력은 있지만 사실 오류가 있는 진술을 자주 생성한다는 점을 드러냈다.
- 이 연구는 장문 생성에서의 가짜 정보가 단순히 유창성 문제를 넘어서 사실 일관성 문제이며, 도메인 특화된 전문가 검증 평가 프레임워크가 필요하다는 점을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.