[論文レビュー] CARE-MI: Chinese Benchmark for Misinformation Evaluation in Maternity and Infant Care
CARE-MIは、感受性の高い出産および乳児ケア分野における長文生成における誤情報の評価を目的とした中国語ベンチマークを提供する。1,612件の専門家が検証済みの質問と、人間が選択した参照資料を備えている。研究では、現在の中国語LLMに顕著な事実的誤りが存在することが明らかになり、人間の評価に依存しない自動判断モデルの提案により、低リソースで知識集約的な分野に応用可能なフレームワークを提供している。
The recent advances in natural language processing (NLP), have led to a new trend of applying large language models (LLMs) to real-world scenarios. While the latest LLMs are astonishingly fluent when interacting with humans, they suffer from the misinformation problem by unintentionally generating factually false statements. This can lead to harmful consequences, especially when produced within sensitive contexts, such as healthcare. Yet few previous works have focused on evaluating misinformation in the long-form (LF) generation of LLMs, especially for knowledge-intensive topics. Moreover, although LLMs have been shown to perform well in different languages, misinformation evaluation has been mostly conducted in English. To this end, we present a benchmark, CARE-MI, for evaluating LLM misinformation in: 1) a sensitive topic, specifically the maternity and infant care domain; and 2) a language other than English, namely Chinese. Most importantly, we provide an innovative paradigm for building LF generation evaluation benchmarks that can be transferred to other knowledge-intensive domains and low-resourced languages. Our proposed benchmark fills the gap between the extensive usage of LLMs and the lack of datasets for assessing the misinformation generated by these models. It contains 1,612 expert-checked questions, accompanied with human-selected references. Using our benchmark, we conduct extensive experiments and found that current Chinese LLMs are far from perfect in the topic of maternity and infant care. In an effort to minimize the reliance on human resources for performance evaluation, we offer off-the-shelf judgment models for automatically assessing the LF output of LLMs given benchmark questions. Moreover, we compare potential solutions for LF generation evaluation and provide insights for building better automated metrics.
研究の動機と目的
- 知識集約的で感受性の高い分野(例:出産および乳児ケア)における長文生成の誤情報評価ベンチマークの不足に対処すること。
- 中国語を含む低リソース言語において、誤情報評価のギャップを埋めること。これまでの多くは英語に焦点を当てていた。
- 人間がアノテートした参照資料に依存しないが、高い信頼性を維持する、自動的かつスケーラブルな評価パラダイムを開発すること。
- 他の知識集約的分野や低リソース言語に適用可能な、再利用可能なベンチマークフレームワークを提供すること。
提案手法
- 出産および乳児ケア分野の1,612件の専門家が検証済みの質問を収集し、各質問に少なくとも3つの権威ある知識ソースを関連付けた。
- 長文生成における事実的正確性と文脈的関連性を保証するため、人間が選択した参照回答を収集した。
- GPT-3.5-turboを用いたゼロショットプロンプティング戦略により、データ拡張およびモデルキャリブレーションのための否定文および真の宣言文を生成した。
- 構造化されたプロンプトテンプレートを用いて、GPT-3-350M、GPT-3-6.7B、LLaMA-13B-Tといった小規模なLLMを微調整し、事実的正確性をスコアリングする自動判断モデルを構築した。
- MOSS、ChatGLM、GPT-4、LLaMAなどの複数のLLMをベンチマークで評価し、出力長、事実的一致性、参照との整合性を測定した。
- 自動評価指標(ROUGE、BLEU)と人間の判断を比較し、長文出力における誤情報検出の信頼性を評価した。
実験結果
リサーチクエスチョン
- RQ1中国語LLMが感受性の高い出産および乳児ケア分野の長文生成において、どれほど広範に事実的誤情報が発生しているか?
- RQ2人間がアノテートした参照資料がなくても、自動判断モデルがLLM出力の事実的正確性をどれほど正確に評価できるか?
- RQ3異なるLLMは、専門家が検証済みの質問と参照資料を備えたベンチマークで、長文の知識集約的出力をどれほど効果的に生成できるか?
- RQ4提案されたベンチマークフレームワークは、他の知識集約的分野や低リソース言語に一般化可能か?
- RQ5標準的な自動評価指標(例:ROUGE、BLEU)は、長文テキスト生成における幻覚を検出する際に、どのような限界を示すか?
主な発見
- 現在の中国語LLMは、平均123.1トークンと4.6文の長文出力を生成するが、出産および乳児ケア分野では顕著な事実的誤りを示している。
- GPT-4とGPT-3.5-turboは、それぞれROUGE-Lスコアが4.779および4.562と最高を記録したが、高い文の流暢さにもかかわらず、幻覚的または誤解を招く主張を生成していた。
- ベンチマークで微調整された自動判断モデルは、人間の判断と強く相関しており、LLM出力のスケーラブルで低コストな評価を可能にした。
- ROUGE や BLEU といった標準的な自動評価指標は、事実的正確性との相関が限定的であり、長文生成における誤情報検出に適さないことが示された。
- ベンチマークは、GPT-4を含む最先端のLLMですら、複雑な医学的概念について推論する際、信ぴょう性はあるが事実的に誤った主張を頻繁に生成することを明らかにした。
- 本研究は、長文生成における誤情報は単なる文の流暢さの問題ではなく、分野特有で専門家が検証済みの評価フレームワークを必要とする、根本的な事実的一致性の問題であることを確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。