[논문 리뷰] Evaluating ChatGPT as a Question Answering System: A Comprehensive Analysis and Comparison with Existing Models
이 논문은 영어 및 페르시아어 데이터셋인 SQuAD, NewsQA, PersianQuAD를 사용하여 챗지피티를 질문-답변 시스템(QAS)으로 평가한다. 간단한 사실 질문에서는 뛰어난 성능을 보이지만, 특히 '어떻게'와 '왜' 유형의 복잡한 질문에서는 전용 모델에 비해 성능이 열 劣하며, 문맥에 답이 없을 경우 심각한 환각 현상이 발생함을 확인하였다. 다만 프롬프트 엔지니어링과 제공된 문맥을 통해 성능 향상이 가능하다.
In the current era, a multitude of language models has emerged to cater to user inquiries. Notably, the GPT-3.5 Turbo language model has gained substantial attention as the underlying technology for ChatGPT. Leveraging extensive parameters, this model adeptly responds to a wide range of questions. However, due to its reliance on internal knowledge, the accuracy of responses may not be absolute. This article scrutinizes ChatGPT as a Question Answering System (QAS), comparing its performance to other existing QASs. The primary focus is on evaluating ChatGPT's proficiency in extracting responses from provided paragraphs, a core QAS capability. Additionally, performance comparisons are made in scenarios without a surrounding passage. Multiple experiments, exploring response hallucination and considering question complexity, were conducted on ChatGPT. Evaluation employed well-known Question Answering (QA) datasets, including SQuAD, NewsQA, and PersianQuAD, across English and Persian languages. Metrics such as F-score, exact match, and accuracy were employed in the assessment. The study reveals that, while ChatGPT demonstrates competence as a generative model, it is less effective in question answering compared to task-specific models. Providing context improves its performance, and prompt engineering enhances precision, particularly for questions lacking explicit answers in provided paragraphs. ChatGPT excels at simpler factual questions compared to "how" and "why" question types. The evaluation highlights occurrences of hallucinations, where ChatGPT provides responses to questions without available answers in the provided context.
연구 동기 및 목표
- 제공된 문맥 단락에서 답변을 추출하는 데 있어 챗지피티의 질문-답변 시스템(QAS)으로서의 효과성을 평가하는 것.
- 사용자 지정된 질문-답변 모델과의 성능 비교를 통해 사실 기반 질문 및 비사실 기반 질문 유형에서의 챗지피티의 성능을 평가하는 것.
- 문맥, 프롬프트 엔지니어링, 질문 복잡도가 정확도 및 환각 빈도에 미치는 영향을 조사하는 것.
- 제공된 문맥에 답변이 존재하지 않을 경우 챗지피티의 환각 빈도를 평가하는 것.
- 표준 QA 메트릭을 사용하여 영어(SQuAD, NewsQA) 및 페르시아어(PersianQuAD) 다국어 데이터셋에서의 성능을 분석하는 것.
제안 방법
- 표준 질문-답변(QA) 데이터셋인 SQuAD 1.1, SQuAD 2.0, NewsQA, PersianQuAD를 사용하여 챗지피티를 평가함.
- 정답 정확도 및 스팸 정밀도를 측정하기 위해 표준 평가 메트릭(F1 점수, 정확 일치(EM), 재현율)를 적용함.
- 문맥 의존성 평가를 위해 문맥 단락이 있는 경우와 없는 경우 두 가지 설정에서 실험을 수행함.
- 질문의 어려움을 정량화하고 다양한 유사도 수준에서 성능를 분석하기 위해 질문과 답변 간의 자카르 유사도를 사용함.
- 특히 문맥에 명시된 답변이 없는 질문 유형에서 정밀도 향상을 위해 이중 단계 프롬프트 엔지니어링을 구현함.
- 사실 기반(사실 기반) 및 비사실 기반(추론 기반) 질문 유형에 따른 응답 패턴을 분석함.

실험 결과
연구 질문
- RQ1문맥이 제공될 경우 챗지피티의 질문-답변 성능이 전용 모델과 비교해 어떻게 되는가?
- RQ2문맥 단락을 제공함으로써 챗지피티의 정답 정확도는 얼마나 향상되고 환각 현상은 얼마나 감소하는가?
- RQ3질문과 답변 간 자카르 유사도로 측정한 질문 복잡도가 다양한 데이터셋에서 챗지피티의 F1 점수에 어떤 영향을 미치는가?
- RQ4제공된 문맥에 답변이 존재하지 않을 경우 챗지피티의 환각 빈도는 얼마인가?
- RQ5간단한 사실 기반 질문과 복잡한 '어떻게' 및 '왜' 질문 간 성능은 어떻게 다름이 있는가?
주요 결과
- SQuAD 1.1에서 챗지피티는 자카르 유사도가 0.5인 질문에서 최고 F1 점수 0.83을 기록하여 중간 복잡도에서 최적의 성능를 보임.
- SQuAD 2.0에서는 자카르 유사도가 0.3일 때 최고 F1 점수 0.78를 기록하여, 유사도가 낮고 더 복잡한 질문에서 더 강한 성능를 보임.
- PersianQuAD 데이터셋에서는 자카르 유사도가 0.09인 질문에서 최고 F1 점수 0.78를 기록하여 낮은 유사도, 복잡한 질의에 대한 처리 능력을 보임.
- NewsQA에서는 어려움 증가에 따라 F1 점수에 주기적인 패턴이 나타나, 어려움과 성능 간 단조로운 관계가 없음을 시사함.
- 챗지피티는 '어떻게' 및 '왜' 질문보다 단순한 사실 기반 질문에서 더 높은 정확도를 보였으며, 이는 깊이 있는 추론과 추론이 요구되는 질문에 비해 성능이 열 劣함.
- 제공된 문맥에 답이 존재하지 않을 경우 빈번히 환각 현상이 관찰되었으며, 모델은 타당해 보이지만 잘못된 응답을 생성함.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.