[논문 리뷰] ChatGPT v Bard v Bing v Claude 2 v Aria v human-expert. How good are AI chatbots at scientific writing?
이 연구는 인문학 및 고고학 분야의 과학적 글쓰기에서 인간 전문가와 대비하여 여섯 개의 AI 채팅 봇—ChatGPT-4, ChatGPT-3.5, Bing, Bard, Claude 2, 그리고 Aria—을 평가한다. 사실 정확도의 정량적 평가와 과학적 기여도의 정성적 분석을 통해, ChatGPT-4가 가장 높은 정확도를 보였으며, 모든 AI 모델이 원본 과학적 내용을 생성하지 못함을 확인하여, AI가 학술 글쓰기에서 인간의 창의성을 재현하는 데 지속적인 한계를 지닌다는 점을 드러낸다.
Historical emphasis on writing mastery has shifted with advances in generative AI, especially in scientific writing. This study analysed six AI chatbots for scholarly writing in humanities and archaeology. Using methods that assessed factual correctness and scientific contribution, ChatGPT-4 showed the highest quantitative accuracy, closely followed by ChatGPT-3.5, Bing, and Bard. However, Claude 2 and Aria scored considerably lower. Qualitatively, all AIs exhibited proficiency in merging existing knowledge, but none produced original scientific content. Inter-estingly, our findings suggest ChatGPT-4 might represent a plateau in large language model size. This research emphasizes the unique, intricate nature of human research, suggesting that AI's emulation of human originality in scientific writing is challenging. As of 2023, while AI has transformed content generation, it struggles with original contributions in humanities. This may change as AI chatbots continue to evolve into LLM-powered software.
연구 동기 및 목표
- 주요 AI 채팅 봇의 인문학 및 고고학 맥락에서의 과학적 글쓰기 품질을 평가하기 위해.
- 인간 전문가 대비 AI가 생성한 내용의 사실 정확도와 과학적 기여도를 평가하기 위해.
- 대규모 언어 모델이 기존 지식을 단순히 통합하는 데 그치지 않고 진정으로 새로운 과학적 통찰을 도출할 수 있는지 조사하기 위해.
- 특히 GPT-4 수준에서 성능이 정점에 도달했는지, 또는 더 새로운 모델이 뚜렷한 향상을 이룰 수 있는지 탐구하기 위해.
- 현재 AI가 학술 연구의 창의성과 깊이를 얼마나 잘 모방할 수 있는지 이해하기 위해.
제안 방법
- 연구는 인문학 및 고고학 분야의 표준화된 과학적 글쓰기 과제를 활용한 비교 평가 프레임워크를 도입하였다.
- 사실 정확도는 AI 출력 결과를 기준 데이터 및 전문가가 검증한 자료와 비교하여 정량적으로 측정하였다.
- 과학적 기여도는 전문가 리뷰를 통해 정성적으로 평가되었으며, 새로움, 논리적 일관성, 방법론의 타당성에 중점을 두었다.
- 평가에는 ChatGPT-4, ChatGPT-3.5, Bing, Bard, Claude 2, Aria 등 다섯 개의 AI 모델에 더하여 인간 전문가의 응답을 기준으로 삼았다.
- 핵심 발견을 명확하고 접근하기 쉽게 요약하기 위해 그래픽 초록 및 핵심 포인트를 활용하였다.
- 결과의 검증 및 확산을 위해 동료 심사 후 오픈 액세스 논문을 활용하였다.
실험 결과
연구 질문
- RQ1다양한 AI 채팅 봇은 인문학 및 고고학 분야에서 과학적 내용을 생성할 때 사실 정확도 측면에서 어떻게 성과를 내는가?
- RQ2AI 채팅 봇은 기존 지식의 단순 통합을 넘어서 실제 원천적인 과학적 기여를 얼마나 할 수 있는가?
- RQ3대규모 언어 모델의 성능은 GPT-4 수준에서 정점에 도달했는가, 아니면 더 새로운 모델이 뚜렷한 향상을 보일 수 있는가?
- RQ4AI 모델의 과학적 글쓰기 품질은 학술 분야에서 인간 전문가의 수준과 비교해 어떻게 다른가?
- RQ5현재 AI는 과학적 글쓰기에서 인간 연구의 깊이와 창의성을 얼마나 잘 재현할 수 있는가에 대한 지속적인 한계는 무엇인가?
주요 결과
- ChatGPT-4는 평가된 모든 AI 모델 중에서 사실 정확도 측면에서 가장 높은 정량적 정확도를 보였다.
- ChatGPT-3.5, Bing, 그리고 Bard는 ChatGPT-4에 이어 사실 정확도에서 뒤지지 않아, 최상위 수준의 모델들이 유사한 성능을 보임을 시사한다.
- Claude 2와 Aria는 사실 정확도 측면에서 상당한 낙차를 보였으며, 주요 LLM 간 성능 격차가 있음을 시사한다.
- 모든 AI 모델은 기존 지식을 융합하고 재구성하는 데 뛰어난 능력을 보였지만, 원천적인 과학적 통찰을 생성하지 못했다.
- 연구는 ChatGPT-4가 대규모 언어 모델 능력의 성능 정점에 도달했을 가능성이 있으며, 모델 크기 증가에 따른 수익 감소 현상이 나타날 수 있음을 제안한다.
- 인간 전문가는 여전히 원천적이고 개념적으로 새로운 과학적 내용을 생성하는 데서 슈퍼리미터한 존재로서의 역할을 유지하고 있으며, 이는 학술 연구에서 인간 창의성의 불가대체성을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.