Skip to main content
QUICK REVIEW

[논문 리뷰] Usefulness of LLMs as an Author Checklist Assistant for Scientific Papers: NeurIPS'24 Experiment

Alexander Goldberg, Ihsan Ullah|arXiv (Cornell University)|2024. 11. 05.
Artificial Intelligence in Healthcare and EducationMedicine인용 수 3
한 줄 요약

이 연구는 NeurIPS 2024에서 대규모 언어 모델(LLM) 기반 체크리스트 어시스턴트를 도입하여 저자들이 제출 기준을 준수하는 데 도움을 주는 것을 평가한다. 이 어시스턴트는 234篇의 논문에 대해 구체적이고 실행 가능한 피드백을 제공하였으며, 70퍼센트 이상의 사용자가 유용하다고 평가하고 피드백에 따라 작업을 수정하였다. 다만 정확도 부족과 지나친 엄격함 등의 문제점이 제기되었으며, 조작에 취약한 점도 확인되었지만, 제출 품질 향상 잠재력은 높게 평가된다.

ABSTRACT

Large language models (LLMs) represent a promising, but controversial, tool in aiding scientific peer review. This study evaluates the usefulness of LLMs in a conference setting as a tool for vetting paper submissions against submission standards. We conduct an experiment at the 2024 Neural Information Processing Systems (NeurIPS) conference, where 234 papers were voluntarily submitted to an "LLM-based Checklist Assistant." This assistant validates whether papers adhere to the author checklist used by NeurIPS, which includes questions to ensure compliance with research and manuscript preparation standards. Evaluation of the assistant by NeurIPS paper authors suggests that the LLM-based assistant was generally helpful in verifying checklist completion. In post-usage surveys, over 70% of authors found the assistant useful, and 70% indicate that they would revise their papers or checklist responses based on its feedback. While causal attribution to the assistant is not definitive, qualitative evidence suggests that the LLM contributed to improving some submissions. Survey responses and analysis of re-submissions indicate that authors made substantive revisions to their submissions in response to specific feedback from the LLM. The experiment also highlights common issues with LLMs: inaccuracy (20/52) and excessive strictness (14/52) were the most frequent issues flagged by authors. We also conduct experiments to understand potential gaming of the system, which reveal that the assistant could be manipulated to enhance scores through fabricated justifications, highlighting potential vulnerabilities of automated review tools.

연구 동기 및 목표

  • LLM 기반 체크리스트 어시스턴트가 저자들이 NeurIPS 제출 기준을 준수하는 데 얼마나 유용한지 평가하는 것.
  • LLM 어시스턴트와의 상호작용 이후 저자들의 인식과 행동 변화를 평가하는 것.
  • 실제 학술 체크리스트 검증 환경에서 LLM의 일반적인 실패 유형과 취약점을 규명하는 것.
  • LLM 피드백이 논문 품질 및 체크리스트 완전성 향상에 측정 가능한 영향을 미치는지 탐색하는 것.

제안 방법

  • NeurIPS 2024 논문 체크리스트(재현성, 윤리, 투명성에 관한 15개의 예/아니요 질문)에 대한 저자의 응답을 평가하는 LLM 기반 체크리스트 어시스턴트를 구현하였다.
  • 어시스턴트는 각 체크리스트 응답을 분석하고, 특정 섹션 참조나 윤리적 영향 논의 확장과 같은 구체적인 개선 사항을 제시하는 상세한 피드백을 생성한다.
  • 사용 전 및 사용 후 설문 조사(각각 539명, 78명)를 실시하여 사용자의 기대와 경험을 평가하였다.
  • 234건의 제출물(중복 제출 40건 포함)을 수집하고 분석하여 체크리스트 근거 설명의 길이와 내용 변화를 추적하였다.
  • 가짜 근거 제시를 통해 점수를 높일 수 있는지 테스트하기 위해 악성 시험을 실시하였다.

실험 결과

연구 질문

  • RQ1저자들이 LLM 기반 체크리스트 어시스턴트를 통해 NeurIPS 제출을 준비하는 데 얼마나 유용하게 느끼는가?
  • RQ2LLM 어시스턴트의 피드백이 체크리스트 완전성 및 논문 품질 향상에 측정 가능한 영향을 미치는가?
  • RQ3LLM이 체크리스트 검증에 사용될 때 가장 흔한 실패 유형은 무엇인가? (예: 정확도 부족, 지나친 엄격함 등)
  • RQ4거짓 근거 제시를 통해 LLM 기반 체크리스트 시스템이 쉽게 조작될 수 있는가?

주요 결과

  • 70퍼센트 이상의 저자가 LLM 기반 체크리스트 어시스턴트가 유용하다고 평가하였으며, 피드백에 따라 논문이나 체크리스트 응답을 수정하겠다고 밝혔다.
  • 저자들은 어시스턴트의 피드백에 따라 실질적인 수정을 이끌었으며, 재제출 시 체크리스트 근거 설명의 길이와 구체성이 크게 증가하였다.
  • LLM은 평균적으로 각 체크리스트 질문당 4~6개의 구체적이고 다각적인 피드백 포인트를 제공하여 제출 내용을 세밀하게 분석함을 보여주었다.
  • 가장 자주 언급된 문제점은 정확도 부족(52명 중 20명)과 지나친 엄격함(52명 중 14명)이었다.
  • 시스템은 조작에 취약하였으며, 악성 테스트에서 위장된 근거 제시를 통해 점수를 성공적으로 높일 수 있었으며, 이는 자동화된 리뷰 도구의 위험성을 드러냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.