Skip to main content
QUICK REVIEW

[논문 리뷰] CiteAudit: You Cited It, But Did You Read It? A Benchmark for Verifying Scientific References in the LLM Era

Zhengqing Yuan, Kaiwen Shi|arXiv (Cornell University)|2026. 02. 26.
Scientific Computing and Data Management인용 수 0
한 줄 요약

CiteAudit은 다중 에이전트 프레임워크와 대규모 벤치마크를 도입하여 과학적 글쓰기에서 인용된 참고문헌의 신뢰성과 증거 정합성을 검증하고, LLM 시대의 환각 인용 문제를 다룬다. 이는 기준선 대비 탐지 정확도와 해석가능성을 향상시켰으며 표준화된 평가 프로토콜을 제공한다.

ABSTRACT

Scientific research relies on accurate citation for attribution and integrity, yet large language models (LLMs) introduce a new risk: fabricated references that appear plausible but correspond to no real publications. Such hallucinated citations have already been observed in submissions and accepted papers at major machine learning venues, exposing vulnerabilities in peer review. Meanwhile, rapidly growing reference lists make manual verification impractical, and existing automated tools remain fragile to noisy and heterogeneous citation formats and lack standardized evaluation. We present the first comprehensive benchmark and detection framework for hallucinated citations in scientific writing. Our multi-agent verification pipeline decomposes citation checking into claim extraction, evidence retrieval, passage matching, reasoning, and calibrated judgment to assess whether a cited source truly supports its claim. We construct a large-scale human-validated dataset across domains and define unified metrics for citation faithfulness and evidence alignment. Experiments with state-of-the-art LLMs reveal substantial citation errors and show that our framework significantly outperforms prior methods in both accuracy and interpretability. This work provides the first scalable infrastructure for auditing citations in the LLM era and practical tools to improve the trustworthiness of scientific references.

연구 동기 및 목표

  • LLM으로 인해 학술 글쓰기에서 환각 인용을 개선해야 할 필요성을 동기화한다.
  • 인용의 신뢰성 및 증거 정합성을 평가하기 위한 확장 가능한 다중 에이전트 검증 프레임워크를 제안한다.
  • 다양한 분야와 인용 유형에 걸친 크고 인간 검증된 벤치마크를 만든다.
  • 인용 검증을 위한 통합 평가 프로토콜과 지표를 제공한다.
  • 최첨단 LLM 실험에서 기준선 대비 향상된 정확도와 해석가능성을 입증한다.

제안 방법

  • Plan controller에 의해 조정되는 Claim Extractor, Retriever, Evidence Matcher, Reasoner, Judge 다섯 에이전트 파이프라인을 설계한다.
  • 실세계 인용 오류와 체계적으로 생성된 환각 인용을 인간 검증과 함께 결합한 대규모 데이터셋을 개발한다.
  • 정확한 메타데이터 일치를 요구하는 엄격한 검증 기준과 함께 다단계 증거 일관성 작업으로 검증을 형식화한다.
  • 에이전트를 통해 웹 검색 및 학술 데이터베이스를 외부 지식 원천으로 구현하여 증거를 근거지로 삼는다.
  • 생성된 벤치마크와 실제 테스트 세트에서 표준 지표로 인용의 충실도와 평결 일관성을 평가한다.

실험 결과

연구 질문

  • RQ1다중 에이전트 프레임워크가 과학 원고에서 환각 인용을 신뢰성 있게 탐지할 수 있는가?
  • RQ2증거 검색 및 추론이 다양한 인용 유형에서 충실성 판단에 어떤 영향을 미치는가?
  • RQ3권위 있는 학자 검증을 포함하는 것이 재현율과 정밀도에 미치는 영향은 무엇인가?
  • RQ4생성된 벤치마크가 실제 현장에서의 인용 오류 패턴을 얼마나 잘 반영하는가?

주요 결과

  • 벤치마크는 실제 세계의 환각 인용과 합성된 인용을 결합하여 실무에서 관찰된 것과 유사한 현실적인 오류 패턴을 보인다.
  • 다중 에이전트 검증은 단일 모델 기준선에 비해 정확도와 해석 가능성을 크게 향상시킨다.
  • 최종 검증 단계로서의 Scholar Agent는 웹 기반 검사만으로 통과하는 강인한 환각을 줄인다.
  • 실세계 데이터에서 제안된 프레임워크가 평가된 방법 중 가장 높은 정확도, 정밀도, 재현율, F1을 달성한다.
  • 추론 비용과 지연을 줄이면서 계획 및 최종 판단 단계에 무거운 추론을 한정해 다수의 독점 LLM 기반 솔루션보다 비용 및 지연이 낮다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.