Skip to main content
QUICK REVIEW

[논문 리뷰] Agentic AI for Scientific Discovery: A Survey of Progress, Challenges, and Future Directions

Mourad Gridach, Jay Nanavati|ArXiv.org|2025. 03. 12.
Scientific Computing and Data Management인용 수 10
한 줄 요약

이 연구 리뷰는 과학 발견을 위한 에이전틱 AI 시스템을 검토하며, 아키텍처(자율 및 협업), 문헌 리뷰의 장애물, 데이터 세트, 지표, 도전과제, 향후 방향을 개략한다. 화학, 생물학, 재료 과학 및 그 이상을 다룬다.

ABSTRACT

The integration of Agentic AI into scientific discovery marks a new frontier in research automation. These AI systems, capable of reasoning, planning, and autonomous decision-making, are transforming how scientists perform literature review, generate hypotheses, conduct experiments, and analyze results. This survey provides a comprehensive overview of Agentic AI for scientific discovery, categorizing existing systems and tools, and highlighting recent progress across fields such as chemistry, biology, and materials science. We discuss key evaluation metrics, implementation frameworks, and commonly used datasets to offer a detailed understanding of the current state of the field. Finally, we address critical challenges, such as literature review automation, system reliability, and ethical concerns, while outlining future research directions that emphasize human-AI collaboration and enhanced system calibration.

연구 동기 및 목표

  • 에이전틱 AI를 정의하고 과학 발견을 가속하는 역할을 설명한다.
  • 자율적이고 협력적인 에이전틱 AI 시스템과 그 도메인 응용을 분류한다.
  • 분야에서 사용되는 데이터 세트, 도구, 평가 지표를 식별한다.
  • 문헌 검토 자동화, 신뢰성 및 윤리의 도전에 주목한다.
  • 인간-AI 협력 및 시스템 보정을 강조하는 향후 방향을 제안한다.

제안 방법

  • 기존 에이전틱 AI 시스템 및 프레임워크(Coscientist, ChemCrow, ProtAgents, LLaMP, Organa 등)의 검토와 통합.
  • 완전 자율 시스템 대 인간-AI 협업 시스템에 대한 분류 체계 개발.
  • SciLitLLM, LitSearch, ResearchArena, CiteME 등의 문헌리뷰 프레임워크와 그 한계 평가.
  • 구현 도구(AutoGen, MetaGPT, Letta, CAMEL, LangChain, AutoGPT)와 데이터 세트(LAB-Bench, MoleculeNet, ZINC, MPcules, AlphaFold, PubChem, ChEMBL)의 정리.
  • 평가 지표(NeurIPS 스타일 논문 평가, 성공률, 사용성 지표)를 포함한 평가 방법의 논의.
  • 신뢰성, 윤리, 잠재적 위험 등의 도전과제와 향후 방향(보정, 거버넌스)의 통합.

실험 결과

연구 질문

  • RQ1과학 발견에서의 에이전틱 AI를 위한 현재의 아키텍처와 프레임워크는 무엇인가?
  • RQ2에이전틱 AI 시스템의 평가 및 벤치마크를 지원하는 데이터 세트, 도구, 지표는 무엇인가?
  • RQ3시스템 성능과 채택을 제한하는 주요 도전과제(문헌 리뷰, 신뢰성, 윤리)는 무엇인가?
  • RQ4인간- AI 협력과 보정이 과학에서의 신뢰성과 영향력을 어떻게 향상시킬 수 있는가?

주요 결과

  • 에이전틱 AI 시스템은 아이데이션에서 논문 작성에 이르는 단계들을 자동화할 수 있으며, 화학, 생물학, 재료 과학에서의 진전을 보이고 있다.
  • 문헌 검토는 여전히 프레임워크 전반에서 주요 병목 현상이며, 여러 접근 방식이 기존 지식에 아이디어를 안정적으로 근거지지하는 데 실패하는 경우가 있다.
  • 여러 자율적 및 협력적 프레임워크가 존재하며, 각 프레임워크는 해석가능성 및 일반화 측면에서 강점과 한계를 가진다.
  • 이들 에이전트를 개발·평가하는 데 사용되는 도구들(AutoGen, LangChain, Letta, CAMEL)과 데이터 세트들(LAB-Bench, MoleculeNet, ZINC, AlphaFold)이 다양하게 활용된다.
  • 평가 프레임워크는 발전하고 있으며, NeurIPS 스타일의 논문 평가와 사용성 지표가 과학적 산출물과 시스템의 유용성을 평가하는 데 점차 포함되고 있다.
  • 향후 방향은 인간-in-the-loop 접근, 더 나은 보정 기법, 신뢰할 수 있고 윤리적인 자율적 과학 발견을 보장하기 위한 강력한 거버넌스를 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.