[논문 리뷰] From Generalist to Specialist: A Survey of Large Language Models for Chemistry
이 종합 검토는 화학 분야에 특화된 대규모 언어 모델(LLM)을 체계적으로 검토하며, 도메인 전문 지식 통합, 다중 모odal 데이터(2D/3D 구조, 스펙트럼) 및 도구 사용 능력에 중점을 둔다. 일반 모델을 화학 전용 에이전트로 변환하는 방법에 대한 분류 체계를 제안하고, 벤치마크를 평가하며, 화학 분야 과학적 발견을 촉진하기 위한 주요 과제와 향후 방향을 규명한다.
Large Language Models (LLMs) have significantly transformed our daily life and established a new paradigm in natural language processing (NLP). However, the predominant pretraining of LLMs on extensive web-based texts remains insufficient for advanced scientific discovery, particularly in chemistry. The scarcity of specialized chemistry data, coupled with the complexity of multi-modal data such as 2D graph, 3D structure and spectrum, present distinct challenges. Although several studies have reviewed Pretrained Language Models (PLMs) in chemistry, there is a conspicuous absence of a systematic survey specifically focused on chemistry-oriented LLMs. In this paper, we outline methodologies for incorporating domain-specific chemistry knowledge and multi-modal information into LLMs, we also conceptualize chemistry LLMs as agents using chemistry tools and investigate their potential to accelerate scientific research. Additionally, we conclude the existing benchmarks to evaluate chemistry ability of LLMs. Finally, we critically examine the current challenges and identify promising directions for future research. Through this comprehensive survey, we aim to assist researchers in staying at the forefront of developments in chemistry LLMs and to inspire innovative applications in the field.
연구 동기 및 목표
- 일반 모델이 화학 분야에서 겪는 한계를 해결하기 위해 도메인 지식, 다중 모달 데이터, 도구 통합 분야의 핵심 과제를 규명한다.
- 사전 훈련, 피니테이닝, 도구 보강 추론을 통해 일반 LLM을 전문화된 화학 LLM으로 전환하는 데 있어 포괄적인 분류 체계를 제공한다.
- 텍스트, 구조, 스펙트럼 모달리티를 포함한 화학 전용 LLM 능력을 평가하기 위한 기존 벤치마크 및 데이터셋을 평가한다.
- 화학 도구(예: 분자 에디터, 시뮬레이션 엔진 등)를 활용해 자율적인 에이전트로서 LLM의 역할을 탐색한다.
- 데이터 부족, 모델 정렬, 다중 모달 추론 분야에서의 열린 과제와 향후 연구 방향을 규명한다.
제안 방법
- 화학 LLM 적응을 도메인 지식 통합, 다중 모달 데이터 처리(1D 시퀀스, 2D 그래프, 3D 구조, 스펙트럼), 도구 사용의 세 가지 핵심 과제로 분류한다.
- 사전 훈련, 지도적 피니테이닝(SFT), 인간 피드백을 통한 강화 학습(RLHF)을 핵심 적응 전략으로 검토하며, SFT는 작업 특화 및 다중 작업 설정으로 추가 분류된다.
- 2D 분자 그래프(예: InstructMol, MolTC), 3D 구조(예: 3D-MoLM), 이미지(예: ChemVLM, MM-RCR)를 처리하는 다중 모달 LLM을 분석한다.
- 외부 도구인 분자 생성기, 반응 예측기, 시뮬레이션 엔진(예: Coscientist, ChemCrow, LLaMP)을 활용하는 도구 보강 LLM을 검토한다.
- 계획 수립, 지식 검색, 구조적 도구를 활용한 작업 실행이 가능한 화학 LLM을 에이전트로 모델링하기 위한 프레임워크를 제안한다.
- 모달리티(텍스트, 스펙트럼, 이미지)와 작업 유형(MCQ, 직접 답변)에 따라 14개 이상의 벤치마크(예: ChemLLMBench, MassSpecGym, ScholarChemQA)를 검토한다.

실험 결과
연구 질문
- RQ1일반 모델이 도메인 지식 통합을 통해 복잡한 화학 전용 작업을 효과적으로 수행할 수 있는 방법은 무엇인가?
- RQ22D/3D 분자 구조, 스펙트럼, 이미지 등 다중 모달 데이터를 화학 중심 LLM에 효과적으로 통합하는 가장 효과적인 방법은 무엇인가?
- RQ3외부 화학 도구를 활용해 LLM이 과학적 추론 및 합성 계획 수립을 위해 자율적인 에이전트로 기능할 수 있는 정도는 어느 정도인가?
- RQ4기존의 벤치마크를 사용할 때 화학 LLM 평가의 현재 한계와 제약 요소는 무엇인가?
- RQ5화학 LLM 분야에서 최신 기술 수준을 향상시키기 위해 가장 유망한 향후 연구 방향은 무엇인가?
주요 결과
- 일반 모델은 도메인 지식 부족으로 인해 반응 예측, 물성 계산, 명명법 분야에서 오류를 범하며 성능이 열등하다.
- 3D-MoLM 및 ChemVLM과 같은 다중 모달 LLM은 3D 구조 및 이미지 기반 작업에서 성능 향상을 보였지만, 데이터 부족과 레이블 품질 문제로 인해 여전히 제한을 받는다.
- SFT 기반 모델인 LlaSMol과 ChemDFM은 분자 물성 예측 및 반응 생성 분야에서 뛰어난 성능을 보이며, 제로샷 프롬프팅 대비 정확도 향상을 이룬다.
- ChemCrow 및 LLaMP와 같은 도구 보강 LLM은 외부 도구를 통합함으로써 후보 역합성 및 시약 예측과 같은 복잡한 작업에서 뚜렷한 성능 향상을 보였다.
- MassSpecGym 및 ScholarChemQA와 같은 벤치마크는 LLM이 스펙트럼 해석 및 도메인 특화 추론에서 여전히 어려움을 겪고 있음을 드러내며, 특히 분포 이탈 상황에서의 성능 저하가 두드러진다.
- 이 조사에서는 특히 현실적인 분자 이미지와 반응 도식에 대한 개방형 대규모 다중 모달 데이터셋의 부재로 인해 모델의 일반화 능력이 제한된다는 중요한 격차를 규명한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.