[논문 리뷰] Grounding Large Language Models in Reaction Knowledge Graphs for Synthesis Retrieval
논문은 반응-지식그래프를 활용한 LLM의 grounding을 연구하여 반응-경로 검색을 Text2Cypher 생성으로 형식화하고, 프롬프트 전략과 체크리스트 기반 수정 루프를 비교하며 재현 가능한 평가 설정을 제시합니다.
Large Language Models (LLMs) can aid synthesis planning in chemistry, but standard prompting methods often yield hallucinated or outdated suggestions. We study LLM interactions with a reaction knowledge graph by casting reaction path retrieval as a Text2Cypher (natural language to graph query) generation problem, and define single- and multi-step retrieval tasks. We compare zero-shot prompting to one-shot variants using static, random, and embedding-based exemplar selection, and assess a checklist-driven validator/corrector loop. To evaluate our framework, we consider query validity and retrieval accuracy. We find that one-shot prompting with aligned exemplars consistently performs best. Our checklist-style self-correction loop mainly improves executability in zero-shot settings and offers limited additional retrieval gains once a good exemplar is present. We provide a reproducible Text2Cypher evaluation setup to facilitate further work on KG-grounded LLMs for synthesis planning. Code is available at https://github.com/Intelligent-molecular-systems/KG-LLM-Synthesis-Retrieval.
연구 동기 및 목표
- 구성된 화학 데이터에 LLM을 grounding하여 합성 계획 도중 환각 및 구식 지식의 문제를 줄이고자 한다.
- 자연어 질문을 반응 지식그래프 위의 실행 가능한 그래프 쿼리로 번역하는 Text2Cypher 파이프라인을 개발한다.
- 제로샷과 원샷 프롬프팅 전략을 체계적으로 비교하고, 정적, 동적 무작위, 임베딩 기반 예시 선택을 포함한다.
- 생성된 쿼리의 실행 가능성을 높이기 위한 가벼운 체크리스트 기반 검증자/수정자 루프를 도입하여 제로샷 설정에서 특히 실행 가능성을 개선한다.
- 합성 검색을 위한 KG-준거 LLM을 벤치마크하기 위한 재현 가능한 평가 설정(데이터셋, 프롬프트, 지표)을 제공한다.
제안 방법
- SMILES의 USPTO 반응에서 이진형 반응 지식그래프(KG)를 구성하고, 반응과 분자를 서로 다른 노드 유형으로 저장한다.
- retrosynthesis 검색을 Text2Cypher 작업으로 바꿔, 자연어 질의에서 Cypher 쿼리를 생성하고 Neo4j에서 실행 가능성을 검증한다.
- 설정별로 단일/다중 단계의 다섯 가지 프롬프트 변형을 설계하고, 정적, 동적 무작위, 임베딩 기반 예시 선택으로 제로샷과 원샷 프롬프팅을 비교한다.
- 검증자가 실행 가능성을 확인하고, 부적합한 쿼리를 최대 세 차례 수정하는 Chain-of-Verification(CoVe) 스타일 루프를 구현한다.
- 쿼리 텍스트 유사도(BLEU, METEOR, ROUGE-L)와 검색 지표(정밀도, 재현율, F1; 다단 경로에 대한 정확 경로 및 부분 경로 재현율)를 사용해 평가한다.
- 생성에 deterministic한 GPT-4.1-mini를 사용하고, 오픈 소스 Text2Cypher 평가 설정 및 코드를 제공한다.
실험 결과
연구 질문
- RQ1LLMs가 반응 KG에 대해 단일 단계 retrosynthesis 검색에서 실행 가능한 Cypher 쿼리를 생성하여 올바른 결과를 도출할 수 있는가?
- RQ2자연어로 질의했을 때 LLM이 다단계 retrosynthesis 경로(길이 4까지의 경로)를 올바르게 생성할 수 있는가?
- RQ3제로샷과 원샷 프롬프팅 및 예시 선택 전략이 검색 정확도와 실행 가능성에 어떤 영향을 미치는가?
- RQ4체크리스트 기반 검증자/수정자 루프가 쿼리 실행 가능성과 검색 품질을 개선하는가, 어떤 조건에서 가장 유용한가?
주요 결과
- 일회 프롬프팅에 정렬된 예시를 사용하는 경우 일관되게 최고의 검색 성능을 얻는다.
- CoVe 스타일의 자기 수정 루프는 주로 제로샷 설정에서 실행 가능성을 개선하고, 좋은 예시가 제공될 때는 이점이 제한적이다.
- 텍스트-대-텍스트 유사도 지표(BLEU, METEOR, ROUGE-L)는 이 작업에서 검색 정확도의 부적절한 지표이다.
- 제로샷에서 원샷으로 이동하면 다단계 작업에서 끝점 기준 고정 및 traversal 방향 위반과 같은 일반적인 검색 오류가 감소한다.
- 작업 특화 검증자는 병목 현상이며, 일반적인 체크리스트는 작업 특유의 실패를 놓치므로 스키마 인식 검증자가 필요하다는 것을 시사한다.
- 이 프레임워크는 재현 가능한 Text2Cypher 평가 설정과 기초 결과를 제공하여 KG-준거 LLMs의 합성 계획 방향을 안내한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.