[논문 리뷰] How much can ChatGPT really help Computational Biologists in Programming?
이 논문은 코딩 작업인 코드 생성, 디버깅, 리팩터링, 파ip라인 개발 등에서 계산 생물학자들이 ChatGPT를 얼마나 유용하게 활용할 수 있는지 평가한다. ChatGPT는 코딩 워크플로우를 크게 가속화하고 생산성을 향상시키지만, 잘못된 세부 정보나 기술적 오류, 잘못된 코드에 대한 과도한 자신감 등 위험을 동반하며, 생물정보학 워크플로우에서 전문가의 검증과 비판적 감시가 필요하다는 점을 입증한다.
ChatGPT, a recently developed product by openAI, is successfully leaving its mark as a multi-purpose natural language based chatbot. In this paper, we are more interested in analyzing its potential in the field of computational biology. A major share of work done by computational biologists these days involve coding up bioinformatics algorithms, analyzing data, creating pipelining scripts and even machine learning modeling and feature extraction. This paper focuses on the potential influence (both positive and negative) of ChatGPT in the mentioned aspects with illustrative examples from different perspectives. Compared to other fields of computer science, computational biology has - (1) less coding resources, (2) more sensitivity and bias issues (deals with medical data) and (3) more necessity of coding assistance (people from diverse background come to this field). Keeping such issues in mind, we cover use cases such as code writing, reviewing, debugging, converting, refactoring and pipelining using ChatGPT from the perspective of computational biologists in this paper.
연구 동기 및 목표
- 계산 생물학자들이 생물정보학 코드를 작성하고 검토하며 디버깅하는 데 있어 ChatGPT의 실용적 유용성을 평가하기 위해.
- 특히 사실 정확성과 코드 정확성 측면에서 대규모 언어 모델(ChatGPT 등)에 의존할 경우 발생하는 제한성과 위험 요소를 규명하기 위해.
- 생물정보학 워크플로우에서 생성형 AI를 책임감 있게 사용하기 위한 실제 사례와 지침을 제공하기 위해.
- ChatGPT의 성능을 특정 생물학적 프로그래밍 작업에서의 전문 코딩 보조도구인 Codex나 GitHub Copilot와 비교하기 위해.
- 환상, 오래된 지식, 의료 및 게놈 데이터 처리에서의 잠재적 편향으로 인해 인간의 감시가 반드시 필요하다는 점을 강조하기 위해.
제안 방법
- 실제 생물정보학 응용 사례(예: 코드 생성, 디버깅, 데이터 파이프라인 구축)를 활용해 ChatGPT와의 상호작용 실험을 수행하였다.
- 기존 생물정보학 도구(예: Samtools, Pysam, PSI-BLAST)와 알려진 생물학 원리와 비교하여 응답의 기술적 정확성을 평가하였다.
- BAM 파일 플래그, VAF 콜링, PCA 대 비표준 PCA 등 복잡한 개념을 설명하고 파이썬 및 바시스크립트에서 작동하는 코드를 생성하는 능력을 테스트하였다.
- 클리닉 데이터를 포함한 민감한 작업(예: cfDNA에서의 클론성 혈액형성 이상)에서의 성능을 평가하였으며, 참조 자료나 통계를 위조하는 경향을 분석하였다.
- 문서화, 오류 처리, 아키텍처 선택(예: 파이썬에서의 subprocess 사용 대 대안 스크립트)을 고려하여 코드 품질을 분석하였다.
- 응답 신뢰도, 일관성, 오류 패턴을 체계적으로 평가하기 위해 41개의 상호작용 트랜스크립트(기록 S1–S41)를 수집하고 분석하였다.

실험 결과
연구 질문
- RQ1ChatGPT는 BAM 파일 처리, 변이 콜링, 데이터 시각화와 같은 작업에서 정확하고 효율적인 생물정보학 코드를 얼마나 잘 생성할 수 있는가?
- RQ2BLAST, PCA, VAF 콜링과 같은 복잡한 생물정보학 개념에 대해 ChatGPT의 기술적 설명은 얼마나 신뢰할 수 있는가?
- RQ3생물정보학에서 ChatGPT를 사용할 경우 주요 위험 요소는 무엇인가? 특히 환상적인 사실, 잘못된 참조, 잘못된 논리적 추론의 경우를 포함하여.
- RQ4생물정보학 전용 시나리오에서 ChatGPT의 성능은 Codex나 GitHub Copilot와 같은 전문 코딩 보조도구와 어떻게 비교되는가?
- RQ5계산 생물학자들이 데이터 무결성이나 재현 가능성에 손상을 주지 않으면서 ChatGPT를 프로그래밍 워크플로우에 어떻게 최적화하여 통합할 수 있는가?
주요 결과
- ChatGPT는 Samtools와 Pysam 같은 핵심 생물정보학 도구를 정확히 설명하여 올바른 사용 사례와 그들 사이의 차이점을 명확히 하였다.
- 모델는 종종 세부 정보를 환상적으로 생성했는데, 예를 들어 클론성 혈액형성 이상이 백혈병 증후군을 유발한다고 주장하여 임상 및 게놈 맥락에서 심각한 위험을 드러냈다.
- 구체적인 통계나 참조 자료를 제공하는 것을 피하고 키워드 검색을 제안하는 방식을 취했으며, 직접적으로 최신 데이터베이스나 논문에 액세스할 수 없었다.
- 쉘 스크립트가 더 적절한 상황에서도 파이썬과 subprocess 모듈을 사용한 코드를 자주 생성하여, 시스템 수준 스크립팅에서 맥락 인식 능력의 부족함을 보였다.
- 문서화가 잘 된 코드를 생성했지만, 이는 때로는 잘못된 논리에 대한 과도한 자신감을 유도하여 표면적인 정확성의 위험을 드러냈다.
- 모델의 지식 기반은 2021년 9월까지의 데이터로 고정되어 있어, 최신 PSI-BLAST 버전이나 현재의 WGS 가격과 같은 최근 개발에 대한 질문에는 부적합하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.