[논문 리뷰] BatGPT: A Bidirectional Autoregessive Talker from Generative Pre-trained Transformer
BatGPT는 우한대학교와 상하이交通大学에서 개발한 이방향 순차적 대규모 언어 모델로, 왼쪽에서 오른쪽 및 오른쪽에서 왼쪽으로의 의존성을 모델링하여 유창성, 일관성 및 맥락 유지 능력을 향상시키도록 설계되었다. 이 모델은 중국어 NLP 벤치마크에서 최고 성능을 기록하며, CMMLU에서 평균 정확도 36.72%와 C-Eval에서 57.4%를 기록했고, 어려운 하위 집합에서 강력한 제로샷 추론 능력을 보였다.
BatGPT is a large-scale language model designed and trained jointly by Wuhan University and Shanghai Jiao Tong University. It is capable of generating highly natural and fluent text in response to various types of input, including text prompts, images, and audio. In the modeling level, we employ a bidirectional autoregressive architecture that allows the model to efficiently capture the complex dependencies of natural language, making it highly effective in tasks such as language generation, dialog systems, and question answering. Moreover, the bidirectional autoregressive modeling not only operates from left to right but also from right to left, effectively reducing fixed memory effects and alleviating model hallucinations. In the training aspect, we propose a novel parameter expansion method for leveraging the pre-training of smaller models and employ reinforcement learning from both AI and human feedback, aimed at improving the model's alignment performance. Overall, these approaches significantly improve the effectiveness of BatGPT, and the model can be utilized for a wide range of natural language applications.
연구 동기 및 목표
- 기존 순차적 모델의 한계, 즉 제한된 메모리와 환각 현상 등을 해결하기 위해 이방향 순차적 아키텍처를 도입한다.
- AI 및 인간 피드백에서 유도된 강화 학습을 통해 인간의 기대와의 일치도를 향상시키고 환각 현상을 줄인다.
- 파라미터 확장 및 피니팅 전략을 통해 저자원 및 복잡한 추론 작업에서의 성능을 향상시킨다.
- 문서, 이미지, 오디오 입력을 고려한 다양한 작업을 수행할 수 있는 유연하고 대규모 언어 모델을 개발한다.
제안 방법
- 시퀀스를 왼쪽에서 오른쪽 및 오른쪽에서 왼쪽으로 모두 처리하는 이방향 순차적 아키텍처를 사용하여 장거리 의존성을 포착한다.
- 사전 훈련된 소형 모델을 활용하는 파라미터 확장 전략을 도입하여 더 큰 BatGPT-15B 모델의 효율적 훈련을 가능하게 한다.
- AI 생성 피드백과 인간 피드백에서 유도된 강화 학습을 통합하여 인간 기대와의 일치도를 향상시키고 환각 현상을 감소시킨다.
- 지시 훈련과 텍스트-텍스트 작업 포맷을 적용하여 다양한 NLP 작업 간의 성능을 통합하고 향상시킨다.
- 중국어 중심 벤치마크 성능 향상을 위해 중국어 전용 콘텐츠를 포함한 다양한 다국어 데이터셋을 사용한다.
- 제로샷 및 소수 샘플 일반화 능력을 평가하기 위해 평가 시 5-shot 프롬프팅 설정을 활용한다.

실험 결과
연구 질문
- RQ1표준 순차적 모델 대비 이방향 순차적 아키텍처가 기억 퇴화와 환각 현상을 줄일 수 있는가?
- RQ2AI 및 인간 피드백에서 유도된 강화 학습은 대규모 언어 모델의 일치도와 사실적 일관성에 어떻게 기여하는가?
- RQ3소형 사전 훈련 모델에서 유도된 파라미터 확장 전략이 BatGPT와 같은 대규모 언어 모델의 성능을 얼마나 향상시킬 수 있는가?
- RQ4이방향 순차적 아키텍처는 CMMLU 및 C-Eval와 같은 복잡한 다영역 벤치마크에서 제로샷 추론 및 소수 샘플 일반화 능력을 향상시키는가?
- RQ5기존 모델들과 비교해 봤을 때 BatGPT는 중국어 NLP 벤치마크의 어려운 추론 중심 하위 집합에서 어떻게 성능을 발휘하는가?
주요 결과
- BatGPT-15B는 CMMLU 벤치마크에서 평균 정확도 36.72%를 기록했으며, 평가된 모든 중국어 중심 LLM보다 뛰어난 성능을 보였다.
- C-Eval 벤치마크에서는 총합 정확도 57.4%를 기록했고, 사회과학 분야에서 72.1%, 인문학 분야에서 60.7%의 정확도를 기록했다.
- 직접 답변 프롬프팅을 사용했을 경우 CMMLU 전체 세트에서 38.48%의 정확도를 기록했고, 사고의 흐름 프롬프팅을 사용했을 경우 35.91%를 기록했으며, 이는 더 큰 규모에서의 향상 잠재력이 있음을 시사한다.
- C-Eval Hard 하위 집합에서는 36.9%의 정확도를 기록했으며, 도전적이고 비직관적인 작업에서 강력한 추론 능력을 보였다.
- 모든 CMMLU 카테고리에서 뛰어난 성능를 보였으며, 중국 관련 주제에서는 37.00%의 정확도, '기타' 카테고리에서는 42.14%의 정확도를 기록했다.
- 다양한 프롬프팅 전략에 걸쳐 일관된 성능를 보이며, 다양한 입력 형식에 대한 강력한 일반화 능력과 적응 가능성의 잠재력을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.