[논문 리뷰] TABLET: Learning From Instructions For Tabular Data
이 논문은 대규모 언어 모델(Large Language Models, LLMs)이 표형 예측을 위한 지시어를 얼마나 잘 학습하는지 평가하기 위해 자연어 지시어의 어조, 세분성, 전문성 수준이 다양하게 구성된 20개의 다양한 표형 데이터셋을 포함한 TABLET라는 벤치마크를 소개한다. 지시어는 Flan-T5 11b의 경우 평균 44% 향상, ChatGPT의 경우 13% 향상시키며 제로샷 F1 성능을 향상시키지만, LLMs는 여전히 지시어의 충실도와 특정 인스턴스에 대한 편향 문제를 겪고 있다.
Acquiring high-quality data is often a significant challenge in training machine learning (ML) models for tabular prediction, particularly in privacy-sensitive and costly domains like medicine and finance. Providing natural language instructions to large language models (LLMs) offers an alternative solution. However, it is unclear how effectively instructions leverage the knowledge in LLMs for solving tabular prediction problems. To address this gap, we introduce TABLET, a benchmark of 20 diverse tabular datasets annotated with instructions that vary in their phrasing, granularity, and technicality. Additionally, TABLET includes the instructions' logic and structured modifications to the instructions. We find in-context instructions increase zero-shot F1 performance for Flan-T5 11b by 44% on average and 13% for ChatGPT on TABLET. Also, we explore the limitations of using LLMs for tabular prediction in our benchmark by evaluating instruction faithfulness. We find LLMs often ignore instructions and fail to predict specific instances correctly, even with examples. Our analysis on TABLET shows that, while instructions help LLM performance, learning from instructions for tabular data requires new capabilities.
연구 동기 및 목표
- 의료 및 금융과 같은 개인정보가 민감한 분야에서 고품질의 레이블이 부여된 표형 데이터 확보의 과제를 해결하기 위해.
- 자연어 지시어가 사전에 학습된 LLM의 세계 지식을 표형 예측에 효과적으로 활용할 수 있는지 조사하기 위해.
- 지시어를 통해 학습할 때 LLM의 제로샷 및 패트치샷 설정에서의 성능와 한계를 평가하기 위해.
- 향후 지시 기반 표형 학습 연구를 지원하기 위해 다양한, 레이블이 부여된 지시어를 포함한 표준화된 벤치마크를 제공하기 위해.
- 표형 작업에서 LLM의 실패 유형, 예를 들어 지시어 준수 실패와 모델 편향을 규명하기 위해.
제안 방법
- 저자들은 UCI ML Repository에서 10개, 희귀 질환의 차별진단(DDX) 데이터셋 10개를 포함해 총 20개의 표형 데이터셋을 수집하였다.
- 각 데이터셋은 소비자 및 임상 분야에서 유래한 지시어의 다양성, 어조, 세분성, 전문성 수준을 고려해 다수의 지시어로 레이블링되었다.
- 지시어는 논리적 표현과 뒤집힌 버전으로도 추가로 레이블링되어 지시어 충실도와 일반화 능력을 테스트하였다.
- 벤치마크는 제로샷 및 패트치샷 평가를 지원하며, 지시어를 포함하거나 포함하지 않은 경우의 LLM 성능 비교를 가능하게 한다.
- Flan-T5 11b 및 ChatGPT 등의 모델을 대상으로 제로샷 및 패트치샷 설정에서 F1 점수를 사용해 성능을 평가하였다.
- 성능의 상한선을 근사하기 위해 KNN 기반의 패트치샷 예제 선택 방법을 사용하였으며, 이를 LLM 결과와 비교하였다.
실험 결과
연구 질문
- RQ1자연어 지시어는 표형 예측 작업에서 LLM의 제로샷 및 패트치샷 성능을 어느 정도 향상시키는가?
- RQ2지시어의 어조, 세분성, 전문성 수준의 다양성이 LLM의 성능 및 지시어 준수에 어떤 영향을 미치는가?
- RQ3특히 논리적으로 뒤집힌 또는 모순적인 지시어가 제시되었을 때 LLM이 지시어를 얼마나 충실히 따르는가?
- RQ4표형 예측을 위한 지시어 학습에서 LLM의 주요 실패 유형은 무엇인가?
- RQ5지시 기반 프롬프팅은 샘플 효율적인 설정에서 완전히 지도 학습 모델에 가까운 성능을 달성할 수 있는가?
주요 결과
- 지시어 덕분에 Flan-T5 11b의 평균 제로샷 F1 성능은 TABLET 벤치마크 전반에서 44% 향상되었고, ChatGPT의 경우 13% 향상되었다.
- 성능 향상은 패트치샷 설정에서 가장 두드러졌다. Flan-T5 11b는 네 개의 컨텍스트 예제를 제공받은 경우 기준선 대비 평균 44%의 F1 향상을 기록했다.
- 지시어의 도움에도 불구하고 LLM은 여전히 심각한 편향을 보였으며, 명확한 지시어와 예시가 제공된 상황에서도 특정 인스턴스를 올바르게 분류하지 못했다.
- 지시어 충실도는 낮았다. 특히 논리적으로 뒤집힌 또는 반대 조건의 지시어일 경우 모델이 지시어를 무시하거나 잘못 이해하는 경우가 많았다.
- KNN 기반의 최적의 패트치샷 예제 선택과 특징 가중치를 적용한 결과, Flan-T5 11b의 F1 점수는 0.77에 머물렀고, 완전히 지도 학습된 KNN 모델의 0.93 F1 점수에 못 미쳤다. 이는 여전이 성능 격차가 존재함을 시사한다.
- 결과적으로 현재 LLM은 사전에 학습된 지식을 효과적으로 활용하면서도 동시에 작업에 특화된 지시어를 충실히 따르는 데 어려움을 겪고 있으며, 향후 더 나은 추론 능력과 지시어 준수 능력 향상을 위한 개선이 필요하다는 점을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.