[논문 리뷰] ReFuGe: Feature Generation for Prediction Tasks on Relational Databases with LLM Agents
에이전트 프레임워크(ReFuGe)는 전문 LLM 에이전트를 사용해 관련 스키마를 식별하고, 다양한 관계 특징을 생성하며, 추론과 검증으로 이를 필터링하고, 예측 성능이 수렴할 때까지 반복하여 여러 RDB 예측 작업에서 베이스라인을 능가합니다.
Relational databases (RDBs) play a crucial role in many real-world web applications, supporting data management across multiple interconnected tables. Beyond typical retrieval-oriented tasks, prediction tasks on RDBs have recently gained attention. In this work, we address this problem by generating informative relational features that enhance predictive performance. However, generating such features is challenging: it requires reasoning over complex schemas and exploring a combinatorially large feature space, all without explicit supervision. To address these challenges, we propose ReFuGe, an agentic framework that leverages specialized large language model agents: (1) a schema selection agent identifies the tables and columns relevant to the task, (2) a feature generation agent produces diverse candidate features from the selected schema, and (3) a feature filtering agent evaluates and retains promising features through reasoning-based and validation-based filtering. It operates within an iterative feedback loop until performance converges. Experiments on RDB benchmarks demonstrate that ReFuGe substantially improves performance on various RDB prediction tasks. Our code and datasets are available at https://github.com/K-Kyungho/REFUGE.
연구 동기 및 목표
- RDB의 예측 작업을 위한 관계 스키마에 대한 자동화되고 정보에 기반한 특징 생성의 필요성을 제시한다.
- 스키마 선택, 특징 생성, 특징 필터링 에이전트를 포함하는 에이전트 프레임워크(ReFuGe)를 제안한다.
- Ground-truth 감독 없이도 반복적 피드백 기반 개선과 자기학습을 시연한다.
- 실제 RDB 벤치마크 다수에 걸쳐 ReFuGe 평가하여 효능을 입증한다.
- 관계 특징이 예측 성능을 개선하는 시점과 방법에 대한 가이드라인과 통찰을 제공한다.]
- method=[
제안 방법
- 스키마 선택 에이전트가 RDB 스키마와 작업 설명에서 관련 테이블과 열을 식별한다.
- 특징 생성 에이전트가 다양한 LLM 인스턴스를 사용해 다양성을 촉진하는 후보 관계 특징을 생성한다.
- 추론 기반 특징 필터링이 의미적 추론에 기반해 이전 반복의 정보를 보강하여 유망한 특징을 선택한다.
- 검증 기반 특징 필터링이 대상 테이블에 임시로 특징을 추가하고 표형 모델을 학습시켜 유용성을 실증적으로 평가한다(예: AUROC).
- 새로운 특징이 선택되지 않을 때까지 이전 반복에서의 자연어 피드백을 받아 특징 생성 및 선택을 안내하는 반복 피드백 루프.
실험 결과
연구 질문
- RQ1ReFuGe가 다양한 데이터셋에서 RDB 예측 작업에 대해 최첨단 베이스라인과 어떻게 비교되는가?
- RQ2주요 구성 요소(스키마 선택, 특징 필터링, 반복 피드백)가 전체 성능에 어떤 기여를 하는가?
- RQ3반복적이고 피드백 기반 루프가 일관되게 예측 성능을 향상시키는가?
- RQ4실무에서 ReFuGe가 생성하는 대표적 특징은 무엇인가(사례 연구)?
주요 결과
- ReFuGe는 대부분의 작업에서 모든 베이스라인을 능가하고 일곱 데이터셋에서 최고 평균 성능 및 평균 순위를 달성한다.
- 특성 제거 연구를 통해 각 구성 요소가 성능에 기여하는 바를 확인했으며, 스키마 선택, 필터링 또는 피드백을 제거하면 결과가 악화되며, 특히 특징 필터링의 영향이 크게 나타난다.
- 반복을 거칠수록 성능이 일반적으로 향상되며, 수렴 전에 작업당 평균 2.4회의 반복이 발생한다.
- 사례 연구는 관련 테이블에서 파생된 특징(예: 클릭된 광고의 구별, 지리적 계층 수준 등)이 상당한 이익을 가져올 수 있음을 보여준다.
- 특징 생성 에이전트의 LLM 인스턴스 수를 늘리면 작업 전반에서 성능이 향상되는 경향이 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.