[논문 리뷰] Expanding search in the space of empirical ML
이 논문은 기계학습 컨fer런스 문화를 확장하여 알고리즘적 신규성 외의 경험적 연구를 더 가치 있게 평가할 것을 주장한다. 데이터, 목표, 실험적 통합 작업의 체계적 인정을 주장한다. 논문은 새로운 개념을 재정의하고, 통합 및 오픈월드 실험에 전용 트랙을 만들며, 산업-학계 협력을 유도하여 기계학습 연구의 재현 가능성과 실제 적용 가능성 향상을 제안한다.
As researchers and practitioners of applied machine learning, we are given a set of requirements on the problem to be solved, the plausibly obtainable data, and the computational resources available. We aim to find (within those bounds) reliably useful combinations of problem, data, and algorithm. An emphasis on algorithmic or technical novelty in ML conference publications leads to exploration of one dimension of this space. Data collection and ML deployment at scale in industry settings offers an environment for exploring the others. Our conferences and reviewing criteria can better support empirical ML by soliciting and incentivizing experimentation and synthesis independent of algorithmic innovation.
연구 동기 및 목표
- 알고리즘적 신규성보다 데이터 및 목표 차원의 경험적 탐구를 우선시하지 않는 기계학습 컨퍼런스 인cent라이브 불균형을 해결한다.
- 벤치마크 중심의 알고리즘 비교 외에도 데이터 및 목표 변동성이 실제 기계학습 성능에 미치는 영향을 간과하고 있는 비중 있는 역할을 부각한다.
- 알고리즘적 외 경험적 기여(예: 통합, 관찰, 오픈월드 실험)를 지원하고 유인하기 위해 컨퍼런스 문화와 심사 기준을 구조적으로 개선한다.
- 산업 연구자들이 대규모 실세계 데이터 및 시스템 성능 분석을 통해 얻은 가치를 인정함으로써 재현 가능성과 실용적 관련성을 강화한다.
- 학계 혁신과 산업 현장 구현 간 격차를 해소하기 위해, 알고리즘적 신규성이 없는 경험적 통찰을 기여할 수 있는 길을 마련한다.
제안 방법
- 연구 영역을 목표, 데이터, 알고리즘의 3차원 검색 공간으로 재정의하여, 모든 차원이 동일한 방법론적 관심을 가져야 한다고 주장한다.
- 컨퍼런스 제출물의 '신규성'을 재정의하여, 다양한 데이터 및 목표에서 기존 알고리즘 간 비교 경험적 연구에서 도출된 통찰도 포함하도록 제안한다.
- IEEE S&P SoK 트랙과 Distill의 출판 모델을 모델로 삼아, 체계적 통합, 분류체계, 장기적으로 굳어진 믿음에 대한 증거 기반 도전을 전담하는 전용 트랙을 도입할 것을 주장한다.
- 실세계 데이터와 다양한 조건에서의 시스템 성능에 접근할 수 있는 산업 연구자들로부터 오픈월드 실험 결과를 적극적으로 모집할 것을 권장한다.
- 재현 가능한 경험적 연구의 장벽을 낮추기 위해 공유 가능한 대표성 있는 데이터셋과 개선된 도구를 지원하며, 이러한 도구가 체계적 실험의 필요성을 대체하지는 않는다는 점을 강조한다.
- 알고리즘 연구자들과 오픈월드 실험자 간 협력을 촉진하여 기존 모델의 실제 적용 격차를 식별하고 해결한다.
실험 결과
연구 질문
- RQ1기계학습 컨퍼런스는 알고리즘 혁신을 포함하지 않는 경험적 연구를 어떻게 더 잘 인정하고 유인할 수 있는가?
- RQ2데이터 및 목표 차원은 기계학습 시스템의 성능과 일반화 능력에 어떤 역할을 하는가? 왜 현재 연구 문화에서는 이들이 충분히 탐구되지 않았는가?
- RQ3기존 컨퍼런스 포맷과 심사 기준은 어떻게 개선되어야 하며, 다양한 데이터셋과 실세계 환경에서 기존 알고리즘의 통합 및 관찰 연구를 지원할 수 있는가?
- RQ4알고리즘적 신규성이 없는 경우에도 산업 연구자의 통찰을 학술 논의에 통합하기 위해 어떤 구조적 변화가 필요한가?
- RQ5오픈월드 실험과 공유 데이터셋은 기계학습 연구의 재현 가능성과 실용적 관련성을 어떻게 향상시킬 수 있는가?
주요 결과
- 현재 컨퍼런스 문화는 알고리즘적 신규성에 치중되어 있어, 데이터, 목표, 시스템 수준의 실험적 탐구에서 도출된 통찰은 체계적으로 가치가 하락되어 있다.
- 벤치마크 데이터셋은 종종 고정적이고 대표적인 것으로 간주되지만, 이는 표본 추출 변동성과 편향을 야기하여 성능 측정과 일반화 능력에 상당한 영향을 미친다.
- 초기 조정, 랜덤 시드, 코드베이스 차이 등 실험적 변동성이 체계적으로 보고되거나 통제되지 않으면 재현성이 떨어진다.
- 기존 연구들은 충분한 튜닝을 거치면 오래된 모델이 새로운 모델보다도 뛰어난 성능을 낼 수 있음을 보여주며, 이는 보고된 성능 향상이 알고리즘적 진보가 아닌 실험적 노이즈에서 기인할 수 있음을 시사한다.
- IEEE S&P SoK 트랙이나 Distill의 사례처럼 통합 및 관찰 연구는 알고리즘적 기여 외에도 시스템 행동, 성능 패턴, 장기적 가정에 대한 고영향력 통찰을 도출할 수 있음을 보여준다.
- 산업 연구자들은 실세계 구현을 통해 중요한 경험적 지식를 확보하고 있지만, 이들의 기여는 인cent라이브와 출판 기준이 맞지 않아 학술 논의에서 자주 배제된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.