Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Practical Lipreading with Distilled and Efficient Models

Pingchuan Ma, Brais Martínez|arXiv (Cornell University)|2020. 07. 13.
Multimodal Machine Learning Applications참고 문헌 39인용 수 5
한 줄 요약

이 논문은 지식 정복 프레임워크와 함께 새로운 Depthwise Separable Temporal Convolutional Network (DS-TCN)를 결합하여 효율적이고 고성능의 립리딩 모델을 구축한다. 점진적으로 단순화된 교사 모델로부터 순차적 정복을 통해, 이전 최고 성능 모델 대비 FLOPs는 8.2배 감소하고 파라미터 수는 3.9배 감소시키면서 LRW(88.5%)와 LRW-1000(46.6%)에서 최신 기준 성능을 달성한다.

ABSTRACT

Lipreading has witnessed a lot of progress due to the resurgence of neural networks. Recent works have placed emphasis on aspects such as improving performance by finding the optimal architecture or improving generalization. However, there is still a significant gap between the current methodologies and the requirements for an effective deployment of lipreading in practical scenarios. In this work, we propose a series of innovations that significantly bridge that gap: first, we raise the state-of-the-art performance by a wide margin on LRW and LRW-1000 to 88.5% and 46.6%, respectively using self-distillation. Secondly, we propose a series of architectural changes, including a novel Depthwise Separable Temporal Convolutional Network (DS-TCN) head, that slashes the computational cost to a fraction of the (already quite efficient) original model. Thirdly, we show that knowledge distillation is a very effective tool for recovering performance of the lightweight models. This results in a range of models with different accuracy-efficiency trade-offs. However, our most promising lightweight models are on par with the current state-of-the-art while showing a reduction of 8.2x and 3.9x in terms of computational cost and number of parameters, respectively, which we hope will enable the deployment of lipreading models in practical applications.

연구 동기 및 목표

  • 고성능 립리딩 모델과 실용적 구현 간 격차를 해소하기 위해 계산 비용을 감소시키는 것.
  • 정확도를 희생시키지 않고 지식 정복을 통해 경량 모델의 성능을 향상시키는 것.
  • 시간 모델링에서 FLOPs와 파라미터를 줄이기 위해 새로운 효율적인 헤드 아키텍처(DS-TCN)를 설계하는 것.
  • 전체 아키텍처를 가진 교사 모델을 사용하는 표준 정복보다 중간 규모의 교사 모델에서 순차적 정복이 더 뛰어난 성능을 내는지 확인하는 것.
  • 효율적인 모델 압축을 통해 자원 제약이 있는 장치에서 정확한 립리딩 시스템을 구현할 수 있도록 하는 것.

제안 방법

  • 자기 정복을 적용하여 LRW와 LRW-1000에서 성능을 향상시키고, 새로운 최고 성능 정확도를 달성한다.
  • 표준 컨볼루션을 깊이 분리형 컨볼루션으로 대체하여 FLOPs와 파라미터를 줄이는 Depthwise Separable Temporal Convolutional Network (DS-TCN)를 제안한다.
  • ResNet-18 백본을 너비 배수 β를 가진 ShuffleNet v2로 교체하여 모델 크기와 계산량을 추가로 줄인다.
  • 각 후속 교사 모델이 이전 학생 모델의 단순화된 버전인 체인 구조의 교사-학생 모델을 사용하는 순차적 정복 전략을 구현한다.
  • 중간 규모의 모델을 교사로 사용하여 아키텍처 격차를 메우고 지식 전달 효율성을 높인다.
  • 3D 컨볼루션을 사용해 공간적 특징을 추출하고, MS-TCN 또는 DS-TCN 헤드를 통해 시간 모델링을 수행함으로써 LRW 및 LRW-1000 데이터셋에서 모델을 훈련시킨다.

실험 결과

연구 질문

  • RQ1지식 정복을 통해 계산 비용을 증가시키지 않으면서도 경량 립리딩 모델의 정확도를 크게 향상시킬 수 있는가?
  • RQ2단일 고성능 교사 모델을 사용하는 표준 정복과 비교해 중간 규모의 교사 모델을 사용한 순차적 정복은 얼마나 효과적인가?
  • RQ3깊이 분리형 컨볼루션 기반 시간 네트워크(DS-TCN)는 성능을 유지하면서 FLOPs와 파라미터를 어느 정도 줄일 수 있는가?
  • RQ4너비 배수 β를 가진 ShuffleNet v2와 같은 효율적인 백본을 DS-TCN와 효과적으로 조합하여 높은 정확도를 확보하면서도 낮은 추론 비용을 달성할 수 있는가?
  • RQ5경량 립리딩 모델에 정복을 적용할 때, 모델 효율성(FLOPs, 파라미터 수)과 정확도 사이의 상호 교환 관계는 어떠한가?

주요 결과

  • 제안된 모델은 계산 비용을 증가시키지 않고도 LRW에서 88.5%의 상위-1 정확도를 달성하여 새로운 최고 성능을 기록한다.
  • LRW-1000에서 모델은 46.6%의 정확도를 달성하여 이 또한 새로운 최고 성능을 기록하며, 뚜렷한 성능 향상을 보였다.
  • 가장 효율적인 모델(ShuffleNet v2 0.5× + DS-TCN)은 LRW에서 0.58G FLOPs와 290만 파라미터로 79.9%의 정확도를 달성했으며, 이는 이전 최고 성능 모델 대비 17.8배와 12.5배 적은 자원을 사용한다.
  • ShuffleNet v2 (1×) + DS-TCN를 사용한 모델는 정복 후 LRW에서 40.4%의 정확도를 기록했으며, 이는 이전 최고 성능을 유지하면서도 FLOPs는 8.2배 감소하고 파라미터 수는 3.9배 감소시켰다.
  • 중간 규모의 교사 모델에서 순차적 정복은 특히 경량 모델에 대해 표준 정복보다 성능을 향상시켰다.
  • LRW-1000에서 가장 우수한 경량 모델(ShuffleNet v2 0.5× + DS-TCN)은 22.9배 적은 파라미터와 18.8배 적은 FLOPs로 40.2%의 정확도를 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.