Skip to main content
QUICK REVIEW

[論文レビュー] AI-based BMI Inference from Facial Images: An Application to Weight Monitoring

Hera Siddiqui, Ajita Rattani|arXiv (Cornell University)|Oct 14, 2020
Cardiovascular Health and Risk Factors被引用数 4
ひとこと要約

本稿では、転移学習と回帰を用いて顔貌画像から身体質量指数(BMI)を推定するための、VGG19、ResNet50、DenseNet、MobileNet、lightCNNの5つの深層学習ベースのCNNアーキテクチャを提案および評価する。主な発見は、BollywoodデータセットにおいてResNet50が1.04という最小の平均絶対誤差(MAE)を達成したことであり、顔貌特徴からのBMI推定において残差接続の有効性が示された。

ABSTRACT

Self-diagnostic image-based methods for healthy weight monitoring is gaining increased interest following the alarming trend of obesity. Only a handful of academic studies exist that investigate AI-based methods for Body Mass Index (BMI) inference from facial images as a solution to healthy weight monitoring and management. To promote further research and development in this area, we evaluate and compare the performance of five different deep-learning based Convolutional Neural Network (CNN) architectures i.e., VGG19, ResNet50, DenseNet, MobileNet, and lightCNN for BMI inference from facial images. Experimental results on the three publicly available BMI annotated facial image datasets assembled from social media, namely, VisualBMI, VIP-Attributes, and Bollywood datasets, suggest the efficacy of the deep learning methods in BMI inference from face images with minimum Mean Absolute Error (MAE) of $1.04$ obtained using ResNet50.

研究の動機と目的

  • 顔貌画像からのBMI推定における複数の深層CNNアーキテクチャの性能を調査および比較すること。
  • 事前学習済みCNN(VGG19、ResNet50、DenseNet、MobileNet、lightCNN)が転移学習を用いてBMIを推定する有効性を評価すること。
  • 回帰手法(SVR、リッジ回帰)の違いがBMI予測精度に与える影響を分析すること。
  • 照明、ポーズ、化粧、および人種的多様性の異なる顔貌画像データセットにおけるモデルの汎化性能を評価すること。
  • モバイルヘルスアプリケーションにおける低遅延・デバイス内デプロイメントに最適なアーキテクチャを同定すること。

提案手法

  • 顔貌画像から深層特徴を抽出するために、ImageNetで事前学習済みのCNN(VGG19、ResNet50、DenseNet、MobileNet、lightCNN)を用いた転移学習が実施される。
  • 事前学習済みCNNは微調整または特徴抽出器として使用され、最終層がBMIを連続値として回帰するように置き換えられる。
  • 抽出された深層特徴に対して、サポートベクターレグレッション(SVR)とリッジ回帰(RR)の2つの回帰モデルが適用され、BMI予測が行われる。
  • 実験は、視覚的BMI(VisualBMI)、VIP-Attributes、Bollywoodの3つの公開データセットを対象として実施され、それぞれが多様な人種的多様性と画像状態を有する。
  • モデルの性能は平均絶対誤差(MAE)を用いて評価され、全体、男性、女性のサブセットごとに別々の指標が算出される。
  • 比較のため、スムーズL1損失を用いたエンドツーエンドのカスタムCNNの訓練も実施される。

実験結果

リサーチクエスチョン

  • RQ1多様なデータセットに跨る顔貌画像に適用された場合、どの深層CNNアーキテクチャが最小のBMI予測誤差を達成するか?
  • RQ2深層特徴と組み合わせた場合、異なる回帰手法(SVR対リッジ回帰)がBMI推定性能に与える影響は何か?
  • RQ3照明、ポーズ、化粧、および人種的多様性などの要因を含むデータセットのばらつきが、BMI予測精度に与える影響は何か?
  • RQ4事前学習済みCNNとカスタムトレーニングされたCNNの間には、BMI推定においてどの程度の性能差があるか?
  • RQ5残差接続や特徴の再利用といったアーキテクチャ的利点を持つResNetおよびDenseNetアーキテクチャが、他のアーキテクチャをどの程度上回るか?

主な発見

  • ResNet50は、Bollywoodデータセットでリッジ回帰と組み合わせることで、1.04という最小の平均絶対誤差(MAE)を達成し、他のすべてのモデルを上回った。
  • VIP-Attributesデータセットでは、ResNet50がリッジ回帰と組み合わせてMAE1.13を達成し、すべてのモデルの中で最低であり、BMI分散が小さい有名人画像においても強力な性能を示した。
  • DenseNetとResNet50は、すべてのデータセットでVGG19、MobileNet、lightCNNを上回り、特にリッジ回帰を用いた場合に顕著であった。
  • リッジ回帰は、すべてのモデルとデータセットにおいて、サポートベクターレグレッションよりも低いMAEを達成した。
  • カスタムCNNアーキテクチャは、限られた学習データのための過学習が生じたことから、MAEが著しく高く(4.12~6.65の範囲)、事前学習済みモデルと比較して劣っていた。
  • 性別による予測誤差の差は顕著ではなく、男性および女性の被験者において一貫した性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。