[论文解读] Prediction of Red Wine Quality Using One-dimensional Convolutional Neural Networks
本文提出一种1D-CNN模型,通过捕捉理化特征之间的相关性来预测红葡萄酒品质,结合皮尔逊相关性分析、主成分分析(PCA)以及Dropout和批量归一化等技术。该模型优于传统机器学习基线模型,在F1-score上高出4.1%(达到85.8%),并证明了1D-CNN与正则化技术在处理具有复杂特征交互的小型数据集中的有效性。
As an alcoholic beverage, wine has remained prevalent for thousands of years, and the quality assessment of wines has been significant in wine production and trade. Scholars have proposed various deep learning and machine learning algorithms for wine quality prediction, such as Support vector machine (SVM), Random Forest (RF), K-nearest neighbors (KNN), Deep neural network (DNN), and Logistic regression (LR). However, these methods ignore the inner relationship between the physical and chemical properties of the wine, for example, the correlations between pH values, fixed acidity, citric acid, and so on. To fill the gap, this paper conducts the Pearson correlation analysis, PCA analysis, and Shapiro-Wilk test on those properties and incorporates 1D-CNN architecture to capture the correlations among neighboring features. In addition, it implemented dropout and batch normalization techniques to improve the robustness of the proposed model. Massive experiments have shown that our method can outperform baseline approaches in wine quality prediction. Moreover, ablation experiments also demonstrate the effectiveness of incorporating the 1-D CNN module, Dropout, and normalization techniques.
研究动机与目标
- 为解决现有模型在捕捉葡萄酒理化特性内在相关性方面的局限性。
- 通过深度学习建模相邻特征之间的局部关系,提升葡萄酒品质预测的准确性。
- 通过Dropout和批量归一化技术,减少在小型数据集上的过拟合问题。
- 验证1D-CNN架构在捕捉特征交互方面相较于传统机器学习模型的有效性。
- 为葡萄酒品质评估提供一种数据驱动、可扩展的替代方案,以取代主观感官评价。
提出的方法
- 应用皮尔逊相关性分析,识别pH、固定酸度、柠檬酸等理化特征之间的关系。
- 使用主成分分析(PCA)降低维度,并从相关特征中提取主成分。
- 设计一种1D-CNN架构,通过单步卷积处理相邻理化特征,以捕捉局部相关性。
- 集成三个Dropout层与批量归一化层,以提升模型泛化能力并减少过拟合。
- 在红葡萄酒品质数据集上训练模型,采用交叉熵损失函数与Adam优化算法。
- 通过消融实验对比多种变体:DNN-D(无正则化)、DNN(含Dropout/批量归一化)、1DCNN-D(含1D-CNN但无正则化)以及完整1DCNN模型。
实验结果
研究问题
- RQ11D-CNN模型能否有效学习并利用红葡萄酒中相邻理化特征之间的相关性进行品质预测?
- RQ2与全连接DNN相比,1D-CNN模块在性能与鲁棒性方面表现如何?
- RQ3Dropout与批量归一化在小型葡萄酒品质数据集上对模型泛化能力的提升程度如何?
- RQ4所提出的模型是否在预测葡萄酒品质方面优于传统机器学习基线模型(如SVM、RF、KNN和LR)?
- RQ5特征相关性分析与PCA对模型性能与可解释性有何贡献?
主要发现
- 1D-CNN模型实现了85.8%的平均F1-score,较最佳基线模型(随机森林)高出4.1个百分点。
- 与最佳基线模型相比,1D-CNN模型在精确率上提升4.1%,准确率提升2.7%,召回率提升2.5%,F1-score提升4.1%。
- 消融实验表明,仅1D-CNN模块相比DNN-D,在所有指标上性能至少提升1.4%。
- 引入Dropout与批量归一化使模型性能在精确率、准确率、召回率与F1-score上均至少提升1.4%。
- 基于DNN的模型(含正则化)在葡萄酒品质预测中优于kNN、SVM、LR与RF等传统机器学习模型。
- 完整1D-CNN模型在所有评估模型中取得了最高的准确率(83.2%)、召回率(84.6%)与F1-score(85.8%)
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。