2. 上海理工大学 机械工程学院, 上海 200093
2. School of Mechanical Engineering, University of Shanghai for Science and Technology, Shanghai 200093, China
目前,钛合金已经在人工关节、牙科种植和外科器械中得到了广泛使用,但是钛合金的生产工艺相对复杂,加工难度大,造成成本较高,限制了其广进一步发展[1]。目前,大范围使用的钛合金成分为Ti-6Al-4V合金(TC4钛合金),医学临床研究发现,TC4钛合金在人体内会向血液释放Al离子和V离子,这些离子会诱发阿尔兹海默症、神经系统病变、骨骼软化症等疾病。TC4钛合金的弹性模量远高于人骨的,因此,会造成“应力屏蔽”现象,不利于新骨的生长。近年来,通过加入不同配比的合金元素(如Ta、Mo、Nb),获得匹配人骨弹性模量的高强度无毒β型钛合金是目前医用材料研究的重要方向之一[2]。
计算相图是一种常用的设计方法,它基于热力学平衡原理和试验数据,并结合了计算机模拟和优化算法,旨在提供对合金体系中各种相的形成和稳定性的深入理解。尽管计算相图方法在预测和计算相图方面非常有用,但它仍然依赖于试验数据和热力学数据库的准确性。钛合金的制备和加工较为复杂,组成元素种类繁多,大幅增加了材料性能试验量,所以会造成上述性能测试方法成本高、周期长、效率低,给新型钛合金的开发带来了诸多挑战。
基于数据驱动方式的机器学习建模无需明确内部的复杂机制,仅依靠数据训练来构建关系模型,目前已成为材料研究的热点之一[3-5]。主要的机械学习方法有多层感知器(multi-layer perceptron, MLP)、卷积神经网络(convolutional neural networks, CNN)、随机森林网络(random forest regression, RFR)等。MLP是一种常见的前馈神经网络模型,由多个节点组成的多个隐藏层构成,每个节点都是一个人工神经元,接收来自前一层的输入,并将加权和输入进行非线性变换后传递给下一层[6]。CNN是一种依靠卷积核从输入数据中提取局部特征,并通过卷积核的滑动获得输入数据特征图的神经网络[7]。RFR是一种集成学习方法,通过组合多个决策树模型来进行预测和分类[8-9]。采用机器学习的方法,是从数据和算法的角度建立模型,揭示数据和性能的相关性和显著性,在合金成分设计和性能预测方面具有一定的指导意义[10-13]。
上世纪80年代末,日本学者Morinaga等[14]提出,采用反映元素电负性的d-电子结合能(Md)和反映d轨道电子结合强度的d-电子结合次数(Bo)来评估元素原子尺寸、电负性及合金化等因素的影响。各合金元素的Md和Bo按照原子分数取加权平均值,即为合金的d-电子平均结合能(
基于钛合金设计公式及机器学习的多层感知器理念建立数学模型,利用模型揭示钛合金元素配比与弹性模量之间的关系。图1是模型数据集转换流程。
|
图 1 模型数据集转换流程 Fig. 1 Dataset conversions process of the models |
首先,数据集收集具有β相的钛合金数据,使用箱型图描述这个数据集的样本分布,横轴为不同参数的名称,纵轴为相应元素参数值;然后,利用相应公式转换成为
| $ \qquad\overline {Bo{\text{}}} = \displaystyle\sum\limits_{i = 0}^n {{x_i}} {\left( {Bo} \right)_i} $ | (1) |
| $ \qquad\overline {Md{\text{}}} = \displaystyle\sum\limits_{i = 0}^n {{x_i}} {\left( {Md} \right)_i} $ | (2) |
| $ \begin{aligned} \qquad{\left[ {Mo} \right]_{}} =& 1.0{\rm{Mo}} + 0.67{\rm{V}} +0.40{\rm{W}} + 0.28{\rm{N}}{\rm{b}} + \\ &0.20{\rm{Ta}} + 2.50{\rm{Fe}} + 1.25{\rm{Cr}} + 1.25{\rm{Ni}} + \\ &1.70{\rm{Mn}} + 1.70{\rm{Co}} - 1.0{\rm{Al}} \end{aligned} $ | (3) |
式中:
数据集经过转换后,只有[Mo]、
通过Spearman计算所得的P值是用于衡量两变量相关性是否具有统计学上显著性的指标。Spearman相关性系数衡量了两个变量之间的线性强度,取值范围为−1~1。
相关性ρ计算公式如下:
| $ \rho = \dfrac{{\frac{1}{n}\displaystyle\sum\limits_{i = 1}^n {\left[ {R({x_i}) - \overline {R(x)} } \right] \times \left[ {R({y_i}) - \overline {R(y)} } \right]} }}{{\sqrt {\left\{ {\frac{1}{n}\displaystyle\sum\limits_{i = 1}^n {{{\left[ {R({x_i}) - \overline {R(x)} } \right]}^2}} } \right\} \times \left\{ {\frac{1}{n}\displaystyle\sum\limits_{i = 1}^n {{{\left[ {R({y_i}) - \overline {R(y)} } \right]}^2}} } \right\}} }} $ | (4) |
式中:
在训练过程中,所有模型将数据集按照8:2的比例进行分割,其中80%用于模型训练,20%作为测试集验证模型性能。为提升模型在训练过程中的收敛速度,将数据集送入模型前进行归一化处理,并采用式(5)将输入量归一化至区间[0,
| $ \qquad x' = \varepsilon \cdot \dfrac{x}{{\max \left( x \right)}} $ | (5) |
| $ \qquad y' = 2\varepsilon \cdot \dfrac{{y - \min \left( y \right)}}{{\max \left( y \right) - \min \left( y \right)}} - \varepsilon $ | (6) |
式中:x、y分别为转化后的输入标签值以及合金的弹性模量;
钛合金中,钛占比一般不超过80%,因此,本文将
本文分别使用CNN、RFR和MLP三种模型,通过Python软件进行建模和计算。
1.2.1 MLP模型图2(a)为MLP模型的训练示意图,其中,输入层接收原始数据或特征向量作为输入,隐藏层进行加权和非线性变换,输出层根据具体任务产生相应的输出结果。隐藏层和输出层之间的连接由权重参数决定,各层之间皆使用激活函数进行连接,这些参数通过训练进行优化。
|
图 2 三种模型内部结构图 Fig. 2 Internal structure diagrams of the three models |
MLP模型的核心思想是通过非线性变换(通常是使用激活函数)将输入数据映射到更高维的特征空间。MLP模型的训练方法通常使用反向传播算法,该算法通过计算损失函数对于权重参数的梯度,不断调整权重参数以最小化损失函数。具体表达如下:
| $ \qquad{y} = R{\text{}}({h_{\rm{k}}}) $ | (7) |
式中:y为输出值;hk为输出层神经元的输入加权和。R为使用的激活函数为整流线性函数(rectified linear unit, R),其表达式为:
| $ \qquad R{\text{}}(x) = \max \left( {0,x} \right) $ | (8) |
在神经网络中,R函数的导数恒为1或0,不存在梯度消失的问题,因此,能够更好地训练深层神经网络。R函数在输入值为负时输出为0,因此,可以使神经网络中的一部分神经元处于关闭状态,增加了网络的稀疏性,减少了模型的复杂程度[16]。
1.2.2 CNN模型CNN模型(见图2b)在经过多个卷积、池化操作后,能挖掘数据中隐含的深层特征[17-18],CNN模型中卷积层公式如下:
| $ \qquad{W_{{\text{output}}}} = \dfrac{{{W_{{\text{input}}}} - {W_{{\text{filter}}}} + 2p}}{S} + 1 $ | (9) |
| $ \qquad{H_{{\text{output}}}} = \dfrac{{{H_{{\text{input}}}} - {H_{{\text{filter}}}} + 2p}}{S} + 1 $ | (10) |
CNN模型中池化层公式如下:
| $ \qquad{W_{{\text{output}}}} = \dfrac{{{W_{{\text{input}}}} - {W_{{\text{filter}}}}}}{S} + 1 $ | (11) |
| $ \qquad{H_{{\text{output}}}} = \dfrac{{{H_{{\text{input}}}} - {H_{{\text{filter}}}}}}{S} + 1 $ | (12) |
式中:W为图像宽度;H为图像高度;S为卷积核步长;p为图像边缘增加的边界像素层数。
在CNN模型中,输入数据只能是图片,所以对于转换后的合金元素数据进行图像化三维处理,随后放入CNN模型中进行训练。
1.2.3 RFR模型RFR模型(见图2c)通过构建多个决策树,并对它们的结果进行综合,从而提高了整体预测的准确性和稳定性。每个决策树都是独立的分类器,最后预测结果由所有决策树的投票或平均所决定。RFR模型的优点包括具有处理高维数据和大规模数据集的能力、对缺失值或异常值的鲁棒性较强、参数调整需求较少[19-24]。
1.3 机器学习模型的预测为量化各个预测模型在验证集上的预测性能,评价指标采用相关指数(r-square, R2),均方根误差(root mean square error, RMSE)两种性能指标对模型性能进行量化,RMSE指标越小表明模型预测性能越优,R2指标越趋近于1,则模型预测能力越具有可信度,R2指标公式如下[25-28]:
| $ \qquad R2 = 1 - \dfrac{{\displaystyle\sum\limits_{i = 1}^n {{{({y_i} - {{{\rm{\hat y}}}_i})}^2}} }}{{\displaystyle\sum\limits_{i = 1}^n {{{({y_i} - {\rm{\bar y}})}^2}} }} $ | (13) |
式中:
RMSE公式如下:
| $ \qquad {\rm{RMSE}}=\sqrt{\dfrac{1}{N}{\displaystyle \sum _{i=1}^{n}({t}_{i}-{y}_{i}{)}^{2}}} $ | (14) |
式中:
所有模型训练完成后,储存相关系数和权重,将数据集中20%未经训练的数据作为验证数据放入模型中进行验证,通过比较其RMSE和R2指标来判断各个模型的优劣[28]。
RFR模型作为机器学习模型在参数确定的情况下,预测性能指标均为确定值[29-31],而CNN模型和MLP模型具有特殊的结构,对具有神经网络结构的模型进行多次预测,对预测结果取平均值,比较性能优劣来判断模型预测性能。本文将分别对CNN模型、MLP模型进行5次训练和预测[32-35]。
2 结果与讨论 2.1 数据集分析图3为未转换前数据的箱型图。在数据集中,钛合金中的Ti最大质量分数为88.2%,弹性模量分布在24.7~116.0 GPa。图3中除了Ti以外,Nb质量分数中位数高于其他合金元素,它是开发低弹性模量钛合金时添加最多的合金元素。其次是Zr,它与Ti同属一族,具有与Ti相似的物理化学性质,可用于强化合金和调整β相稳定性。数据集中,三元和四元钛合金最多,所以,钛合金数据集中一组合金成分常常缺失一种或多种合金元素,从而导致数据集具有较强的稀疏性。由于这些合金元素在数据集中稀疏性太大,所以它们配比中位数接近零。需要指出的是,稀疏性太大的数据集对于神经网络训练是非常不利的。
|
图 3 数据集未转换前合金元素统计箱型图 Fig. 3 Statistical box plot image of the alloy elements before dataset conversion |
图4是数据集转换后参数统计箱型图。图4中除了[Mo]参数以外,
|
图 4 数据集转换后参数统计箱型图 Fig. 4 Statistical box plot image of the parameter after dataset conversion |
图5是采用Spearman系数计算数据集各参数同弹性模量所得的相关性系数的热力图。如果计算得到的Spearman相关性系数具有较小的P值(通常小于选定的显著性水平,如0.05),则可以认为观察到的相关性系数不太可能是由随机因素导致的,存在着真实的相关性。这意味着可以拒绝零假设,并认为两个变量之间存在显著的线性相关性。由图5可知,[Mo]与钛合金的弹性模量(E)相关性最大,相关性系数为0.29。在本文数据集中反映出[Mo]与弹性模量呈正相关;在数据集中
|
图 5 采用Spearman系数计算数据集各参数同弹性模量(E)所得的相关性值的热力图 Fig. 5 Heat chart of the Spearman coefficient-calculated correlation value between each parameter in the dataset and elastic modulus (E) |
表1是通过Spearman计算所得数据集之间的P值,弹性模量与[Mo]、
| 表 1 数据集参数之间的P值 Tab. 1 P-values between the parameters in the dataset |
三种模型经过计算和迭代后,最终确定MLP结构为3-8-10-1,因此模型的输入节点为3,隐藏层第一层节点数为8,隐藏层第二层节点数为10,最后输出层的节点为1;CNN模型采用10个3×3的卷积核,全连接层节点数为128;RFR模型的决策树数量为120。
图6是训练好的MLP、CNN、RFR模型对验证集数据进行验证所得预测对比图。图6中红色点线为验证集中钛合金所对应的实测弹性模量,而蓝色则是模型通过大量训练以后预测所得到的相应合金的弹性模量,可以看出,MLP模型可以很好地去模拟合金的元素配比和弹性模量之间的相应关系,预测值的数据和实测值的数据较为贴合,具有可靠预测合金性能的能力。
|
图 6 机器学习模型验证集预测图 Fig. 6 Prediction images of the validation sets obtained by machine learning models |
表2 为预测模型性能指标。从表2 可以看到,MLP模型的RMSE和R2指标平均值分别是7.54 GPa和0.66;CNN模型的RMSE和R2指标平均值分别是3.58 GPa和−0.61;RFR模型的RMSE和R2指标平均值分别是10.03 GPa和0.40。当R2的评分大于0时才能证明模型的预测结果具有可信度,比较三者R2评分可知,MLP模型对于钛合金弹性模量的预测建模是可信度最高的。RMSE代表预测结果和实际模量之间的偏差,MLP模型的RMSE于3个模型中处于中游。在模型评价中,R2指标的权重大于RMSE的,模型的第一评价标准是R2。综合可知,MLP模型在本文数据集中的预测性能最佳,CNN模型具有一定的预测能力,但是可靠性不高,RFR模型的预测能力介于二者之间。MLP模型综合性能指标相较于其他两个模型更具优势,模型预测结果更为可靠。
| 表 2 预测模型性能指标 Tab. 2 Performance indicators of the prediction models |
为了更加直观地表达MLP模型在全部数据集上的预测效果,通常采用拟合优度图进行直观判断。图7是MLP模型对所有数据集的预测拟合图,图中蓝色圆形点集表示模型在训练集的预测值,红色圆形点集表示模型在测试集上的预测值。从图7中可以看出,MLP模型在测试集上的预测值大部分靠近中心线,数据散点分布更紧凑,表明预测值更接近实际值。图7也反映了MLP模型对数据集的较好拟合情况。
|
图 7 MLP模型拟合图 Fig. 7 Fitting graph of the MLP model |
为了进一步说明MLP模型的可靠性,从测试集中选取5组常见的钛合金进行模型预测分析。表3是5组常见钛合金的弹性模量实测值与预测值,二者的偏差在MLP模型的RMSE范围内,说明预测结果均是合理的,即MLP模型的预测能力是可靠的。
| 表 3 5组常见钛合金的弹性模量实测值与预测值 Tab. 3 Measured and predicted elastic moduli of five groups of common titanium alloys |
本文利用合金设计公式转换后的数据集作为原始数据集,建立机器学习模型。通过验证和分析模型的预测性能,得出以下结论:
(1)利用合金设计公式对原始数据集进行转换,解决了原始数据集稀疏值较大的问题。
(2)弹性模量的大小与[Mo]呈显著的正相关,与
(3)建立了基于CNN、REF、MLP的三种钛合金弹性模量预测模型。其中,MLP模型对钛合金弹性模量预测的RMSE、R2指标平均值分别为7.54 GPa、0.66,相较于RFR模型、CNN模型,MLP模型具有更优的预测性能和预测精度。
| [1] |
黄俊辉, 孙明, 张燕艳, 等. Al-Ti-B在Al-Si合金中的晶粒细化行为的研究进展[J]. 有色金属材料与工程, 2022, 43(5): 47-60. |
| [2] |
余欢欢, 许祥杰, 李强. Ti-18Nb-10Zr-(2, 4, 6)Cr合金显微组织和力学性能的研究[J]. 有色金属材料与工程, 2021, 42(4): 12-18. |
| [3] |
MOHAMED E S, NAQISHBANDI T A, BUKHARI S A C, et al. A hybrid mental health prediction model using support vector machine, multilayer perceptron, and random forest algorithms[J]. Healthcare Analytics, 2023, 3: 100185. DOI:10.1016/j.health.2023.100185 |
| [4] |
BONINI NETO A, ALVES D A, MINUSSI C R. Artificial neural networks: multilayer perceptron and radial basis to obtain post-contingency loading margin in electrical power systems[J]. Energies, 2022, 15(21): 7939. DOI:10.3390/en15217939 |
| [5] |
杨飞. 团簇式嵌入的机器学习多元Ti合金成分与性能及工艺优化[D]. 大连: 大连理工大学,2022.
|
| [6] |
桂冠, 徐京城. 保温管道数值模拟及机器学习预测模型[J]. 有色金属材料与工程, 2023, 44(1): 69-74. |
| [7] |
ZHANG J Y, LI K. A multi-view CNN encoding for motor imagery EEG signals[J]. Biomedical Signal Processing and Control, 2023, 85: 105063. DOI:10.1016/j.bspc.2023.105063 |
| [8] |
凌兴. 随机森林算法在生物医药企业价值评估中的应用研究[D]. 南昌: 江西财经大学, 2023.
|
| [9] |
SOLORIO-RAMÍREZ J L, JIMÉNEZ-CRUZ R, et al. Random forest algorithm for the classification of spectral data of astronomical objects[J]. Algorithms, 2023, 16(6): 293. DOI:10.3390/a16060293 |
| [10] |
衣晓洋, 曹新建, 黄博文, 等. 基于d电子理论对Ti-Nb-Cu三元形状记忆合金性能优化(英文)[J/OL]. Transactions of Nonferrous Metals Society of China, 1–26[2023-10-07]. http://kns.cnki.net/kcms/detail/43.1239.tg.20230222.1647.043.html.
|
| [11] |
王学民, 徐敬沛, 何云. 基于多层感知机的航空发动机压气机盘应力温度预测[J/OL]. 航空动力学报, 1–9[2023-10-07].https://doi.org/10.13224/j.cnki.jasp.20220297.
|
| [12] |
卞文硕. 基于多层感知机的集成学习网络流量数据预测应用研究[D]. 武汉: 湖北工业大学, 2021.
|
| [13] |
房崇鑫, 盛震宇, 夏明, 等. 基于CNN-BiLSTM混合神经网络的雷达信号调制方式识别[J/OL]. 无线电工程, 1–10[2023-10-07]. http://kns.cnki.net/kcms/detail/13.1097.TN.20230922.1352.009.html.
|
| [14] |
MORINAGA M, SAITO J, MORISHITA M.. Design of titanium alloys by means of a d-electrons theory[J]. Journal of Japan Institute of Light Metals, 1992, 42(11): 614-621. |
| [15] |
张玉梅, 郭天文, 李佐臣. 牙科用Ti-Zr合金的研制及性能特点[J]. 华西口腔医学杂志, 1999, 17(4): 329-330. DOI:10.3321/j.issn:1000-1182.1999.04.010 |
| [16] |
LIU X J, ZHANG H Y, ZHANG S, et al. Hot deformation behavior of near-β titanium alloy Ti-3Mo-6Cr-3Al-3Sn based on phenomenological constitutive model and machine learning algorithm[J]. Journal of Alloys and Compounds, 2023, 968: 172052. DOI:10.1016/j.jallcom.2023.172052 |
| [17] |
BEAN C, STINVILLE J C, NAÏT-ALI A, et al. Microstructural statistics for low-cycle fatigue crack initiation in α+β titanium alloys: a microstructure based RVE assessment[J]. International Journal of Fatigue, 2023, 176: 107854. DOI:10.1016/j.ijfatigue.2023.107854 |
| [18] |
袁晨航. β 型钛合金成分设计及组织性能研究[D]. 沈阳: 沈阳航空航天大学, 2022.
|
| [19] |
郑轲心. 基于人工智能的机器学习在医疗中的应用[J]. 数字通信世界, 2022(9): 103-105. |
| [20] |
CHORAŚ M, DEMESTICHAS K, GIEŁCZYK A, et al. Advanced Machine Learning techniques for fake news (online disinformation) detection: a systematic mapping study[J]. Applied Soft Computing, 2021, 101: 107050. DOI:10.1016/j.asoc.2020.107050 |
| [21] |
YUAN B, XIA H, GUO C C. An evaluation index system for intellectual capital evaluation based on machine learning[J]. Alexandria Engineering Journal, 2021, 60(1): 1519-1524. DOI:10.1016/j.aej.2020.11.006 |
| [22] |
GAO Y, HUANG X R. Forecast of compensation amount based on big data network and machine learning algorithm in intellectual property law[J]. Microprocessors and Microsystems, 2021, 80: 103623. DOI:10.1016/j.micpro.2020.103623 |
| [23] |
KOTA V D, SHARMA H, ALBERT M V, et al. A low-power wireless system for predicting early signs of sudden cardiac arrest incorporating an optimized CNN model implemented on NVIDIA Jetson[J]. Sensors, 2023, 23(4): 2270. DOI:10.3390/s23042270 |
| [24] |
MIRANDA RUIZ F, LAHRMANN B, BARTELS L, et al. CNN stability training improves robustness to scanner and IHC-based image variability for epithelium segmentation in cervical histology[J]. Frontiers in Medicine, 2023, 10: 1173616. DOI:10.3389/fmed.2023.1173616 |
| [25] |
张锟滨, 陈玉明, 吴克寿, 等. 粒向量驱动的随机森林分类算法研究[J/OL]. 计算机工程与应用, 1–12[2023-10-07]. http://kns.cnki.net/kcms/detail/11.2127.TP.20230904.1118.002.html.
|
| [26] |
ZHAO K, DU C J, TAN G X. Enhancing basketball game outcome prediction through fused graph convolutional networks and random forest algorithm[J]. Entropy, 2023, 25(5): 765. DOI:10.3390/e25050765 |
| [27] |
ZHOU Y, WANG K, SUN Z G, et al. Simultaneous improvement of strength and elongation of laser melting deposited Ti-6Al-4V titanium alloy through three-stage heat treatment[J]. Journal of Materials Processing Technology, 2022, 306: 117607. DOI:10.1016/j.jmatprotec.2022.117607 |
| [28] |
SUN Z X, ZHAO M Y, DONG Y, et al. Hybrid model with secondary decomposition, randomForest algorithm, clustering analysis and long short memory network principal computing for short-term wind power forecasting on multiple scales[J]. Energy, 2021, 221: 119848. DOI:10.1016/j.energy.2021.119848 |
| [29] |
DAGHISTANI T, ALSHAMMARI R. Comparison of statistical logistic regression and randomForest machine learning techniques in predicting diabetes[J]. Journal of Advances in Information Technology, 2020, 11(2): 78-83. |
| [30] |
BECKSCHÄFER P, FEHRMANN L, HARRISON R, et al. Mapping leaf area index in subtropical upland ecosystems using RapidEye imagery and the randomForest algorithm[J]. iForest - Biogeosciences and Forestry, 2014, 7(1): 1-11. DOI:10.3832/ifor0968-006 |
| [31] |
CHEN X Q, ZHENG D J, LIU Y T, et al. Multiaxial strength criterion model of concrete based on random forest[J]. Mathematics, 2023, 11(1): 244. DOI:10.3390/math11010244 |
| [32] |
LIAO H L, MEI H Y, HU G, et al. Machine learning strategy for predicting flutter performance of streamlined box girders[J]. Journal of Wind Engineering and Industrial Aerodynamics, 2021, 209: 104493. DOI:10.1016/j.jweia.2020.104493 |
| [33] |
史榴, 梁鹏晨, 常庆, 等. 机器学习在医用金属材料特性研究中的应用[J/OL]. 中国组织工程研究, 1–8[2023-10-12]. http://kns.cnki.net/kcms/detail/21.1581.R.20230825.1243.013.html.
|
| [34] |
ZHAN Z X, HU W P, MENG Q C. Data-driven fatigue life prediction in additive manufactured titanium alloy: a damage mechanics based machine learning framework[J]. Engineering Fracture Mechanics, 2021, 252: 107850. DOI:10.1016/j.engfracmech.2021.107850 |
| [35] |
PENG Z, SONG W L, et al. Model establishment of surface roughness and experimental investigation on magnetorheological finishing for polishing the internal surface of titanium alloy tubes[J]. Journal of Intelligent Material Systems and Structures, 2020, 30(12): 1278-1289. |
2023, Vol. 44


