ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

振动信号频带那么多,到底该看哪个?DRN+DWWC:让网络自己学权重,故障诊断准确率较高

振动信号频带那么多,到底该看哪个?DRN+DWWC:让网络自己学权重,故障诊断准确率较高 读这篇论文之前我一直觉得小波包分解就是“提个特征”的预处理步骤用完就扔。但这篇论文给了我一个全新的视角与其纠结选哪个频带不如把“频带重要性”也变成可学习的参数让网络自己决定看哪里、不看哪里。更让我惊喜的是这个“动态加权层”只加了64个参数却让ResNet的准确率硬生生提升了3-4个百分点。这种“小改动、大收益”的设计比堆叠网络层数有意思多了。写这篇解读是想把这种“领域知识轻量创新”的思路分享出来。以下是对原论文的解读希望对大家有所帮助。IEEE TIE 2018论文解读让小波系数”动起来”——带动态加权小波系数的深度残差网络DRNDWWC论文信息标题Deep Residual Networks With Dynamically Weighted Wavelet Coefficients for Fault Diagnosis of Planetary Gearboxes作者Minghang Zhao, Myeongsu Kang, Baoping Tang, Michael Pecht (Fellow, IEEE)期刊IEEE Transactions on Industrial Electronics (TIE)年份2018DOI10.1109/TIE.2017.2762639论文阅读笔记行星齿轮箱故障诊断中到底哪个频带最重要这篇TIE论文说别纠结了让网络自己学一、聊聊我为什么关注这篇论文在读深度学习和故障诊断交叉领域的文献翻到这篇TIE上的文章时有种”原来还能这么玩”的感觉。说实话刚开始看到标题里”动态加权小波系数”Dynamically Weighted Wavelet Coefficients, DWWC这个概念我的第一反应是小波变换不是信号处理里的老方法了吗深度残差网络DRN/ResNet不是计算机视觉里的热门架构吗把这两个看似不相关的东西揉在一起能擦出什么火花但读完之后发现作者在一个非常实际的问题上找到了巧妙的切入点行星齿轮箱的振动信号频带众多到底哪些频带携带了最关键的故障信息传统方法要么靠专家经验指定要么干脆全频段一起上。这篇论文的思路是别让人来选让网络自己动态学习每个频带的权重。这篇博客是我自己的学习笔记尽量用比较直白的方式把论文的核心思想梳理一遍希望对同样关注这个方向的朋友有所帮助。二、这个研究要解决什么问题2.1 行星齿轮箱故障诊断为什么特别难行星齿轮箱是现代工业中的”传动明星”相比于普通的平行轴齿轮箱它具有更高的功率密度和传动效率被广泛应用于燃气轮机、重型卡车、直升机和风力发电机等关键装备中。但行星齿轮箱的结构也远比平行轴齿轮箱复杂太阳轮、行星轮、内齿圈、行星架多个部件相互啮合振动传递路径长信号成分极其丰富。在恶劣工况下长期运转齿面点蚀、齿根裂纹等故障时有发生。一旦故障未被及时发现可能导致整个传动系统瘫痪造成巨大的经济损失甚至安全事故。振动分析是行星齿轮箱故障诊断的主流方法。理论上通过频谱分析或包络分析可以检测故障特征频率。但实际操作中困难重重低频确定性成分干扰不对中引起的1×、2×转频成分会淹没故障特征高频噪声干扰背景噪声和结构共振让高频段信噪比极低频率成分复杂行星齿轮箱连接电机、平行齿轮箱等多个旋转部件频谱极其拥挤变转速问题转速变化时故障特征频率随之漂移传统频谱分析失效这些因素叠加在一起使得行星齿轮箱的故障诊断成为机械故障诊断领域公认的”硬骨头”。2.2 从传统方法到深度学习两条路线的困境第一条路线基于信号分析的方法。工程师们用频谱分析、包络解调、小波变换、经验模态分解EMD等工具试图从振动信号中提取故障特征频率。但正如前面所说行星齿轮箱的振动信号太复杂了故障特征频率往往被淹没在大量无关成分中。要准确识别故障需要丰富的专业知识和经验而且变转速工况下这些方法基本失效。第二条路线基于数据驱动的机器学习方法。为了避免信号分析的主观性研究者们转向数据驱动方法。传统做法是先人工提取一组统计特征如均方根、能量、峭度、峰峰值、熵等然后把这组特征送入SVM、随机森林、神经网络等分类器。但这里有个核心问题这些统计特征真的能完整表征行星齿轮箱的动态特性吗行星齿轮箱在变工况变转速、变负载下运行时振动信号的统计特性会发生显著变化。同一健康状态在不同工况下的统计特征分布可能差异巨大而不同健康状态在某些工况下的统计特征又可能非常接近。结果就是特征分布严重重叠分类器难以区分。更糟糕的是即使领域专家绞尽脑汁设计特征集也无法保证这些特征能覆盖所有故障模式的判别信息。配置一个”万能”的统计特征集一直是这个领域的长期痛点。2.3 核心矛盾深度学习来了但频带选择问题依然悬而未决近年来深度学习的崛起给故障诊断带来了新的希望。深度神经网络尤其是CNN可以直接从原始信号或时频表示中自动学习特征省去了人工设计特征的麻烦。但作者敏锐地指出了一个被忽视的问题当把小波包系数作为CNN的输入时不同频带的小波系数对故障诊断的贡献是不一样的。有些频带可能包含了强烈的故障特征信息有些频带可能主要是噪声还有些频带可能与其他频带高度冗余。传统做法要么把所有频带的小波系数一视同仁地送入网络可能引入大量噪声和冗余信息凭经验选择”重要”频带可能遗漏关键信息且不同故障的最优频带可能不同有没有一种方法能让网络自动学习每个频带的重要性权重在训练过程中动态调整从而聚焦于真正携带故障判别信息的频带这就是本文要解决的核心问题。三、已有方法为什么不够用3.1 传统机器学习特征工程是瓶颈传统数据驱动方法的核心是”特征工程浅层分类器”。研究者需要从振动信号中提取大量统计特征然后筛选、降维最后送入分类器。但行星齿轮箱的振动信号具有高度复杂性、冗余性和变异性复杂结构导致振动传递路径长信号成分丰富变工况运行导致信号统计特性动态变化强背景噪声导致特征信噪比低在这些因素作用下人工设计的统计特征分布很容易重叠不同健康状态的样本在特征空间里”挤成一团”分类器根本分不开。3.2 经典CNN能学特征但不会”挑频带”CNN直接从原始振动信号或时频表示中学习特征避免了人工特征工程。Ince等人用1-D CNN做电机故障诊断Ding和He用2-D CNN从二维小波包能量图学习特征进行轴承故障诊断都取得了不错的效果。但经典CNN有个问题如果输入是多频带的小波包系数矩阵CNN的卷积核会在所有频带上滑动它不会区分哪些频带更重要。所有频带被平等对待噪声频带和冗余频带的信息被一并学习这会干扰判别性特征的提取。3.3 DRN/ResNet解决了深度问题但没解决频带问题ResNet通过恒等shortcut解决了深层网络的梯度消失问题可以训练上百层的网络。更深的网络意味着更强的特征学习能力。但ResNet本质上还是CNN它同样不会自动区分不同频带的重要性。更深的网络虽然能学到更抽象的特征但如果输入中包含了大量无关频带的信息这些无关信息也会被逐层传递和放大影响最终的诊断精度。3.4 小波变换用了但没用”活”小波包变换Wavelet Packet Transform, WPT是分析非平稳振动信号的有力工具。它能将信号分解到多个频带每个频带对应一组小波系数。但现有方法使用小波包系数的方式比较”死板”要么只选某一个频带的系数作为输入可能丢失其他频带的关键信息要么把所有频带系数堆叠起来作为输入引入了噪声和冗余要么计算各频带的能量作为特征丢失了时域细节信息。没有人想过能不能让小波包系数的”重要性”也成为可学习的参数在训练过程中动态优化四、本文的核心创新动态加权小波系数DWWC4.1 一个基于领域知识的关键洞察作者抓住了一个很关键的点不同频率带的小波系数对故障诊断的贡献是不同的而且这个贡献应该由数据驱动、由网络自动学习而不是由人工预设。这个判断有明确的物理依据不同故障类型齿面点蚀、齿根裂纹、缺齿、轴承故障等会在不同频带产生特征响应同一故障在不同工况下其特征频带可能偏移或展宽某些频带可能主要是噪声对诊断无益甚至有害不同频带之间可能存在冗余信息。因此理想的做法是保留所有频带的信息避免遗漏但给每个频带分配一个自适应权重突出重点、抑制噪声。4.2 技术路线四步走整个DRNDWWC方法可以概括为四个步骤第一步小波包分解对原始振动信号进行6层小波包分解得到64个终端节点频带每个节点包含64个小波系数。4096点的信号经过6层分解后4096/2^6 64正好每个节点64个系数。把这些系数按频带排列成一个矩阵64行频带× 64列系数作为网络的输入。第二步标准卷积层提取局部特征输入矩阵首先经过标准卷积层。3×3的卷积核在矩阵上滑动利用局部感受野和权值共享策略提取局部特征。ReLU作为激活函数避免梯度消失问题。第三步动态加权层DWWC本文的核心创新这是整个方法最精妙的地方。在残差块中插入一个”动态加权层”它的作用是对特征图的每一行对应一个频带乘以一个可学习的权重。具体来说假设输入特征图有C个通道每个通道是一个64×H的矩阵64行对应64个频带 - 动态加权层为每一行学习一个权重输出特征图的第i行 输入特征图第i行 ×这些权重在训练过程中通过梯度下降自动优化。网络会学会哪些频带的系数对区分不同健康状态更重要就给它更大的权重哪些频带主要是噪声就给它较小的权重甚至趋近于零。第四步残差块堆叠全局平均池化全连接分类加权后的特征图继续在残差块中传递经过多层卷积、BN、ReLU的变换逐步提取从低层到高层的判别性特征。最后通过GAP层和全连接层输出分类结果。4.3 动态加权层的数学表达动态加权层的操作非常简洁yixi·wi其中是输入特征图的第i行第i个频带是该频带的权重是加权后的输出。权重的梯度计算也很直接然后通过梯度下降更新权重这里的E是softmax交叉熵损失函数。在训练过程中网络不断调整使得损失最小化也就是使得分类最准确。自然而然地对分类有帮助的频带会得到更大的权重。4.4 残差块的改进设计经典ResNet的残差块表达为其中F(·)包含两个BN、两个ReLU、两个卷积层。本文改进后的残差块表达为其中G(·)包含一个BN、一个ReLU、一个动态加权层是动态加权层的参数。也就是说在经典残差路径之外增加了一条”动态加权路径”。这条路径不经过卷积直接对特征图进行频带级别的加权相当于给网络增加了一个”频带注意力”机制。4.5 这个设计精妙在哪里我自己梳理了三个觉得特别妙的地方第一把领域知识小波分解嵌入到深度学习框架中小波包分解不是作为预处理步骤简单提取特征而是作为网络的输入格式让网络在原始分解结果上直接学习。更重要的是动态加权层让网络能够”理解”小波分解的频带结构并根据任务目标优化每个频带的贡献。这是领域知识与深度学习深度融合的典范。第二“动态”二字是关键这里的”动态”有两层含义 权重是在训练过程中动态学习、动态优化的不是人工预设的。权重是网络参数的一部分随着训练的进行不断调整最终收敛到最优值。这与传统的”先分解、再选频带、再提取特征”的流水线式方法完全不同。在DRNDWWC中分解、加权、特征学习、分类是端到端联合优化的。第三轻量且高效动态加权层只增加了极少的参数量每个频带一个权重计算开销几乎可以忽略不计。但它带来的性能提升却非常显著。这种”小改动、大收益”的设计体现了作者对问题本质的深刻理解。五、实验做了哪些验证5.1 实验数据集行星齿轮箱振动信号实验使用了一个传动诊断模拟器Drivetrain Diagnostics Simulator设备包括电机、两级行星齿轮箱、两级平行齿轮箱、扭矩控制器和磁粉制动器。两个加速度传感器分别采集水平和垂直方向的振动信号采样率25.6kHz。健康状态共9类包括1个健康状态H3种轴承故障球故障SFB、内圈故障SFI、外圈故障SFO均带健康齿轮1种复合轴承故障CSF带健康齿轮4种齿轮故障齿根裂纹TRC、齿面点蚀TSP、齿崩缺TCF、齿缺失TMF均带健康轴承工况设置3种负载条件0V、4V、8V变转速20~38.7Hz。每种工况下采集4段56秒振动信号每段信号分割为350个0.16秒样本。每类健康状态共4200个样本。噪声设置为测试鲁棒性人为添加高斯白噪声使信噪比SNR5dB。数据集水平方向信号构成Dataset 1垂直方向信号构成Dataset 2。5.2 对比方法实验对比了非常全面的基线方法传统机器学习方法验证特征学习的必要性多类SVM使用统计特征 三层神经网络NN使用统计特征深度学习方法验证DRNDWWC的优越性CNN经典卷积神经网络DRN深度残差网络无动态加权DRNDWWC本文方法每种深度学习方法测试了3种卷积核数量m1, 2, 4。超参数设置学习率初始0.1第40轮和第80轮分别除以10共训练100轮Batch size128动量0.9权重初始化He初始化L2正则化0.0001损失函数Softmax交叉熵5.3 定量结果DRNDWWC全面领先几个关键发现1. 特征学习的价值被充分验证DRNDWWC (m4) 在无噪声环境下的数据说明深度学习自动学习的特征远优于人工设计的统计特征尤其是在行星齿轮箱这种复杂系统上。2. DRNDWWC优于所有对比方法比CNN提升约9%训练和10%测试比DRN提升约3%训练和4%测试这个提升虽然百分比看起来不大但考虑到基线方法DRN本身已经很强了95%在”高手过招”的层面上再提升3-4个百分点是非常不容易的。3. 动态加权层对噪声具有鲁棒性在SNR5dB的噪声环境下的数据说明动态加权层不仅能在干净数据上提升性能还能在噪声环境下通过抑制噪声频带来保持高诊断精度。5.4 损失曲线分析训练稳定无过拟合图8展示了CNN、DRN和DRNDWWC (m4) 在Dataset 1上的训练损失和测试损失曲线。几个观察 三种方法的测试损失都收敛到了一个稳定的水平说明没有过拟合训练损失的波动比测试损失大这是因为训练损失基于mini-batch计算少量样本的误分类会导致较大波动DRNDWWC的损失下降最快收敛值最低。5.5 t-SNE可视化特征学习效果的直观展示作者用t-SNE将不同层的高维特征图投影到3D空间直观展示了各方法的特征学习能力。CNN图9 输入层9个健康状态严重重叠浅层Conv开始有分离趋势但仍有大量混叠深层CBB×3分离度改善但部分状态仍有重叠。DRN图10 输入层同样严重重叠浅层Conv分离趋势比CNN更明显深层RBB×3各类别基本可辨但仍有少量混叠。DRNDWWC图11输入层同样严重重叠浅层ConvDynamic分离趋势优于DRN深层DRBB×39个健康状态几乎完全分离只有极少数点错分。可视化结果非常直观DRNDWWC学到的特征在3D空间中”聚类最紧凑、类间最分离”。动态加权层帮助网络在早期层就聚焦于判别性频带使得后续深层网络更容易提取高层次的判别性特征。5.6 动态加权层的权重学到了什么虽然论文没有专门展示学习到的权重值但从设计原理可以推断携带故障特征频率的频带如齿轮啮合频率、轴承故障特征频率所在频带会得到较大的权重主要是噪声的频带会得到较小的权重冗余频带与其他频带信息高度重复的权重也会被抑制。这种”自动频带选择”机制相当于给网络配备了一个”频带注意力”模块让它知道”该看哪里”。六、方法的局限和未来可以改进的地方作者在论文中没有过多讨论局限但从方法设计和实验设置中可以推断出几个后续研究方向小波基的选择本文使用了固定的小波基函数进行小波包分解。不同小波基对信号的分解效果不同最优小波基可能因设备和故障类型而异。未来可以探索自适应小波基选择或通过可学习的小波滤波器替代固定小波基。分解层数的自适应本文固定使用6层分解得到64个频带。分解层数决定了频带的分辨率最优层数可能因信号特性和故障类型而异。未来可以探索自适应分解层数。动态加权的更复杂形式本文的动态加权是”频带级别”的每行一个权重更细粒度的加权如时频点级别可能进一步提升性能但参数量和计算量也会大幅增加。需要在精度和效率之间权衡。跨设备迁移实验数据来自同一台模拟器实际工业场景中训练数据和测试数据可能来自不同设备。将DRNDWWC与域适应技术结合可能是解决跨设备迁移诊断的方向。可解释性虽然动态加权层让网络”关注”了某些频带但这些频带与物理故障模式之间的对应关系尚不明确。如果能建立”权重模式-故障类型-物理机理”的映射将大大提升方法的可解释性。七、我的一些思考和收获7.1 “领域知识深度学习”才是正道DRNDWWC给我最大的启发是真正有效的深度学习模型不是把通用架构直接套用到新领域而是要把领域知识巧妙地嵌入到网络设计中。本文的领域知识体现在知道振动信号适合用小波包分解进行时频分析知道不同频带携带的信息重要性不同知道应该让网络自动学习频带权重而不是人工预设。如果作者不懂信号处理和小波分析不太可能想到”动态加权小波系数”这个设计。这再次印证了一个道理好的深度学习模型不是纯数学游戏而是领域知识与网络设计的深度融合。7.2 “注意力机制”的早期探索动态加权层本质上是一种”频带注意力”机制让网络自动学习”该关注哪些频带”。这篇论文发表于2017年TIE 2018比Transformer和自注意力机制的爆发2017年底的”Attention Is All You Need”还要早。从这个意义上说DRNDWWC可以看作是注意力机制在故障诊断领域的早期探索。它证明了在特定领域设计有针对性的”注意力”模块比通用的自注意力机制可能更有效。7.3 端到端学习的威力传统方法是”分解、选频带、提特征、分类”的多阶段流水线每个阶段独立优化。DRNDWWC则是端到端联合优化小波分解提供结构化输入动态加权层、卷积层、分类层一起训练损失函数的梯度一直回传到动态加权层的权重。这种端到端学习让网络能够自动发现”对分类最有利的频带权重组合”这是分阶段方法无法做到的。7.4 轻量设计的重要性动态加权层只增加了64个权重参数对应64个频带计算开销微乎其微。但它带来的性能提升却非常显著DRN→DRNDWWC提升约3-4%。这提醒我们网络设计的精髓不在于堆叠多少层、增加多少参数而在于在正确的地方做正确的事。一个轻量但巧妙的设计往往比盲目加深网络更有效。7.5 这篇论文的写作值得学习问题清晰开篇就点明行星齿轮箱故障诊断的困难以及现有方法的不足。动机充分详细解释了为什么需要动态加权层“没有哪个频带被公认为包含最重要的故障信息”。方法简洁动态加权层的数学表达只有几行公式但设计动机解释得非常清楚。对比全面从传统机器学习SVM、NN到深度学习CNN、DRN再到本文方法层层递进。可视化直观t-SNE三维可视化让读者一眼就能看出不同方法的特征学习效果差异。八、总结这篇论文的核心贡献可以概括为一句话让小波系数的”重要性”也成为可学习的参数让网络自动聚焦于携带故障判别信息的频带。具体来说问题行星齿轮箱振动信号频带众多不同频带对故障诊断的贡献不同。传统方法要么人工选频带可能遗漏关键信息要么全频段一视同仁引入噪声和冗余。方法设计了DRNDWWC带动态加权小波系数的深度残差网络。在小波包分解的基础上在残差块中插入动态加权层为每个频带学习一个自适应权重。权重在训练过程中通过梯度下降自动优化使得网络自动聚焦于判别性频带、抑制噪声频带。效果在9类健康状态的行星齿轮箱故障诊断任务上DRNDWWC的测试准确率比CNN提升约10%比DRN提升约3-4%。在SNR5dB的噪声环境下仍保持约97%的准确率。t-SNE可视化证明DRNDWWC学到的特征具有最强的判别性和分离度。个人觉得这篇论文的价值不仅在于提出了一个有效的故障诊断方法更在于它展示了一种”领域知识驱动网络设计”的范式深入理解问题领域的物理特性找到关键瓶颈然后设计一个轻量但巧妙的网络模块来解决它。这种思路比盲目追逐最新架构更有启发性也更适合工程实际。参考文献M. Zhao, M. Kang, B. Tang, and M. Pecht, “Deep residual networks with dynamically weighted wavelet coefficients for fault diagnosis of planetary gearboxes,” IEEE Trans. Ind. Electron., vol. 65, no. 5, pp. 4290-4300, May 2018, doi: 10.1109/TIE.2017.2762639.
返回列表