(论文速读)无人机旋翼轻量化声学故障检测与识别
论文题目:Toward lightweight acoustic fault detection and identification of UAV rotors(无人机旋翼轻量化声学故障检测与识别)
会议:EI - ICUAS 2023
摘要:数据驱动的故障检测与隔离(FDI)系统受到了研究者的广泛关注。最近的一些应用利用无人机(UAV)上记录的声信号来评估推进系统的状态并诊断旋翼叶片的损伤。在这项工作中,我们提出了对先前开发的FDI方案的两个主要改进。它们的目的是为了减少基于深度LSTM(长短期记忆)的故障分类器的计算量。首先,基于主成分分析(PCA)的特征空间约简允许减小神经网络的规模,从而减少数学运算的数量。其次,一种改进的算法引入了多个弱分类器的集成,并采用决策融合策略来提供系统的最终状态。使用大量的真实飞行声学数据集对所开发的方案进行了评估,并与原始算法进行比较。结果表明,所提出的改进在假设的性能约束下显著减少了计算时间。
用“听觉”给无人机旋翼做体检:一套面向机载部署的轻量化故障检测方法
1. 这篇论文要解决什么问题?
多旋翼无人机的推进系统由电调、电机和旋翼组成。旋翼叶片一旦发生断裂、缺口或边缘变形,不仅会改变推力,还可能引起振动和控制性能下降。对于主动容错控制系统而言,仅仅在飞行器已经明显失稳后发现“执行器效能下降”是不够的;更理想的做法,是尽早检测旋翼本体的物理损伤,并进一步判断损伤类型和位置。
声学信号为这个问题提供了一条可行路径。旋翼高速转动时会持续产生声音,叶片的几何形状、质量分布和气动状态发生变化后,声音的频谱结构也会改变。因此,可以在无人机机身上布置麦克风,通过声音识别旋翼是否健康。
但论文指出,现有声学故障诊断研究离真正的机载应用还有明显距离:
-
很多实验使用外置、高质量麦克风,在悬停甚至地面固定条件下采集数据,信号质量明显优于真实机载环境。
-
一些方法使用长达数秒的信号窗口,故障发生后必须等待完整窗口,难以满足容错控制对快速诊断的要求。
-
深度神经网络本身计算量较大,而小型无人机通常只能搭载功耗、内存和算力都受限的嵌入式处理器。
-
传统模型驱动方法通常关注“效能损失”“饱和”“偏置”等最终表现,不一定能够直接识别旋翼叶片的物理损伤。
因此,这篇论文的重点并不是把分类准确率继续推高,而是在保持准确率基本不变的前提下,让已有的声学故障检测与隔离系统运行得更快、更适合低功耗机载计算平台。

论文 Figure 1:用于声学故障检测系统开发的 Falcon V5 无人机。
2. 原始系统如何通过声音识别旋翼故障?
2.1 四通道麦克风与九分类任务
论文研究的是一架对称布局的 X8 构型无人机。它具有四个同轴推进单元,每个位置包含上下两个电机和旋翼。研究人员在机身上布置了四个麦克风,分别对应 A、B、C、D 四个推进位置。

论文 Figure 2:四个推进位置与四通道麦克风阵列之间的对应关系。
系统需要识别两类旋翼损伤:
-
F 类,fractured tip:叶尖的一部分断裂,造成旋翼质量不平衡;
-
E 类,edge damage:叶片没有发生明显断裂,但翼型边缘出现变形。
每种损伤都可能出现在 A、B、C、D 四个位置,再加上健康状态 H,因此总共有九个类别:AE、AF、BE、BF、CE、CF、DE、DF 和 H。
需要注意,这里的 A—D 表示四个同轴推进位置,而不是逐一识别八个电机中的每一个旋翼。
2.2 从原始声音到 MFCC 特征
原始系统使用 44.1 kHz 采样率。以 500 ms 为例,每一帧包含 22,050 个采样点。处理流程包括:
-
从连续声音中截取一帧并加窗;
-
进行快速傅里叶变换,得到频谱;
-
使用 Mel 滤波器组压缩和重组频谱;
-
对滤波结果取对数;
-
进行离散余弦变换,得到 Mel 频率倒谱系数,即 MFCC。
每个声道提取 104 个 MFCC,四个声道合计得到 416 个声学特征。论文所说的 425 维记录还包括九维类别标签;真正输入分类器的声学特征部分是 416 维。

论文 Figure 3:原始声学故障检测流程,包括四通道采集、分帧、FFT、Mel 滤波、对数与 DCT、MFCC 输入向量、LSTM 分类和最终预测。
2.3 原始 LSTM 分类器
原始模型由一个 LSTM 层和一个线性层组成。作者此前尝试过堆叠多层 LSTM,但没有得到明显的准确率提升,计算时间却增加了,因此最终保留单层结构。
论文给出的最佳原始模型参数为:LSTM 层大小 512、线性层大小 256、输出类别数 9、批大小 640,使用交叉熵损失和 Adam 优化器。该模型在先前评估中取得 0.995 的准确率、0.989 的精确率、0.980 的召回率和 0.985 的 F1 分数。

论文 Table I:最佳原始 LSTM 故障分类器的网络参数和性能指标。
问题在于,这个模型要一次性处理四个声道拼接后的高维特征,在 Raspberry Pi 3B+ 这类机载平台上计算成本偏高。
3. 创新一:利用 PCA 压缩 MFCC 特征空间
四个声道一共提供 416 个 MFCC,但这些变量对分类结果的贡献并不完全相同。直接人工筛选频带并不容易,因为旋翼声学信号是非平稳的,飞行动作和转速变化会让重要频段发生变化。
作者因此引入主成分分析(PCA)。PCA 不直接选择某几个原始 MFCC,而是把原始变量线性组合成一组彼此不相关的主成分。第一个主成分解释最多的数据方差,后续主成分解释的信息依次减少。只保留前若干个主成分,就可以把 416 维输入压缩为几十维。
其基本步骤为:
-
对数据归一化并去中心化,计算协方差矩阵;
-
计算协方差矩阵的特征值与特征向量;
-
按解释方差大小排序,保留前若干个主成分;
-
将原始 MFCC 投影到较低维的主成分空间。
PCA 本身也需要计算,因此“维度降低”并不自动意味着整体更快。论文的做法是把 PCA 变换时间也纳入测试,在不同主成分数量下同时观察分类指标和处理时间。
4. 创新二:把一个大模型拆成四个单通道弱分类器
原始方法将四个声道的 MFCC 拼接起来,再送入一个较大的 LSTM。论文提出的第二项改进,是为每个麦克风通道设置一个较小的 LSTM 分类器。
每个子模型只处理一个声道的数据,但仍然输出全部九个类别。这是因为某个旋翼的故障不仅能被距离最近的麦克风听到,其他麦克风也会记录到相应声学特征,只是信号强度和辨识能力不同。
这种拆分有两个目的:
-
减少每个网络的输入维度和浮点运算量;
-
让四个子模型可以利用四核 CPU 并发执行。

论文 Figure 4:四个单通道故障分类器、PCA 模块、权重矩阵和决策融合模块组成的集成模型结构。
5. 创新三:根据麦克风空间位置设计加权决策融合
四个子模型不能简单地一人一票。对于位置相关的故障类别,距离目标推进单元最近的麦克风应该拥有更高权重。
论文使用参数 () 控制主通道权重。对于某个故障类别,最近麦克风的输出权重为 (
),其余三个麦克风平均分享 (1-
),即每个远端通道的权重为:
若第 (i) 类故障在第 (j) 个样本上的最终得分为 (S(ci,xj)),最近麦克风输出为 (S0(ci,xj)),其余三个通道输出为 (Sk(ci,xj)),则故障类别的融合得分为:

对于健康类别 H,不存在“最近的故障位置”,因此四个通道采用相同的 0.25 权重:

这种设计把麦克风阵列的物理布局直接编码进决策层,保留了故障定位能力。

论文 Table II:九个类别对应的四通道决策融合权重矩阵。
最终系统把 PCA 特征压缩和四模型集成结合起来,形成 EM-PCA 模型。
6. 实验是如何进行的?
6.1 飞行平台
实验平台为定制的 Falcon V5 X8 四旋翼无人机,外形尺寸为 615 mm × 615 mm,轴距 450 mm,整机质量 1600 g,推重比 3.1。平台共有四个同轴推进单元和八个旋翼,使用 10 × 3.3 英寸碳纤维旋翼。

论文 Table III:Falcon V5 无人机的主要结构、动力和电池参数。
6.2 麦克风与机载计算平台
声学采集系统使用 ReSpeaker 四麦克风阵列和 Raspberry Pi 3B+。麦克风带宽为 100 Hz—10 kHz,信噪比为 65 dB,声学过载点为 123 dB。较高的声学过载能力对近距离记录高声压级旋翼噪声很重要。

论文 Figure 5:Falcon V5 上的 ReSpeaker 麦克风阵列、Raspberry Pi 3B+ 和飞控安装位置。
用于测试的 Raspberry Pi 3B+ 搭载 Broadcom BCM2837 SoC,包含四个 1.4 GHz ARM Cortex-A53 64 位核心和 1 GB 内存,热设计功耗约 7 W。论文在这一平台上直接测量单帧处理时间,而不是只在桌面 GPU 上报告结果。
6.3 数据集
研究人员完成了 36 次单独飞行,每次平均持续约 200 秒,覆盖四个故障位置、两种损伤类型和健康状态。九个类别平均各有约 1000 秒音频。
连续音频被切分为 100—500 ms 的帧,因此每一类最终形成数千个样本。飞行过程中包含不同轨迹和动态机动;故障飞行中既有单个损坏旋翼,也有两个损坏旋翼同时存在的情况。

论文 Figure 6:实验使用的两种损伤旋翼,其中(a)为 F 类叶尖断裂,(b)为 E 类叶片边缘变形。
预训练模型使用来自其他飞行实验、此前未参与训练的数据进行测试。验证重复十次,并计算准确率、精确率、召回率、F1 分数和单帧平均处理时间。作者预先设定的约束是:相对基准模型,准确率最多下降 1 个百分点。
7. 实验结果
7.1 仅使用 PCA:较少特征依然可以保持高准确率
比较实验中的完整模型记为 FM。Figure 7 给出的 FM 基准结果为:
-
准确率:0.993;
-
精确率:0.975;
-
召回率:0.981;
-
F1:0.978;
-
单帧平均处理时间约 22 ms。
当保留 78 个主成分时,FM-PCA78 的准确率为 0.994,略高于 FM;精确率、召回率和 F1 分别为 0.979、0.986 和 0.982,处理时间约 20 ms。
当主成分减少到 52 个时,FM-PCA52 的准确率为 0.989,相比 FM 下降 0.4 个百分点;处理时间约 17—18 ms,下降超过 20%。这正是论文用于说明“在很小准确率损失下获得明显加速”的代表性配置。
即使只保留 20 个主成分,FM-PCA20 的准确率仍达到 0.985,但精确率、召回率和 F1 分别下降到 0.953、0.949 和 0.951。说明准确率对降维相对稳定,但更细致地观察漏检和误检时,过度压缩带来的损失更明显。


论文 Figure 7:FM、FM-PCA78、FM-PCA52 和 FM-PCA20 的准确率、精确率、召回率、F1 及单帧处理时间对比。
7.2 PCA 与集成模型结合:处理时间减少超过三分之一
Figure 8 将 FM 与三种 EM-PCA 模型进行比较。三种集成模型的准确率分别为:
-
EM-PCA78:0.983;
-
EM-PCA52:0.984;
-
EM-PCA20:0.985。
它们都保持在 98% 以上。EM-PCA20 相比 FM 的准确率从 0.993 降到 0.985,下降 0.8 个百分点,仍在作者规定的 1 个百分点约束内。
与此同时,集成模型的单帧平均处理时间约为 15—16 ms,相比 FM 的约 22 ms 下降超过 33%。论文还观察到处理时间标准差减小,说明并发执行的四分类器结构具有更稳定的时间表现。


论文 Figure 8:FM 与 EM-PCA78、EM-PCA52、EM-PCA20 的分类指标和单帧处理时间对比。
需要注意,论文正文称集成模型在精确率和召回率方面“略优于”完整模型,但 Figure 8 标注的数值实际上低于 FM。例如,EM-PCA20 的精确率、召回率和 F1 分别为 0.968、0.949 和 0.956,而 FM 分别为 0.975、0.981 和 0.978。因此,最稳妥的结论是:集成模型在准确率仍高于 98%且下降不超过 1 个百分点的条件下,显著减少了处理时间;不能根据 Figure 8 认为它全面改善了所有分类指标。
7.3 决策融合参数的最佳值为 0.5
作者使用网格搜索调整。对于所有测试的集成模型,准确率曲线都在 (\alpha=0.5) 附近达到局部最大值,因此最终把最近麦克风的权重设为 0.5,另外三个通道各占约 0.1667。
PCA 压缩程度越高、子模型越小,调整带来的准确率增益越明显。这说明当单个弱分类器能力下降时,利用传感器空间关系进行合理融合更为重要。

论文 Figure 9:EM-PCA78、EM-PCA52、EM-PCA26 和 EM-PCA10 在不同 (
) 下的分类准确率。
8. 这篇论文真正的贡献是什么?
这篇论文使用的 PCA、LSTM 和集成学习本身都不是新算法。它的主要贡献在于面向一个明确的机载部署瓶颈,把三种设计组合成一套可运行的工程方案:
-
用 PCA 减少多通道 MFCC 的输入维度;
-
把一个大模型拆成四个可并发执行的单通道模型;
-
根据麦克风与旋翼的空间对应关系设计加权融合;
-
在真实飞行数据和 Raspberry Pi 3B+ 上验证速度与准确率之间的折中。
最终结果是:在准确率下降不超过 1 个百分点的约束下,单帧处理时间减少超过 33%,同时整体准确率仍高于 98%。这使声学旋翼诊断更接近低功耗机载部署,而不只是停留在离线分类实验中。
9. 阅读结果时还应注意哪些限制?
第一,论文所说的“轻量化”主要由单帧处理时间体现。文中没有给出模型参数量、内存占用、能耗或实际 CPU 利用率,因此不能把它等同于所有资源维度都减少了 33%。
第二,约 15—22 ms 是计算处理时间,不包括等待 100—500 ms 音频窗口形成的时间。论文也没有给出从故障实际发生到最终告警的完整端到端时延。
第三,实验集中在一种 Falcon V5 平台、一种麦克风阵列布局和两种旋翼损伤类型。更换机架尺寸、旋翼型号、麦克风距离或外部噪声环境后,模型是否仍能保持同样性能,需要进一步验证。
第四,实验在室内完成。作者认为旋翼声音较大,因此初步实验中没有观察到明显环境影响,但论文没有系统展示室外风噪、其他无人机噪声或复杂背景声条件下的量化结果。
第五,论文自己的文字描述与 Figure 8 在精确率、召回率方面存在不一致,因此解读时应优先引用图中具体数值,并把主要贡献限定为计算加速和准确率约束内的性能保持。
作者提出的后续工作,是研究麦克风与旋翼之间距离变化对诊断性能的影响。
10. 总结
这篇论文回答了一个很实际的问题:一套准确率很高的无人机声学故障诊断系统,怎样才能在 Raspberry Pi 3B+ 这样的低功耗平台上运行得更快?
作者给出的答案是:先用 PCA 压缩四通道 MFCC,再把单一大 LSTM 改为四个单通道小 LSTM,最后利用麦克风和旋翼的空间位置进行加权融合。
该方案没有追求新的最高准确率,而是在明确的工程约束下进行取舍。与完整模型相比,改进系统把单帧处理时间从约 22 ms 降低到约 15 ms,减少超过 33%;在代表性配置下,准确率仍保持在 98% 以上,并满足不超过 1 个百分点下降的约束。
对于需要把深度学习故障诊断真正放到无人机上的研究者,这篇工作最值得借鉴的并不是某个单独算法,而是它围绕“真实数据、低功耗硬件、明确性能约束”进行系统设计和验证的方法。
更多推荐
所有评论(0)