(论文速读)E2E-PKSCLN:AIC 物理先验 + 自监督对比学习的激光多普勒信号去噪
论文题目An End-to-End Self-Supervised Contrast Learning Network Embedded With Prior Knowledge for Laser Doppler Signals Denoising中文翻译一种嵌入先验知识的端到端自监督对比学习网络用于激光多普勒信号去噪期刊IEEE Transactions on Instrumentation and Measurement2025摘要激光多普勒信号在测量过程中会受到环境光、温度和机械振动的影响从而产生显著的基线漂移和随机噪声。传统激光多普勒测振仪LDV信号去噪方法面临多项挑战包括复杂的参数选择、有限的实时性能、不完全的噪声抑制以及不足的泛化能力。为解决这些问题本文设计了一种嵌入先验知识的端到端自监督对比学习网络E2E-PKSCLN。首先所提出的方法设计了一个基于 Akaike 信息准则AIC的先验知识嵌入模块将基线漂移建模为分段线性趋势并通过残差计算将其从原始信号中去除。随后构建带有简单自监督对比学习SimCLR模块的去噪自编码器通过并行数据增强和对比学习优化信号特征表达从而抑制跨频带的复杂噪声。最后搭建全光纤激光多普勒振动测量验证平台并采集覆盖 12 个频带的 60 组 LDV 信号进行测试。实验结果表明与传统方法相比所提出方法可使信噪比SNR这一关键指标提高 1–40 dB尤其在高频频段表现明显同时信号去噪后的结构相似性指数SSIM接近 1。一、研究背景与核心问题1.1 LDV 信号的难点不只是“有噪声”激光多普勒测振仪Laser Doppler VibrometerLDV是一种典型的非接触式振动测量手段在航空航天、汽车、旋转机械以及生物医学等领域都有应用。问题在于实际测出来的信号往往并不干净。环境振动、散斑效应、激光噪声、被测物表面反射率变化都会影响信号除此之外环境光变化以及声光调制器 AOM 工作频率的不稳定还会导致一个非常麻烦的问题——baseline drift也就是基线漂移。论文 Figure 1全光纤激光多普勒测振系统光路结构Figure 1 主要是交代信号从哪里来。测量光照射振动物体后产生多普勒频移再与经过 AOM 调制的参考光发生干涉最终由平衡光电探测器得到原始 Doppler 信号。这张图本身不是论文的方法创新但它解释了后面为什么作者能够引入“物理先验”LDV 的 baseline drift 并不是一个完全未知的黑盒噪声而是可以从测量机理中找到来源。传统去噪方法通常使用小波变换、EMD、滤波、频域处理等方法但这类方案往往需要针对不同频带手动选择参数高频、非平稳和多源噪声下泛化能力有限而且还可能把与噪声相似的真实振动特征一起滤掉。深度学习虽然可以学习更复杂的噪声分布但又出现另一个问题纯数据驱动模型通常缺少对 LDV 物理机制的显式利用。所以这篇论文实际上想解决两个不同性质的问题一个是具有明确物理来源的 baseline drift另一个是成分复杂、跨频带变化的随机噪声。如果把整篇论文说白了其实就是先用物理先验把“能解释的漂移”处理掉再用自监督对比学习去处理“难显式建模的复杂噪声”。这也是 E2E-PKSCLN 最核心的思路。二、E2E-PKSCLN 整体框架先去漂移再学去噪论文 Figure 2E2E-PKSCLN 整体结构整个流程可以分成三步。首先原始 Doppler 信号经过 IQ Demodulation利用低通滤波、反正切、phase unwrap 等步骤得到初步的振动位移信号。随后位移信号进入Prior Knowledge Embedded Module。这一部分根据 AIC 自适应决定分段数对 baseline drift 进行分段线性拟合然后通过残差运算把漂移从信号中扣掉。最后去除 baseline drift 后的信号送进DAE SimCLR。模型对同一个信号进行不同的数据增强一方面通过 Encoder–Decoder 完成信号重构另一方面通过对比学习约束 latent feature使同一信号的不同增强版本靠近、不同信号彼此远离最终输出 denoised vibration displacement signal。所以 E2E-PKSCLN 并不是单纯“拿一个神经网络直接从 noisy signal 回归 clean signal”。Prior Knowledge Module 解决的是低频、非平稳的趋势项DAE SimCLR 解决的是趋势项去掉以后仍然存在的宽带随机噪声。这比让一个神经网络同时学习“什么是趋势漂移”和“什么是随机噪声”更有针对性。三、核心模块一用 AIC 物理先验去除非平稳 Baseline Drift3.1 Baseline drift 为什么可以建模论文首先从 LDV 的测量机理解释 baseline drift。理想情况下参考光的 AOM 频率为 ()但实际工作频率是 ()。当两者不完全一致时会引入一个漂移因子最终实际解调得到的位移信号可以写成也就是说AOM 频率误差会在正常振动位移信号上额外叠加一个与时间相关的线性趋势项。这一步很关键。如果 baseline drift 只是完全随机的干扰那么直接交给深度网络学习可能是合理的但既然它能够从系统物理模型中推导出来就没有必要完全依赖神经网络“猜”。3.2 为什么不是直接拟合一条直线问题在于实际 AOM 工作频率并不是固定不变的。因此实际 baseline drift 也不是一条从头到尾斜率固定的直线而更接近一个分段线性趋势。作者把 baseline 建模为其中 () 和 () 分别表示第 (i) 个区间的斜率与截距。得到 baseline estimate (b(t)) 后直接利用残差其中 (x(t)) 就是去除 baseline drift 后送入后续 DAE 的信号。直观理解就是不让神经网络负责“把整条倾斜趋势拉平”而是先利用物理模型把趋势项从信号里扣掉让后续网络集中精力处理真正的噪声。3.3 AIC 在这里做了什么分段线性拟合还有一个问题到底应该分成多少段分得太少复杂的非平稳 baseline 拟合不准分得太多又容易过拟合而且计算复杂度会上升。作者因此使用 AIC 自动选择分段数其中 (K) 是分段数量参数数量为 (p2K)() 是采用 (K) 段拟合时的总 fitting loss。AIC 实际上是在做一个经典权衡它不会只追求越来越小的拟合误差而会对分段数增加进行惩罚。论文 Table I不同频率下的最优分段数作者把最大分段数设置为 ()再针对 60 个样本分别计算 AIC。Table I 可以看到不同频带甚至同一频带的不同样本最终得到的 (K) 并不完全相同。例如部分信号只需要 9、11 或十几段而很多复杂样本最终选择接近 20 段。这说明作者并不是为所有信号人工规定一个固定的 segmentation 参数而是让 AIC 根据数据自己决定拟合复杂度。实验部分也明确说明60 个样本均通过 AIC 来确定最优分段数。3.4 Figure 5 和 Figure 6为什么一定要先去 baseline论文 Figure 58 kHz 原始 Doppler 信号及 IQ 解调结果论文 Figure 68 kHz 解调信号局部放大结果Figure 5 和 Figure 6 是作者专门用来说明问题性质的两张图。8 kHz 信号经过 IQ 解调以后从整体尺度看几乎像一条持续上升的直线真正的高频振动被巨大的 baseline drift 淹没。去除漂移并局部放大以后真正的周期性位移变化才显现出来。但 Figure 6 同时说明baseline 去掉以后信号仍然存在明显的低频和随机噪声。所以 Prior Knowledge Module 只能解决第一层问题它并不能完成全部 denoising。这也自然引出了第二个核心模块。四、核心模块二DAE SimCLR 学习跨频带的噪声不变表示4.1 为什么普通 DAE 还不够传统 Denoising Autoencoder 的逻辑很简单然后通过 reconstruction loss 让输出尽量接近目标信号。但对于 LDV 来说不同频率下的振动特征差异很大噪声又来自机械振动、环境光、电子器件热噪声和 shot noise 等不同来源。如果只优化 reconstruction lossEncoder 得到的 latent representation 并不一定具有足够好的噪声不变性和跨频带区分能力。作者因此把 SimCLR 风格的对比学习嵌入 DAE。论文 Figure 3Self-Supervised Representation Contrast Learning4.2 正负样本怎么构造对一个原始振动信号 (x)首先进行两种数据增强然后经过共享 Encoder因为和来自同一个原始信号所以 (()) 构成 positive pair。来自其他原始信号的表示则构成 negative pair。模型要学习的就是同一个真实振动信号即使叠加了不同噪声其特征表示也应该保持接近不同振动信号的特征则应该彼此区分。作者采用余弦相似度并通过类似 InfoNCE 的 contrastive loss让 positive pair 靠近、negative pair 远离。这就是所谓 self-supervised 的关键模型不需要人为给每条信号打上“这个是 5 kHz 的第几类噪声”之类的标签而是通过数据增强自动构造监督关系。4.3 Parallel Data Augmentation 在模拟什么实验中每个样本分别加入white noise 和 pink noise噪声强度设置为 2、4、6、8、10 dB。Pink noise 用于模拟机械振动以及环境光波动带来的低频干扰white noise 则用于模拟电子器件中的热噪声和 shot noise。最终从原始 60 条信号扩展得到 600 个 noisy samples。这一步并不是单纯为了“数据量变多”。更重要的是同一个真实信号经过不同噪声污染以后仍然应该被 Encoder 映射到相近区域这恰好与 contrastive learning 的目标一致。4.4 CPAF-Loss既要重构也要把表示空间拉开作者最后把 reconstruction 和 contrast learning 放到一起其中() 负责保证 Decoder 最终能够恢复信号() 负责优化 latent feature使其对噪声更鲁棒() 控制两者之间的权重。论文把这个组合称为Contrast Perception Adaptive Fusion LossCPAF-Loss。两者一个约束输出空间一个约束 representation space。论文 Table IIDAE Network ArchitectureTable II 还可以看到这里的 DAE 本身并不复杂。也就是说真正的方法重点并不是堆一个很深的神经网络而是AIC 物理先验 简单 DAE Contrast Learning 的组合方式。五、实验结果与消融分析5.1 数据采集与评价设置论文 Figure 4全光纤 LDV 实验平台作者没有只使用仿真信号而是搭建了实际的全光纤 LDV vibration test bench。实验覆盖0.5、1、2、3、4、5、6、7、8、9、10、11 kHz 共 12 个频带每个频带采集 5 组信号总计 60 组每条采样时间为 80 ms。实验硬件使用 AMD Ryzen 9 8945HS、32 GB 内存和 RTX 4060 8 GB GPU软件环境为 Python 3.12.2、PyTorch 2.6.0 和 MATLAB R2021a。评价指标使用 SNR、MSE、MAE 和 SSIM。其中 SNR 越大越好MSE/MAE 越小越好SSIM 越接近 1说明重建信号在结构上越接近参考信号。这里还需要区分“训练”和“评估”的 reference signal。论文的方法训练强调不依赖人工提供的 clean reference signal而在最终定量评估中作者对 60 条去除 baseline 的信号进行 bandpass filtering提取主频成分作为 evaluation reference clean signal。5.2 Table I Figure 7参数是怎么确定的Table I 用 AIC 给不同样本自动寻找最优分段数最大限制为 (K20)。论文 Figure 7Optimizer、Learning Rate 与 Contrast Weight 对训练 Loss 的影响最终作者选择Adam Learning Rate 0.001 初始)。训练采用 full-batch并运行 5000 iterations。这部分属于设计选择实验主要作用不是证明方法优于 baseline而是说明最终配置是怎么确定的。5.3 Figure 8从波形上看去噪以后发生了什么论文 Figure 8不同频率下 E2E-PKSCLN 去噪前后的时域结果Figure 8 从 500 Hz 一直展示到 11 kHz。图中同时绘制 noisy signal、clean/reference signal 和 denoised signal。一个比较明显的现象是随着频率升高原始 noisy signal 与 clean signal 在幅值和局部波形上的偏差越来越明显而 E2E-PKSCLN 输出的 denoised signal 基本能够继续跟随参考振动的周期、相位和幅度变化。作者据此认为模型不仅在低频有效在宽频带尤其是高频区域也能较好保留 waveform、amplitude 和 phase 等关键信号特征。5.4 Figure 9 Table III主实验结果论文 Figure 9 与 Table III不同去噪方法在 12 个频带上的定量比较作者与五类方法进行比较WT、EMD、VMD、DAREDN 和 ResTransUnet。最值得关注的是 SNR。E2E-PKSCLN 在多数频带取得最高 SNR例如1 kHz42.81 dB3 kHz46.56 dB7 kHz52.34 dB8 kHz39.71 dB9 kHz35.85 dB10 kHz35.46 dB11 kHz27.83 dB。也就是说论文优势最明显的区域确实主要集中在中高频。但这里不能简单写成“所有频率全面第一”。例如 0.5 kHz 时WT 的 SNR 是21.85 dB高于 E2E-PKSCLN 的13.11 dB2 kHz 时VMD 的19.59 dB也高于 E2E-PKSCLN 的17.46 dB。所以更准确的结论应该是**E2E-PKSCLN 在大多数频带特别是高频区域取得明显优势而不是每个单项都第一。**论文正文也使用了“across most frequency bands”的表述。另外从 Table III 可以看到E2E-PKSCLN 的 MSE 和 MAE 整体明显更低。在 8–11 kHz 区间SSIM 分别达到大约0.99、0.99、0.99、0.98说明即使到了高频区域去噪以后仍然能够较好保持原有的时域结构。所以 Figure 9 和 Table III 共同说明的不只是“噪声小了”而是三方面同时得到改善。5.5 Table IV换成非高斯、非平稳噪声还能不能工作主实验里的 white noise 和 pink noise 仍然属于训练增强中明确见过的噪声类型。因此作者又额外加入Laplace noise 和 nonstationary noise验证模型面对不同分布干扰时的鲁棒性。论文 Table IVNon-Gaussian and Nonstationary Noise Denoising Results从 Table IV 看在这类额外干扰下模型在很多中高频区域仍然保持较高 SNR。例如 3 kHz 为46.68 dB7 kHz 为37.51 dB8 kHz 为37.42 dB高频区域 SSIM 大多仍能保持在0.97–1.00左右。不过 0.5 kHz 的 SSIM 只有0.55说明模型在所有频率上的鲁棒性并不是完全一致。这张表真正支持的是E2E-PKSCLN 并不是只对训练时的白噪声和粉红噪声有效它对新的非高斯、非平稳干扰也表现出一定泛化能力。5.6 Table V实时性怎么样传统 LDV 信号处理的一个问题就是不同频率往往需要复杂的分解、变换和参数调整因此作者专门进行了 denoising speed 对比。论文 Table V不同方法去噪时间比较Table V 中60 条测试信号在相同平台上重复测试十次。因此至少在论文这套实验环境和信号长度下E2E-PKSCLN 是表中平均推理时间最低的方法。作者据此强调了模型在实时 LDV 处理中的应用潜力。这个结果也和 Table II 的网络结构相呼应模型核心 DAE 本身只是几层全连接层并没有设计特别庞大的 Backbone。5.7 Figure 10 Table VI到底哪个模块最重要论文 Figure 10 与 Table VIE2E-PKSCLN 消融实验作者设计了四个变体PK只使用 Prior Knowledge Module 去 baseline不做后续神经网络去噪PKDAE保留 Prior Knowledge但把 DAE SimCLR 换成普通 DAESCLN去掉 Prior Knowledge让原始 noisy signal 直接进入 DAE SimCLRNDA保留完整模型但去掉 parallel data augmentation。完整 E2E-PKSCLN 记为 BASELINE。先看PK。仅仅去掉 baseline drift 并不能完成完整降噪11 kHz 时 SNR 只有−1.84 dB说明物理先验主要负责趋势校正而不是随机噪声抑制。再看SCLN。如果完全不要 Prior Knowledge直接把 noisy signal 交给 DAE SimCLR11 kHz SNR 会进一步跌到−15.76 dB完整模型则是27.83 dB。这一组差距非常直观地说明先验模块并不是一个可有可无的预处理它实际上决定了后面的神经网络面对的是不是一个“合理的学习问题”。如果 baseline drift 还在Encoder 需要同时处理巨大的非平稳趋势和局部随机噪声对比学习本身很难解决全部问题。PKDAE 则说明 Contrast Learning 也有自己的作用。只使用普通 DAE 后部分频带的性能明显低于完整模型尤其 0.5 kHz SNR 只有1.50 dB完整方法是13.11 dB。最后是 NDA。去掉 parallel augmentation 后大多数频率的 SNR 也会下降说明不同噪声强度和不同噪声类型构造出的增强视图确实能够提高模型鲁棒性。因此从“模块分工”而不是简单看有没有下降可以得到Prior Knowledge主要负责消除 baseline driftDAE Contrast Learning主要负责学习复杂随机噪声下的稳定表示并完成信号恢复Data Augmentation进一步提高对不同噪声条件的适应能力。5.8 Table VII作者还做了统计显著性检验这篇论文的消融还有一个比较少见的部分作者没有只看平均指标而是进一步进行了 one-way ANOVA 和 Tukey HSD test。论文 Table VIIANOVA and Tukey HSD Test ResultsANOVA 得到说明几个消融模型之间的 SNR 整体存在显著差异。Tukey HSD 进一步显示完整 BASELINE 与 PK、SCLN 之间差异显著这进一步支持了“只有 prior”以及“只有 contrast network”都不够的结论。这里还有一个值得注意的边界BASELINE 与 NDA 之间的 Tukey 检验 (p0.25)并没有达到统计显著BASELINE 与 PKDAE 的 (p0.81) 也同样没有显著差异。因此虽然从具体频带和平均 SNR 看数据增强以及 Contrast Learning 都带来了收益但如果严格从 Table VII 的统计检验来看它们的证据强度没有 Prior Knowledge 模块那么直接。这其实和整篇论文的方法设计逻辑是一致的最核心的不是“用了 SimCLR”而是先利用 LDV 的物理机制把一个难以学习的大趋势项从数据中剥离出去。六、总结与思考如果把这篇论文压缩成一句话可以理解成E2E-PKSCLN 不是让深度网络包办所有去噪任务而是先利用 AIC 和 LDV 物理机理去掉可解释的非平稳 baseline drift再利用 DAE SimCLR 学习剩余复杂噪声下的稳定特征表示。如果只记住一个方法论我觉得就是面对真实工业信号不一定什么都要交给神经网络。能够通过测量机理明确解释的干扰先用物理模型消掉剩下难以显式描述的部分再让自监督学习去解决。