持续对比强化学习:面向航空发动机故障诊断的环境感知智能体

发布时间:2026/9/29 11:13:23
持续对比强化学习:面向航空发动机故障诊断的环境感知智能体 在航空工程领域航空发动机的状态监控与故障诊断高度依赖于实际运行数据的积累。论文《Continual contrastive reinforcement learning: Towards stronger agent for environment-aware fault diagnosis of aero-engines through long-term optimization under highly imbalance scenarios》针对实际运行中极度不平衡的数据分布、动态变化的运营环境以及持续增长的监测数据提出了一种结合环境交互机制与持续动态演进的机器学习方法——持续对比强化学习Continual Contrastive Reinforcement Learning, CCRL。该方法致力于构建一个能够与实际业务流程协同更新、在小样本与多类别严重不平衡条件下保持判别稳定性的故障诊断智能体。1.业务交互与持续演进框架传统数据驱动的故障诊断通常采用“离线训练、离线微调、在线部署”的静态模式难以适应真实民航运行中持续产生的新数据以及随气象、季节等环境要素发生的数据漂移。本研究将航空公司的实际运行体系抽象为强化学习的交互环境。在实际机队运营中飞机在关键飞行阶段的状态参数通过空地通信系统传输至地面维护系统并归档。智能体基于最近若干航次的发动机性能参数对当前状态进行推断维护团队与技术专家结合智能体的推断结果与实际检查情况做出最终归因并在经验库中记录真实故障标签与反馈信息。智能体定期从经验库中抽取历史样本更新策略网络使模型具备伴随数据积累而实现持续演进的能力。图1论文原图 Fig. 2CCRL 整体流程与航空公司业务流程的交互架构2.特征区分模块自编码器预训练与加权对比学习在航空发动机时序监控数据中直接套用图像领域的经典数据增强方式如旋转、裁剪、几何变换或基于生成式对抗网络合成数据可能破坏时序参数固有的物理相关性并引入虚假噪声。因此本方法不依赖数据合成而是直接基于真实样本构建对比样本对并通过两阶段策略进行表征学习。图2论文原图 Fig. 3特征区分模块结构与对比学习流程2.1 正常工况样本的自编码器预训练由于发动机故障在全生命周期中发生概率极低数据集中绝大部分数据均为正常状态样本。为防止模型在初期直接接触稀有故障而陷入过拟合模型首先构建一个基于长短期记忆网络LSTM的自编码器。仅使用数量占主导地位的正常样本对编码器与解码器进行无监督重建训练。此时编码器主要用于提取时间序列的基础压缩表征捕获发动机参数随航次演化的共性时序规律。2.2 加权对比学习与样本对构造在自编码器完成预训练后提取其编码器结构作为对比学习网络的底层骨干并附加两层全连接层作为投影层。正负样本对构建属于同一故障类别的不同实际飞行序列被定义为正样本对属于不同类别包括不同故障类别及正常类别的序列被定义为负样本对。加权损失设计针对真实故障批次中正负样本分布极不均衡、且发动机参数总体走势具有基础共性的问题设计了带有样本权重的对比损失。通过赋予正样本对更高的聚合权重强化同类故障特征在隐空间的聚类趋势通过适当调控负样本对的抑制权重避免不同工况间合理的共性参数被过度拉离。差异化学习率微调在对比训练阶段预训练的编码器部分采用较低的学习率进行精细微调投影层使用相对较高的学习率从而在保留预训练基础时序模式的同时增强对细微故障差异的分离能力。3.类别识别模块非平衡奖励驱动的决斗双深度Q网络为了直接应对由于故障样本极度匮乏带来的判别偏差诊断模型的主分类阶段采用强化学习范式具体选用决斗双深度Q网络Dueling Double Deep Q-Network, D3QN结构。图3论文原图 Fig. 4类别识别模块训练机制与策略/目标网络结构3.1 编码器冻结与状态处理在特征区分模块完成训练后其编码器参数被整体冻结不再参与强化学习过程的梯度更新仅作为固定的特征提取器。输入的时间序列先经过冻结编码器输出特征再送入新的LSTM主干网络提取最终时间步的隐藏状态。3.2 决斗架构与解耦估计由于不同类别样本量差异悬殊若直接回归状态-动作价值函数容易导致常见类别的状态评估对各动作产生整体性数值偏移。网络在此处采用决斗结构将网络输出端分流为两个独立的线性映射层状态价值流输出一个标量评估当前序列所处工况状态本身的综合价值。动作优势流输出一个与候选诊断类别数量等长的向量评估选择特定诊断类别的相对优势。最终的动作价值通过将状态价值与减去均值后的动作优势向量相加组合而成消除了单一基准值波动对动作决策选择的干扰。3.3 样本频次倒数归一化奖励函数强化学习在分类任务中的常见缺陷是偏向多数类以获取常规奖励。为此本方法设计了与样本规模挂钩的非对称环境反馈针对每种类别依据其在训练集中的样本总量计算其倒数并进行整体欧几里得范数归一化形成各类别对应的基础权重。当智能体做出正确诊断时环境给予与该类别样本稀缺程度正相关的正奖励当诊断错误时扣除对应强度的负奖励。该机制显著放大了少数类故障诊断结果对网络梯度更新的敏感度迫使策略网络在权衡探索与利用时充分关注样本极少的故障特征。3.4 稳定性与策略探索设计为避免动作价值的高估系统采用双网络结构即由策略网络决定动作选择由定期延迟同步的目标网络计算目标价值。动作选择过程遵循探索率随训练步数逐步线性衰减的策略在训练初期保持高探索意愿随着经验积累逐步收敛至基于策略网络的确定性输出。4.总结该研究构建的技术路线围绕“无合成时序对比表征”与“自适应代价敏感强化决策”两方面展开先利用大批量的正常飞行数据完成自编码器预训练奠定时序压缩表征基础利用真实样本组合构建加权正负样本对微调对比编码器以约束隐空间的类内紧凑性与类间离散度将冻结的表征网络与决斗双Q网络耦合通过反比于样本频次的奖励函数重构环境反馈机制。整体架构兼顾了模型在小样本、多故障类型不平衡条件下的判别稳定性契合机队运营数据逐步增加、环境动态变化的工业实际场景。参考文献Continual contrastive reinforcement learning: Towards stronger agent for environment-aware fault diagnosis of aero-engines through long-term optimization under highly imbalance scenarios[J]. Advanced Engineering Informatics, 2025, 65©: 103297.https://www.sciencedirect.com/science/article/pii/S1474034625001909

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询